輝達研究團隊於2026年8月21日釋出其Agentic Variation Operators(AVO)架構,在ARC-AGI-3基準上取得100.00的RHAE分數,完成全部183個關卡,覆蓋25個環境,且環境動作數比對比系統VISTA少12%。該結果將Claude Opus 5從30%的模型基線提升至100%,凸顯系統設計對智慧體效能的關鍵作用。
AVO是一個通用編碼智慧體系統,其核心在於通過持久記憶與監督機制支援長時程自主操作。持久記憶儲存先前的實現、評估結果、編譯器及效能分析器輸出,使智慧體能從當前狀態恢復,而非重複重建搜尋;監督器則監控整體搜尋軌跡,在進展停滯或出現重複低效迴圈時,引導主智慧體轉向替代策略。在GPU核心最佳化實驗中,AVO連續執行七天,自主探索超過500個最佳化方向,提交40個核心版本,在NVIDIA DGX B200系統上,其多頭注意力核心效能較cuDNN最高提升3.5%,較FlashAttention-4最高提升10.5%。此外,該智慧體在約30分鐘的額外自主工作後,將演化核心適配至分組查詢注意力。
該研究強調,智慧體系統的效能與通用性源於系統級架構,而非僅依賴模型能力。AVO在ARC-AGI-3上的成功,展示了將同一通用智慧體連線至不同任務介面的可行性,僅需更換環境特定工具與評估方式。這一系統級視角對AI代理棧的安全與可靠性設計亦有啟示,提示效能、可靠性與安全性需在完整系統中統籌設計。
對於AI產業投資者而言,該成果表明智慧體架構創新可能成為提升模型實際應用效能的關鍵槓桿,尤其在長時程、多步驟任務場景中。輝達通過AVO展示了系統設計對前沿模型效能的放大作用,或將對AI基礎設施層中智慧體開發工具與平台的競爭格局產生影響。