英伟达研究团队于2026年8月21日发布其Agentic Variation Operators(AVO)架构,在ARC-AGI-3基准上取得100.00的RHAE分数,完成全部183个关卡,覆盖25个环境,且环境动作数比对比系统VISTA少12%。该结果将Claude Opus 5从30%的模型基线提升至100%,凸显系统设计对智能体性能的关键作用。
AVO是一个通用编码智能体系统,其核心在于通过持久记忆与监督机制支持长时程自主操作。持久记忆保存先前的实现、评估结果、编译器及性能分析器输出,使智能体能从当前状态恢复,而非重复重建搜索;监督器则监控整体搜索轨迹,在进展停滞或出现重复低效循环时,引导主智能体转向替代策略。在GPU内核优化实验中,AVO连续运行七天,自主探索超过500个优化方向,提交40个内核版本,在NVIDIA DGX B200系统上,其多头注意力内核性能较cuDNN最高提升3.5%,较FlashAttention-4最高提升10.5%。此外,该智能体在约30分钟的额外自主工作后,将演化内核适配至分组查询注意力。
该研究强调,智能体系统的性能与通用性源于系统级架构,而非仅依赖模型能力。AVO在ARC-AGI-3上的成功,展示了将同一通用智能体连接至不同任务界面的可行性,仅需更换环境特定工具与评估方式。这一系统级视角对AI代理栈的安全与可靠性设计亦有启示,提示性能、可靠性与安全性需在完整系统中统筹设计。
对于AI产业投资者而言,该成果表明智能体架构创新可能成为提升模型实际应用效能的关键杠杆,尤其在长时程、多步骤任务场景中。英伟达通过AVO展示了系统设计对前沿模型性能的放大作用,或将对AI基础设施层中智能体开发工具与平台的竞争格局产生影响。