AI 编程工具 Cursor 的开发商 Anysphere(近期被 SpaceX 以 600 亿美元收购)公布了一项对比测试,展示了其新版 Agent Swarm 系统在代码生成效率上的显著提升。测试要求新旧两版系统仅凭一份 835 页的 SQLite 文档,将 SQLite 用 Rust 语言重写,禁止访问源码、测试套件或互联网。
新版系统将 AI 代理划分为两类角色:规划者代理使用 GPT-5.5、Grok 4.5、Opus 4.8 等前沿模型,将大目标递归分解为小任务;执行者代理则使用 Composer 2.5 等更廉价、更快的模型来具体编码。这种分工主要解决了单一代理在长时间任务中因需要同时记住整体目标与当前步骤而导致的“上下文漂移”问题。规划者不写代码,执行者不规划,两者各司其职。
测试结果对比鲜明。经过 4 小时运行,新版系统所有配置的测试得分在 73% 至 85% 之间,而旧版得分仅 11% 至 77%。最终,新版每种配置均达到 100% 的测试通过率,旧版则因自身产生的合并冲突而停滞。旧版系统在 2 小时内产生了 68,000 次 Git 提交,是新版的约 70 倍,但大部分是无效工作;旧版累计超过 70,000 次 合并冲突,新版则始终低于 1,000 次。冲突最严重的文件在旧版中记录了 7,771 次冲突,涉及 1,173 个代理,新版仅为 47 次。
代码质量方面,新版系统也展现出巨大优势。在 Fable 5 配置下,旧版引擎代码需要 64,305 行,新版仅需 9,908 行;在 Opus 配置下,旧版用 19,013 行代码获得 97% 得分,新版用 4,645 行 即达到 100%。在同等或更优测试得分下,新版架构将代码库规模削减了最多 85%。
成本差异更为惊人。总成本从 Opus 混合配置的 1,339 美元 到 GPT-5.5 单独运行的 10,565 美元 不等,相差达 15 倍。执行者代理消耗了每次运行中至少 69% 的 token(通常超过 90%),但由于规划者 token 单价更高,在 Opus 混合配置中,规划者虽只占 token 小部分,却贡献了总成本的三分之二。最贵的 GPT-5.5 运行中,仅执行者成本就达 9,373 美元。
Cursor 表示,新版系统通过分离规划与执行,主要解决了上下文管理问题。旧版系统曾尝试使用整合者代理来解决冲突,反而造成了更多瓶颈。新版则让代理将决策记录在共享设计文档中,代码与决策通过编译时检查关联,冲突由中立代理解决。此外,Cursor 还让代理在人类参与的工作流中学会不触碰核心代码,但在测试中允许它们“故意破坏”,以探索更优方案。
这一测试结果对 AI 编程领域具有启示:通过合理的架构设计,大部分编码工作可由廉价模型完成,前沿模型仅用于规划与决策,从而大幅降低算力成本与开发开支。