AI 程式設計工具 Cursor 的開發商 Anysphere(近期被 SpaceX 以 600 億美元收購)公佈了一項對比測試,展示了其新版 Agent Swarm 系統在程式碼生成效率上的顯著提升。測試要求新舊兩版系統僅憑一份 835 頁的 SQLite 文件,將 SQLite 用 Rust 語言重寫,禁止訪問原始碼、測試套件或網際網路。

新版系統將 AI 代理劃分為兩類角色:規劃者代理使用 GPT-5.5、Grok 4.5、Opus 4.8 等前沿模型,將大目標遞迴分解為小任務;執行者代理則使用 Composer 2.5 等更廉價、更快的模型來具體編碼。這種分工主要解決了單一代理在長時間任務中因需要同時記住整體目標與當前步驟而導致的“上下文漂移”問題。規劃者不寫程式碼,執行者不規劃,兩者各司其職。

測試結果對比鮮明。經過 4 小時執行,新版系統所有配置的測試得分在 73% 至 85% 之間,而舊版得分僅 11% 至 77%。最終,新版每種配置均達到 100% 的測試通過率,舊版則因自身產生的合併衝突而停滯。舊版系統在 2 小時內產生了 68,000 次 Git 提交,是新版的約 70 倍,但大部分是無效工作;舊版累計超過 70,000 次 合併衝突,新版則始終低於 1,000 次。衝突最嚴重的檔案在舊版中記錄了 7,771 次衝突,涉及 1,173 個代理,新版僅為 47 次。

程式碼質量方面,新版系統也展現出巨大優勢。在 Fable 5 配置下,舊版引擎程式碼需要 64,305 行,新版僅需 9,908 行;在 Opus 配置下,舊版用 19,013 行程式碼獲得 97% 得分,新版用 4,645 行 即達到 100%。在同等或更優測試得分下,新版架構將程式碼庫規模削減了最多 85%

成本差異更為驚人。總成本從 Opus 混合配置的 1,339 美元 到 GPT-5.5 單獨執行的 10,565 美元 不等,相差達 15 倍。執行者代理消耗了每次執行中至少 69% 的 token(通常超過 90%),但由於規劃者 token 單價更高,在 Opus 混合配置中,規劃者雖只佔 token 小部分,卻貢獻了總成本的三分之二。最貴的 GPT-5.5 執行中,僅執行者成本就達 9,373 美元

Cursor 表示,新版系統通過分離規劃與執行,主要解決了上下文管理問題。舊版系統曾嘗試使用整合者代理來解決衝突,反而造成了更多瓶頸。新版則讓代理將決策記錄在共享設計文件中,程式碼與決策通過編譯時檢查關聯,衝突由中立代理解決。此外,Cursor 還讓代理在人類參與的工作流中學會不觸碰核心程式碼,但在測試中允許它們“故意破壞”,以探索更優方案。

這一測試結果對 AI 程式設計領域具有啟示:通過合理的架構設計,大部分編碼工作可由廉價模型完成,前沿模型僅用於規劃與決策,從而大幅降低算力成本與開發開支。