在最新一輪DRACO公開評測的Brave Search組測試中,海外旗艦模型GPT-5.6-sol首次入榜,交出了平均得分63.99、平均任務成本1.71美元的成績單。然而,佔據該組榜首的並非某個單一模型,而是一個名為OpenSquilla 0.5.0 Preview的多模型整合方案。
該方案以平均得分64.09、平均任務成本僅0.12美元的表現,在質量分上略高於GPT-5.6-sol 0.10分,同時將成本壓縮至後者的約1/14。與另一海外模型Fable 5的1.21美元成本相比,OpenSquilla的成本也僅為其約1/10。
OpenSquilla的技術路線頗為獨特:它並非依賴某個超級模型單打獨鬥,而是由DeepSeek、GLM、Kimi、Qwen四個國產模型並行提案,再由一個聚合模型對輸出結果進行整合。整個陣容中不含任何海外旗艦模型。截至目前,Brave Search組已覆蓋GPT-5.6-sol、Fable 5、Opus 4.8、GPT-5.5等多款海外模型,OpenSquilla整合方案在質量分與平均成本兩項指標上均位列第一。
這一結果折射出AI Agent任務競爭邏輯的深層轉向。過去,產業敘事高度聚焦“誰擁有最強的單模型”,引數規模、基準跑分是核心標尺。但DRACO這類面向複雜Agent任務的評測,開始將成本效率推到與質量同等重要的位置。一個由多個相對輕量模型協同工作的整合方案,能夠在質量不降的前提下,將單任務成本壓到旗艦模型的零頭,這對大規模商業部署的意義不言而喻。
從產業鏈角度看,這種“模型組織能力”的崛起,可能重新分配價值捕獲點。上游晶片與算力需求依然剛性,但中游的模型呼叫策略、任務路由與聚合演算法,正成為新的效率槓桿。對於下游應用廠商而言,不再需要把所有預算押注在呼叫最貴API上,而是可以通過多模型編排實現價效比最優解。
值得注意的是,OpenSquilla方案中四個提案模型均來自中國團隊,這也在一定程度上展示了國產模型在特定任務場景下的協同潛力。不過,DRACO評測僅反映特定測試集下的表現,實際生產環境中的穩定性、延遲與長尾場景覆蓋能力,仍需更多驗證。