AI 產業的競爭焦點正從淺層對話互動轉向實際生產力比拼,各大廠商加速迭代模型並瞄準多智慧體協同、AI 程式設計等高付費意願場景。在此背景下,Agnes AI 今日正式宣佈其文本大模型與 AI 程式設計產品矩陣的全面升級,包括 Agnes-2.5 Flash 正式上線、旗艦文本模型 Agnes-2.5 Pro Alpha 即將開放體驗,以及 AI 工作台 AgnesCode 的功能最佳化。此次升級旨在強化模型在複雜推理、Agent 任務執行、專業程式設計及智慧開發場景中的能力,為開發者和企業使用者提供更高效的 AI 生產力工具。
Agnes-2.5 Flash 專為日常程式設計、Agent 和高頻開發任務打造,其 API 與 AgnesCode 已全面上線,並延續不限期免費開放策略。該模型提升了程式碼理解、Bug 修復、專案重構、多檔案修改及多步驟任務執行等能力,旨在滿足普通使用者的日常需求。
Agnes-2.5 Pro Alpha 是 Agnes AI 首款付費模型,定位為旗艦文本模型 Agnes-2.5 Pro 的體驗先行版本,支援 100 萬 Token 超長上下文視窗,面向複雜智慧體、專業程式設計和高難度工程任務場景最佳化。該模型在多個公開評測榜單中展現出較強綜合能力:在 Artificial Analysis 的 Intelligence Index 中,Agnes-2.5 Pro Alpha 得分 39,在其同類模型中位列 第 9;該指數由 9 項評測構成,覆蓋 Agent 任務、程式碼執行、科學推理、知識可靠性和長上下文理解等能力,其中 Agent 和程式設計相關評測權重較高。此外,在真實 Linux 終端智慧體基準測試 Terminal-Bench v2.1 中,該模型得分 67%;該測試在隔離 Docker 沙箱環境執行,固定保留 89 項真實工程任務,並修復了多項底層問題,分數反映模型在模擬終端環境中完成工程任務的能力。Agnes-2.5 Pro Alpha 的 API 定價為每百萬輸入 Token 0.45 美元(約合人民幣 3.05 元)、每百萬輸出 Token 0.90 美元(約合人民幣 6.09 元)。為降低體驗門檻,使用者登入 AgnesCode 可領取免費積分進行體驗。
伴隨模型升級,AgnesCode 平台也完成了首字生成時延(TTFT)最佳化,使用者下發提示詞後整體響應效率提升,連續編碼和多輪智慧體任務流轉更加順暢。此外,AgnesCode 將於 7 月 28 日 上線 CLI 命令列功能,使用者登入部署後可在本地專案資料夾用自然語言完成程式碼解析、檔案修改、故障排查、測試編譯等開發工作,授權後還可直接執行終端指令和安裝依賴。
從呼叫資料看,Agnes AI 的商業化規模已躋身全球前列。根據該公司披露的最新資料,其全模態模型的單週 Token 處理量達到 8.16 萬億,其中文本 Token 為 5.1 萬億(佔 62.5%),多模態 Token 為 3.06 萬億(佔 37.5%)。這一配比顯示,Agnes 的多模態模組已具備獨立可用、穩定可靠的產品能力,使用者實際業務場景覆蓋了文本對話、程式碼編寫、圖片處理、影片解析等多元需求。對比全球 AI 模型聚合平台 OpenRouter 的最新大模型周呼叫榜單,頭部玩家如小米 MiMo-V2.5 以 10.2T tokens 位列第一,DeepSeek V4 Flash 以 6.01T tokens 位列第二,Agnes 的周處理量級已與行業頭部水平相當。
在推理基建層面,Agnes 團隊也在參與開源框架 SGLang 的社群建設,目前已提交 4 項程式碼貢獻,其中 3 項已正式合併,另有 1 項通過維護者稽核,正在完成後續測試與合併流程。SGLang 作為支撐萬億級 Token 流轉的核心開源框架,是各技術團隊打磨工程能力的關鍵。
Agnes 此次從模型、呼叫量到工具的全方位升級,表明其全模態能力已通過海量線上呼叫檢驗,完成了從實驗室演算法原型向穩定可用產品能力的迭代閉環。隨著 AI 應用形態進入新一輪升級週期,使用者將大模型深度對接內部業務系統、嵌入全流程工作鏈路,推動 Token 消耗量指數級攀升,模型競爭已告別單點效能比拼,進入綜合實力全方位角逐階段。