AI 产业的竞争焦点正从浅层对话交互转向实际生产力比拼,各大厂商加速迭代模型并瞄准多智能体协同、AI 编程等高付费意愿场景。在此背景下,Agnes AI 今日正式宣布其文本大模型与 AI 编程产品矩阵的全面升级,包括 Agnes-2.5 Flash 正式上线、旗舰文本模型 Agnes-2.5 Pro Alpha 即将开放体验,以及 AI 工作台 AgnesCode 的功能优化。此次升级旨在强化模型在复杂推理、Agent 任务执行、专业编程及智能开发场景中的能力,为开发者和企业用户提供更高效的 AI 生产力工具。

Agnes-2.5 Flash 专为日常编程、Agent 和高频开发任务打造,其 API 与 AgnesCode 已全面上线,并延续不限期免费开放策略。该模型提升了代码理解、Bug 修复、项目重构、多文件修改及多步骤任务执行等能力,旨在满足普通用户的日常需求。

Agnes-2.5 Pro Alpha 是 Agnes AI 首款付费模型,定位为旗舰文本模型 Agnes-2.5 Pro 的体验先行版本,支持 100 万 Token 超长上下文窗口,面向复杂智能体、专业编程和高难度工程任务场景优化。该模型在多个公开评测榜单中展现出较强综合能力:在 Artificial Analysis 的 Intelligence Index 中,Agnes-2.5 Pro Alpha 得分 39,在其同类模型中位列 第 9;该指数由 9 项评测构成,覆盖 Agent 任务、代码执行、科学推理、知识可靠性和长上下文理解等能力,其中 Agent 和编程相关评测权重较高。此外,在真实 Linux 终端智能体基准测试 Terminal-Bench v2.1 中,该模型得分 67%;该测试在隔离 Docker 沙箱环境运行,固定保留 89 项真实工程任务,并修复了多项底层问题,分数反映模型在模拟终端环境中完成工程任务的能力。Agnes-2.5 Pro Alpha 的 API 定价为每百万输入 Token 0.45 美元(约合人民币 3.05 元)、每百万输出 Token 0.90 美元(约合人民币 6.09 元)。为降低体验门槛,用户登录 AgnesCode 可领取免费积分进行体验。

伴随模型升级,AgnesCode 平台也完成了首字生成时延(TTFT)优化,用户下发提示词后整体响应效率提升,连续编码和多轮智能体任务流转更加顺畅。此外,AgnesCode 将于 7 月 28 日 上线 CLI 命令行功能,用户登录部署后可在本地项目文件夹用自然语言完成代码解析、文件修改、故障排查、测试编译等开发工作,授权后还可直接运行终端指令和安装依赖。

从调用数据看,Agnes AI 的商业化规模已跻身全球前列。根据该公司披露的最新数据,其全模态模型的单周 Token 处理量达到 8.16 万亿,其中文本 Token 为 5.1 万亿(占 62.5%),多模态 Token 为 3.06 万亿(占 37.5%)。这一配比显示,Agnes 的多模态模块已具备独立可用、稳定可靠的产品能力,用户实际业务场景覆盖了文本对话、代码编写、图片处理、视频解析等多元需求。对比全球 AI 模型聚合平台 OpenRouter 的最新大模型周调用榜单,头部玩家如小米 MiMo-V2.5 以 10.2T tokens 位列第一,DeepSeek V4 Flash 以 6.01T tokens 位列第二,Agnes 的周处理量级已与行业头部水平相当。

在推理基建层面,Agnes 团队也在参与开源框架 SGLang 的社区建设,目前已提交 4 项代码贡献,其中 3 项已正式合并,另有 1 项通过维护者审核,正在完成后续测试与合并流程。SGLang 作为支撑万亿级 Token 流转的核心开源框架,是各技术团队打磨工程能力的关键。

Agnes 此次从模型、调用量到工具的全方位升级,表明其全模态能力已通过海量线上调用检验,完成了从实验室算法原型向稳定可用产品能力的迭代闭环。随着 AI 应用形态进入新一轮升级周期,用户将大模型深度对接内部业务系统、嵌入全流程工作链路,推动 Token 消耗量指数级攀升,模型竞争已告别单点性能比拼,进入综合实力全方位角逐阶段。