8月14日晚间,阿里旗下千问办公宣布上线智谱GLM-5.3和DeepSeek V4 Pro两款外部模型,用户可在产品首页“前沿模型”档位直接选用。同日,百度文库网盘通用智能体GenFlow正式启用中文名“库库AI”,并推出独立桌面端,其模型池同样引入DeepSeek、智谱GLM等外部模型。加上早已内置多家第三方模型的腾讯WorkBuddy和字节TRAE Work,国内头部厂商的办公Agent正集体转向模型聚合模式。
过去大模型产品比拼的是“谁家模型更强”,而办公Agent阶段的竞争逻辑已悄然改变:先把不同模型放进同一个工作台,让更多用户愿意把真实工作交进来。只有用户真正使用,写作、表格分析、PPT制作等真实工作流持续进入Agent,平台才有机会积累任务拆解、工具调用、失败恢复和用户纠正等反馈,进而打磨Harness(智能体执行框架),形成数据飞轮。
目前千问办公的“前沿模型”数量不算多,除自家千问模型外,外部主要是GLM-5.3和DeepSeek V4 Pro。但千问办公明确表示,三款前沿模型发布后都快速完成接入,“这个节奏我们会一直保持下去”,暗示内置模型池后续会持续扩张。相比之下,腾讯WorkBuddy已形成更大的模型池,涵盖混元Hy3、智谱GLM、MiniMax、Kimi和DeepSeek等多个系列;字节TRAE Work产品端可见模型包括Seed系列、智谱GLM、DeepSeek以及千问等;百度库库AI同样引入DeepSeek、智谱GLM等外部模型。四家产品的共同点明显:不再把能力完全绑定在一家模型上。
这种聚合背后是对真实工作流数据的渴求。当Agent搜索网页、打开文档、分析Excel、制作PPT、调用软件,并与用户来回修改任务时,会留下完整执行过程:模型如何拆解任务、调用哪些工具、哪一步失败、用户在哪一步纠正、最终什么结果被接受。百度集团副总裁、个人超级智能事业群总裁王颖认为,随着公共数据逐渐被模型充分学习,AI继续提升过程中,人产生的新知识、新经验和新想法会越来越重要。未来真正需要共同建立的是通用智能体能力、记忆与存储,以及个人知识和经验三部分能力。
模型池越丰富,越有机会提升不同任务的完成率,降低用户尝试门槛;只有更多用户把工作交给Agent,平台才能获得持续反馈,优化任务拆解、Context管理、工具选择、失败恢复等Harness能力。因此,模型聚合不只是能力拼盘,更是为数据飞轮争取更多真实任务。
然而,聚合并不意味着大厂边界消失。从产品端可见的默认模型池看,WorkBuddy虽接入多家外部模型,但没有阿里千问和字节Seed;TRAE Work已内置千问,但没有腾讯混元;库库AI目前也未见混元、千问和Seed。各家扩大模型选择的同时,仍保留着自己的生态边界。
把更多模型装进同一个Agent,只解决了“有没有得选”,真正决定聚合路线能否跑通的是下一步怎么选。大模型落地一直存在一组近似“不可能三角”的权衡:效果、速度和成本很难同时拉满。能力更强的模型通常推理价格更高,复杂任务为求更好结果往往需要更长思考和执行时间;反之,一味追求便宜和低延迟,又可能牺牲任务完成质量。路由要解决的正是这道三角题:为完成一项工作,应在什么环节花更多钱换能力,又在什么环节用速度和成本换效率。
这也让聚合型办公Agent的竞争出现另一层差异。理想状态是用户只需提出任务,后台根据任务难度、时效要求和模型成本完成选择。用户看到的可能只是一次“帮我做完这份报告”的请求,后台却可能在不同步骤间调用不同模型。对个人用户,差别体现在结果质量、等待时间和积分消耗;对企业客户,则落到一项工作的单位算力成本。办公Agent一旦大规模使用,几分钱、几毛钱的单次调用差异会随任务量放大,路由由此成为一笔规模化的经济账。
但从Agent完整执行链条看,路由只是Harness中的一环。一项任务从提出到交付,还涉及任务拆解、Context管理、工具调用、模型选择和失败恢复。路由决定“这一环该调用谁”,但真正决定任务能否稳定完成的是整套Harness能否协同这些环节。这也正是聚合路线可能形成壁垒的地方:模型本身可以接入,价格也可能随市场竞争下降,但如何在效果、速度和成本间找到更好平衡,需要足够多的真实任务和长期积累的调度经验。当WorkBuddy、TRAE Work、千问办公、库库AI手里的模型越来越多,真正拉开差距的可能是同一道题谁算得更精:什么时候该用最强模型,什么时候又根本没必要。