8月14日晚間,阿里旗下千問辦公宣佈上線智譜GLM-5.3和DeepSeek V4 Pro兩款外部模型,使用者可在產品首頁“前沿模型”檔位直接選用。同日,百度文庫網盤通用智慧體GenFlow正式啟用中文名“庫庫AI”,並推出獨立桌面端,其模型池同樣引入DeepSeek、智譜GLM等外部模型。加上早已內建多家第三方模型的騰訊WorkBuddy和位元組TRAE Work,國內頭部廠商的辦公Agent正集體轉向模型聚合模式。

過去大模型產品比拼的是“誰家模型更強”,而辦公Agent階段的競爭邏輯已悄然改變:先把不同模型放進同一個工作台,讓更多使用者願意把真實工作交進來。只有使用者真正使用,寫作、表格分析、PPT製作等真實工作流持續進入Agent,平台才有機會積累任務拆解、工具呼叫、失敗恢復和使用者糾正等反饋,進而打磨Harness(智慧體執行框架),形成資料飛輪。

目前千問辦公的“前沿模型”數量不算多,除自家千問模型外,外部主要是GLM-5.3和DeepSeek V4 Pro。但千問辦公明確表示,三款前沿模型釋出後都快速完成接入,“這個節奏我們會一直保持下去”,暗示內建模型池後續會持續擴張。相比之下,騰訊WorkBuddy已形成更大的模型池,涵蓋混元Hy3、智譜GLM、MiniMaxKimi和DeepSeek等多個系列;位元組TRAE Work產品端可見模型包括Seed系列、智譜GLM、DeepSeek以及千問等;百度庫庫AI同樣引入DeepSeek、智譜GLM等外部模型。四家產品的共同點明顯:不再把能力完全繫結在一家模型上。

這種聚合背後是對真實工作流資料的渴求。當Agent搜尋網頁、開啟文件、分析Excel、製作PPT、呼叫軟體,並與使用者來回修改任務時,會留下完整執行過程:模型如何拆解任務、呼叫哪些工具、哪一步失敗、使用者在哪一步糾正、最終什麼結果被接受。百度集團副總裁、個人超級智慧事業群總裁王穎認為,隨著公共資料逐漸被模型充分學習,AI繼續提升過程中,人產生的新知識、新經驗和新想法會越來越重要。未來真正需要共同建立的是通用智慧體能力、記憶與儲存,以及個人知識和經驗三部分能力。

模型池越豐富,越有機會提升不同任務的完成率,降低使用者嘗試門檻;只有更多使用者把工作交給Agent,平台才能獲得持續反饋,最佳化任務拆解、Context管理、工具選擇、失敗恢復等Harness能力。因此,模型聚合不只是能力拼盤,更是為資料飛輪爭取更多真實任務。

然而,聚合並不意味著大廠邊界消失。從產品端可見的預設模型池看,WorkBuddy雖接入多家外部模型,但沒有阿里千問和位元組Seed;TRAE Work已內建千問,但沒有騰訊混元;庫庫AI目前也未見混元、千問和Seed。各家擴大模型選擇的同時,仍保留著自己的生態邊界。

把更多模型裝進同一個Agent,只解決了“有沒有得選”,真正決定聚合路線能否跑通的是下一步怎麼選。大模型落地一直存在一組近似“不可能三角”的權衡:效果、速度和成本很難同時拉滿。能力更強的模型通常推理價格更高,複雜任務為求更好結果往往需要更長思考和執行時間;反之,一味追求便宜和低延遲,又可能犧牲任務完成質量。路由要解決的正是這道三角題:為完成一項工作,應在什麼環節花更多錢換能力,又在什麼環節用速度和成本換效率。

這也讓聚合型辦公Agent的競爭出現另一層差異。理想狀態是使用者只需提出任務,後台根據任務難度、時效要求和模型成本完成選擇。使用者看到的可能只是一次“幫我做完這份報告”的請求,後台卻可能在不同步驟間呼叫不同模型。對個人使用者,差別體現在結果質量、等待時間和積分消耗;對企業客戶,則落到一項工作的單位算力成本。辦公Agent一旦大規模使用,幾分錢、幾毛錢的單次呼叫差異會隨任務量放大,路由由此成為一筆規模化的經濟賬。

但從Agent完整執行鏈條看,路由只是Harness中的一環。一項任務從提出到交付,還涉及任務拆解、Context管理、工具呼叫、模型選擇和失敗恢復。路由決定“這一環該呼叫誰”,但真正決定任務能否穩定完成的是整套Harness能否協同這些環節。這也正是聚合路線可能形成壁壘的地方:模型本身可以接入,價格也可能隨市場競爭下降,但如何在效果、速度和成本間找到更好平衡,需要足夠多的真實任務和長期積累的排程經驗。當WorkBuddy、TRAE Work、千問辦公、庫庫AI手裡的模型越來越多,真正拉開差距的可能是同一道題誰算得更精:什麼時候該用最強模型,什麼時候又根本沒必要。