華爾街投行傑富瑞(Jefferies)近期對八款主流中美AI Agent進行了一次系統性實測,結果顛覆了“模型越強,Agent越強”的直覺。在總分排名中,阿里巴巴的千問辦公以95分位居第一,儘管其背後模型Qwen 3.8 Max的智慧分僅為56,在參測模型中排第四;而模型能力最強的Claude Opus 5(智慧分61)對應的Anthropic產品Claude Cowork以94分屈居第二。OpenAI的Codex(基於GPT-5.6 Sol,智慧分59)以92分位列第三。這一結果讓傑富瑞得出核心結論:決定一個AI Agent好不好用,往往不是背後那個模型,Harness(管理機制)做得好足以彌補模型智慧的差距。

所謂Harness,是指Agent中除模型外的所有元件,負責“管理”而非“思考”。傑富瑞將其拆解為六層:指令(定義任務與紅線)、上下文(提供背景資訊)、工具(可呼叫的外部能力)、邊界(行動範圍)、反饋(錯誤糾正與重新規劃)以及治理(組織級管控)。這六層對應企業僱傭員工後的管理流程,模型如同聰明的新人,而Harness則是讓新人發揮效能的管理體系。報告用控制變數實驗證明:同一模型Claude Opus 4.6在不同Harness下,在Terminal-Bench 2.0基準上的得分從58.0%到76.4%不等,差距達18.4個百分點;Gemini 3 Pro同樣僅換Harness,得分從56.0%到69.4%,差13.4個百分點。

本次實測覆蓋美國三款(Claude Cowork、Codex、Gemini Spark)和中國五款(騰訊Workbuddy、阿里千問辦公、位元組豆包、月之暗面Kimi Work、MiniMax Code)產品,測試任務包括多檔案檢索、自主聯網研究、控制瀏覽器、製作PPT和生成營銷海報,每項任務按5個維度打分,滿分100分。最終排名為:千問辦公95分、Claude Cowork 94分、Codex 92分、Kimi Work 86分、豆包77分、MiniMax Code 71分,Workbuddy與Gemini Spark並列墊底(66分)。

值得注意的是,千問辦公的“逆襲”並非偶然。傑富瑞將Agent能力拆分為模型(權重60%)和Harness(權重40%),反推出各產品的“隱含Harness分”,結果顯示千問辦公的Harness分最高,甚至超過美國產品。這印證了Harness優勢足以抵消模型智慧差距。

實測還揭示了中美Agent的能力差異:在營銷海報任務上,美國產品普遍表現不佳,Claude Cowork和Gemini Spark均在此翻車,而中國產品如千問辦公和豆包表現更好;在控制瀏覽器任務上,中國產品成為弱點,Workbuddy和MiniMax Code在此栽跟頭,美國產品則更穩定。速度方面,美國產品中Gemini Spark最快、Codex次之、Claude Cowork最慢;中國產品中Workbuddy最快,Kimi Work和千問辦公偏慢。此外,Claude Cowork在PPT排版和配色上“品味”最佳,但傑富瑞認為這歸功於模型能力而非Harness。

價格上,中國模型具有顯著優勢:千問辦公背後的Qwen 3.8 Max API價格每百萬token約1.1美元,而GPT-5.6 Sol為4.4美元、Opus 5為3.9美元。

報告特別分析了騰訊Workbuddy的“錯位”現象:其6月月訪問量約2100萬,在中國同類Agent中排名第一,但隱含Harness分卻在中國產品中墊底。傑富瑞給出三個原因:一是Workbuddy深度嵌入騰訊生態(騰訊文件、IMA、企業微信),入口優勢明顯;二是其採用模型無關路線,使用者可切換Kimi K3、DeepSeek V4、GLM 5.2等開源模型;三是騰訊營銷投入較大。報告判斷,短期Workbuddy贏在入口和分發,長期來看2100萬用戶基礎將沉澱海量真實使用資料,反哺Harness改進和模型訓練。在中國市場現階段,分發能力暫時跑在Harness工程前面,但決定Agent最終走多遠的關鍵仍是Harness。

傑富瑞還對比了中美在Harness上的優劣勢。中國優勢包括:超級App整合(Agent直接嵌入企微、飛書、釘釘等平台,打通資料、分發、變現);模型無關的Harness(如Workbuddy、位元組Trae);低token價格(出口管制倒逼高效MoE架構和推理最佳化,中國模型token價格平均比美國低70%到80%);迭代速度快(使用者量大、失敗案例多,促進快速改進)。短板則有:模型差距仍在(弱模型更依賴Harness);產品定價低(中小企業價格敏感、大型央國企偏愛定製專案);出海難(中國Agent為本地生態最佳化,而美國Harness受益於全球標準化軟體棧);算力瓶頸(Agent工作流對推理算力消耗大,高階算力短缺可能影響服務穩定性)。

報告最後強調Harness的三大價值:粘性(客戶的工作習慣、歷史、聯結器等沉澱在Harness中,換走成本高);資料飛輪(每次執行產生trace資料,可反哺強化學習和Harness改進,形成正迴圈);付費意願(企業購買的是“Harness+模型”打包的完整產品,而非單純“智慧”)。因此,對AI公司而言,AI落地的關鍵在工程層而非模型層,把Harness做好比追最強模型更可能做出落地產品。