華爾街投行傑富瑞(Jefferies)的分析師近日對八款全球主流AI Agent進行了真實辦公任務實測,結果顯示,阿里旗下的千問辦公(Qwen Office)綜合得分排名第一,超越了Claude Cowork、Codex等美國產品。這一評測結果於8月19日由雷鋒網報道,引發了市場對AI Agent競爭格局的新關注。
此次測試共設定了5項真實辦公任務,包括基於多份檔案完成公司年報摘要、聯網查詢並比較公司經營資料、操作真實桌面瀏覽器完成資訊檢索和文件生成、根據資料製作英文PPT,以及基於參考圖片生成營銷海報。測試結果顯示,千問辦公整體表現較為均衡,尤其在複雜辦公任務、網頁瀏覽器控制以及多模態內容生成等場景中表現突出,是唯一一個在所有測評維度中均獲得90分以上的Agent產品。
報告進一步將Agent能力拆分為模型與Harness兩部分進行分析。所謂Harness,是圍繞模型執行的一整套工程機制,包括指令、上下文、工具呼叫、邊界控制、反饋糾錯和治理等。按照傑富瑞的測算,千問辦公的“隱含Harness分”位居此次測試產品首位,高於Claude Cowork和Codex等七款國內外主流Agent產品。這也意味著,在底層模型之外,如何通過工程和產品能力將模型智慧穩定轉化為實際任務結果,正在成為Agent競爭的重要維度。
除任務表現外,成本也正成為Agent商業化需要考慮的重要因素。報告顯示,千問辦公底層Qwen 3.8 Max的API價格明顯低於部分海外頭部模型。由於Agent通常需要進行多輪推理、持續呼叫工具和執行長鏈路任務,企業未來衡量Agent價值時,除了模型和產品能力,也可能進一步關注“Cost per Task”,即完成一項真實任務所需的執行成本。阿里Qwen模型和千問辦公Agent的組合體現出較好的效能與成本優勢。
過去幾個月,Agent的競爭正在從個人辦公轉向企業級場景。報告認為,對於企業級Agent而言,工作流和生態協同是核心競爭壁壘。隨著Agent持續連線企業資料、業務系統、協作工具和許可權體系,使用者的歷史任務、工作習慣、聯結器、Skills和自動化流程會逐漸沉澱在產品中,形成更高的使用粘性和遷移成本。
據介紹,“千問辦公”不僅可以幫助個人提效,為企業的AI需求設計,也是“千問辦公”的鮮明特色。目前“千問辦公”已初步打通釘釘IM工具,企業員工通過“千問辦公”,即可完成群聊總結、文件表格建立、訊息郵件收發等操作。未來,企業客戶還可以將“千問辦公”接入到真實繁雜的工作流中,全面連線企業真實的資料庫和工作流,幫助企業提升辦公與組織效率。
此次評測結果不僅展示了千問辦公在模型與工程協同上的優勢,也反映出AI Agent賽道正從單純比拼模型能力,轉向綜合考量工程實現、成本效率與生態整合。對於投資者而言,這一趨勢意味著,在評估AI應用層公司時,除了關注其底層模型效能,還需重視其產品化能力、成本結構以及企業級生態佈局。