AI競爭的焦點正在從模型本身轉向如何讓模型可靠地工作。業內提出一個公式:Agent=Harness+Model,其中Harness指圍繞大模型構建的智慧體工程系統,被視為AI時代的“作業系統”。8月1日,DeepSeek Harness團隊負責人崔添翼在X平台釋出招募資訊,面向Agent Harness相關開源專案開發者,開啟DeepSeek Harness內測招募。此前幾天,輝達CEO黃仁勳與LangChain創始人Harrison Chase進行公開對談,罕見地未談GPU和算力,而是聚焦於“當Agent開始真正替人呼叫工具、執行流程,企業該把工程資源放在哪裡”,核心關鍵詞正是Harness。黃仁勳甚至提出激進觀點:未來公司會把越來越多能力建在Harness上。
什麼是Harness?直譯是“馬具、韁繩”。如果將大模型比作千里馬,Harness就是駕馭它的全套裝備。黃仁勳在訪談中為其劃定了邊界:這不是簡單的模型包裝層,而是一整套圍繞模型構建的智慧體工程系統,包括系統提示詞、工具說明、記憶管理、上下文管理、任務拆分、重試機制、評測體系、許可權控制和審計追蹤。類比而言,大模型是發動機,Harness就是把發動機變成整車的系統工程,包括變速箱、制動器、儀表盤和方向盤。
Harness與Agent Framework常被混淆,但兩者層面不同。Framework解決“如何開發一個Agent”,Harness解決“如何讓Agent長期可靠地執行”。若將Agent比作員工,Framework是招聘手冊,Harness則是企業管理系統,負責安排任務、提供工具、儲存經驗、監督執行。從技術演進看,Harness的重要性類似作業系統之於計算機:個人電腦時代,Windows、Linux讓硬體生態爆發;移動網際網路時代,iOS和Android構建了軟體生態;Agent時代,大模型類似晶片,Harness則更像新的作業系統,決定AI能力如何被呼叫,也決定應用生態如何形成。
一個Harness需要多種核心能力,包括複雜任務的規劃能力、呼叫外部工具的能力、記憶和狀態管理能力,以及企業級所需的許可權控制、安全機制、執行日誌和效果評估。它並非簡單增加功能模組,而是在重新構建AI軟體執行方式:過去軟體是人寫規則、機器執行,未來軟體是人提出目標、AI自主規劃執行,中間的執行層就是Harness。
Anthropic的Claude Code原始碼近期洩露,51萬行程式碼揭示了頭部廠商Harness的六大核心元件:多層級System Prompt(超大規模、分層、可快取,固定快取部分可達十幾萬token)、Tool Schema(工具規範,核心工具在訓練階段適配)、Tool Call Loop(工具呼叫迴圈,分規劃與執行模式,先理解任務再進入沙盒執行)、Context Manager(上下文管理器,採用指標索引式記憶,解決百萬token上下文的高效利用)、Sub Agent(子智慧體,共享KV Cache與輸入上下文)、Verification Hooks(驗證鉤子,解決模型“自我美化、虛報完成”問題)。這套架構顯示,讓AI Agent穩定工作可能需要幾十萬行程式碼的系統工程,而非簡單呼叫API。
黃仁勳為何如此重視Harness?資料可以說明其價值。LangChain團隊做過對照實驗,讓GPT-5.2-Codex在Terminal Bench 2.0(89道真實任務的Agent編碼評測基準)上執行,預設提示詞和標準工具下得分僅52.8%,排在三十名開外;不修改模型權重,只調整系統提示詞、工具描述和中介軟體後,得分升至66.5%,躋身前五。黃仁勳在訪談中還披露,LangChain讓Nemotron 3 Ultra配合Harness最佳化,在Deep Agents評測中得分追到0.86,與最高分閉源模型的0.87僅差0.01,單次評測成本從43.48美元壓到4.48美元,便宜近10倍。Anthropic研究團隊讓Claude Opus 4.5製作復古遊戲,單Agent不用Harness時20分鐘完成、成本9美元,但程式碼不達標;套用三個Agent Harness(規劃器、生成器、評估器)後耗時6小時、成本200美元,但輸出是可端到端交付的工作軟體。這些案例說明,模型早已具備創造完整軟體的能力,只是需要被Harness啟用。
黃仁勳對AI產業的判斷始終圍繞AI必須進入真實世界、成為生產力,因為只有這樣GPU才有更大增長空間。Harness正對應這一目標:對企業而言,真正有價值的不是能聊天的AI,而是一批能承擔具體工作的AI員工。未來企業可能擁有負責市場分析、軟體開發、客戶服務、供應鏈管理的Agent,但只有Harness才能讓這些Agent真正進入企業流程。黃仁勳認為,未來每家公司都會擁有自己的AI員工,大模型是數字員工的大腦,Harness則是讓AI員工進入企業組織體系的基礎設施。輝達近年戰略已從單純銷售GPU轉向構建完整AI計算平台,覆蓋從訓練到應用的整個生命週期,而Harness正是讓大模型從實驗室走向生產的關鍵。
Harness近期引爆AI技術圈,很大程度上源於OpenAI和Anthropic等一線大廠將其植入工程體系並取得成果。OpenAI是最早意識到其重要性的公司之一:2026年初,工程師Ryan Lopopolo帶領不到10人的團隊,用5個月讓Codex寫出超過100萬行程式碼,全程未手敲一行,他將這套系統稱為“Harness Engineering”。實驗核心是在倉庫根目錄新增一個不到100行的AGENTS.md檔案,包含專案說明、禁止操作、完成定義三部分,Codex便從“能寫程式碼”變為“穩定交付”。AGENTS.md作為專案根目錄的“總行為綱領”,Agent啟動時自動讀取並注入系統提示詞。Anthropic則使用CLAUDE.md,包含流式Agent迴圈、許可權治理的工具排程系統、上下文管理層。Claude Code超過51.2萬行原始碼洩露,涵蓋1900個TypeScript檔案、40多個內建工具、46000行查詢引擎,以及三層自愈記憶架構,還藏著44個未釋出功能標誌。
國內廠商也在加碼。今年6月,DeepSeek正式組建Harness團隊,公開招募研究員、工程師和產品經理,方向明確對標Claude Code。騰訊是國內最早公開佈道Harness理念的大廠之一,其WorkBuddy已成為中國日活第一的AI Agent,從決定做claw模式到全量上線僅用一週,原因是Harness在內部打磨已久,超過2000名員工將日常工作交給它,使用反饋沉澱回Harness。開源社群節奏更快:6月初更新的OpenClaw(龍蝦)版本已具備完善Harness能力,如自動剝離模型推理過程、規範化MCP工具結果、自動恢復擴充套件思考;2026年2月上線的Hermes(愛馬仕)主打“自主學習、持久記憶”,其“技能進化”機制在完成5次以上同類呼叫後自動將流程提煉為標準技能文件。
對於開發者,寫一個最小可用的Harness並不難,約200行程式碼即可。例如“幫我分析輝達最近一週的重要新聞並整理成公眾號提綱”這類任務,傳統流程是“使用者—大模型—回答”,無Harness時模型僅做一次推理;加入Harness後,任務被拆解為多個階段,模型只負責每一步的思考,Harness組織整個執行過程。企業級Harness則複雜得多。難易程度取決於流程控制需求:若只想讓AI在專案中“聽話”,寫個AGENTS.md即可;若想體驗完整Harness工程,可使用Harness Engineering MCP等工具,理解runtime、tools、memory、orchestration等模組設計。核心邏輯是讓AI從“自由發揮”變為“有約束地執行”。
回到公式Agent=Model+Harness,未來使用者使用AI時,首先問的可能不再是“用哪個模型”,而是“你的Harness搭好了嗎”。未來的公司可能不再只是人員、部門和軟體的集合,而是一組持續進化的專業智慧體。大模型是所有企業都能買到的基礎設施,企業自己的Agent Harness才是真正難以複製的控制系統。