AI竞争的焦点正在从模型本身转向如何让模型可靠地工作。业内提出一个公式:Agent=Harness+Model,其中Harness指围绕大模型构建的智能体工程系统,被视为AI时代的“操作系统”。8月1日,DeepSeek Harness团队负责人崔添翼在X平台发布招募信息,面向Agent Harness相关开源项目开发者,开启DeepSeek Harness内测招募。此前几天,英伟达CEO黄仁勋与LangChain创始人Harrison Chase进行公开对谈,罕见地未谈GPU和算力,而是聚焦于“当Agent开始真正替人调用工具、执行流程,企业该把工程资源放在哪里”,核心关键词正是Harness。黄仁勋甚至提出激进观点:未来公司会把越来越多能力建在Harness上。
什么是Harness?直译是“马具、缰绳”。如果将大模型比作千里马,Harness就是驾驭它的全套装备。黄仁勋在访谈中为其划定了边界:这不是简单的模型包装层,而是一整套围绕模型构建的智能体工程系统,包括系统提示词、工具说明、记忆管理、上下文管理、任务拆分、重试机制、评测体系、权限控制和审计追踪。类比而言,大模型是发动机,Harness就是把发动机变成整车的系统工程,包括变速箱、制动器、仪表盘和方向盘。
Harness与Agent Framework常被混淆,但两者层面不同。Framework解决“如何开发一个Agent”,Harness解决“如何让Agent长期可靠地运行”。若将Agent比作员工,Framework是招聘手册,Harness则是企业管理系统,负责安排任务、提供工具、保存经验、监督执行。从技术演进看,Harness的重要性类似操作系统之于计算机:个人电脑时代,Windows、Linux让硬件生态爆发;移动互联网时代,iOS和Android构建了软件生态;Agent时代,大模型类似芯片,Harness则更像新的操作系统,决定AI能力如何被调用,也决定应用生态如何形成。
一个Harness需要多种核心能力,包括复杂任务的规划能力、调用外部工具的能力、记忆和状态管理能力,以及企业级所需的权限控制、安全机制、运行日志和效果评估。它并非简单增加功能模块,而是在重新构建AI软件运行方式:过去软件是人写规则、机器执行,未来软件是人提出目标、AI自主规划执行,中间的运行层就是Harness。
Anthropic的Claude Code源代码近期泄露,51万行代码揭示了头部厂商Harness的六大核心组件:多层级System Prompt(超大规模、分层、可缓存,固定缓存部分可达十几万token)、Tool Schema(工具规范,核心工具在训练阶段适配)、Tool Call Loop(工具调用循环,分规划与执行模式,先理解任务再进入沙盒执行)、Context Manager(上下文管理器,采用指针索引式记忆,解决百万token上下文的高效利用)、Sub Agent(子智能体,共享KV Cache与输入上下文)、Verification Hooks(验证钩子,解决模型“自我美化、虚报完成”问题)。这套架构显示,让AI Agent稳定工作可能需要几十万行代码的系统工程,而非简单调用API。
黄仁勋为何如此重视Harness?数据可以说明其价值。LangChain团队做过对照实验,让GPT-5.2-Codex在Terminal Bench 2.0(89道真实任务的Agent编码评测基准)上运行,默认提示词和标准工具下得分仅52.8%,排在三十名开外;不修改模型权重,只调整系统提示词、工具描述和中间件后,得分升至66.5%,跻身前五。黄仁勋在访谈中还披露,LangChain让Nemotron 3 Ultra配合Harness优化,在Deep Agents评测中得分追到0.86,与最高分闭源模型的0.87仅差0.01,单次评测成本从43.48美元压到4.48美元,便宜近10倍。Anthropic研究团队让Claude Opus 4.5制作复古游戏,单Agent不用Harness时20分钟完成、成本9美元,但代码不达标;套用三个Agent Harness(规划器、生成器、评估器)后耗时6小时、成本200美元,但输出是可端到端交付的工作软件。这些案例说明,模型早已具备创造完整软件的能力,只是需要被Harness激活。
黄仁勋对AI产业的判断始终围绕AI必须进入真实世界、成为生产力,因为只有这样GPU才有更大增长空间。Harness正对应这一目标:对企业而言,真正有价值的不是能聊天的AI,而是一批能承担具体工作的AI员工。未来企业可能拥有负责市场分析、软件开发、客户服务、供应链管理的Agent,但只有Harness才能让这些Agent真正进入企业流程。黄仁勋认为,未来每家公司都会拥有自己的AI员工,大模型是数字员工的大脑,Harness则是让AI员工进入企业组织体系的基础设施。英伟达近年战略已从单纯销售GPU转向构建完整AI计算平台,覆盖从训练到应用的整个生命周期,而Harness正是让大模型从实验室走向生产的关键。
Harness近期引爆AI技术圈,很大程度上源于OpenAI和Anthropic等一线大厂将其植入工程体系并取得成果。OpenAI是最早意识到其重要性的公司之一:2026年初,工程师Ryan Lopopolo带领不到10人的团队,用5个月让Codex写出超过100万行代码,全程未手敲一行,他将这套系统称为“Harness Engineering”。实验核心是在仓库根目录添加一个不到100行的AGENTS.md文件,包含项目说明、禁止操作、完成定义三部分,Codex便从“能写代码”变为“稳定交付”。AGENTS.md作为项目根目录的“总行为纲领”,Agent启动时自动读取并注入系统提示词。Anthropic则使用CLAUDE.md,包含流式Agent循环、权限治理的工具调度系统、上下文管理层。Claude Code超过51.2万行源代码泄露,涵盖1900个TypeScript文件、40多个内置工具、46000行查询引擎,以及三层自愈记忆架构,还藏着44个未发布功能标志。
国内厂商也在加码。今年6月,DeepSeek正式组建Harness团队,公开招募研究员、工程师和产品经理,方向明确对标Claude Code。腾讯是国内最早公开布道Harness理念的大厂之一,其WorkBuddy已成为中国日活第一的AI Agent,从决定做claw模式到全量上线仅用一周,原因是Harness在内部打磨已久,超过2000名员工将日常工作交给它,使用反馈沉淀回Harness。开源社区节奏更快:6月初更新的OpenClaw(龙虾)版本已具备完善Harness能力,如自动剥离模型推理过程、规范化MCP工具结果、自动恢复扩展思考;2026年2月上线的Hermes(爱马仕)主打“自主学习、持久记忆”,其“技能进化”机制在完成5次以上同类调用后自动将流程提炼为标准技能文档。
对于开发者,写一个最小可用的Harness并不难,约200行代码即可。例如“帮我分析英伟达最近一周的重要新闻并整理成公众号提纲”这类任务,传统流程是“用户—大模型—回答”,无Harness时模型仅做一次推理;加入Harness后,任务被拆解为多个阶段,模型只负责每一步的思考,Harness组织整个执行过程。企业级Harness则复杂得多。难易程度取决于流程控制需求:若只想让AI在项目中“听话”,写个AGENTS.md即可;若想体验完整Harness工程,可使用Harness Engineering MCP等工具,理解runtime、tools、memory、orchestration等模块设计。核心逻辑是让AI从“自由发挥”变为“有约束地执行”。
回到公式Agent=Model+Harness,未来用户使用AI时,首先问的可能不再是“用哪个模型”,而是“你的Harness搭好了吗”。未来的公司可能不再只是人员、部门和软件的集合,而是一组持续进化的专业智能体。大模型是所有企业都能买到的基础设施,企业自己的Agent Harness才是真正难以复制的控制系统。