DeepSeek 近日向开发者社区发布了其开源代理 Harness 的早期版本,该框架基于 Cordis 元框架,核心设计理念是“一切皆插件”。据 DeepSeek 官方介绍,模型、工具、技能、会话、沙箱、文件系统、循环、编排和 UI 均以插件形式实现,可自由混合、匹配、替换和扩展。这一创新设计不仅展示了技术实力,更标志着中国 AI 实验室开始在模型基准和价格之外的领域展开竞争。
Harness 一词今年在 AI 领域广泛流行,指代一种长期存在的软件功能——中间件或调解层,负责处理输入给 AI 模型的数据及模型返回的输出。它管理提示词、上下文、工具编排、代理循环、状态、错误处理、安全、权限等。例如,Anthropic 的 Claude Code 和 OpenAI 的 Codex 分别作为其模型家族的 Harness。此外,还有 Aider、Cline、Goose、OpenCode、OpenHands、Pi 等多个 Harness。Google 的 Antigravity 则由 Agent Runtime、桌面应用和 CLI 组成。
随着模型日益商品化,Harness 层成为竞争焦点。Harness 往往实现用户界面,形成用户惯性,开发者一旦习惯某种工具链,切换成本较高。研究表明,不同 Harness 的设计选择会导致模型性能和成本显著差异。例如,Pi 编码代理使用约 200 个 token 的最小系统提示,而 Claude Code 曾使用约 10,000 个 token,上月 Anthropic 将其削减了约 80%。同一模型在不同 Harness 下会产生不同结果。
DeepSeek Harness 的独特之处在于其插件化设计。它利用底层 Cordis 框架的插件系统,支持动态添加和移除组件而不破坏应用。DeepSeek 研究论文(作者 Yifan Shi、Wei Zhang、Tianyi Cui)阐述了 Cordis 的功能:支持时间组合性(移除组件并恢复其效果)和空间组合性(组件间依赖管理)。论文以微软 Visual Studio Code 的插件系统为例,指出 VS Code 扩展在共享进程中运行,激活后无法动态移除,需重启宿主。而 DeepSeek Harness 支持插件依赖,避免强制重启和崩溃。
DeepSeek Harness 还支持思维链轨迹记录。所有模型可见内容(系统提示、推理、工具调用、子代理调度、上下文注入)均记录在追加式会话日志中,开发者可通过轨迹视图按来源检查,并支持恢复、分叉、搜索和重放。思维链推理是 DeepSeek R1 的特色,将其分解为一系列“思考”步骤并反思后输出最终答案。访问中间推理有助于评估模型推理质量、响应准确性及“思考”对输出的影响。Anthropic 提供部分思考访问,但日益通过摘要隐藏原始推理,部分出于对蒸馏风险的担忧。Anthropic 已部署分类器检测思维链诱导,且不显示原始思维链,仅提供摘要,需联系销售才能获取原始推理。
DeepSeek Harness 的发布表明,中国 AI 实验室正从模型层竞争转向工具链和生态竞争。其插件化设计可能吸引开发者,降低切换成本,形成生态粘性。同时,思维链轨迹的透明性可能为模型评估和调试提供新工具,但也可能引发对推理安全性的讨论。总体而言,Harness 层正成为 AI 竞争的新战场,DeepSeek 此举可能推动行业重新关注中间件层的创新。