原创 鸿辰 铑科技 2026年8月3日 18:00 北京 听全文

作者 | 鸿辰

编辑 | 头头

AI竞争的焦点正在发生转移,Agent=Harness + Model,这条公式正在重塑整个行业。

8月1日,DeepSeek Harness团队负责人崔添翼在X平台发布招募信息,面向Agent Harness相关开源项目开发者,开启DeepSeek Harness内测招募。

再往前推几天,英伟达CEO黄仁勋和LangChain创始人Harrison Chase进行了一次公开对谈,特别的是,平常把GPU、算力挂嘴边的老黄一点没提这些概念,两个人对谈的主题只有一个:当Agent开始真正替人调用工具、执行流程,企业该把工程资源放在哪里?

总结为一个关键词,就是“Harness”。

他甚至抛出了一个很激进的观点,“未来的公司会把越来越多能力建在Harness上。”

什么是Harness?直译过来就是“马具、缰绳”。你可以大模型比喻成一匹蓄势待发的千里马,Harness就是驾驭它的全套装备。

访谈中,黄仁勋给Harness画了一个边界:这不是一个简单的模型包装层,而是一整套围绕模型构建的智能体工程系统,包括系统提示词、工具说明、记忆管理、上下文管理、任务拆分、重试机制、评测体系、权限控制和审计追踪。

如果大模型是发动机,Harness就是把发动机变成整车的系统工程,变速箱、制动器、仪表盘、方向盘,缺一不可。

1、Harness究竟是什么?

但是,虽然上面简单介绍了Harness,仍然有很多人把它和Agent Framework混为一谈,事实上它们是不同层面的概念。

简单来说,Framework解决的是“如何开发一个Agent”,而Harness解决的是“如何让一个Agent长期可靠地运行”。举个例子,我们把一个Agent比作一个员工,Framework更像是招聘手册,告诉开发者如何创建员工,而Harness更像是企业管理系统,负责安排任务、提供工具、保存经验、监督执行,并确保员工能够持续完成工作。

从技术演进角度看,Harness的重要性类似于操作系统之于计算机。

个人电脑时代,硬件决定性能,但真正让计算机生态爆发的是Windows、Linux这样的操作系统;移动互联网时代,智能手机的价值也不仅来自芯片,而来自iOS和Android构建的软件生态。

Agent时代,大模型可能类似于芯片,Harness则更像新的操作系统,它决定AI能力如何被调用,也决定未来应用生态如何形成。

一个Harness需要很多核心能力,比如面对复杂任务时的规划能力,以避免陷入重复或者错误路径;再比如调用工具的能力,以管理模型与外部工具之间的连接,让AI能够真正影响现实环境。还有记忆和状态管理的能力,让Agent真正拥有长期记忆。

此外,企业级Agent还需要权限控制、安全机制、运行日志以及效果评估体系。所以,Harness并不是简单增加几个功能模块,而是在重新构建AI软件运行方式。

过去软件是人写规则,机器执行,而未来软件是人提出目标,AI自主规划执行。两者之间的差异就是中间需要一个新的运行层,这个运行层就是Harness。

Anthropic的Claude Code前段时间遭遇泄露源代码,51万行代码完整揭示了头部厂商的Harness六大核心组件:

1. 多层级System Prompt:超大规模、分层、可缓存的复杂指令集。固定缓存部分包含Agent身份、工具定义、安全策略,大小可达十几万token。

2. Tool Schema(工具规范):工具定义直接决定调用准确率。核心工具在模型训练阶段就完成适配,推理时无需额外提供工具描述。

3. Tool Call Loop(工具调用循环):Harness最核心的部分,分“规划模式”和“执行模式”,先理解任务、梳理文件系统、生成执行方案,再进入沙盒执行,以消除长链路执行中的中间错误,降低重试成本。

4. Context Manager(上下文管理器):采用指针索引式记忆,不直接存储完整内容,仅记录文件指针与主题标签,解决百万token上下文的高效利用问题。

5. Sub Agent(子智能体):主Agent为子Agent定义子任务,共享KV Cache与输入上下文,成本远低于串行执行。

6. Verification Hooks(验证钩子):解决模型“自我美化、虚报完成”的问题。

这套架构显示,让一个AI Agent稳定工作,可能是一个需要几十万行代码的系统工程,而不只是调用一个API。

2、为什么黄仁勋如此重视?

可以用一些数据来说明Harness的价值。

LangChain团队做过一个对照实验,让GPT-5.2-Codex在Terminal Bench 2.0上运行,后者是一个89道真实任务组成的Agent编码评测基准。如果只用默认提示词和标准工具,得分只有52.8%,排在三十名开外。

而在不修改模型权重,只调整系统提示词、工具描述和中间件后,其得分飙升到66.5%,跻身前五。模型还是那个模型,效果天壤之别,问题就在Harness上。

黄仁勋在本文开头的访谈中,也披露了一个数据。

LangChain让Nemotron 3 Ultra配合Harness优化,在Deep Agents评测中得分追到0.86,与最高分闭源模型的0.87只差0.01,单次评测成本从43.48美元压到了4.48美元,便宜近10倍。

Anthropic的研究团队也曾经让Claude Opus 4.5做过一个复古游戏制作器。单Agent不用Harness的情况下,20分钟完成,成本9美元,生成的代码达不到标准。套上三个Agent Harness(规划器、生成器、评估器)后,6小时完成,成本200美元。看着成本提高了,但输出的结果是可以端到端交付的工作软件。

真相是,模型早就具备了创造完整软件的能力,只是需要被Harness激活。

作为英伟达的老板,黄仁勋对于AI产业的判断始终围绕一个核心,就是AI最终必须进入真实世界,成为生产力。因为只有这样,他的GPU才有更大的增长空间。

Harness对应的就是这个目标,因为对企业来说,真正有价值的并不是一个能够聊天的AI,而是一批能够承担具体工作的AI员工。

未来,企业可能拥有负责市场分析的Agent、负责软件开发的Agent、负责客户服务的Agent、负责供应链管理的Agent。但是,只有Harness才能让这些Agent真正进入企业流程。

黄仁勋认为,未来每家公司都会拥有自己的AI员工,而大模型只是这些数字员工的大脑,Harness则是让AI员工进入企业组织体系的基础设施。

近年来,英伟达的战略布局已不再只是单纯销售GPU。从硬件、软件栈,到企业AI服务,再到机器人和工业智能,英伟达正在构建完整的AI计算平台,进而覆盖AI从训练到应用的整个生命周期。

但如果没有Harness,大模型只能停留在实验室和聊天窗口。有了Harness,AI才可能成为真正参与企业生产流程的智能系统。

这正是黄仁勋如此重视Harenss的原因。

3、正在进行的Harness争夺战

对AI大模型玩家来说,建立正在强大的Harness生态势在必行。

事实是,Harness之所以在近期引爆AI技术圈,很大程度上是因为 OpenAI 和Anthropic等一线大厂将其深深植入到了他们的工程体系之中,并取得了相当瞩目的成果 。

OpenAI可以说是最早意识到Harness重要性的公司之一。

2026年初,OpenAI工程师Ryan Lopopolo带着不到10人的团队,用5个月时间让Codex写出超过100万行代码,全程没有手敲一行。他把这套能让模型可靠工作的系统称为"Harness Engineering"。

这个实验看起来很简单,就是在仓库根目录加了一个不到100行的AGENTS.md文件,至少三块:项目说明、禁止操作、完成定义。Codex就从"能写代码"变成了"稳定交付"。

这个实验还揭示了一个关键理念,即AGENTS.md作为项目根目录的"总行为纲领",Agent启动时自动读取并注入系统提示词,让模型知道"这个项目的代码风格是什么、禁止操作有哪些、完成定义是什么"。

Anthropic同样在Harness上下足了功夫,其核心文件是CLAUDE.md,包括一个流式Agent循环、一套权限治理的工具调度系统、一层让模型在任意长会话中保持专注的上下文管理层。

Claude Code超过51.2万行源代码意外泄露,也验证了这一点。其涵盖了1900个TypeScript文件、40多个内置工具、46000行的查询引擎,以及一个三层自愈记忆架构。而且,泄露代码中还藏着44个未发布的功能标志。

国内厂商们自然也不甘落后,今年6月,DeepSeek正式组建Harness团队,公开招募Harness研究员、工程师和产品经理,方向明确为对标Claude Code。

国内其它大厂在Harness布局上,同样都在加码。比如腾讯就是国内最早公开布道Harness理念的大厂之一,WorkBuddy现在已成为中国日活第一的AI Agent,而从决定做claw模式到全量上线只花了一周。

之所以能跑得这么快,很重要的一个原因就是,WorkBuddy的Harness早在面向市场前就在腾讯内部完成了打磨,超过2000名员工将日常工作交给它,每一次使用和反馈都沉淀回Harness里。

开源社区的节奏比大厂更快。

其中,6月初更新的OpenClaw(龙虾)版本已经具备完善的Harness能力,QQBot能自动剥离模型推理过程、防止内部思考泄露给用户;MCP工具结果在到达提供者转换器之前被规范化,避免非文本块污染会话历史;Anthropic扩展思考在缓存过期或网关重启后自动恢复。

2026年2月上线的Hermes(爱马仕)主打"自主学习、持久记忆、越用越聪明",其最激进的设计"技能进化"机制,其实就是一种Harness工程。在完成5次及以上同类工具调用或复杂任务后,Hermes自动将执行流程提炼为标准化的技能文档。

4、如何开始写一个Harness?

说了这么多Harness的概念、趋势、大厂布局,你可能会有个想法,“我能不能动手写一个Harness?”

这并不是一件很难的事情,不需要几千行代码。最小可用的Harness,只需要理解它的核心工作方式,再加上两百行代码就能跑起来。

这里举一个最简单的例子,比如“帮我分析英伟达最近一周的重要新闻,并整理成一份公众号提纲。”

按照以往的使用习惯,大家会直接把这句话发送给大模型,这个流程就是:

“用户——大模型LLM——回答”

里面是没有Harness,大模型收到问题之后,没有规划,没有工具,也没有状态管理,只是进行了一次推理。

如果要加入一个Harness,就是把整个内容创作任务拆解成多个阶段。

通过上面的图你会发现,真正工作的已经不是模型,而是整个流程。模型只负责每一步需要思考的部分,而Harness负责组织整个执行过程。

当然,真正企业级的Harness远远没有这么简单,整个结构更接近于下面这张图。

写一个Harness,难易程度取决于你想把流程控制到什么程度。如果只是想让AI在项目里听话一点,写个AGENTS.md,200行的Markdown就够了。但如果想体验完整的Harness工程流程,最好是用Harness Engineering MCP等工具,理解runtime、tools、memory、orchestration等模块的设计,再根据自己业务场景去改造和扩展。

但无论你从哪个起点开始,核心逻辑都是一样的,就是让AI从"自由发挥"变成"有约束地执行"。

回到本文开头的公式,Agent = Model + Harness。未来,大家在使用AI时,可能首先问的不再是“用哪个模型”。而是,你的Harness搭好了吗?

未来的公司,可能不再只是人员、部门和软件的集合,而是一组持续进化的专业智能体。大模型是所有企业都能买到的基础设施,企业自己的Agent Harness,才是那个真正难以复制的、属于你自己的控制系统。