ENGINEERING 2026 · 05 · 14 方法论

Harness 工程:给 AI Agent 装上方向盘和刹车 Harness Engineering — Steering & Brakes for Agents

模型管"能不能做到",harness 管"敢不敢交付"。模型是租来的,谁都能调到同一个;harness 是你自己长出来的,那才是护城河。

00 引子

一个 demo,为什么不敢交付

一个 AI Agent 的演示,常常很惊艳:它能查资料、能调工具、能一步步把任务做完。围观的人鼓掌,但真正要为结果负责的人,往往不敢直接把它交付出去。

原因不在模型不够聪明,而在它缺了一整套东西:它记不住跨会话的偏好,出错了不会自己恢复,做了什么没有痕迹可查,更没有任何东西拦得住它去执行一个不该执行的危险动作。

业界对这件事有个越来越清晰的共识,可以浓缩成一个等式。

FIG.01Agent = Model + Harness
Agent = Model + Harness
模型负责思考(能力上限) · Harness 负责把思考变成可靠、可控、可交付的行动
01
上下文管理
02
记忆系统
03
Agent 循环
04
执行边界
05
工具生态
06
可观测与评估
harness,本意是驾驭烈马的缰绳和鞍具。模型是那匹有爆发力的马,harness 决定你能不能稳稳地骑着它到达目的地。包在模型外面那一整圈代码与结构,就是 harness。
01 比例

5% 与 95%

关于 agent 工程,有一个常被引用的估计:构建一个 agent,大约 5% 的工作是"在循环里调用模型",剩下 95% 是上下文管理、工具执行、沙箱隔离和错误处理。

大多数人的注意力,都集中在那 5% 上,盯着模型参数、盯着榜单分数。但真正决定一个 agent 能不能上线的,是另外的 95%。

FIG.02一个 agent 的工作量构成
5%Model
95%Context · Tools · Sandbox · Recovery
一个旁证:今天顶级的编程类 agent,彼此之间越来越像,相似度甚至高于它们底层用的模型。这说明行业正在找到那套承重的脚手架,工程价值沉淀在 harness 里,而不是模型里。模型决定能力上限,harness 决定结果能否每一次都复现。
02 方向盘 / 刹车

让它走对路,也让它闯不了祸

方向盘解决"方向"问题,让 agent 把劲使在正确的地方;刹车决定的是它出事的代价有多大,这是 demo 和"敢交付"之间最硬的一道分界。两者缺一不可。

FIG.03方向盘与刹车,各管一摊

方向盘

Steering · 让它走对路
  • 工具少而精:十个边界清晰的工具,胜过五十个含混重叠的
  • 上下文与记忆调度:压缩冗余、外置记忆、按需加载,决定它"看到什么"
  • 规则沉淀:把踩过的坑写成检查单,精简可执行
  • 编排能简则简:多数任务一条主线走完,别堆多 agent

刹车

Brakes · 让它闯不了祸
  • 分层护栏:输入输出两端拦越权、过滤敏感、校验合规
  • 工具风险分级:只读放行,不可逆/涉钱动作先校验
  • 人在回路:反复失败或高风险动作,必须人复核
  • 沙箱与可回滚:隔离环境、留检查点、能一键回退
  • 可观测:每步决策、每次调用、每笔成本都能查
在一个诊疗建议类场景里,"人在回路"这一层近乎强制:任何可能影响处置的结论,都该有人复核后才生效。没有刹车的 demo,只能演示,不能交付。
03 约束

软约束与硬约束

把方向盘和刹车落地时,会遇到一个根本性的选择:约束写在哪一层。很多人习惯把约束写进 prompt,反复叮嘱模型"必须这样、不准那样"。这是软约束。问题是,在一个概率系统里,规则更多是被理解,而不是被执行。哪怕你明确规定了某种操作方式,模型仍可能换条路把它绕过去。

FIG.04软约束 vs 硬约束
软约束Prompt Layer

求它别犯错。写在提示词里,叮嘱模型"必须、不准"。在概率系统里只会被理解,不保证被执行,可被绕过。

↓ 成熟 harness 的方向 ↓
硬约束System Layer

让它没法犯错。沉到结构与环境层:危险命令在沙箱被禁,越权动作在权限层被拦,非法输出在校验层被打回,错误路径根本无法发生。

软约束是"求它别犯错",硬约束是"让它没法犯错"。前者写在提示词里,后者长在系统里。成熟的 harness,是把尽可能多的软约束,翻译成硬约束。
04 结论

模型是租来的,harness 是护城河

模型管的是"能不能做到",harness 管的是"敢不敢交付"。一个普通的模型,配上一套好的 harness,能跑赢一个更强的模型配上一套糟糕的 harness。同一个模型,换一套 harness,表现可以从中游冲到前列。

这背后的道理很朴素:模型是租来的,谁都能调到同一个;harness 是你自己长出来的,那才是护城河。

给 AI Agent 装上方向盘,让它走对路;装上刹车,让它闯不了祸。这两件事做到位,一个 agent 才算真正从"能演示",走到了"敢上线"。