一个 demo,为什么不敢交付
一个 AI Agent 的演示,常常很惊艳:它能查资料、能调工具、能一步步把任务做完。围观的人鼓掌,但真正要为结果负责的人,往往不敢直接把它交付出去。
原因不在模型不够聪明,而在它缺了一整套东西:它记不住跨会话的偏好,出错了不会自己恢复,做了什么没有痕迹可查,更没有任何东西拦得住它去执行一个不该执行的危险动作。
业界对这件事有个越来越清晰的共识,可以浓缩成一个等式。
上下文管理
记忆系统
Agent 循环
执行边界
工具生态
可观测与评估
5% 与 95%
关于 agent 工程,有一个常被引用的估计:构建一个 agent,大约 5% 的工作是"在循环里调用模型",剩下 95% 是上下文管理、工具执行、沙箱隔离和错误处理。
大多数人的注意力,都集中在那 5% 上,盯着模型参数、盯着榜单分数。但真正决定一个 agent 能不能上线的,是另外的 95%。
让它走对路,也让它闯不了祸
方向盘解决"方向"问题,让 agent 把劲使在正确的地方;刹车决定的是它出事的代价有多大,这是 demo 和"敢交付"之间最硬的一道分界。两者缺一不可。
方向盘
- 工具少而精:十个边界清晰的工具,胜过五十个含混重叠的
- 上下文与记忆调度:压缩冗余、外置记忆、按需加载,决定它"看到什么"
- 规则沉淀:把踩过的坑写成检查单,精简可执行
- 编排能简则简:多数任务一条主线走完,别堆多 agent
刹车
- 分层护栏:输入输出两端拦越权、过滤敏感、校验合规
- 工具风险分级:只读放行,不可逆/涉钱动作先校验
- 人在回路:反复失败或高风险动作,必须人复核
- 沙箱与可回滚:隔离环境、留检查点、能一键回退
- 可观测:每步决策、每次调用、每笔成本都能查
软约束与硬约束
把方向盘和刹车落地时,会遇到一个根本性的选择:约束写在哪一层。很多人习惯把约束写进 prompt,反复叮嘱模型"必须这样、不准那样"。这是软约束。问题是,在一个概率系统里,规则更多是被理解,而不是被执行。哪怕你明确规定了某种操作方式,模型仍可能换条路把它绕过去。
求它别犯错。写在提示词里,叮嘱模型"必须、不准"。在概率系统里只会被理解,不保证被执行,可被绕过。
让它没法犯错。沉到结构与环境层:危险命令在沙箱被禁,越权动作在权限层被拦,非法输出在校验层被打回,错误路径根本无法发生。
模型是租来的,harness 是护城河
模型管的是"能不能做到",harness 管的是"敢不敢交付"。一个普通的模型,配上一套好的 harness,能跑赢一个更强的模型配上一套糟糕的 harness。同一个模型,换一套 harness,表现可以从中游冲到前列。
这背后的道理很朴素:模型是租来的,谁都能调到同一个;harness 是你自己长出来的,那才是护城河。
给 AI Agent 装上方向盘,让它走对路;装上刹车,让它闯不了祸。这两件事做到位,一个 agent 才算真正从"能演示",走到了"敢上线"。