一个绕不开的追问
设想两个评分系统。一个判断医患对话的质量:问诊是否充分、有没有遗漏关键病史、安抚是否到位。另一个判断客服会话的质量:有没有真正解决问题、语气是否得体、有没有做出违规承诺。
两套系统要回答的是同一个问题:AI 给出的这个分,凭什么可信。
落到工程上,给 AI 输出打分只有两条路。规则引擎把"算好"拆成可枚举的标准,关键词命中没有、必填项缺没缺、流程顺序对不对,逐条计分。LLM 直接打分把待评内容和评分要求一起交给另一个大模型,让它读完给分、给理由。
直觉几乎一边倒地偏向第二条。大模型能读懂语义、能听出弦外之音,规则那套又笨又死。但这个直觉恰恰掩盖了问题的本质:两条路线的分歧不在精度高低,而在它们根本不解决同一类问题。
确定性逻辑,还是语义判断
把两类任务摊开,差异立刻清楚。规则引擎的主场是可枚举的确定性逻辑:用药剂量在不在安全区间、必问项问了几项、退款金额有没有超过权限、输出格式是否合法。这类标准能写成 if-else,要的是 100% 精度,和每一次都一样的结果。
LLM 的主场是不可枚举的语义判断:安抚到不到位、解释够不够通俗、语气有没有居高临下、论证是否有说服力。这类判断无法穷举,要的是理解力。
错配的代价是双向的。用规则去测语义,得到的是一张几百条仍补不全的关键词表,换一种说法就失效;用 LLM 去测格式,得到的是一个连日期格式都偶尔判错的玄学考官。工具放错位置,再强的工具也是负担。
规则引擎
- 剂量是否落在安全区间
- 必问 / 必填项是否齐全
- 退款金额是否超出权限
- 输出格式 / Schema 是否合法
LLM 打分
- 安抚 / 共情是否到位
- 解释是否通俗易懂
- 语气是否居高临下
- 论证是否具有说服力
危险的不是会错,是错得有系统
对 LLM 打分最常见的担心是"不准"。准不准其实次要。真正的风险在于:它的错误有方向、成体系,而且表达得很自信。近几年学术界把 LLM-as-a-judge 的系统性偏差研究得相当透彻,四类最该知道。
位置偏好
两个答案只调换前后顺序,结论就可能翻转,且系统性偏向排在前面的那个。
MT-Bench:一致率 ≈ 65%啰嗦偏好
把答案灌水变长却不增信息,反而更容易拿高分。写长写华丽即可骗分。
灌水攻击被骗率 > 90%自我偏好
偏爱风格像自己输出的内容。自我识别能力越强,偏心越重,与对错无关。
偏向低困惑度表达不可复现
即便 temperature=0,受浮点、硬件、版本影响,同一输入打分仍会漂移。
Score Drift四类放在一起,推论很干脆。
随机噪声可以靠多次打分取平均消除,系统性偏差不能。一个稳定偏向长答案、偏向靠前答案、偏向像自己答案的考官,多打几次平均,得到的是同一个方向的系统性误差。更棘手的是,这类偏差可被反向利用:在内容审核、营销文案评分这类场景,只要把回答写长、辞藻堆得华丽,就能稳定骗到高分。
规则引擎的短板,与不可替代
规则的死穴是脆。换种表达就抓瞎,标准稍一抽象就无能为力。客观项游刃有余,碰上"共情够不够"彻底没辙。
但它有一个常被低估的价值:确定性。规则构成评估体系的地基,英文社区称之为 eval floor。它没有 LLM 的噪声,可被当作回归测试的稳定基线。一个连确定性下限都没有的评估系统,等于在流沙上盖楼。
两条路线的能力分布几乎互补。可复现、可解释、可回归、成本低,是规则的强项;语义判断与泛化,是 LLM 的主场。正因为互补,把它们摆成"二选一",从一开始就问错了。
| 维度 | 规则引擎 | LLM 打分 |
|---|---|---|
| 可复现 | 同输入永远同分 | 分数会漂移 |
| 可解释 | 扣在哪条清清楚楚 | 理由近似事后追认 |
| 可回归 | 能做回归基线 | 不能单独做金标准 |
| 语义判断 | 接近为零 | 主场 |
| 泛化 | 换说法即失效 | 应对千变万化 |
| 成本 | 极低 | 每次调用都烧钱 |
分界线画在哪,才是真功夫
成熟的评估体系早已不是单选,而是一条分层流水线。工程上真正的难点,是把规则与 LLM 的分界线画在正确位置。一条可操作的原则:能推到规则侧的判断,绝不留给 LLM。
确定性过滤
格式合法性、必填项、安全红线,用规则一刀切,先挡掉大部分明显失败。又快又便宜,不必惊动大模型。
软判断拆成检查项
把"共情够不够"拆成可勾选标准:是否先回应情绪再陈述事实、是否用对方能懂的措辞、是否打断。rubric 越细,LLM 越是照表打分而非凭印象。
语义残差 + 人工兜底
真正无法枚举的,才交 LLM,并配确定性兜底:裁判尽量输出二元通过/不通过、小模型评审团取代单模型、关键场景人工定标准与终裁。
三层之外,还有一条贯穿性的判断:LLM judge 的上限,不取决于模型多聪明,而取决于评分标准拆得多细。
这条路线的工业级样本是 OpenAI 的 HealthBench:每条回答都用医生撰写、与具体对话绑定的标准评分,累计约四万八千条评分标准。其内核,是把语义判断尽可能还原成可枚举的检查项。好的 LLM 评估,是把判断尽量重新规则化之后,剩下的那一小块语义残差。
不是单选题,是一条流水线
规则引擎与 LLM 打分,不是先进与落后之争,而是两种工具对应两类问题。规则解确定性,LLM 解语义;规则给地基,LLM 补上限。
把评估做成一条流水线,而不是一道单选题,核心动作只有一个:不断追问每一条判断,还能不能再往规则那一侧推一格。每推一格,换回一分可复现、可解释、可回归;推不动的语义残差,才交给 LLM,并为它配上确定性的安全网。
这条分界线画在哪,才是一套评估系统真正的产品功夫。