EVALUATION 2025 · 11 · 20 方法论

规则引擎 vs LLM 直接打分:AI 评估系统的路线选择 Rule Engine or LLM Judge — Routing the Evaluation

两条路线的分歧,不在精度高低,而在它们根本不解决同一类问题。规则解确定性,LLM 解语义;真正的功夫,是把那条分界线画在正确的位置。

00 引子

一个绕不开的追问

设想两个评分系统。一个判断医患对话的质量:问诊是否充分、有没有遗漏关键病史、安抚是否到位。另一个判断客服会话的质量:有没有真正解决问题、语气是否得体、有没有做出违规承诺。

两套系统要回答的是同一个问题:AI 给出的这个分,凭什么可信。

落到工程上,给 AI 输出打分只有两条路。规则引擎把"算好"拆成可枚举的标准,关键词命中没有、必填项缺没缺、流程顺序对不对,逐条计分。LLM 直接打分把待评内容和评分要求一起交给另一个大模型,让它读完给分、给理由。

直觉几乎一边倒地偏向第二条。大模型能读懂语义、能听出弦外之音,规则那套又笨又死。但这个直觉恰恰掩盖了问题的本质:两条路线的分歧不在精度高低,而在它们根本不解决同一类问题。

01 类别

确定性逻辑,还是语义判断

把两类任务摊开,差异立刻清楚。规则引擎的主场是可枚举的确定性逻辑:用药剂量在不在安全区间、必问项问了几项、退款金额有没有超过权限、输出格式是否合法。这类标准能写成 if-else,要的是 100% 精度,和每一次都一样的结果。

LLM 的主场是不可枚举的语义判断:安抚到不到位、解释够不够通俗、语气有没有居高临下、论证是否有说服力。这类判断无法穷举,要的是理解力。

错配的代价是双向的。用规则去测语义,得到的是一张几百条仍补不全的关键词表,换一种说法就失效;用 LLM 去测格式,得到的是一个连日期格式都偶尔判错的玄学考官。工具放错位置,再强的工具也是负担。

FIG.01两条路线对应两类问题

规则引擎

Deterministic Logic · 确定性逻辑
  • 剂量是否落在安全区间
  • 必问 / 必填项是否齐全
  • 退款金额是否超出权限
  • 输出格式 / Schema 是否合法
可枚举 → 要 100% 精度,要每次一致

LLM 打分

Semantic Judgement · 语义判断
  • 安抚 / 共情是否到位
  • 解释是否通俗易懂
  • 语气是否居高临下
  • 论证是否具有说服力
不可枚举 → 要理解力,容忍区间
一个常被引用的对照:体温计与老中医。体温计只测一个维度,但刻度客观,谁来量都一样;老中医维度俱全,但不同人、甚至同一人不同时辰,结论都可能不同。没有人用体温计辨证,也没有人请老中医读体温。
02 偏差

危险的不是会错,是错得有系统

对 LLM 打分最常见的担心是"不准"。准不准其实次要。真正的风险在于:它的错误有方向、成体系,而且表达得很自信。近几年学术界把 LLM-as-a-judge 的系统性偏差研究得相当透彻,四类最该知道。

FIG.02LLM 裁判的四类系统性偏差
α
位置偏好
Position Bias

两个答案只调换前后顺序,结论就可能翻转,且系统性偏向排在前面的那个。

MT-Bench:一致率 ≈ 65%
β
啰嗦偏好
Verbosity Bias

把答案灌水变长却不增信息,反而更容易拿高分。写长写华丽即可骗分。

灌水攻击被骗率 > 90%
γ
自我偏好
Self-Preference

偏爱风格像自己输出的内容。自我识别能力越强,偏心越重,与对错无关。

偏向低困惑度表达
δ
不可复现
Non-Reproducible

即便 temperature=0,受浮点、硬件、版本影响,同一输入打分仍会漂移。

Score Drift
随机噪声可以靠多次打分取平均消除,系统性偏差不能。一个稳定偏向长答案、靠前答案、像自己答案的考官,多打几次平均,得到的是同一个方向的系统性误差,还可被反向利用。

四类放在一起,推论很干脆。

随机噪声可以靠多次打分取平均消除,系统性偏差不能。一个稳定偏向长答案、偏向靠前答案、偏向像自己答案的考官,多打几次平均,得到的是同一个方向的系统性误差。更棘手的是,这类偏差可被反向利用:在内容审核、营销文案评分这类场景,只要把回答写长、辞藻堆得华丽,就能稳定骗到高分。

03 互补

规则引擎的短板,与不可替代

规则的死穴是。换种表达就抓瞎,标准稍一抽象就无能为力。客观项游刃有余,碰上"共情够不够"彻底没辙。

但它有一个常被低估的价值:确定性。规则构成评估体系的地基,英文社区称之为 eval floor。它没有 LLM 的噪声,可被当作回归测试的稳定基线。一个连确定性下限都没有的评估系统,等于在流沙上盖楼。

两条路线的能力分布几乎互补。可复现、可解释、可回归、成本低,是规则的强项;语义判断与泛化,是 LLM 的主场。正因为互补,把它们摆成"二选一",从一开始就问错了。

FIG.03能力分布:几乎互补
维度规则引擎LLM 打分
可复现同输入永远同分分数会漂移
可解释扣在哪条清清楚楚理由近似事后追认
可回归能做回归基线不能单独做金标准
语义判断接近为零主场
泛化换说法即失效应对千变万化
成本极低每次调用都烧钱
强项与短板几乎一一对位。这种互补结构,正是把评估从"单选题"改写成"流水线"的物理基础。
04 分界

分界线画在哪,才是真功夫

成熟的评估体系早已不是单选,而是一条分层流水线。工程上真正的难点,是把规则与 LLM 的分界线画在正确位置。一条可操作的原则:能推到规则侧的判断,绝不留给 LLM。

FIG.04分层评估流水线
L1 Rule
确定性过滤

格式合法性、必填项、安全红线,用规则一刀切,先挡掉大部分明显失败。又快又便宜,不必惊动大模型。

L2 Rubric · LLM
软判断拆成检查项

把"共情够不够"拆成可勾选标准:是否先回应情绪再陈述事实、是否用对方能懂的措辞、是否打断。rubric 越细,LLM 越是照表打分而非凭印象。

L3 LLM + Human
语义残差 + 人工兜底

真正无法枚举的,才交 LLM,并配确定性兜底:裁判尽量输出二元通过/不通过、小模型评审团取代单模型、关键场景人工定标准与终裁。

EVAL FLOOR · 确定性回归基线,贯穿全流程
这套结构与医院分诊同构:先过分诊台(规则,快、便宜、挡掉明显问题),可疑的才送专家(LLM 与人工,慢、贵、判细节)。没有哪家医院让主任医师坐在门口,给每个挂号者量体温。

三层之外,还有一条贯穿性的判断:LLM judge 的上限,不取决于模型多聪明,而取决于评分标准拆得多细。

这条路线的工业级样本是 OpenAI 的 HealthBench:每条回答都用医生撰写、与具体对话绑定的标准评分,累计约四万八千条评分标准。其内核,是把语义判断尽可能还原成可枚举的检查项。好的 LLM 评估,是把判断尽量重新规则化之后,剩下的那一小块语义残差。

05 结论

不是单选题,是一条流水线

规则引擎与 LLM 打分,不是先进与落后之争,而是两种工具对应两类问题。规则解确定性,LLM 解语义;规则给地基,LLM 补上限。

把评估做成一条流水线,而不是一道单选题,核心动作只有一个:不断追问每一条判断,还能不能再往规则那一侧推一格。每推一格,换回一分可复现、可解释、可回归;推不动的语义残差,才交给 LLM,并为它配上确定性的安全网。

这条分界线画在哪,才是一套评估系统真正的产品功夫。