当裁判无法裁决:LLM 评测里那个被跳过的"无法判定"桶
CauterRule 是一个开源 sidecar:从 agent 的反复失败中学习常驻规则(extract → replay-test → promote),试着把可复用的指导从噪音般的过度泛化里分离出来。v0.1.0 已发布(GitHub 与 PyPI,pip install cauterule,含 CLI、MCP server、7 种导出格式和内置 git 规则包)。现场测试报告评估 4 个模型、394 条轨迹。
核心发现:多数结果是"无法判定"
每个 benchmark 都有三个桶:pass、fail、inconclusive。多数人只看前两个。CauterRule 的现场测试里,第三个桶比前两个加起来还大——而且它最重要。
全部 4 模型、1538 个候选的分布:
| 判定 | 数量 | 占比 |
|---|---|---|
| Pass | 365 | 23.7% |
| Fail | 359 | 23.3% |
| Inconclusive | 814 | 52.9% |
一半以上的结果是"也许"——回放引擎既没通过也没拒绝候选。这不是边缘桶,是输出的大多数,也是大多数 benchmark 报告干脆跳过的部分:pass 是胜利、fail 是损失、inconclusive 是尴尬——意味着你的评测工具没干成活。但忽略 inconclusive 桶 = 忽略一半以上数据,而且很可能从留下的一半里得出错误结论。
模型间的意外差异
| 模型 | 候选 | Inconclusive | 占比 |
|---|---|---|---|
| Local Llama 3.2B | 379 | 189 | 49.9% |
| Local Qwen 4B | 373 | 209 | 56.0% |
| Cloud GPT-4o-mini | 394 | 248 | 62.9% |
| Cloud Llama 3.1 8B | 392 | 168 | 42.9% |
最强的云模型(Llama 3.1 8B)inconclusive 率最低(42.9%)——更好的抽取产生更具体的触发器,更容易被回放引擎验证。但付费云模型 GPT-4o-mini 的 inconclusive 率最高(62.9%),超过两个本地模型。 只看 pass 数它和本地模型差不多(77 vs 72 vs 93);看 inconclusive 率它是最优柔寡断的。这不是说 4o-mini 是坏模型——它产生的是回放引擎无法评估的候选。输出不是更差,是更难打分——不同的失败,指向不同的修复。
实践建议
- 评测报告永远带上 inconclusive 桶,跳过它就是忽略大多数数据;
- 模型对比别只看 pass/fail:高 inconclusive 率("难以打分")与低正确率是不同问题;
- agent 失败学习类工具要区分"提取质量"与"验证能力"——回放引擎判不了的候选,先修可评分性。