更好的模型改善了数字,但没有修复产品
AI 工程里有个让人安心的幻想:系统出问题时,你告诉自己问题是模型——多花点钱、用个更强的,产品就好了。有时这是真的。CauterRule 现场测试最有用的产出之一,就是弄清楚这个故事在哪个点不再成立。这篇 dev.to 文章(Pragmatic AI Tools 系列第 14 篇)用四模型对照实验讲清了"模型天花板 vs 产品地板"。
为什么值得做云模型对照
修完解析器、prompt、结果重置和语料时间戳问题后,他们终于有了可信的基准。那一刻云模型对照才值得做:把两个可用的云模型跑完整语料(openai/gpt-4o-mini 和 meta-llama/llama-3.1-8b-instruct)。目的不只是拿更好看的数字,而是回答一个更尖锐的问题:剩余问题主要是本地模型弱,还是产品问题?
答案:两者都有,但主要是后者。
全模型对照
| 模型 | 类型 | 总行 | 候选 | 通过 | 通过% | 未定 | 失败 |
|---|---|---|---|---|---|---|---|
| omlx Llama-3.2-3B-4bit | 本地 | 393 | 379 | 72 | 19.0% | 189 | 118 |
| omlx Qwen3-4B-2507-4bit | 本地 | 373 | 373 | 93 | 24.9% | 209 | 71 |
| gpt-4o-mini | 云 | 394 | 394 | 77 | 19.5% | 248 | 69 |
| llama-3.1-8b-instruct | 云 | 394 | 392 | 123 | 31.4% | 168 | 101 |
三件事跳出来:云模型消除了大部分可用性和格式歧义,两者解析可靠性接近完美;llama-3.1-8b-instruct 是测试过的最强模型(392 个候选中 123 通过);gpt-4o-mini 运营上仍有价值——稳定、便宜、394 条轨迹全部可跑。
但表里有比排名更重要的微妙之处:即使最强模型仍产出 168 个未定和 101 个硬失败——392 个候选中 269 个(69%)输出不是明确可用。更好的模型改善了系统,没有定局产品。
模型质量真正重要的地方
精选语料是观察这个差异的最干净镜头:云模型明显帮上质量的忙,llama-3.1-8b-instruct 是最强测试模型,正面案例语料改善远快于安全语料。后一点比排名更重要。
按语料看赢家:云模型在"从失败中学习最容易"的地方赢了;在"克制最重要"的地方没有决定性胜出。raw/ci 语料上,最强模型仍从 110 条轨迹里产出 60 个未定和 39 个硬失败——这一批里最强模型依然很吵。报告里的观察值得单独拎出来:没有重放清晰度的原始广度还不是证据。产品能处理广泛原始语料,但如果产出大多是未定判断,那不等于产出了可信结果。
云模型明确改善了什么
近乎完美的解析可靠性、全语料候选生成、golden 和 failures/positive 上更强的结果、corrections 和宽原始语料上更强的表现。llama-3.1-8b-instruct 是整批里最具性价比的模型:failures/positive 上 22 通过/5 未定/3 失败(最实用的提取基准上最好的单结果)、noisy 上 5/0/0 干净横扫、raw/opencode 上 18 通过(超过其他所有模型)。报告结论:当前最佳性价比基准模型——不是最贵或最大,而是在对实际规则提取最重要的语料上稳定胜过 gpt-4o-mini。
更好的模型没修什么
这才是故事更重要的一半。即使换了更强的云模型,系统在最关乎信任的语料上仍然挣扎:successes、failures/negative、nearmiss。
- successes:最强云模型 3 通过/6 未定/11 失败。那 3 个"通过"不是胜利,是误报——successes 语料上的"通过"意味着系统从不该产生规则的轨迹里提取了规则,每个 pass 都是安全违规。
- failures/negative:最强云模型 3/1/6,现场测试每个模型都产出 5–6 个硬失败,没有模型超过 3 个通过。拒绝门与驱动提取的模型无关地弱。
- nearmiss:6 通过/1 未定/7 失败,比本地好,但失败仍多于通过。触发器在看起来相似但不应触发的案例上开火。
如果云模型清理了这些,文章会是完全不同的走向。它们没有。
差距不是模型质量,是判断质量
云对照之前,还有理由相信剩余弱点主要是模型问题:本地小模型、指令遵循有限、输出嘈杂——也许大模型能修好。云对照之后,这个解释死了。更强、解析近乎完美、跑在可信基准上的模型,在 successes 上仍产出 11 个失败,在 failures/negative 上无法可靠拒绝坏候选。问题不是模型生成不了规则,是产品的判断——何时提取、何时拒绝、何时保持沉默——不够强。
报告指出六个具体差距:安全差距(successes/failures/negative/nearmiss 上表现太弱)、重放信任差距(匹配器和重放引擎未定太多,尤其原始语料)、提升信心差距(候选很多但缺少一致安全的证据)、人工判断差距(依赖重放启发式胜过人工评审的规则质量)、发布标准差距(没有绑定安全敏感语料的显式通过/失败阈值)、运营比较差距(知道哪些模型有前景,但需要更清晰的模型类授权策略)。前三个是真正的发布阻碍。
学到的
- 更好的模型提升天花板,不提升地板。云模型抬高了最佳结果,没有抬高最差结果,地板是产品问题不是模型问题。
- 安全语料上的"通过"不总是胜利。不看语料标签数通过数会得到虚假进步感,必须知道每个语料在测什么再解读数字。
- 未定是沉默的杀手。gpt-4o-mini 394 个候选中 248 个未定(63% 输出不表态),不当失败显示、不触发警报,但也没产出可用规则。77 个通过加 248 个"也许","也许"不建立信任。还要按语料拆分未定桶,才知道哪些是匹配器的错、哪些是模型的错。
- 现场测试成功了,即使产品没有完全通过。测试迫使系统经历现实对照、暴露工具缺陷、验证修复改善信号、画出剩余工作的连贯地图。产品明显改善,产品也尚未通过严格发布门。两者同时为真,这是诚实工程报告的好结果。
如果云模型解决了一切,结论会很简单:用更好的模型。那很方便,但教得更少。实际发生的事更好:云对照把基准改善到足以暴露真正剩余的工作——更强的模型帮了很多,但核心挑战现在住在重放信任、安全和提升信心里。这正是严肃现场测试应该浮出水面的东西。云模型让产品看起来更好,也让产品剩余弱点更难否认——这就是跑它们的原因。
来源:A Better Model Improved the Numbers. It Didn't Fix the Product. - DEV Community