编程 推理强度参数实测:更高档位不等于更好答案,只等于更贵

2026-09-08 01:11:24

GPT-6 Astra 推理强度定价实测:max 比 low 贵 2.3 倍,答案相同

在 GPT-6 Astra 上,reasoning_effort: "max" 的花费是 low 的 2.3 倍,而在全部 11 个已验证任务上返回相同答案;唯一改变准确率的设置是 none——33 次运行失败 17 次。reasoning_effort 是控制模型在回答前做多少隐藏思考的请求参数,思考按输出价计费为 reasoning tokens,从 none 到 max 的有序档位就是这篇测的梯子。

梯子与文档不符:API 自己的输入检查宣传七个值,其中一个(minimal)在每个模型上都被拒绝,一个文档从未提及的值(disabled)在 Astra 上被接受且不会关闭任何东西。这影响怎么读 OpenAI 的发布基准——报告为"任意 effort 下的最大值",排行榜数字来自梯子最贵的一档。

TL;DR

  • GPT-6 Astra 接受七个 reasoning_effort 值(含 none 和 disabled);文档列五个并称 none 不受支持;
  • none 是唯一把 reasoning tokens 清零的值,它失败 33 个已验证任务里的 17 个;其他每档 33/33;
  • disabled 花 243 个 reasoning tokens(对比 low 的 151),每个正确答案贵 54%,准确率相同;
  • 按牌价,GPT-6 Astra 每个正确答案成本是 GPT-5.6 Sol 的 1.57 倍(low)与 2.57 倍(max)——在两者都答对的工作上。

基准上的位置

agent 风格工作(模型在循环里驱动工具,常在终端)领先;在 Humanity's Last Exam 和 Artificial Analysis Intelligence Index(十个评测的独立聚合)上落后 Claude Fable 5.1。且每个分数都报在"最高档位"——表格里:Terminal-Bench 4.0 Astra 57.9% vs Sol 37.3%、Fable 5.1 55.8%;Terminal-Bench Science 0.1 Astra 64.6%;FrontierMath Tier 4 Astra 97.6% vs Sol 83.0%;ARC-AGI-3 Astra 99.9% vs Sol 7.8%;Humanity's Last Exam with tools Astra 57.2% vs Fable 5.1 65.0%(差 7.8 分,在表里但不在正文里);Artificial Analysis 指数 Astra 61.2 vs Fable 5.1 65.7——Astra 在 OpenAI 自己的表里落后于 Fable 5.1、Opus 5 和 Fable 5。

还有三点:网络安全分数是 OpenAI 自述"没有生产防护"下测的,正式发布的模型"会拒绝"概念验证漏洞利用任务;表格下那句连接基准与账单的话是"评测分数为任意 effort 下的最大值"。

实践建议

  • 用 API 前实测自己任务的 effort 档位:多数任务 low 与 max 答案相同,成本差 2.3 倍;
  • 读模型发布基准先问"这个分数是哪个 effort 档位报的"——"最大值"意味着最贵档;
  • 成本敏感场景别默认 max,从 low 起步用任务级评测验证增量收益。

来源:GPT-6 Astra Reasoning Effort: max Costs 2.3x low for the Same Answers - DEV Community

复制全文 生成海报 AI LLM 定价 评测

推荐文章

程序员茄子在线接单