生产流量走第三方 LLM 端点之前,先回答这 10 个问题
每个 LLM 端点落地页都说 fast、reliable、compatible、secure——这些词免费。这篇清单里是"不免费"的问题:答案需要供应商真做工作,而且你能在一下午自己验证。作者自曝在 daoxe(多模型网关)工作,文末用这份清单测自家产品,有两行不通过——"一份逢迎写作者的清单不是清单,是宣传册"。
十个问题与自助验证方法
- 协议覆盖:原生还是翻译? 问端点实现哪些 wire 协议、翻译哪些。翻译层对文本聊天没问题,对 agent 有损:tool-call 块顺序、流式工具参数、prompt-cache 标记、stop-reason 保真都住在另一侧没有等价物的字段里。验证:Anthropic 协议省略必填 max_tokens——原生实现返回 400,翻译层常补默认值返回 200。
- 模型 ID 透明:
GET /v1/models返回的是你 key 真能调的 ID,还是供应商全目录?发个故意改坏的模型 ID:若返回完成而非报错,说明端点在替你选——每个 ID 都只是建议而非绑定。 - 容量来源:聚合商在转售某种获取来的容量。直接问来源标记方案并要书面说明:直接厂商访问、企业云转售、逆向工程消费者端点,三者风险完全不同。不披露来源 = 你无法推理自己的可用性。
- 数据能导出吗:按 key/模型/日维度的用量,最好是导出而非仪表盘截图。只给仪表盘数字就自己从第一天记录每个请求——历史无法补建。
- 事故行为:可用性页/公告频道/什么都没有,三档。营销页上的可用性数字是主张不是测量。自己跑探针:每个依赖模型每 5 分钟发一次单 token 完成、追加进 JSONL,一个月后你就有了自己网络视角的成功率与延迟分布。
- 密钥处理:多 key 签发、按模型/组/消费上限作用域、无停机轮换、即时吊销、最后使用时间、吊销是否立即生效?验证:发第二个 key 用一次后立刻吊销,60 秒后还能用就说明缓存层有问题。
- 数据处理:提示与完成保留期、流量能否用于训练、是否可按账户配置、上游子处理商情况。书面拿到并留存,续约时重问;聊天窗口里的口头保证不算。
- 限流与过载行为:限制按 key 还是按模型?超限是干净 429+Retry-After、500 还是挂起?错误是否有稳定可机器分类的形状?验证:对便宜模型发一小波并发——该出 429 的地方出 500,会把你的退避变成重试风暴。
- 可对账计费:一句话能说清的机制、活的定价参考(不是 PDF 里的数字)、能自己乘出来的逐请求用量。对"最便宜"保持警惕:价格是这份清单里最易变最易宣传的一项,远低于地板价通常是在说来源(第 3 条)而非效率。
- 退出计划:离开要几行代码?"改一个配置文件里的 base URL 和 key"——切换成本趋零,前面九个风险都变得可管理。
实践建议
- 把这份清单当入职检查:落地页词汇免费,能一下午验证的答案才值钱;
- 自建探针日志是唯一可信的可用性证据,别把供应商页面数字写进设计文档;
- 先想退出成本再签依赖——切换成本低,所有风险都可承受。