编程 为什么 Token 价格下降了 75%,你的 AI 账单却翻了三倍

2026-09-06 15:14:58

为什么 Token 价格下降了 75%,你的 AI 账单却翻了三倍

Elastic 博客发表文章,探讨了一个看似矛盾的现象:尽管 LLM 的 Token 价格在过去一年中下降了约 75%,但许多企业的 AI 账单却增长了两到三倍。文章分析了导致这一现象的根本原因,并提供了控制 AI 成本的实用策略。这一分析对于正在大规模部署 AI 应用的企业具有重要参考价值。

现象:价格下降 vs 账单增长

Token 价格的下降趋势

过去一年,主要 LLM 提供商的 Token 价格显著下降:

  • GPT-4 级别模型的输入 Token 价格下降约 70-80%
  • 输出 Token 价格下降约 50-60%
  • 新模型的推出往往伴随着更低的定价
  • 竞争加剧推动价格持续下降

按常理推断,企业的 AI 账单应该随之下降。但实际情况恰恰相反。

AI 账单的增长趋势

许多企业报告:

  • AI 相关支出增长了 200-300%
  • AI 成本在 IT 预算中的占比快速上升
  • 某些部门的 AI 支出超出预算数倍
  • 成本增长速度远超预期

这一矛盾现象引发了广泛关注。

根本原因分析

1. 使用量的爆炸式增长

价格下降刺激了使用量的增长,这是最直接的原因:

  • 更多用户:价格下降使更多员工可以使用 AI 工具
  • 更多用例:企业开始在更多场景中应用 AI
  • 更频繁的调用:单次任务中的 LLM 调用次数增加
  • 更长的上下文:应用倾向于使用更长的上下文窗口

使用量的增长速度远远超过了价格下降的速度,导致总成本上升。

2. Agent 和多步骤工作流

AI 应用正从简单的单轮问答演进到复杂的 Agent 系统:

  • 多步骤推理:一个任务可能需要 5-10 次甚至更多的 LLM 调用
  • 工具调用:Agent 可能调用多个工具,每次工具调用后都需要 LLM 决策
  • 重试和纠错:Agent 可能需要多次重试才能完成任务
  • 自我验证:Agent 可能调用额外的 LLM 来验证自己的输出

一个复杂的 Agent 任务消耗的 Token 可能是简单问答的 10-100 倍。

3. 上下文膨胀

上下文窗口的扩大和 RAG 的普及导致了上下文膨胀:

  • RAG 检索:每次查询可能检索大量文档片段注入上下文
  • 对话历史:多轮对话的历史记录不断累积
  • 工具结果:工具调用的返回结果可能很大
  • 系统提示词:复杂的系统提示词可能包含数千 Token

许多应用没有优化上下文使用,导致每次调用都携带大量不必要的 Token。

4. 输出 Token 的高成本

虽然输入 Token 价格下降更多,但输出 Token 仍然昂贵:

  • 输出 Token 的价格通常是输入 Token 的 2-5 倍
  • Agent 系统往往产生大量输出(推理过程、工具调用、最终结果)
  • 某些模型的输出 Token 价格下降幅度较小
  • 长输出的生成还增加了延迟和计算成本

5. 模型选择不当

许多企业没有根据任务复杂度选择合适的模型:

  • 用大模型处理简单任务(如分类、提取)
  • 没有利用小模型或专用模型
  • 没有实现模型路由(根据任务动态选择模型)
  • 过度追求"最好"的模型而忽视成本效益

6. 缺乏成本监控和治理

许多企业在 AI 成本管理方面存在盲区:

  • 没有细粒度的成本追踪(按用户、部门、用例)
  • 没有设置预算和告警
  • 没有成本优化的流程和责任人
  • 缺乏对 AI 应用 ROI 的评估

成本控制策略

1. 实现细粒度成本监控

建立全面的成本监控体系:

  • 按用户、部门、应用、用例追踪 Token 使用
  • 监控输入/输出 Token 的比例
  • 追踪每次任务的平均调用次数
  • 设置预算阈值和实时告警
  • 定期生成成本分析报告

2. 优化上下文使用

减少不必要的 Token 消耗:

  • 实现智能的对话历史管理(摘要、截断)
  • 优化 RAG 检索(只返回最相关的片段)
  • 精简系统提示词
  • 实现上下文窗口的动态调整
  • 使用上下文压缩技术

3. 实现模型路由

根据任务复杂度选择合适的模型:

  • 简单任务用小模型(分类、提取、格式化)
  • 复杂任务用大模型(推理、生成、规划)
  • 实现自动的模型选择逻辑
  • 建立模型性能和成本的基准测试
  • 考虑使用专用模型(代码模型、数学模型等)

4. 优化 Agent 设计

减少 Agent 的不必要调用:

  • 优化规划逻辑,减少步骤数
  • 实现高效的工具调用(批量调用、并行调用)
  • 减少重试次数(改进提示词、增加约束)
  • 避免冗余的自我验证
  • 实现 Agent 的提前终止条件

5. 利用缓存和批处理

减少重复计算:

  • 实现 LLM 响应缓存(相同查询返回缓存结果)
  • 使用批处理 API 处理大量请求
  • 预计算和缓存嵌入向量
  • 利用提供商的折扣(预留容量、承诺使用)

6. 建立成本治理流程

从组织层面管理 AI 成本:

  • 设立 AI 成本管理的责任人
  • 建立 AI 应用的审批流程
  • 制定 AI 使用的最佳实践指南
  • 定期审查和优化 AI 应用
  • 将 AI 成本纳入 IT 财务管理体系

成本优化的 ROI

实施成本优化策略可以带来显著的回报:

  • 上下文优化通常可以减少 30-50% 的 Token 使用
  • 模型路由可以将简单任务的成本降低 70-90%
  • Agent 优化可以减少 20-40% 的调用次数
  • 缓存可以减少 10-30% 的重复计算
  • 综合优化通常可以将 AI 账单降低 50% 以上

这些优化不需要牺牲输出质量,通过合理的架构设计和工程实践,可以在保持甚至提升质量的同时大幅降低成本。

总结

Token 价格下降但 AI 账单增长的矛盾现象,根源在于使用量的爆炸式增长、Agent 多步骤工作流、上下文膨胀、输出 Token 高成本、模型选择不当和缺乏成本治理。要控制 AI 成本,企业需要从技术和组织两个层面入手:技术上实现细粒度成本监控、优化上下文使用、实现模型路由、优化 Agent 设计、利用缓存和批处理;组织上建立成本治理流程、设立责任人、制定最佳实践。随着 AI 应用从实验阶段走向大规模部署,成本管理将成为企业 AI 战略的核心组成部分。那些能够在保持质量的同时有效控制成本的企业,将在 AI 时代获得显著的竞争优势。

来源:https://www.elastic.co/blog/token-costs-ai-bills

推荐文章

程序员茄子在线接单