我们在客户账户中反复观察到这样一种模式:每 token 的定价一代比一代低,但每月的 AI 支出这一行却在持续攀升。问题不在于单位成本的下降——真正的原因是对话量和模型档位使用量这两方面的增长都没有得到有效管理。
区分对话量增长与档位漂移
当账单上升时,首先要弄清楚的是两种截然不同的原因中,究竟是哪一种导致的:是整体对话数量增加(这通常是业务健康的信号,是好消息),还是有过多本不需要高档位模型处理的意图,却被路由到了昂贵的模型档位(这是一种路由效率问题,完全可以修正)。如果没有按意图划分的成本可视化数据,这两种原因很容易被混为一谈。
按意图类别设定预算,而不只是设一个总体上限
单一的月度支出总上限会造成一种不良激励:一旦接近上限,团队往往会选择全面降低服务质量,而不是去解决真正的效率问题。更好的做法是按意图类别分别设定预算:
| 意图类别 | 建议成本上限 | 依据 |
|---|---|---|
| 订单状态查询、常见问题 | 当前中位数的 2-3 倍 | 复杂度低,量大 |
| 账单查询、基础故障排查 | 当前中位数的 2 倍 | 复杂度中等 |
| 多步骤技术问题、投诉 | 逐案评估,只监控不设上限 | 预期差异较大 |
每次模型迭代都要重新审视路由阈值
每当新一代模型发布——可能更便宜、更快,有时两者兼具——哪些意图值得使用高档位模型的判断逻辑也会随之改变。与其等到出现成本异常才去复查,不如建立一个周期性的日历提醒,定期对照当前的模型格局重新评估路由阈值,这样才能在造成数月不必要支出之前就抓住节省机会。
警惕隐藏在重试与降级回退中的成本
一个不那么明显的成本漂移来源是重试和降级回退行为——一次对话如果首次尝试失败,并针对同一档位或更高档位的模型进行重试,可能会在不知不觉中把单次客户交互的实际成本成倍放大。在只显示最终成功尝试的单次对话成本视图中,这一点很容易被忽略,因此值得将重试率及其相关成本作为一个独立指标单独追踪,而不是想当然地认为它可以忽略不计。
成本管理是持续性运营工作,而非一次性设置
AI 成本管理并不是一次性的架构决策,而是一项需要与预算中其他重要支出项目同等对待、定期审查的持续运营工作。那些只设置一次按意图预算、之后再也不复查的团队,往往会逐渐退回到这套框架原本要避免的那种总体上限盲区,原因很简单:随着产品、流量结构以及底层模型格局的持续变化,各个意图类别及其合理的成本上限也在不断变化。