距离我们四月份报道的推理模型部署案例已过去大约六个月,各客户账户积累的生产数据已经足够多,足以清晰看出哪些部署兑现了承诺、哪些则远未达到预期——而两者的差异更多在于运营纪律,而非模型选择。

两种模式,而非一个连续谱系

特征 成功的部署 停滞的部署
升级矩阵 每月审查 上线后从未变动
上线前的变更测试 每次都用模拟沙盒(Simulation Sandbox) 临时起意,想起来才做
对话审计 对照业务结果 对照语气,或干脆不审计
成本跟踪 按意图类别拆分 只看总账单,甚至完全不看
六个月后的结果 解决率提升幅度约为对照组的3倍 尽管升级了模型,表现仍持平

几乎无一例外,过去两个季度中自主解决率增幅最大的账户,都是把我们今年分别撰写过的各项实践,当作一个相互关联的整体系统来采纳——没有任何一项单独的实践能解释这种差距,真正起作用的是这些实践的组合,并且是作为常规运营而非一次性举措来执行的。这与Q2基准报告在七月得出的结论几乎完全吻合:头部账户的区别在于审查节奏,而非所处行业或所使用的模型。

审查习惯与审查形式之间的区别

并非所有日历上写着"月度审查"的账户,都实现了这一规律所预示的增长。在名义上按月审查的账户中,真正的分水岭在于:审查是否真的促成了改变——如果审查连续数月都得出"无需调整"的结论,其表现与完全没有审查流程的账户一样趋于平淡。真正起作用的不是会议本身,而是根据审查结果切实调整阈值和路由规则的意愿。

这对未来六个月意味着什么

在2026年,支撑安全、快速迭代的工具链——模拟测试、影子模式、金丝雀发布、成本可视化、审计追踪——已经足够成熟,以至于强弱部署之间的剩余差距,越来越多地是一种运营选择,而非技术局限。真正领先的团队,靠的不是用上了更好的模型,而是把AI智能体当作一个需要持续、严格维护的系统,而不是一个只上线一次的项目。

考虑到今年产品路线图中有相当大一部分——从模拟沙盒到智能体治理2.0(Agent Governance 2.0)——都是专门为了消除这种持续维护中的摩擦而构建的,我们预计有纪律和无纪律的部署之间的差距只会进一步扩大,而不是缩小,因为现有工具已经让保持这种纪律比以往任何时候都更容易、更廉价。六个月的生产数据得出了一个相当明确的结论:在2026年,AI客服部署周围的运营纪律,其重要性至少不亚于底层所用的模型;而真正重要的那种纪律,是根据审查结果切实采取行动的意愿,而不仅仅是存在一个定期会议。