本月发布的版本解决了自我们上线智能体记忆 API 以来收到的两个最常见需求:一是在改动触及真实客户之前,提供一种安全的测试方式;二是提供一种直接的方法,用来在事后证明智能体做了什么、为什么这么做。

智能体模拟沙盒

在此之前,测试提示词或策略变更,要么依赖人工在少数精心挑选的场景上做 QA,要么直接将改动推送给一小部分真实流量,然后观察是否出现问题。全新的模拟沙盒会将拟议的改动放到一个包含数千条历史匿名对话回放的库中运行,精确指出哪些历史交互在新版本下会得出不同的结果,并标记出任何会给出与现行策略相悖答案的情况。

团队可以基于自己遇到的边缘案例构建自定义场景集,并在未来每次改动时重新运行这些场景——这意味着从过往事故中吃一堑长一智,不必等到下次有人改动同一处配置时才重新踩坑。该沙盒还支持并排对比,可同时展示当前生产环境智能体与拟议改动版本针对同一历史输入给出的回应。

合规审计追踪

现在,每一次自主决策——无论是问题解决、退款批准、升级处理,还是拒绝请求——都会生成一条结构化、可导出的审计记录:

  • 输入:触发该决策的客户消息以及提取出的任何实体
  • 策略版本:该时刻生效的确切规则集
  • 模型版本:处理该轮对话所用的模型及其配置
  • 推理摘要:以通俗语言呈现的决策路径追踪
  • 结果:所采取的操作及其结果

这些记录可按客户、日期范围、决策类型和策略版本进行查询,且一经写入即不可更改——这是任何可能需要将其作为争议证据提交的账户所必须满足的要求。

本次发布的其他更新

已读回执功能现已覆盖所有消息渠道集成,不再局限于网页聊天,这填补了运行大规模 WhatsApp 和 WeChat 部署的团队一直以来反复提出的一个需求缺口。4 月上线的推理引擎现已支持在挂件(widget)中流式输出部分回复,通过在生成过程中即时展示回答内容,而不是等待完整答案生成完毕,从而降低了较长回答的感知延迟。

审计追踪支持按客户、按日期范围、按决策类型、按策略版本进行查询,因此合规团队在调查某个具体投诉时,可以在几秒钟内调出确切的记录,而无需在数周的对话记录中逐一搜索。记录会根据每个账户配置的保留策略进行保存,且一经写入即不可更改,这一点对任何可能需要将其作为争议证据提交的账户都至关重要。

可用性

模拟沙盒现已在 Growth 版和 Enterprise 版计划中开放使用;合规审计追踪导出功能仅限 Enterprise 版,可通过您的客户团队申请开通。我们预计这两项功能都将成为任何大规模、频繁调整智能体配置的团队不可或缺的基础工具。