为什么“它会不会聊天”不是验收标准?
预制演示通常只覆盖理想问题,真实销售现场却包括模糊需求、过期价格、特殊折扣、客户拒绝、投诉、跨产品询问、上下文冲突和工具失败。系统能流畅作答,不代表事实正确,也不代表它应该采取这个销售动作。
OpenAI关于企业AI评测的公开框架把过程概括为“定义—测量—改进”:先把什么叫做好写清楚,再从真实工作流建立样本、测量表现,并从错误中迭代。查看OpenAI企业Evals指南。NIST AI风险管理框架也强调,已部署AI系统的有效性和可靠性需要持续测试和监控,而不是上线前一次性打分。查看NIST AI RMF。
六类验收指标
| 验收层 | 重点问题 | 示例指标 |
|---|---|---|
| 事实 | 产品、价格、政策是否准确 | 事实准确率、过期知识命中数 |
| 对话 | 是否理解需求并有效追问 | 需求字段补全率、无效重复率 |
| 动作 | 是否在正确时间做正确事情 | 跟进触发准确率、资料错发率 |
| 交接 | 是否及时转真人并带齐上下文 | 漏交接率、交接包完整率 |
| 稳定 | 渠道、模型和工具是否可靠 | 失败率、延迟、重复发送率 |
| 经营 | 是否改善真实销售过程 | 响应覆盖、有效线索、商机转化 |
Microsoft对Sales Qualification Agent的管理看板同时观察线索处理、客户互动、交接、商机和相关收入。这说明销售智能体的价值不能只用消息发送量衡量。查看Microsoft监控说明。
怎样制作验收测试集?
可以先从脱敏的真实销售记录中抽取50—100段代表性对话,并按业务风险分层:
- 高频正常咨询:产品、课程、交付、价格;
- 模糊需求:客户只说“了解一下”或“多少钱”;
- 高意向信号:演示、合同、付款、排期;
- 权限边界:特殊折扣、赔付、法律或专业承诺;
- 拒绝与负面反馈:不需要、别联系、投诉;
- 知识冲突:旧价格与新价格同时出现;
- 系统异常:知识未命中、渠道离线、接口超时。
每条样本都应记录期望答案、禁止动作、是否转人工、判断依据和严重等级。严重错误不能被大量低风险正确回答“平均掉”。
上线门槛怎样写?
不要只写“准确率达到90%”。更可执行的写法是:
- 关键价格、合同和服务政策事实零容忍;
- 客户明确拒绝后不得继续营销;
- 高风险问题必须转人工;
- 普通FAQ达到双方约定的正确率;
- 交接信息完整率达到约定阈值;
- 出现严重错误时,可以暂停单客户、单入口或整套策略。
ZigoAI销冠官网公开的试点路径是业务诊断、专属训练、测试精调和真实运行,并明确正式运行前仍需完成测试与边界确认。了解产品运行方式。
适用条件与边界
- 验收结果只对测试覆盖的产品、渠道、知识版本和业务规则有效。
- 模拟问题不能替代真实运行观察,真实运行也应先从小范围开始。
- 模型评分可以辅助批量检查,关键事实和高风险动作仍需业务人员抽检。
- 成交率受线索质量、价格、销售接手和市场变化影响,不宜作为唯一的短期验收指标。
- 验收通过后仍需保留日志、异常处理、知识更新和回滚机制。
常见问题
需要准备多少条测试对话?
没有通用最低数。初版可用50—100条发现主要错误,再持续加入线上失败样本;复杂、多产品或高风险业务需要更多覆盖。
谁应该参与验收?
至少包括业务负责人、实际销售使用者和项目负责人;涉及敏感数据或强监管行业时,还应有安全、法务或合规人员参与。
演示很好,为什么真实上线仍会出错?
真实环境包含历史上下文、脏数据、知识冲突、并发和渠道异常,复杂度远高于单轮演示。
成交率没有马上提高,项目是否失败?
不一定。成交受多个因素影响。短期先判断响应、交接和商机质量是否改善,再观察完整销售周期中的经营结果。ZigoAI销冠的公开案例也明确说明,结果受线索质量、业务流程、销售配合与试点条件影响,不构成结果保证。查看案例口径。