质量评测不是挑几段“聊得像真人”的对话
语言自然只是表层体验。一个回复可能语气很好,却引用了过期价格;也可能事实正确,却没有识别客户正在比较方案、要求人工或明确拒绝继续联系。对企业而言,真正要评的是整套系统能否在具体销售场景中完成预期任务,同时把不可接受的错误拦在上线之前。
OpenAI的评测最佳实践建议先定义目标,再使用生产数据、历史日志和专家构造样本建立数据集,明确指标后运行比较,并持续把新问题补入评测。官方同时提醒,生成式模型具有变化性,只沿用传统软件的少量确定性测试并不足够。查看OpenAI评测最佳实践。
因此,评测对象不应只写成“模型好不好”,而应是一个可验收任务,例如:面对首次咨询,能否基于已提供资料回答问题、补齐必要需求,并在出现报价审批、投诉或知识缺口时正确交接。
六个维度,分别回答六种风险
| 评测维度 | 核心问题 | 典型失败 |
|---|---|---|
| 事实与依据 | 回答是否能由当前有效资料支持 | 编造功能、引用过期价格、来源与结论不符 |
| 意图与任务 | 是否理解客户目的并完成当前任务 | 答非所问、遗漏关键问题、错误判断阶段 |
| 销售推进 | 下一步是否必要、自然且符合SOP | 无目的追问、过早索取电话、重复催促 |
| 安全与边界 | 是否拒绝越权并及时转人工 | 错误承诺、隐私泄露、拒绝后继续营销 |
| 工具与动作 | 调用对象、参数和结果处理是否正确 | 发错资料、重复建任务、工具失败后假装成功 |
| 客户体验 | 表达是否清楚、克制、连贯 | 模板腔、信息过载、身份或口径前后冲突 |
若系统使用知识检索,还要把“检索到正确材料”和“最终回答忠于材料”分开测量。Microsoft对RAG评测的说明区分了相关性、忠实性和回答完整性:回答既不能加入来源之外的主张,也不能漏掉完成任务所需的关键信息。查看Microsoft RAG评测指标。
测试集先覆盖场景,再追求数量
不存在适用于所有企业的固定题量。更可靠的起点,是把业务拆成“常见任务、困难边界、风险阻断、真实失败”四层,并确认每个重要场景都有代表性样本:
- 常见任务:产品咨询、需求补齐、资料推荐、预约和普通跟进;
- 困难边界:信息模糊、多意图、长上下文、口语缩写、前后修改需求;
- 风险阻断:价格与合同承诺、投诉、隐私、提示词注入、明确拒绝和必须转人工;
- 真实失败:从生产质检、人工纠错、客户负面反馈和工具异常中持续回收。
样本应保留输入、允许使用的知识、期望动作、不可接受动作和判定理由。使用真实聊天记录时,需要先脱敏并控制访问范围;若只保存一句“标准答案”,评审者很难判断其他同样正确的表达。
OpenAI建议测试数据覆盖典型、边缘和对抗样本,并避免只用与训练或调试样本高度相似的数据。查看数据集设计建议。测试集还应按渠道、产品、客户阶段和任务类型切片,防止总体平均分掩盖某个关键场景持续失败。
评分项与阻断项必须分开
语气、简洁度、需求理解等可以使用等级分或成对比较;但错误报价、暴露个人信息、绕过审批、客户明确拒绝后仍触达,以及应转人工却继续自动处理,不应被其他高分抵消。更稳妥的方式是设置两层门槛:
- 先过红线:任何关键阻断项出现即停止该版本上线,记录原因并修复;
- 再比质量:在红线通过的版本中,比较事实、任务完成、推进质量、体验与成本。
NIST AI风险管理框架把有效可靠、安全、隐私、透明和有害偏差管理等共同视为可信AI特征,并强调应按实际使用情境持续测量和管理,而不是只观察单一准确率。查看NIST可信AI特征。
销售结果可以作为后续观察指标,但不能简单等同于回复质量。成交还受到线索来源、价格、销售接手、供给和周期影响。更合理的做法是先证明AI行为合格,再观察合格行为是否改善有效需求、人工接手和商机推进。
人工评审与自动评分怎样配合?
规则程序适合检查链接、字段、固定禁语、是否调用工具和结构完整性;模型评分适合处理相关性、表达和复杂语义;业务专家负责价格、政策、销售判断与高风险边界。三者应组合使用,而不是彼此替代。
自动评分器上线前,要用一批经过多人复核的样本做校准,观察它与专家是否经常在同一类问题上分歧。评分标准尽量写成可判断的问题,例如“是否包含知识库之外的产品能力主张”,而不是“回答是否优秀”。OpenAI建议优先使用分类、成对比较或按明确标准打分,并持续校准自动评分与人工判断。查看评分器设计建议。
涉及动作型智能体时,还要评估过程:是否选择正确工具、参数是否正确、工具报错后是否如实说明、是否在未经授权时执行高影响操作。OpenAI的智能体安全指南把提示词注入、数据泄露和不恰当工具调用列为需要通过设计与评测共同控制的风险。查看OpenAI智能体安全指南。
一套可执行的七步评测流程
- 定义范围:写清AI负责什么、不负责什么,以及必须交给谁。
- 建立能力地图:按场景、渠道、阶段、知识和动作列出待测能力。
- 整理测试集:使用脱敏真实样本,补充边界、对抗和必须阻断的问题。
- 编写评分规则:为每项写明通过、失败、严重程度和判断依据。
- 运行与复核:固定模型、提示词、知识和工具版本,自动评分后抽样人工复核。
- 执行上线门槛:红线全部通过,关键场景达到预设标准,遗留风险有人负责。
- 持续回归:小流量上线,监测真实错误;每次提示词、知识、模型或工具变化都重跑相关测试。
NIST的Measure Playbook建议定义可接受的性能边界,记录无法测量的风险,并比较部署前后表现;这意味着评测报告不仅要给分,还要说明适用范围、未覆盖项和超限后的纠正动作。查看NIST Measure Playbook。
如果正在设计首次验收,可以配合AI销售项目验收清单确定责任边界;若准备比较新旧版本,可继续参考AI销售A/B测试方法和提示词与知识库版本管理。
评测报告至少回答什么?
- 本次测试对应哪个模型、提示词、知识和工具版本;
- 覆盖了哪些渠道、产品、阶段与风险场景;
- 哪些阻断项通过,哪些失败,失败是否已经复测;
- 总体结果与关键切片结果是否一致;
- 人工与自动评分分歧集中在哪里;
- 哪些能力没有测、为什么没有测、上线后如何监控;
- 最终决定是上线、小流量、修改重测还是停止。
一份只展示平均分、不展示失败样本的报告,无法支持上线判断。质量评测的价值不是证明系统“很智能”,而是让团队知道它在哪些条件下可用、出错时会造成什么影响,以及谁负责收口。
适用条件与边界
- 本文适用于企业AI销售系统的通用评测设计,不构成某一产品已经具备相关评测功能的说明。
- 涉及医疗、金融、法律、未成年人、合同与特殊价格的场景,应提高人工审核和上线门槛。
- 真实客户对话进入测试集前,应完成必要脱敏、权限控制、用途限定和保存期限管理。
- 自动评分只能提高覆盖效率;关键错误、低置信度和评分分歧仍需业务专家复核。
- 离线分数只代表测试条件,不能替代小流量验证、生产监测和人工接手机制。
- ZigoAI销冠官网当前未公开内置评测平台细节;具体测试、报表与版本能力需在项目启动前确认。
常见问题
AI销售评测可以只看回答准确率吗?
不可以。还应检查需求理解、下一步推进、拒答与转人工、工具调用、隐私安全及客户体验;错误报价等高风险问题应单独设为阻断项。
测试集需要多少条对话?
没有适用于所有企业的固定数量。应先覆盖主要场景与高风险边界,再按错误类型和真实流量持续补充;是否充分取决于覆盖度,而不只是条数。
可以完全用大模型给大模型打分吗?
可以用于规模化初筛,但不能直接替代人工。评分标准要具体,自动评分器需用专家标注样本校准,高风险失败和分歧样本仍应由人复核。
离线评测通过后可以直接全量上线吗?
不建议。离线通过只证明系统在测试条件下达到门槛,还应经过小流量验证,并持续监测真实环境中的错误、交接和客户反馈。
ZigoAI销冠是否公开了内置评测平台?
截至本文核查日,官网没有公开内置评测平台的具体说明。本文提供通用质量评测框架,具体测试、报表和版本能力应在项目启动前确认。