AI 试点的准确率往往很好看,因为评测用的是整理过的样例。生产里最多的是缺字段、写错料号、照片模糊、口语化描述。模型没见过这些,建议就飘。评测集从哪来,决定智能能不能值班。演示数据只能证明演示。历史工单和真实错单才能证明生产。
把被驳回、被改写、被客诉的样本当成黄金集,比再买标注团队更接近真实。
演示集如何骗过上线会
演示集类别均衡、字迹清晰、结论唯一。现场类别长尾、一张单多个意图、责任人意见打架。用前者达标去覆盖后者,是把实验室指标当成经营指标。
没有错单,模型不会学到拒绝。它会在不该建议时仍给一句流畅的话。流畅在生产里是风险。

黄金集怎么建
- 从近半年工单按类型抽样,强制包含驳回、改派、客诉。
- 每条样本有标准动作或标准拒绝,争议样本由业务主人仲裁。
- 新失败上线一周内入集,模型回归不通过不得扩场景。
- 禁止用供应商提供的通用集代替你们的错单,行业不同,错法不同。
XYN 数智化系统把工单和质检落在可配置应用里,错单可以回流成评测。评测集从真实失败来,智能才有资格说自己能进生产。从演示来,它只是会开会。
