评测集从哪来:用历史工单和真实错单,而不是演示数据

Publié le: 2023-05-19 Source: 许愿牛科技

用干净演示集评测,上线后一碰真实错单就垮。评测集要从历史工单、被驳回的单、客诉里来,并定期加入新的失败样例。评测不过,模型不准进入生产。

AI 试点的准确率往往很好看,因为评测用的是整理过的样例。生产里最多的是缺字段、写错料号、照片模糊、口语化描述。模型没见过这些,建议就飘。评测集从哪来,决定智能能不能值班。演示数据只能证明演示。历史工单和真实错单才能证明生产。

把被驳回、被改写、被客诉的样本当成黄金集,比再买标注团队更接近真实。

演示集如何骗过上线会

演示集类别均衡、字迹清晰、结论唯一。现场类别长尾、一张单多个意图、责任人意见打架。用前者达标去覆盖后者,是把实验室指标当成经营指标。

没有错单,模型不会学到拒绝。它会在不该建议时仍给一句流畅的话。流畅在生产里是风险。

评测要用历史错单而不是干净演示集
干净的准确率很漂亮。漂亮保护不了下一张脏工单。

黄金集怎么建

  • 从近半年工单按类型抽样,强制包含驳回、改派、客诉。
  • 每条样本有标准动作或标准拒绝,争议样本由业务主人仲裁。
  • 新失败上线一周内入集,模型回归不通过不得扩场景。
  • 禁止用供应商提供的通用集代替你们的错单,行业不同,错法不同。

XYN 数智化系统把工单和质检落在可配置应用里,错单可以回流成评测。评测集从真实失败来,智能才有资格说自己能进生产。从演示来,它只是会开会。

新的失败样例要在一周内进入回归评测
评测集要会生长。不生长的集,三个月后会和模型一起过期。