评测集从哪来: 用历史工单和真实错单 而不是演示数据

게시일: 2023-05-19 출처: 许愿牛科技

用干净演示集评测 上线后一碰真实错单就垮. 评测集要从历史工单·被驳回单·客诉来 定期加入新失败样例. 评测不过模型不准进生产.

AI试点准确率往往很好看 因为评测用整理样例. 生产里最多缺字段·写错料号·照片模糊·口语描述. 模型没见过这些 建议就飘. 评测集从哪来决定智能能不能值班. 演示数据只证明演示 历史工单和真实错单才能证明生产.

被驳回·被改写·被客诉样本当成黄金集 比再买标注团队更接近真实.

演示集如何骗过上线会

演示集类别均衡字迹清晰结论唯一. 现场类别长尾一张单多个意图责任人打架. 用前者达标覆盖后者 是把实验室指标当经营指标.

没有错单模型不会学到拒绝 它会在不该建议时仍给流畅话. 流畅在生产里是风险.

评测要用历史错单而不是干净演示集
干净准确率很漂亮. 漂亮保护不了下一张脏工单.

黄金集怎么建

  • 从近半年工单按类型抽样 强制包含驳回·改派·客诉.
  • 每条样本有标准动作或标准拒绝 争议样本由业务主人仲裁.
  • 新失败上线一周内入集 模型回归不通过不得扩场景.
  • 禁止用供应商通用集代替你们错单 行业不同错法不同.

XYN 数智化 시스템 工单质检落在可配置应用 错单可回流成评测. 评测集从真实失败来 智能才有资格说自己能进生产. 从演示来 它只是会开会.

新失败样例要在一周内进入回归评测
评测集要会生长. 不生长的集 三个月后会和模型一起过期.