評測集從哪來:用歷史工單和真實錯單,而不是演示數據

發布時間: 2023-05-19 來源: 许愿牛科技

用乾淨演示集評測,上線後一碰真實錯單就垮。評測集要從歷史工單、被駁回的單、客訴裡來,並定期加入新的失敗樣例。評測不過,模型不準進入生產。

AI 試點的準確率往往很好看,因為評測用的是整理過的樣例。生產裡最多的是缺欄位、寫錯料號、照片模糊、口語化描述。模型沒見過這些,建議就飄。評測集從哪來,決定智能能不能值班。演示數據只能證明演示。歷史工單和真實錯單才能證明生產。

把被駁回、被改寫、被客訴的樣本當成黃金集,比再買標註團隊更接近真實。

演示集如何騙過上線會

演示集類別均衡、字跡清晰、結論唯一。現場類別長尾、一張單多個意圖、責任人意見打架。用前者達標去覆蓋後者,是把實驗室指標當成經營指標。

沒有錯單,模型不會學到拒絕。它會在不該建議時仍給一句流暢的話。流暢在生產裡是風險。

評測要用歷史錯單而不是乾淨演示集
乾淨的準確率很漂亮。漂亮保護不了下一張髒工單。

黃金集怎麼建

  • 從近半年工單按類型抽樣,強制包含駁回、改派、客訴。
  • 每條樣本有標準動作或標準拒絕,爭議樣本由業務主人仲裁。
  • 新失敗上線一周內入集,模型回歸不通過不得擴場景。
  • 禁止用供應商提供的通用集代替你們的錯單,行業不同,錯法不同。

XYN 數智化系統把工單和質檢落在可配置應用裡,錯單可以回流成評測。評測集從真實失敗來,智能才有資格說自己能進生產。從演示來,它只是會開會。

新的失敗樣例要在一周內進入回歸評測
評測集要會生長。不生長的集,三個月後會和模型一起過期。