AI 試點的準確率往往很好看,因為評測用的是整理過的樣例。生產裡最多的是缺欄位、寫錯料號、照片模糊、口語化描述。模型沒見過這些,建議就飄。評測集從哪來,決定智能能不能值班。演示數據只能證明演示。歷史工單和真實錯單才能證明生產。
把被駁回、被改寫、被客訴的樣本當成黃金集,比再買標註團隊更接近真實。
演示集如何騙過上線會
演示集類別均衡、字跡清晰、結論唯一。現場類別長尾、一張單多個意圖、責任人意見打架。用前者達標去覆蓋後者,是把實驗室指標當成經營指標。
沒有錯單,模型不會學到拒絕。它會在不該建議時仍給一句流暢的話。流暢在生產裡是風險。

黃金集怎麼建
- 從近半年工單按類型抽樣,強制包含駁回、改派、客訴。
- 每條樣本有標準動作或標準拒絕,爭議樣本由業務主人仲裁。
- 新失敗上線一周內入集,模型回歸不通過不得擴場景。
- 禁止用供應商提供的通用集代替你們的錯單,行業不同,錯法不同。
XYN 數智化系統把工單和質檢落在可配置應用裡,錯單可以回流成評測。評測集從真實失敗來,智能才有資格說自己能進生產。從演示來,它只是會開會。
