數據質量差不要先上 AI:清洗、口徑、權限的最小閉環

發布時間: 2023-03-17 來源: 许愿牛科技

數據又髒又不一致時上 AI,模型會把錯誤說得更像真理。先做清洗、口徑和權限的最小閉環:誰負責、怎麼定義、誰能看。閉環轉起來,智能才有原料,而不是有一堆會說話的髒數。

數據質量差時上 AI,是把不確定加速。報表對不上,模型仍會給出流暢建議,現場更難反駁。清洗如果只是一次性導表,過兩周又髒。缺的不是算法,是最小閉環:髒數據能被發現、有口徑主人、有權限邊界,並且能回到業務單據去改。

不要先上 AI。先讓一張核心表變得可信任。可信任的標準不是完美,是爭議有人收口。

髒數據上智能會怎樣

同一客戶多個編碼,模型會把逾期和優質混在一起。同一產量兩種口徑,預測會在會議上當場翻車。權限不收口,敏感欄位進入提示詞,合規會叫停整個項目。智能變成了髒數據的擴音器。

一次性清洗外包更危險。外包離開後,沒有主人的表會立刻回潮。回潮後,業務不再相信任何智能結論。

上AI前要先有數據清洗口徑和權限閉環
流暢不是正確。正確要先有主人。沒有主人的數,不配進模型。

最小閉環長什麼樣

  • 選一個經營指標,寫清定義、取數點、刷新頻率、責任人。
  • 質量規則(空值、重複、跨系統不一致)每日跑,低於閾值不得進駕駛艙。
  • 修正必須回到源單據,禁止只在倉裡改一版"乾淨表"。
  • 權限按欄位,導出和訓練默認最小集,擴大要審批。

XYN 數智化系統把業務動作落在可配置應用裡,口徑和權限可以跟單據走。數據質量差時,先讓閉環轉。轉起來了,再談 AI。否則智能只是更貴的猜。

數據修正必須回到源單據而不是只改寬表
倉裡的乾淨是假乾淨。源單據改了,閉環才算轉完一圈。