數據入表之前:資產目錄、血緣和質量評分要先能講清楚

發布時間: 2025-04-25 來源: 许愿牛科技

倉裡堆滿表,模型仍不敢用,是因為沒人說得清這張表從哪來、誰負責、準不準。入表之前先講清資產目錄、血緣和質量評分,智能才有原料,而不是有一堆同名的數。

數據項目喜歡先入湖、先入倉、先入表。表多了以後,分析師仍然不敢用:同一指標三張表,刷新時間不同,主鍵偶發重複。模型效果差,會被說成算法不行。其實原料沒有身份證。沒有目錄、血緣和質量評分,入表只是把混亂搬了個家。

入表之前要能講清楚:這是什麼、從哪來、能不能當生產數據用。講不清,就先別進生產鏈路。

只入表會製造更大的同名數

業務系統繼續改欄位,倉裡的表不會自動改含義。血緣一斷,口徑會在沉默中漂移。質量問題沒有評分,告警會變成全員疲勞,最後誰也不看。目錄如果只是清單,沒有主人,清單會過期得比數據更快。

智能團隊為了趕試點,會私下再抽一份"乾淨表"。私下的乾淨無法運營,人一走又回到原始混亂。

入表前要有資產目錄血緣和質量評分
表可以很多。沒有身份證的表,模型只能猜。

三句話過不了就不要入生產

  • 目錄:中文名、業務含義、責任人、刷新頻率,缺一不可。
  • 血緣:來源系統、主鍵、轉換規則,能點回單據,而不是只能點到腳本。
  • 質量評分:完整性、唯一性、及時性,低於閾值不得進入經營指標和模型訓練。
  • 同名指標必須合併或改名,禁止"臨時表"長期存活。

XYN 數智化系統把業務動作落在可配置應用裡,血緣可以從單據長出來。數據入表是手段。先能講清楚,智能才有資格用這些表做決定。

質量低於閾值的表不得進入模型訓練
評分是閘門。沒有閘門的倉,只是一個更大的文件夾。