數據項目喜歡先入湖、先入倉、先入表。表多了以後,分析師仍然不敢用:同一指標三張表,刷新時間不同,主鍵偶發重複。模型效果差,會被說成算法不行。其實原料沒有身份證。沒有目錄、血緣和質量評分,入表只是把混亂搬了個家。
入表之前要能講清楚:這是什麼、從哪來、能不能當生產數據用。講不清,就先別進生產鏈路。
只入表會製造更大的同名數
業務系統繼續改欄位,倉裡的表不會自動改含義。血緣一斷,口徑會在沉默中漂移。質量問題沒有評分,告警會變成全員疲勞,最後誰也不看。目錄如果只是清單,沒有主人,清單會過期得比數據更快。
智能團隊為了趕試點,會私下再抽一份"乾淨表"。私下的乾淨無法運營,人一走又回到原始混亂。

三句話過不了就不要入生產
- 目錄:中文名、業務含義、責任人、刷新頻率,缺一不可。
- 血緣:來源系統、主鍵、轉換規則,能點回單據,而不是只能點到腳本。
- 質量評分:完整性、唯一性、及時性,低於閾值不得進入經營指標和模型訓練。
- 同名指標必須合併或改名,禁止"臨時表"長期存活。
XYN 數智化系統把業務動作落在可配置應用裡,血緣可以從單據長出來。數據入表是手段。先能講清楚,智能才有資格用這些表做決定。
