数据入表之前:资产目录、血缘和质量评分要先能讲清楚

Published: 2025-04-25 Source: 许愿牛科技

仓里堆满表,模型仍不敢用,是因为没人说得清这张表从哪来、谁负责、准不准。入表之前先讲清资产目录、血缘和质量评分,智能才有原料,而不是有一堆同名的数。

数据项目喜欢先入湖、先入仓、先入表。表多了以后,分析师仍然不敢用:同一指标三张表,刷新时间不同,主键偶发重复。模型效果差,会被说成算法不行。其实原料没有身份证。没有目录、血缘和质量评分,入表只是把混乱搬了个家。

入表之前要能讲清楚:这是什么、从哪来、能不能当生产数据用。讲不清,就先别进生产链路。

只入表会制造更大的同名数

业务系统继续改字段,仓里的表不会自动改含义。血缘一断,口径会在沉默中漂移。质量问题没有评分,告警会变成全员疲劳,最后谁也不看。目录如果只是清单,没有主人,清单会过期得比数据更快。

智能团队为了赶试点,会私下再抽一份"干净表"。私下的干净无法运营,人一走又回到原始混乱。

入表前要有资产目录血缘和质量评分
表可以很多。没有身份证的表,模型只能猜。

三句话过不了就不要入生产

  • 目录:中文名、业务含义、责任人、刷新频率,缺一不可。
  • 血缘:来源系统、主键、转换规则,能点回单据,而不是只能点到脚本。
  • 质量评分:完整性、唯一性、及时性,低于阈值不得进入经营指标和模型训练。
  • 同名指标必须合并或改名,禁止"临时表"长期存活。

XYN 数智化系统把业务动作落在可配置应用里,血缘可以从单据长出来。数据入表是手段。先能讲清楚,智能才有资格用这些表做决定。

质量低于阈值的表不得进入模型训练
评分是闸门。没有闸门的仓,只是一个更大的文件夹。