数据质量差不要先上 AI:清洗、口径、权限的最小闭环

Diterbitkan: 2023-03-17 Sumber: 许愿牛科技

数据又脏又不一致时上 AI,模型会把错误说得更像真理。先做清洗、口径和权限的最小闭环:谁负责、怎么定义、谁能看。闭环转起来,智能才有原料,而不是有一堆会说话的脏数。

数据质量差时上 AI,是把不确定加速。报表对不上,模型仍会给出流畅建议,现场更难反驳。清洗如果只是一次性导表,过两周又脏。缺的不是算法,是最小闭环:脏数据能被发现、有口径主人、有权限边界,并且能回到业务单据去改。

不要先上 AI。先让一张核心表变得可信任。可信任的标准不是完美,是争议有人收口。

脏数据上智能会怎样

同一客户多个编码,模型会把逾期和优质混在一起。同一产量两种口径,预测会在会议上当场翻车。权限不收口,敏感字段进入提示词,合规会叫停整个项目。智能变成了脏数据的扩音器。

一次性清洗外包更危险。外包离开后,没有主人的表会立刻回潮。回潮后,业务不再相信任何智能结论。

上AI前要先有数据清洗口径和权限闭环
流畅不是正确。正确要先有主人。没有主人的数,不配进模型。

最小闭环长什么样

  • 选一个经营指标,写清定义、取数点、刷新频率、责任人。
  • 质量规则(空值、重复、跨系统不一致)每日跑,低于阈值不得进驾驶舱。
  • 修正必须回到源单据,禁止只在仓里改一版"干净表"。
  • 权限按字段,导出和训练默认最小集,扩大要审批。

XYN 数智化系统把业务动作落在可配置应用里,口径和权限可以跟单据走。数据质量差时,先让闭环转。转起来了,再谈 AI。否则智能只是更贵的猜。

数据修正必须回到源单据而不是只改宽表
仓里的干净是假干净。源单据改了,闭环才算转完一圈。