上周参加山东 CIO 联盟线上专题交流会,主题是AI 赋能的源端数据质量改造。坦白讲,一开始看到标题,内心预期并不高。
数据治理这个话题,行业已经热了很多年。不少企业平台一轮轮建,预算一笔笔投入,但数据问题如同野草,清理完一波很快又复现。不过将近三小时的分享听下来,不少我们习以为常的 “行业常识”,确实该拿出来重新掰扯一番。
很多企业砸重金上 MDM 主数据平台、搭建数据中台,到头来数据质量依旧反反复复,问题到底出在哪?中翰软件创始人段效亮在分享开篇,就点出了一个普遍踩坑点:绝大多数企业,一直在数据结果上做修补,却完全忽略了问题产生的源头。
这里有个很关键的认知差异:真正适合做治理的,是物料编码、供应商档案、设备参数这类描述业务实体的静态基础数据。而报表、交易流水这类分析型数据,本质只是业务产出的结果。如果源头录入就已经出错,后续不管在数仓做多少次清洗加工,都属于亡羊补牢。不少企业耗费大量人力做报表整改,忙活半天收效甚微,很大概率就是从一开始努力的方向就走偏了。
这也引出了两套完全不同的治理思路:末端治理 vs 源端治理。
把问题全部丢进数据仓库事后清洗,这套模式在金融、电信行业尚可跑通,但放到制造工业企业身上就会水土不服。制造企业海量物料、图纸图号错综复杂,AI 仅靠后端数据,根本分辨两个不同图号实际指向同一件物料。
源端治理的思路就不一样:不改动现有业务流程,把治理能力前置,在数据刚刚产生的瞬间就完成校验、拦截与修正,从根源掐断脏数据。对工业企业而言,这才是更贴合现实的解题思路。
整场交流最有看点的,还是 AI 原生数据治理平台带来的变化。
市面上不少 AI + 数据治理项目,大多只是给老系统外挂一个 AI 插件,实际落地效果差强人意。而基于本体模型构建的知识骨架,把业务语义、实体关系沉淀进系统,能力不止于简单标出数据错误,还可以反向定位,追踪到底是哪一步业务操作埋下隐患。对于极度依赖老员工经验维护数据的传统制造业,这套能力格外实用。
还有一个很有意思的交付模式叫 “双轨带练”:AI 线上顾问作为主力,线下专家做辅助,核心目标不是厂商包办项目,而是把治理能力交付给企业内部的业务骨干。未来建模、数据清洗、日常运维,不必事事仰仗 IT 团队或者外部服务商,业务人员通过自然语言对话就可以完成操作。据称整体投入可以下降近一半,更重要的改变是:数据治理不再是强加给业务的额外负担,变成业务流程的一部分。
现场也照顾了大量存量系统的现实痛点:很多企业手上已经跑着老旧 MDM,推倒重来成本高、风险大。分享给出了一套务实折中方案:原有平台保留存储、接口能力不动,外层叠加独立 AI 能力层,核心治理逻辑全部迁移至 AI 侧,甚至不需要原有软件厂商配合。这套数十万级别的改造方案,已经在山东头部国企完成实践,给陷入二次数据治理困境的企业提供了低风险过渡选项。
演示环节里,对话框完成绝大部分治理工作的画面让不少参会者眼前一亮:上传 Excel 就能自动建模、导入文件一键诊断数据问题、对话即可生成系统对接接口、异常截图直接定位故障。当操作门槛被压缩到这种程度,业务部门不再是被动配合的旁观者,直接成为数据质量第一负责人。
山东 CIO 联盟秘书长最后的总结很耐人寻味:AI 工具最大的价值,是拉低了业务参与数据治理的门槛,让企业真正的数据文化有机会落地。
整场分享没有贩卖焦虑,也没有堆砌晦涩概念。抛开各类高大上名词,回归本质:数据治理终极目的从来不是把数据 “管死”,而是服务业务。当治理这件事变得像日常对话一样简单自然,数据的价值才会真正释放。