大模型时代,数据治理与AI的"双向奔赴"
有一个冷知识:大模型项目的预算,八成花在模型上;翻车的原因,八成在数据上。
我们去年那个知识库项目就是标准样本。RAG架构,模型用的当时最能打的一个。立项会上为选模型吵了三个钟头,数据怎么整,三分钟全票通过,意见就四个字:先跑起来再说。这句话后来被证明是全年最贵的决策。
上线一个月,业务方的反馈清单越来越像事故报告:引用三年前废止的老制度,把两个部门打架的口径搅成一锅,还有最出圈的一次,实习生在系统里搜出了高管的薪酬。
排查到凌晨三点,结论写在会议纪要上,平静得近乎无情:模型没有错。表格是解析器切碎的,旧文件没人下线,薪酬文件没人想过要拦。模型只是把喂给它的东西,忠实地复述了一遍。
后来看到Gartner在2024年7月的预测:到2025年底,至少30%的生成式AI项目会在概念验证之后被放弃,首要原因不是模型能力,而是数据质量差、风险控制缺位。另一条预测更狠,到2026年,拿不出"AI就绪数据"的企业,六成以上的AI项目会被放弃。
大模型没有制造新的数据问题,它把企业过去十年欠下的数据债,一次性全讨回来了。但它同时也在还一笔大礼:治理数据的成本,被AI实实在在打了折。讨债和还债同时发生,这就是数据治理和AI的双向奔赴。
先看讨债的这一面。传统数据治理有个默认边界:核心库表、主数据、指标口径。这套体系通常只覆盖了企业数据里最规整的那一小块。剩下的合同、图纸、会议纪要、邮件、客服录音,这些非结构化数据普遍被认为占了企业数据的八成以上,没有元数据,没有责任人,没有版本,堆在黑屋子里,大家绕着走。
RAG的路数,恰恰是把黑屋子整个搬空,把每样东西都请到模型面前。于是过去可以绕开的问题,全变成了前置必答题。
最先撞上的是解析。扫描件的OCR错误、PDF表格被切碎、页眉页脚混进正文,人读的时候一眼就跳过去了,机器读的时候全是毒药。切片会把错误固化进向量库,之后每次检索都命中同一处错误。很多团队第一反应是调提示词、换模型,折腾一圈才发现瓶颈在解析这一层。这也是过去一年文档解析工具能长成一条独立赛道的原因。
然后是权限。传统BI的权限守在报表层,而RAG的检索如果感知不到文档本身的访问控制,实习生搜出高管薪酬就不是意外,是迟早。这把锁现在有了名字,叫权限感知检索(ACL-aware retrieval),企业级方案基本已经当成标配。
更隐蔽的是时效。文档更新了,向量库里的旧切片还躺着;制度改了口径,新旧两版并存,检索时一并召回,回答全凭运气。向量库正在长成一座新的数据仓库,那就得用管数据仓库的标准来管它:版本、生命周期、下线流程,一样不能少。
最麻烦的是血缘与合规。一份文档从哪来、谁授权的、出了错能不能溯源,这些从前可以含糊,现在不行了。国内的《生成式人工智能服务管理暂行办法》2023年8月施行,白纸黑字要求训练数据来源合法;欧盟AI法案2025年8月起要求通用大模型公开训练数据摘要。合规不再是数据团队发文件倡议,而是长出牙齿的监管。
过去数据质量差,损失是隐性的。Gartner估算过,企业每年因数据质量问题平均损失一千余万美元,但报表不准还能靠人工核对兜底。AI时代没有人工兜底:同一个错误,人犯一次,模型可以犯一万次,而且每一次都理直气壮。
讨债讲完了,再讲还债。数据治理过去为什么总排不上优先级?因为它是个赔本差事:花钱、防错、收益看不见。AI恰好把这门生意的成本结构改了。
最直观的是人力苦役。给表写业务口径注释,一个治理专员一天写二十张,写到眼睛发直;现在让模型读一遍表结构和样本数据,起草说明,人只做核对,一天几百张。敏感数据的分类分级,过去靠人海一份份过手,现在模型初筛、人工抽检复核,快了几倍不止,而且因为有人把着最后一道闸,准确率反而比纯人工更稳。何况分类分级本来就是《个人信息保护法》之下躲不掉的功课,从前大家只是各自躲着,现在躲不动了。
数据质量稽核也类似:格式错乱的手机号、逻辑矛盾的日期、同一个客户八种写法,这类规则的发现和验证,模型已经干得不错。
还有一桩容易被忽略的好处:出考卷。知识库上线前应该有一套评测集,一批带标准答案的问题,用来度量检索和回答的质量。过去全靠人工设计,出不起几道;现在让模型照着真实文档批量拟题,人工拣选定稿。数据整理得好不好,不用再吵,跑一遍考卷便知。治理这件事,头一回有了自己的度量衡。
成本降下来之后,ROI的逻辑就反转了。整好的那批数据,直接决定RAG和Agent答得准不准、上线快不快。"三分模型、七分数据"已经是从业者少有的共识。于是出现了一个多年未见的现象:从前是治理团队追着业务要口径,现在是业务方来敲治理的门,“我们要上知识库,你们什么时候把数据整好?”
我们那个翻车的知识库,最后只做了三件事:给文档打版本号,给检索接上权限,让每个回答附上出处。三个月后,投诉停了。修它没有用任何高深的技术,用的全是治理喊了十年、没人肯认真做的那几样。
至于路径,别等大而全的治理工程。先拣AI要用的那两成数据来治,治一样、用一样,应用的边界走到哪里,治理就跟到哪里。大公司的正路多半不是另起炉灶,而是在攒了多年的家底上接着盖:目录、血缘、权限本来就有,缺的只是接到向量库和Agent的流水线上。小公司没有历史包袱,从第一个AI应用起就把元数据、权限、版本三样立起来,成本远低于事后补救。最怕的是两头不靠,旧的没接上,新的没立规。
把讨债和还债合起来看,变化就不是局部的,而是范式级的:
| 维度 | 传统数据治理 | 大模型时代 |
|---|---|---|
| 治理对象 | 库表、主数据、指标 | +非结构化文档、语料、向量库、合成数据 |
| 核心目标 | 报表准确、过审计 | AI应用效果 + 合规 + 可追溯 |
| 关键动作 | 建模、定标准、质量稽核 | 解析切分、权限感知检索、语料血缘 |
| 度量口径 | 质量分、标准覆盖率 | 检索准确率、回答可溯源比例、评测通过率 |
| 组织角色 | 数据治理专员 | 懂AI的数据工程师 + 懂数据的AI工程师 |
过去讲治理,讲的是"管物",把每样东西登记、擦拭、归位;现在要讲"管流",东西从哪里来、经过谁的手、去了哪里、用过几回。这是在管一条供应链,供应链就要有供应链的管法。
供应链上还多了两样旧账本里没有的东西。
首先是合成数据。互联网上的新语料渐渐用尽,用AI生成数据再喂AI只会越来越多。2024年《自然》杂志的研究给这个隐患起了名字,叫模型崩塌(model collapse):影子生影子,真实的细节一代代磨掉,像翻拍又翻拍的老照片。合成数据不是不能用,但它本身成了新的治理对象,来源要标注、质量要评估、混入比例要可控。
更麻烦的是删除问题。数据可以从库里删掉,但已经融进模型参数的知识删不掉。所以各国的新规都指向同一个方向,国内的《人工智能生成合成内容标识办法》2025年9月起施行,欧盟的训练数据透明义务也已生效:AI用过的每一份数据,都得说得出从哪来、到哪去。
经常有人问,数据治理工程师会不会失业。不会。失业的不是人,是旧的活法:从写数据标准文档的,变成给AI搭数据供应链的;服务对象也从一年一度的审计,变成一群等米下锅的算法工程师。
回到开头那个项目。它现在活得好好的,业务方每周还在催着往知识库里加新文档。
回头看,杀死AI项目的从来不是模型,救活项目的也不是模型。模型只是那条流水线上最亮的一环,而流水线上游的解析、权限、版本、血缘,才决定这条线到底是流水线还是瀑布。
数据治理和AI,从来不是谁服务谁。AI要更好的数据,AI也让治理数据第一次变得划算。这两件事撞在一起,做数据的人和做AI的人,接下来要干的是同一份活。
你们的项目翻过什么车、后来怎么修的?评论区聊聊,让我看看谁的最惨烈。
注:Gartner预测出自其2024年7月29日新闻稿,即30%的GenAI项目将于2025年底前在PoC后被放弃,及其关于AI-ready data的2026年预测;"模型崩塌"出自Shumailov等发表于《自然》2024年7月的研究;《生成式人工智能服务管理暂行办法》2023年8月15日施行;《人工智能生成合成内容标识办法》2025年9月1日施行;欧盟《人工智能法案》通用模型透明义务2025年8月2日起适用。