根据 Gartner 的预测,直至 2026 年,企业将会放弃 60% 缺乏「AI 就绪数据」支撑的 AI 项目。对企业领袖而言,这个数字带来一个不太舒服的结论:威胁你 AI 计划的最大因素,往往不是你选用哪一个模型,而是模型底下的数据。
大多数董事会的讨论,仍然把 AI 当成一个「模型问题」。但在实际运作中,一套企业 AI 系统是否可靠、是否合规、是否经得起追问,早在第一个提示语送出之前,就已经在数据层决定了。AI 数据治理正是管理这一层的纪律,而在 2026 年,它已经成为企业回报最高的投资之一。
什么是 AI 数据治理?
AI 数据治理,是一套政策、控制与问责机制,用来决定 AI 系统可以使用哪些数据、这些数据如何检查质量与保护安全,以及一旦出错由谁负责。它把传统的数据治理延伸到训练数据、检索来源、模型输出,以及每一个 AI 辅助决策背后的审计轨迹。
用简单的话说,它是「信任的操作系统」。它回答监管机构、审计师或董事会成员迟早会问的三个问题:输入了什么数据、数据从何而来、你能否证明它被妥善处理。
缺少它,AI 部署就是一个黑盒,产出一堆没有人能核实的自信答案。有了它,同一套系统就变成一个可以问责、可以向客户、监管机构与董事会交代的系统。
为什么企业 AI 风险如今集中在数据层?
企业 AI 风险转移到数据层,是因为模型本身已经商品化,而喂养模型的数据却依然杂乱、割裂、治理不足。当 AI 在生产环境失效,根本原因通常是过时、偏颇或未经授权的数据,而不是模型的缺陷。
证据相当明确。根据 Gartner 于 2025 年 2 月发表的研究,63% 的机构表示自己并没有、或不确定是否拥有适合 AI 的数据管理实践。换言之,大多数部署 AI 的企业,都建立在一个自己无法背书的基础之上。
麦肯锡 2025 年《AI 现状》调查提出第二个警号。虽然 88% 的机构已在至少一个业务职能中使用 AI,但只有 1% 认为自己的 AI 策略已臻成熟。采用与成熟之间的鸿沟,很大程度上就是数据治理的鸿沟。
好消息同样具体。麦肯锡指出,使用高质量训练数据的企业,其 AI 模型准确度会高出 20% 至 30%。数据质量不是一项合规杂务,而是直接牵动模型表现的杠杆。
AI 数据治理与传统数据治理有何不同?
传统数据治理保护的是「静态」的数据,也就是资料库与报表中的数据。AI 数据治理还必须管理「流动中」、穿越模型的数据:训练集、喂养实时系统的检索管道,以及模型生成的输出。它加入了传统治理从不需要的数据血缘、漂移监测与输出问责。
对决策者而言,三项差异最为关键。第一是范围:AI 会消化电邮、合约、通话记录等非结构化数据,而旧有框架往往忽略这些。第二是动态性:AI 模型的行为会随数据改变而改变,因此治理必须持续进行,而不是每季一次的检讨。第三是可解释性:你必须能够把一个 AI 输出追溯回它的来源,这意味着要治理的是检索层,而不仅是数据仓库。
这也是 AI 数据治理与监管接轨之处。若你正在梳理自己的责任,我们关于欧盟《AI 法案》对香港企业意味着什么的解读,正好说明治理期望如何逐步变成法律。
一套 AI 数据治理框架包含什么?
一套实用的 AI 数据治理框架有五个部分:立章、分类、控制、监测与改进。立章确立拥有权与政策,分类界定数据的敏感度与就绪程度,控制执行存取与质量规则,监测追踪生产环境中的漂移与滥用,改进则以定期修补闭合整个循环。每一部分都有明确负责人。
立章。确立由谁负责 AI 数据决策、哪些数据可用于 AI,以及哪些应用场景需要审批。这是董事会以白纸黑字定下风险胃纳的地方。
分类。按敏感度与 AI 就绪程度为数据分类。并非所有数据都适合用来训练或支撑模型。个人资料、客户机密与受监管记录,在接触 AI 系统之前,都需要明确的处理规则。
控制。在使用的当下执行存取、质量与来源规则,包括去重、验证、遮蔽个人资料,以及记录每一个数据来源的出处。
监测。系统上线后,持续留意数据漂移、异常与衰退。按照 2026 年逐渐成形的数据质量指引,大多数运作中的 AI 失效,并非以戏剧性的宕机出现,而是以无声的质量衰退呈现。
改进。把治理视为一个循环。将事故、审计发现与模型错误反馈到政策之中,让框架随时间收紧,而不是束之高阁。
AI 数据治理在实际运作中如何体现?
在实际运作中,AI 数据治理把抽象的政策,转化为嵌入真实工作流程的检查点。一家金融服务公司会把关哪些客户记录可以进入模型;一家物流企业会在数据喂入预测代理之前先行验证。两者的治理都内嵌在管道之中,而非事后外挂。
设想一家香港金融服务公司,为客户经理部署一个 AI 助手。数据治理决定这个助手可以读取产品文件与匿名化的交易模式,但永远不能读取原始客户身分资料,并记录每一次检索,让合规部门能够还原任何一个答案。结果,是一个公司真的敢放在受监管员工面前使用的助手。
再设想一家区域物流企业,用 AI 预测派送延误。治理不足,模型就会从数月来标签错误的货运记录中学习,预测悄悄失准。治理到位,系统每日验证数据并标示异常,模型就能在环境变化时保持准确。差别不在算法,而在于环绕数据的纪律。
在香港《个人资料私隐条例》下,AI 数据治理意味着什么?
在香港《个人资料(私隐)条例》之下,任何触及个人资料的 AI 系统,都必须遵守六项保障资料原则,包括目的限制、资料准确与资料保安。AI 数据治理,正是企业把这些原则落地的方式:控制 AI 可以使用哪些个人资料,并证明这种使用合法。
个人资料私隐专员公署已就 AI 的使用发出指引,明确表示数据处理的期望,直接适用于 AI 部署。对香港企业而言,这代表一个缺乏书面数据治理的 AI 项目,同时也是一项合规风险,而不仅仅是技术风险。
实务上的重点,是把《私隐条例》的责任,内建到框架的分类与控制阶段,让私隐以「设计即合规」的方式执行,而不是事后补救。
企业最常犯的错误是什么?
最常见的错误,是把数据治理当成一个「项目」,而不是一种「运营能力」。企业为试点清洗一次数据、宣告成功,然后眼看质量在系统上线那一刻开始衰退。不持续的治理,是早已失败的治理。
第二个错误,是治理了数据仓库,却忽略了检索层。许多 2026 年的 AI 系统,会从实时文件库与向量资料库抽取数据,若这些来源未经治理,模型就会继承它们内部的每一个错误与权限漏洞。
第三个错误,是拥有权含糊不清。当没有任何一位高管负责 AI 数据决策,问责就会蒸发,而财务总监对 AI 价值的追问,也就是我们在如何撰写财务总监愿意批准的 AI 商业方案一文所谈的问题,将变得无法有信心地回答。
策略重点
AI 数据治理,不是 AI 策略中「稍后再处理」的乏味部分。它是决定其他一切能否运作的部分。2026 年领先的企业,不是 AI 预算最大的一批,而是最先让自己的数据值得信任、然后放手让模型做好本份的一批。
把治理视为一种有明确拥有权的持续能力,以「设计即合规」的方式内建《私隐条例》责任,并像看待数据仓库一样认真地治理检索层。做到这些,AI 就不再是一个你祈求它会运作的黑盒,而是一个你能够向任何客户、审计师或董事会交代的系统。
懂AI的冷,更懂你的难。UD 同行28年,让科技成为有温度的陪伴。二十八年服务香港企业的经验告诉我们:持久的 AI 价值,始于可信的数据,而不是聪明的模型。
本文由 UD 企业 AI 团队审阅。
准备好让你的数据 AI 就绪了吗?
掌握了框架,下一步是弄清楚你的组织实际处于什么位置。UD 的 AI Ready Check 为你评估数据就绪程度,而我们会手把手带你完成每一步,从就绪评估、治理设计,到部署上线与持续监测,28 年企业服务经验,全程与你同行。