Gartner 预期,到 2026 年底,40% 的企业应用程序将内建针对特定任务的 AI 代理,而 2025 年这个比例还不足 5%。同一家机构亦预测,超过 40% 的代理式 AI 项目将在 2027 年前被取消。
这两个数字描述的是同一批企业。代理部署的速度,已经超过了企业看清它们在做什么的能力。
填补这个落差的那一层技术有正式名称。在 2026 年,它从工程师的方便工具,变成董事会层级的控制机制。它叫做代理可观测性(Agent Observability),而它往往就是试点项目能否转为正式营运的分水岭。
什么是 AI Agent 可观测性?
AI Agent 可观测性,是指记录并评估代理执行的每一个步骤,包括推理路径、工具调用、数据检索与最终输出,令任何失误都能追溯到某一个具体决策,而不是靠猜测。它把代理由黑盒,变成可稽核的业务流程。
量度单位是追踪记录(trace)。一笔追踪记录,就是代理一次完整执行的全部记录,并按每个动作拆分为若干区段。
聊天机器人产生一个你能读到的答案。代理产生的是十二个甚至三十个动作组成的链条,而使用者绝大部分都看不见。
企业风险如今就藏在这条链上。若你无法重播它,你便无法向稽核人员、监管机构,或收到错误答案的客户解释清楚。
为什么可观测性在 2026 年成为企业优先事项?
原因在于代理真正进入生产环境,而工具市场亦围绕这个转变完成整合。New Relic 于 2026 年 2 月推出 Agentic Platform;思科(Cisco)于 2026 年 4 月 9 日宣布有意收购评估与护栏初创公司 Galileo,并将其纳入 Splunk Agent Observability。
当这种规模的基础设施供应商在八星期内先后押注同一个范畴,这个范畴已经离开研究阶段。
背后的商业压力同样具体。麦肯锡估算,AI 代理每年可为各类业务场景带来 2.6 万亿至 4.4 万亿美元的价值。
然而交付记录相对单薄。2026 年的采用数据分析显示,约三分之二企业已试用过代理,但成功规模化并产生可量度价值的不足 10%。
New Relic 的平台正好说明企业现在买的是什么:多代理系统可视化、涵盖每个代理阶段的完整请求生命周期瀑布图,以及横跨模型、向量数据库与协作框架的五十多项整合。
可观测性与传统应用监控有何不同?
传统监控回答系统是否运作正常、是否够快、有没有报错。可观测性则回答另一个问题:一个运作正常、速度够快、没有报错的系统,是否在做正确的事。代理可以在 900 毫秒内回传一个干净的 HTTP 200,同时引用了一份早已被取代的政策文件。
对掌握科技预算的管理层而言,有四项差异值得注意。
--- 传统监控量度可用性与延迟;可观测性把准确性、根据性与政策合规度视为一级指标。
--- 传统监控把一次请求视为单一事件;可观测性把它视为由推理步骤、工具调用与检索构成的树状结构。
--- 传统监控有明确的通过或失败状态;可观测性要为概率性输出评分,因此你需要先有评估准则,才需要仪表板。
--- 传统监控甚少牵涉业务部门;可观测性必须由业务专家定义什么才算好答案。
最后一点最常被低估。可观测性并非纯粹的工程采购,把它当作工程采购,结果就是做出一堆业务同事看不懂的漂亮图表。
一套完整的可观测性堆栈会记录什么?
达到生产级别的堆栈,会记录对话中每一个推理步骤、工具调用、知识检索与决策点的追踪细节,并把质量分数、成本、延迟与安全发现放在同一条时间轴上。建基于 Galileo 收购案的 Splunk Agent Observability,正是明确地把这些信息整合在同一视图。
企业应该期望看到以下清单。
--- 每次代理执行的完整追踪与区段记录,保留期需符合你的稽核窗口。
--- 工具调用记录,显示代理接触了哪个系统、传入什么参数、回传什么结果。
--- 检索记录,显示调取了哪些文件,以及当中哪些真正被写入答案。
--- 自动化评估,就准确性、根据性、语气与政策遵循度评分。
--- 人工反馈回路,把被标记的追踪记录转化为下一个版本的测试案例。
--- 按执行次数、按流程、按业务单位划分的成本与代币用量账目。
有一项能力区分成熟与不成熟的平台:部署前的多轮模拟。2026 年发表的比较评测指出,只有少数平台(例如 Latitude 与 Maxim AI)支持部署前多轮模拟,而这正好能捕捉单轮评估套件无法察觉的失效。
可观测性如何支持香港的 AI 管治与《私隐条例》合规?
香港目前没有专门的 AI 法例,因此《个人资料(私隐)条例》完整适用于任何处理个人资料的 AI 系统。可观测性提供合规审查所需的证据:代理存取了什么数据、为何存取,以及该存取对于既定目的是否必要。
个人资料私隐专员公署于 2026 年完成第三轮 AI 合规审查,涵盖 60 间机构。根据公署资料,60 间机构中有 57 间(约 95%)在日常营运中使用 AI,约 79% 已使用超过一年,约 51% 同时运行三个或以上的 AI 系统。
该轮审查未发现违反《私隐条例》的情况,这是好消息。但真正值得董事会关注的,是走向。
公署把 2026 年的审查范围,由银行、金融、保险及教育,扩展至会计、餐饮、创新科技、物流与物业管理等行业。
公署的建议几乎与可观测性的能力一一对应:管治架构、私隐影响评估、AI 稽核、员工培训、事故应变计划,以及针对代理式 AI 的审慎管控。2026 年 3 月,公署另行发出提示,把代理式 AI 界定为独立且较高的私隐风险。
没有追踪记录的 AI 稽核,只是一场访谈。有追踪记录的 AI 稽核,才是一次检查,而两者之中只有一种能撑过追问。
在中国内地与香港企业内部,这会是什么样子?
以下三个场景,反映代理在 200 至 500 人规模的机构中实际的部署方式。三个场景的共通点是:代理在技术上运作正常,但若没有追踪级别的证据,问题根本看不见。
一家制造企业部署代理处理供应商交期查询。它解决了 71% 的个案。追踪记录显示,其中 9% 的「已解决」个案,引用的是六小时未更新的缓存排程数据。
一家医疗行政机构为登记团队部署内部政策查询代理。同事反映好用。检索记录却显示,它 60% 的引用来自同一个 2023 年的文件夹,原因是那个文件夹的标签最整齐,而不是内容最准确。
一家专业服务公司为营运团队部署代理。第六个月的采用率只有 12%。追踪记录显示,代理在 44% 的对话中都先提出澄清问题。以合规角度而言这是正确行为,但对于两个会议之间的前线同事而言,这是无法忍受的。
这三项发现,每一项都会改变一个决定。而它们都不会出现在系统可用率的仪表板上。
企业若跳过可观测性,会出现什么问题?
跳过可观测性的企业,通常不会遇上戏剧性事故,而是陷入证据真空:没有人能证明代理有效,也没有人能证明它无效,于是预算讨论自动倾向会议室中最怀疑的那一位。Gartner 把 2027 年前超过 40% 代理式 AI 项目被取消的预测,归因于回报不明确与管治薄弱。
量度落差非常明显。2026 年多份分析引用的调查数据显示,企业平均预期代理式 AI 带来 171% 回报,但只有 39% 能把任何 EBIT 影响归因于 AI。
另一项相关数据更能说明问题:约 80% 的 AI 使用者表示个人生产力提升,但只有 37% 汇报有 EBIT 影响。无法反映在损益表上的生产力,通常是从未在流程层面被量度过的生产力。
管治成熟度令问题加剧。综合 Gartner、德勤与 IBM 的分析指出,只有约五分之一企业对自主代理拥有成熟的管治模式,换言之约 80% 部署代理的机构,并不具备安全规模化所需的基础。
随之而来的四种失效模式相当可预测。
--- 静默劣化:模型或提示词改动令答案质量下降,却数星期无人察觉。
--- 成本无法归属:每月代币账单无法拆分到业务单位,于是没有单位愿意为它辩护。
--- 价值无法验证:试点无法被证明有效,续期变成意见之争。
--- 稽核风险:监管机构询问代理曾存取哪些数据,而诚实的答案是记录没有保留。
管理层应该如何安排首个 90 天?
次序应该是先建可观测性,再谈规模,而不是倒过来。可行的做法由定义「什么才算正确答案」开始,接着把一条流程完整仪表化,然后才扩展。在定义评估准则之前就先买平台,只会得到有数据而无判断的结果。
一套适用于企业的 90 天次序如下。
--- 第 1 至 15 天:挑选一条有指定业务负责人、有可量度成果的代理流程。一条,不是一个组合。
--- 第 16 至 30 天:由业务专家撰写 30 至 50 条参考问题及公认的正确答案。这就是你的评估集,也是整个过程中最有价值的资产。
--- 第 31 至 50 天:为追踪、工具调用与检索建立记录。在产生大量数据之前,先确认保留期符合稽核与《私隐条例》要求。
--- 第 51 至 70 天:每次改动都对参考集执行自动化评估,并每星期把被标记的追踪记录交回业务负责人。
--- 第 71 至 90 天:加上每次执行成本与每宗已解决个案成本,然后用一页向财务部门同时呈现质量、成本与覆盖率。
另有两个相关决策与这项工作并行。第一,你如何在一开始就把正确信息喂给代理,这正是情境工程要处理的问题。第二,你如何在不让全部使用者同时受影响的情况下发布改动,这就是分阶段推出背后的逻辑。
把可观测性与嵌入式交付模式结合的机构,推进速度通常更快,这也是前线部署工程师这个角色今年在企业 AI 项目中迅速普及的部分原因。
策略上的核心结论是什么?
可观测性不是监控系统的升级。它是把 AI 试点转化为可辩护投资方案的机制,也是回答每个企业代理项目最终都要面对的三个问题的唯一实际方法:它有效吗、它花多少钱、你能否证明。
Gartner 对 2026 与 2027 年的两个预测并不矛盾,它们描述的是一道筛选。四成应用会内建代理,四成以上代理项目会被取消,而站在筛选正确一边的机构,大多是那些看得见自己代理在做什么的企业。
香港企业在这件事上有一项具体优势。私隐专员公署已经公布了良好管治的标准,这意味着合规要求与效能要求,罕有地指向同一个方向。
要建立这种可见度,工具重要,判断力同样重要,而有一个看过多轮科技周期起落的伙伴同行,会容易得多。懂AI,更懂你 UD相伴,AI不冷。
本文由 UD 企业 AI 团队审阅。
让你的 AI 代理,第一次变得可量度
掌握了框架,下一步是找出最值得优先仪表化的那一条流程。UD 团队手把手带你完成每一步,由 AI 准备度评估、评估准则设计,到部署上线、追踪记录与向上汇报成效,28 年企业服务经验,全程陪你走。