一家管理二十多个物业项目的香港物管集团,有一个 AI Agent 负责处理供应商付款审批。它已经运行了四个月。上周二,它批准了一笔 18 万港元的重复付款。
营运总监提出最直接的问题:是哪一步出错?没有人答得出。推理过程消失了,剩下的只有一行日志,写着任务已成功完成。
这个缺口有一个名称,叫做可观测性(Observability)。在 2026 年,它是企业 AI 在试点阶段运作良好、却在正式上线后停滞的主要原因之一。
什么是 AI Agent 可观测性?
AI Agent 可观测性是指在 Agent 的推理与执行路径上逐步采集结构化遥测数据:由它接收的指令开始,经过每一次检索、模型调用与工具操作,直至最终输出。它让你能够重建 Agent 做了什么、为什么这样做,以及付出了多少成本。
对决策者而言,关键区别在于日志与追踪记录之间。日志记录「发生了某件事」,追踪记录则记录「产生这件事的整棵决策树」。
一次 Agent 运行并非一问一答。它是一连串分支:模型决定搜索文档库、阅读三条结果、调用内部 API、重新考虑、再调用第二个 API,然后写出答案。每一步都是独立环节,各自有输入、输出、延迟与成本。
可观测性的意思是,上述每一步都被采集成可以事后重播的关联记录。
为什么可观测性在 2026 年变得关键?
因为 Agent 的部署速度已经超越了监督能力。企业把 Agent 推入实际营运的速度,远快于建立检视能力的速度。现有证据显示,阻挡正式上线的并非模型质量,而是监督缺口。而香港监管机构在过去一年,正朝同一方向收紧要求。
根据麦肯锡《State of AI Trust in 2026》报告,62% 企业至少已在试用 Agent,23% 已进入规模化阶段,但只有 30% 在 Agentic AI 治理上达到第三级或以上的成熟度。
同一份报告指出,接近三分之二受访者把安全与风险列为扩展 Agentic AI 的首要障碍,排名甚至高于监管不确定性。
上线数据更为严峻。2026 年 7 月引述的 IDC 研究显示,88% 的 AI Agent 概念验证从未进入广泛生产:每启动 33 个试点,大约只有 4 个真正投入实际营运。
Gartner 2026 年 CIO 及科技主管调查则显示,只有 17% 企业已全面部署 AI Agent,而超过 60% 预期两年内做到。这代表一个相当庞大的群体,即将发现自己是否有能力审核已部署的系统。
可观测性与 AI 评估、传统监控有何分别?
三者在不同时间点回答不同问题。评估问的是「上线前这个 Agent 够好吗」;监控问的是「系统有没有运作」;可观测性问的是「这一次运行实际做了什么」。企业可以同时拥有三者,却依然处于盲区,因为每一项只覆盖一个窗口。
传统应用性能监控是为确定性的请求与响应路径而设计,衡量延迟、错误率与吞吐量。这些指标依然有用,但对诊断「答错」几乎没有帮助,因为一个错误答案通常在正常时间内返回 HTTP 200。
评估属于上线前及定期进行的纪律。若需要相关框架,UD 已另文处理:什么是 AI Eval?
可观测性属于运行期的一层。它让六周后客户、审计师或监管机构提问时,事件仍然可以被重建。
--- 监控回答:服务是否健康?
--- 评估回答:Agent 的准确度是否足以部署?
--- 可观测性回答:这一次运行究竟发生了什么,哪一步出错?
一份 Agent 追踪记录应该包含什么?
可用的追踪记录会采集单次运行的完整环节树,将每一次模型调用、检索与工具操作记录为独立节点。缺乏逐步采集,你就无法回答最基本的取证问题:哪一步产生了错误输出。这正是评估任何供应商说法时应套用的实际测试。
认真的平台在记录元素上相当一致:
--- 输入:用户指令、系统指示,以及运行时注入的任何上下文
--- 每次检索:搜索了什么、返回了哪些文档、相关度分数为何
--- 每次模型调用:模型版本、参数、输入输出 Token 数量及成本
--- 每次工具调用:接触了哪个系统、传入什么参数、返回什么结果
--- 决策节点:Agent 在何处选择了某一分支而非另一分支
--- 身份:由哪个用户、服务账户或 Agent 凭证授权此次运行
最后一项是企业买家最常在需求清单上遗漏的,却是审计师最先追问的。
香港监管机构期望你能够展示什么?
香港并无单一 AI 法规,相关期望嵌入现有制度之中,而这些期望在 2026 年上半年明显收紧。对受监管机构而言,实际要求是一条经得起审查的可解释、可审计决策轨迹,而不是一份声称已有轨迹的政策文件。
香港金融管理局要求认可机构维持可解释、可审计的 AI 决策轨迹,即系统须能展示每项决定背后所依据的数据,并以监管人员可以审视的形式呈现。
个人资料私隐专员公署则另外针对 Agentic AI 表态,指出 Agent 可能接触本机设备、文件、电邮、凭证、浏览器内容及外部服务,并可能在无即时人为参与下执行多步任务。其建议包括最小访问权限、不授予管理员权限、隔离运行环境,以及对具重大个人影响的决定保留人为复核。
两者合起来的信息相当清楚:若你的 Agent 接触个人资料,而你无法重建它的行为,你并没有合规立场,你只有一个假设。
UD 对控制面的另文处理见:如何治理 AI Agent。
如何在 90 天内建立可观测性能力?
从一个 Agent 开始,而不是从采购平台开始。在香港中型企业行之有效的次序是:先为单一生产环境 Agent 做端到端埋点,证明能重播一次真实事故,然后才把同一模式向外扩展。在能够重播一份追踪记录之前就购买平台,通常只会产生一个无人信任的仪表板。
第 1 至 30 天:为一个 Agent 埋点
挑选财务或客户风险最高的 Agent。为每一次运行采集完整环节树,包括逐步成本。追踪记录保留期至少须覆盖最长的审计周期。
第 31 至 60 天:验证重播能力
取过去一个月的一次真实失败案例,完全依靠追踪记录重建它。若做不到,说明埋点不完整,而你以极低代价学到了这一点。
第 61 至 90 天:连结问责
为每个 Agent 指定负责人。界定哪些失败类别触发人为复核。每月发布一份报告,显示运行量、按类别划分的失败率、每个成功结果的成本,以及未结事故。这份报告正是把遥测数据转化为管理工具的关键。
企业省略可观测性时会出什么问题?
五种失效模式反覆出现,而五者都在 Agent 已被托付实际工作之后才浮现。每一种在埋点阶段防范的成本都很低,一旦事故已进入复核程序,修补代价就变得高昂。
--- 无声的质量衰退。模型版本改变、检索质量转移,准确度连续数周下滑而无人察觉,因为系统可用率仍然是 100%。
--- 无法重建的事故。企业知道 Agent 造成了损失,却无法说明过程,于是技术问题升级为法律风险。
--- 成本漂移。没有人把支出归因到具体步骤,于是一个每次运行都默默重试五次的 Agent,看起来像整体预算超支,而不是一个可修正的错误。
--- 问责分散。IT 团队说流程属于业务部门,业务部门说系统属于 IT,结果没有人为输出负责。
--- 治理表演。政策写明 Agent 受到监督,却没有任何追踪记录可以证明。这份政策会在第一次审计时失效。
下一步应该做什么?
在下一次技术检讨会议上提出一个问题:指定上月某一次 Agent 运行,要求团队向你展示它的追踪记录。这个答案比任何成熟度评分更能说明你的上线准备程度。若记录存在,你属于麦肯锡所描述的那 30%;若不存在,你已经知道第一个项目是什么。
可观测性是不起眼的工作。它不会带来新功能,也无法在董事会幻灯片上展示成果。但它正是「一个你能够辩护的 AI 计划」与「一个你只能够描述的 AI 计划」之间的分野。
二十八年香港企业科技经验告诉我们,能够存活下来的系统,是那些操作者说得清楚的系统。懂AI的冷,更懂你的难。UD 同行28年,让科技成为有温度的陪伴。
由 UD 企业 AI 团队审阅。
准备好部署真正可审计的 AI Agent?
知道追踪记录应该包含什么是一件事;把 Agent 部署在一个每项操作都被采集、授权与可复核的环境之中,是另一件事。UD 团队手把手带你完成每一步,由准备度评估、安全沙盒部署,到监控、成本归因,以至董事会会追问的每月报告。28 年服务香港企业,全程陪你走。