一家香港物流公司的客服组每天处理六百多张查件请求。营运总监被告知,AI 可以接手其中大部分的第一轮回应。六家供应商已经来过提案,每份演示看起来都差不多,而没有一家说清楚:当 AI 判断错误、并且已经动了系统里的数据时,谁来负责。
2026 年 7 月 22 日,OpenAI 推出了一项专门围绕这个问题设计的产品。它叫 Presence,而它不是一个 API。
什么是 OpenAI Presence?
OpenAI Presence 是一项企业级产品,用于把语音与对话 AI 代理部署到真实生产流程中。它把模型推理能力,与企业自订的政策、防护栏、获授权动作清单及升级规则结合。部署由 OpenAI 的 Forward Deployed Engineers 主导,而非自助注册,每一个代理只负责一项明确工作。
这个区别比表面上重要。API 给你一个模型,控制层由你自己建。Presence 把控制层本身当成产品交付。
根据 OpenAI 的发布公告,理由写得很直接:企业面对的挑战,已经不是证明 AI 代理能否运作,而是让它可靠到足以在生产环境中承担高价值工作。
为什么 OpenAI 选择推出交付型产品,而不是又一次模型更新?
因为代理项目的失败率是部署问题,不是模型问题。Gartner 在 2025 年 6 月访问了超过 3,400 家正在投资代理式 AI 的机构,结论是:超过四成的代理式 AI 项目将在 2027 年底前被取消,主因是成本失控、商业价值不明确,以及风险控制不足。
这三个原因,没有一个是靠更聪明的模型可以解决的。
Gartner 的 2026 年代理式 AI 技术成熟度曲线,把这个类别放在「期望膨胀高峰期」:只有 17% 的机构真正部署过 AI 代理,但超过六成表示会在两年内部署。意向与落地之间的落差,正是 Presence 针对的市场。
Gartner 同时预测,2026 年将有三分之一的企业因为过早部署 AI 而损害客户体验。对管理层而言,这才是真正的风险线:内部试点失败只是烧掉预算,面对客户的代理失败则是烧掉客户。
一次 Presence 部署实际上如何运作?
每一次部署都由一项具体工作开始,例如处理帐单争议、支援保险理赔,或处理员工的 IT 服务请求。代理只获得该项工作所需的知识与系统权限。企业随后订立政策,界定代理可以做什么、什么情况需要审批、什么情况必须交回人手。
OpenAI 描述的流程有五个阶段,而每一个阶段本质上都是组织管理任务,不是技术任务。
--- 界定工作范围。一项工作,范围要窄到成功与否可以被量度。
--- 连接知识与系统。只连该项工作需要的,多一项都不连。
--- 设定权限与政策。获授权动作、审批门槛、升级触发条件。
--- 上线前测试。以模拟情境与评分器检查代理是否达成正确结果、是否遵守政策、是否正确使用工具、是否在适当时候升级。
--- 上线后持续改善。生产环境的对话记录与升级个案会暴露缺口,Codex 会提出修改建议,团队先对照现行版本测试,再批准受控推行。
把这份清单当成一份职位说明书再读一次。五个阶段之中有四个属于你的营运、合规与客户服务团队,只有一个属于模型。
那个 75% 解决率究竟说明了什么?
Presence 目前支援 OpenAI 自己的英语电话支援线,在无需人手介入的情况下解决 75% 的来电问题。其由 Codex 驱动的改善循环,在 10 天内把人手转接率降低了 15 个百分点。这些是真实公布的数字,但同时也是最理想情况:OpenAI 用自己的产品,处理自己的支援队列。
把它当成天花板,而不是预测值。
真正可以借用的洞察在第二个数字,不是第一个。10 天内减少 15 个百分点的转接率,说明价值累积的位置在改善循环,而不是上线当天的准确度。上线准确度只是起点,上线后修补缺口的速度才是真正的能力。
这会重写你对供应商的提问方式。不要问代理第一天有多准,要问这个平台让你在第三个星期修好你发现的问题有多快。
今天谁真的买得到 OpenAI Presence?
Presence 只透过有限度正式发布计划,向合资格的企业客户提供。部署由 OpenAI 的 Forward Deployed Engineers 及指定的全球系统整合商主导。OpenAI 明确表示,Presence 目前并非自助式产品,企业必须联络其 OpenAI 客户团队。
对香港大多数中型企业而言,这扇门暂时是关着的。
公布的设计合作伙伴反映了它服务的层级。BBVA 正在墨西哥探索日常银行业务的 AI 语音支援。SoftBank 正在测试自然的日语客户对话。IAG 则研究在恶劣天气与自然灾害等高需求时刻提供支援。这些都是设有专责 AI 转型领导层的跨国集团。
一家二百人规模的本地专业服务公司,并不是 Forward Deployed Engineer 计划的目标客户。及早认清这一点,可以省下一整季无效的供应商会议。
买不到的香港企业,可以从中拿走什么?
架构比使用权更有价值。Presence 实质上是一份公开的生产级代理部署参考设计,当中每一个组件,都可以写进你的招标文件、内部建置计划或本地供应商评估标准,与最终选用哪个平台无关。
有四项要求值得直接搬进你自己的评估准则。
--- 按工作范围授权。代理只看得见其单一工作所需的数据与系统。这同时是让代理部署在《个人资料(私隐)条例》下站得住脚的最低成本方法。
--- 明确的审批门槛。用文字写下哪些动作代理可以自行执行、哪些必须由人签批,而且要在上线前议定。
--- 上线前模拟测试。针对边缘情境与高风险情境测试,并就结果、政策合规、工具使用与升级行为四个维度评分。
--- 指定一位上线后改善负责人。要有一个具名的人,每星期审视升级个案并批准修改。
本地情境令后两点更为关键。个人资料私隐专员公署完成了对香港 60 间机构的循规审查,2026 年 5 月公布的结果显示,95% 的机构在日常运作中使用 AI,超过一半同时运行三个或以上的 AI 系统。公署未发现违反《个人资料(私隐)条例》的情况,但指出随着应用普及,部分治理措施反而有转弱的迹象。
应用速度正在跑赢治理速度。一个会在客户帐户上执行获授权动作的代理,正是这道落差变得最昂贵的位置。如果你还未理清每一个代理在系统内如何被识别与授权,这个问题值得先解决,我们在代理身分的专题解析中已另行处理。
交付型代理平台与订阅式聊天机械人有何不同?
选择取决于一个问题:这个流程需要 AI 去「做」一件事,还是只需要它「讲」一件事?回答是知识问题,执行是治理问题,而两者的成本结构完全不同。
回答只需要准确检索。如果工作是告诉客户退款政策是什么,你需要的是准确检索、多语言覆盖,以及对系统不知道的事情诚实处理。一个配置得好的订阅式聊天机械人就是相称的答案。
执行需要治理架构。如果工作是核实来电者身分、查阅帐户、应用政策,然后真的把退款发出去,你已经进入另一个风险类别。此时你需要获授权动作清单、审批门槛、审计轨迹与升级规则。
大部分机构最终会发现,约七成查询适用第一种模式,余下三成需要第二种。在建立供应商短名单之前先定下这个比例,比任何功能对照表都更有价值。
代理部署在实务上会在哪里出错?
Gartner 所描述的被取消项目,大部分源于三种失败模式,而三种都在上线前已经看得见,前提是你知道要看什么。
范围蔓延。试点以「处理帐单查询」开始,变成「处理客户服务」。一项有可量度解决率的窄工作,变成一个没有及格线的无限职责。
没有升级契约。团队定义了代理可以做什么,却忘记定义它必须在什么时候停手。结果代理要么不断升级,摧毁成本论据;要么极少升级,摧毁信任论据。
上线后没有负责人。项目团队在上线当日解散,升级记录堆积而无人阅读。到第四个月,代理仍在依照第二个月已经修改过的政策回答问题。这是最安静的杀手。
还有第四种模式值得专门向董事会指出:在测试中表现正常的代理,在目标冲突与压力之下可能出现不同行为,我们在代理式错位风险的分析中已详细检视。
签约之前应该问任何代理平台供应商什么?
有五个问题,足以分辨一个能撑过生产环境的平台,与一个只撑得过演示的产品。按这个次序提问,并要求书面答覆。
--- 这个代理负责哪一项单一工作,多少解决率才算成功?如果供应商无法协助你写下及格线,你买的是一个试点。
--- 哪些动作代理可以不经人手审批执行,这份清单存放在哪里?它应该是一份受管治的文件,不是一段对话。
--- 政策修改如何在触及客户之前完成测试?模拟能力现在是基本要求,不是加值功能。
--- 改善循环具体如何运作,由谁负责?要问实际频率,也要问实际那个人。
--- 客户数据存放在哪里,谁有权存取?在《个人资料(私隐)条例》之下,无论基建由哪家供应商持有,这个答案的责任都属于你。
留意一点:这五个问题没有一个关于模型质素。在 2026 年,模型质素是入场门槛,部署纪律才是差异所在。
策略性结论
值得理解 OpenAI Presence,不是因为香港大多数企业本季就买得到,而是因为它为一场争论下了结论:企业 AI 代理最难的部分从来不是推理能力,而是政策、升级规则、上线前模拟,以及第六个月时仍然负责改善循环的那个人。
这是营运模式问题,而营运模式问题不会因为等下一次模型更新而解决。它靠界定一项工作、写下规则、上线前测试、指定负责人来解决。任何机构本月就可以开始,用任何平台,在任何预算之下。
技术会继续移动,纪律才会累积。懂AI,更懂你 UD相伴,AI不冷。
本文由 UD 企业 AI 团队审阅。
先看清准备度,再看供应商名单
在评估任何代理平台之前,你需要先知道自己哪些流程真的已经可以被界定范围、被治理、被量度。UD 团队手把手带你完成每一步,从 AI 准备度评估、流程范围界定、政策设计,到部署上线与成效追踪,28 年香港企业服务经验,全程陪你走。