一家香港物流集团在一月批出自动化项目预算。到六月,项目停滞。模型运作正常,问题出在别处:团队每日使用的货运系统写于 2004 年,没有 API,供应商开价六位数、需时七个月才能加建接口。AI 根本无处可接。
AI 能够理解的范围,与 AI 能够实际操作的范围之间存在落差。这道落差,是香港企业自动化项目最常见的死因。而在 2026 年,有一类工具正式进入生产阶段,针对的正是这个问题。
什么是电脑操作代理?
电脑操作代理(computer-use agent)是一种以人类方式操作软件的 AI 系统:它观看屏幕、判断点击位置、输入文字、滚动页面,再读取结果。它不需要 API,也不需要集成项目。只要一个人能够通过浏览器或桌面应用完成的流程,电脑操作代理就可以尝试。
商业上真正关键的分别在于界面。其他所有企业 AI 集成方式,都要求目标系统开放结构化的接入点。电脑操作代理则直接把用户界面本身当作集成层。
这一项特性,改变了哪些系统属于可触及范围。终端仿真器、以 Citrix 发布的应用程序、政府电子申报平台、老旧 ERP 前端,以及 API 覆盖率极低的 SaaS 产品,全部无需供应商参与即可成为候选。
为什么电脑操作代理在 2026 年成为企业议题?
因为它不再是预览版本。微软于 2026 年 5 月 13 日将 Copilot Studio 的电脑操作代理正式推出(general availability),覆盖所有商业版 Power Platform 地区。正式推出,意味着讨论从研究演示转移到采购清单。
正式版本内置了企业买家在第一次会议就会追问的控制项。根据微软 Copilot Studio 的公告,功能包括 Azure Key Vault 凭证存储、Microsoft Purview 审计日志,以及可配置的人工复核环节,推理引擎则提供 OpenAI 的电脑操作模型与 Claude Sonnet 4.5。
2026 年内,其他供应商亦沿相近路线推进。对香港的运营主管而言,重点不在于哪一家胜出,而在于一项过去被归类为实验性质的能力,如今已附带支持合约、审计轨迹与按步计价的价目。
电脑操作代理实际如何运作?
它运行一个感知循环。代理截取当前画面,具视觉能力的模型解读画面内容,代理选定一个动作并执行,然后再次截取画面以验证结果。循环持续,直至任务完成或被防护机制中止。
这解释了为何此技术按步收费而非按席位收费。每一次循环都是一个可计价的推理单位;一项需要人工点击四十次的任务,成本大约是一次点击任务的四十倍。
这同时解释了它的可靠性特征。由于代理依据所见画面进行推理,而非依循录制的坐标,按钮移位或表单改版通常不会造成中断。相反,一个本身含糊的画面,会导致错误的判断,而不是一次干净的报错。
对运营总监而言,实际后果是:故障形态不是会触发告警的系统崩溃,而是一个看似合理、却执行在错误位置的动作。因此,验证机制的设计,比选用哪个模型更重要。
电脑操作代理与 RPA 有何分别?
传统机器人流程自动化(RPA)依循录制脚本,绑定特定选择器或屏幕坐标。电脑操作代理则在执行当下解读画面,再决定下一步。界面一改,RPA 即断;代理能够适应,但可能推理错误。
两者的经济结构因此不同。RPA 单次执行成本低,维护成本高。针对长期运营 RPA 项目的业界分析普遍指出,持续成本的大部分来自界面改动,而非新增业务逻辑。
电脑操作代理刚好相反。由于每一步都消耗模型推理,单次执行成本明显较高;但维护成本下降,因为没有选择器库需要在供应商每次改版后修补。
正确的企业结论不是取代。对于高流量、稳定、结构化的流程,RPA 仍然更便宜、更可预测。代理的价值在于流量较低、例外情况多、变动频繁的工作,而这恰恰是香港大多数后勤部门从未自动化过的一类。
应该先把哪些流程交给电脑操作代理?
套用四项测试。流程必须受限于屏幕(没有可行的 API)、可验证(机器能确认结果)、可逆转(出错可以还原),以及有边界(单次执行有明确终点)。四项之中任何一项不符,就不是好的首选。
受限于屏幕这项测试,保护的是商业理据。如果已有干净的 API,一般集成会更便宜、更可靠;此时选用代理,等于为零回报付出溢价。
可验证这项测试,是最多企业略过的一项。将供应商发票输入旧有会计前端属于可验证,因为入账记录可以读回并比对。一封需要判断力的客户邮件,则不属于此类。
可逆转与有边界两项,界定的是波及范围。把数据重新输入待审核队列是可逆转的;提交法定申报则不是,应该置于人工审批关卡之后,而非交由代理自主处理。
按此评分,香港最强的首批候选流程通常是同样四类:在老旧运营系统与现代财务平台之间重复输入数据、从银行或船公司平台提取结单、在政府网站查核牌照与许可状态,以及在两个从未集成的系统之间进行对账。
电脑操作代理的运行成本是多少?
定价按用量计算,单位是步数而非席位。在 Copilot Studio,电脑操作按代理动作费率计费;针对其信用额模式的公开分析显示,在标准预付价目下,单一步骤成本约为 0.04 美元,而预付信用额承诺可压低实际费率。
这个数字必须配合步数才有意义。一次四十步的对账作业,推理成本约为 1.6 美元。每日执行两次、全年计算,属于四位数港元级别的年度支出项。
令财务团队意外的成本,不是成功的执行,而是重试。代理在第三十五步失败后重新开始,会再次消耗前面三十五步;因此,不可靠的流程,成本是名义价格的数倍。
编列预算时应据此调整:计算每次成功完成的成本,而非每步成本,并在承诺用量之前,要求任何试点提供实测成功率。
企业部署电脑操作代理时,通常错在哪里?
五种失败模式解释了大部分停滞项目:选中一个没有机器可核对结果的流程;沿用共用的员工登录账号;略过影子模式期;量度活动量而非完成率;以及把所有代理当成需要完全相同的治理强度。
凭证上的错误,破坏力最大,也最常见。把员工账号交给代理,会摧毁责任归属、破坏职务分工,并令日后任何审计都无法回答。代理需要自己的身份,并仅限于任务所需的最少画面范围。
治理上的错误则较为隐蔽。Gartner 于 2026 年 5 月警告,对所有 AI 代理套用划一治理,本身就会导致企业代理失败;失败集中出现于未能区分「代理能够采取的行动」与「代理获授予的访问范围」的组织。
代价已在组合层面被量化。Gartner 于 2026 年 2 月的分析预测,超过 40% 的代理式 AI 项目将于 2027 年底前被取消,原因归于落地执行、治理与未经证实的商业价值,而非模型能力不足。
投入生产前,电脑操作代理需要哪些控制?
六项,而且在香港受监管环境下没有商量余地:专属的非人类身份、范围受限的访问权、完整的动作级审计日志、不可逆步骤的人工审批关卡、明确的中止条件,以及一位为输出负责的具名负责人。
--- 专属身份。代理以自身身份验证,绝不冒用员工账号,令每一个动作都可追溯。
--- 范围受限的访问权。权限只覆盖任务所需画面,将误读画面造成的损害封顶。
--- 动作级审计日志。每一次点击、输入与读取的数据字段都被记录,因为私隐专员查询或内部审计要求提交的,正是这条轨迹。
--- 人工审批关卡。付款、提交与删除等步骤一律暂停等待人工确认,无论代理过往表现多好。
--- 中止条件。代理在重试达到设定次数后,或遇到任何无法辨识的画面时停止,而非自行发挥。
--- 具名负责人。由个人而非委员会核准代理范围,并每周检视其例外日志。
香港还有一项特定考量。当受限于屏幕的流程涉及个人资料时,代理是代你读取及处理该等资料,私隐专员公署就工作场所使用 AI 的指引,对它的适用方式与对一名员工完全相同。设计审计轨迹时,应假设有一天你必须把它交出来。
未来 30 天应该如何开始?
执行一次为期四周的结构化评估,而非一次采购程序。第一周,盘点受限于屏幕的流程,并按四项测试评分。第二周,选定其中一项并建立量度机制。第三及第四周,以影子模式运行代理并收集数据。
影子模式是区分存活项目与第六个月被取消项目的关键纪律。代理在没有写入权限的情况下执行任务,同时由一名同事完成相同工作,两份输出每日比对。
唯一重要的指标,是无需人工修正的完成率。一个能够干净完成 70% 执行的代理,是实质节省。一个完成 95% 步骤、但每次执行都需要复核的代理,只是把工作搬了位置,并没有把它移除。
在试点开始之前,就把通过或不通过的门槛写下来,并让财务负责人在场。根据 Deloitte 于 2026 年初发表的企业生成式 AI 现状研究,供应商提供的代理约需 38 天达致首次价值,自建方案则约需 94 天;因此四周评估属于务实安排,而非乐观假设。
相关决策框架,可参考 UD 的文章:企业如何量度 AI 是否真正见效、AI 代理的非人类身份,以及企业 AI 自建与采购的抉择。
策略要点
电脑操作代理不会令你的旧有系统变得现代化。它令这些系统变得可触及,而对大多数香港企业而言,这正是十年来真正卡住自动化的那道限制。
2026 年能够从中取得价值的组织,不是预算最大的一批,而是选对可验证、可逆转流程、为每个代理配置独立身份、并量度完成率而非活动量的一批。
这些工作并不耀眼,回报却在其中。懂AI,更懂你 UD相伴,AI不冷。
由 UD 企业 AI 团队审阅。
准备好找出你的第一个自动化切入点?
掌握框架是一回事,在自己的运营中找出真正通过四项测试的流程,是另一回事。UD 在香港企业系统内耕耘 28 年,手把手带你完成每一步,由准备度评估、流程评分,到部署、控制设计与成效量度。