一家香港物流集團的 AI 客服代理已經上線四個月,回答一直不錯。直到一位長期客戶問:「跟上季同樣的安排,可以嗎?」代理完全不知道「上季」是什麼。營運總監要親自跟進,供應商說這是提示詞問題。這不是提示詞問題,而是記憶(Memory)問題,也是企業級 AI 代理長期困在試點階段的頭號原因。
什麼是 Agent Memory(代理記憶)?
Agent Memory 是讓 AI 代理跨對話儲存、檢索與更新資訊的架構,使它不必每次從零開始。它存在於模型的上下文視窗之外,決定代理記住什麼、記多久,以及誰有權查看這些內容。
對預算討論而言,關鍵區別在於:上下文視窗是臨時工作空間,對話結束即清空;記憶則是持久的基礎設施,會跨越對話存續、承載治理規則,並隨時間累積價值。
大多數企業買家買到的是前者,卻以為自己買到了後者。關於臨時層的運作原理,UD 已另文說明什麼是上下文視窗,以及 AI 為何會遺忘。
為什麼大多數企業 AI 代理試點無法進入生產環境?
因為試點根本不需要記住任何事情。四星期的概念驗證跑的是乾淨、簡短、單次對話的任務;生產環境跑的卻是數個月累積的客戶歷史、不斷變動的政策,以及多步驟工作。兩者之間的落差,正是代理項目陣亡之處。
數據相當嚴峻。麥肯錫、Gartner 與 AI Governance Institute 於 2026 年 1 月至 3 月間發表的研究顯示,86% 的企業 AI 代理試點從未進入生產環境。Gartner 另行預測,超過 40% 的 agentic AI 項目將於 2027 年底前被取消。
同一批 2026 年研究列出的首要障礙依序為:64% 的主管指向評估能力缺口,57% 指向治理摩擦,51% 指向模型可靠性。值得注意的是這份清單的排序:模型質素只排第三,落後於兩個屬於架構而非演算法層面的問題。
同一研究給出的務實時間表是:由試點到有限度生產需 6 至 12 個月,到全面企業部署需 12 至 18 個月。壓縮這個時間表的機構,正是落入 Gartner 取消率統計中的那一群。
Agent Memory 實際上如何運作?
記憶的運作分三步:抽取、儲存、檢索。每次互動之後,系統抽取值得保留的內容,連同時間戳與擁有者等中繼資料寫入儲存層,之後在需要時只檢索相關片段。模型永遠不會看到整個檔案庫。
最後一點正是商業關鍵。把代理見過的所有內容全部餵回去技術上可行,財務上卻是災難,因為上下文視窗中的每一個 token,在每一次呼叫時都會計費。
選擇性檢索才是讓記憶負擔得起的原因。Mem0 於 2026 年公布的基準測試顯示,其在 LoCoMo 取得 92.5 分、LongMemEval 取得 94.4 分,平均每次查詢約 6,956 個 token,在相近準確度下較全上下文方案便宜三至四倍,中位總延遲為 0.708 秒。
下次與供應商開會之前,這三個基準名稱值得先記下來。
--- LoCoMo:1,540 條問題,涵蓋單跳、多跳、開放領域與時序記憶。
--- LongMemEval:500 條問題,涵蓋知識更新與跨對話回憶。
--- BEAM:在 100 萬與 1,000 萬 token 規模下的評估。
企業代理需要哪幾種記憶?
2026 年一份發表於 arXiv 的 LLM 代理記憶系統綜述,以認知科學角度歸納出多種記憶類型。就企業應用而言,以下四類承擔了幾乎全部的實務重量。
--- 工作記憶:當前任務狀態,對話結束即清空。這正是大多數試點僅有的部分。
--- 情節記憶:什麼時候、與誰、發生過什麼。前文那位物流客戶要的,正是這一種。
--- 語義記憶:關於你公司的持久事實,例如價格級距、產品規格、審批門檻。
--- 程序記憶:你的組織如何做事,包括升級路徑與例外處理。
只能描述工作記憶的供應商,賣給你的其實是一個牽繩較長的聊天機械人。你應追問:其餘三類他們持久化了哪幾種?這些儲存實際存放在哪裡?誰有權刪除一條記錄?
記憶到底能提升多少代理表現?
提升幅度足以改寫商業論證。Mem0《State of AI Agent Memory 2026》報告中的測試,讓代理在企業數據任務上逐步累積過往互動記錄。準確率在僅僅 62 條記錄之後,由 2.5% 升至超過 50%,並超越專家人手策劃的基準線。
請以採購角度再讀一次:同一個模型、同一組提示詞、同一批工具。唯一的變數,是代理能否看見自己的歷史。而 62 條記錄,大約只是單一部門兩星期的中度使用量。
Mem0 於 2026 年 4 月發布的新演算法,增幅亦集中在企業工作最依賴的兩個範疇:時序推理提升 29.6 分,多跳推理提升 23.1 分。時序推理回答的是「我們三月談定了什麼」;多跳推理回答的是「哪幾份合約會受該項改動影響」。
這些都不是消費級聊天機械人的問題,而是部門主管每天都要面對的問題。
Agent Memory 對香港的個人資料合規意味著什麼?
意味著具備記憶的代理本身就是一個個人資料儲存庫,必須按此管治。代理保留的任何可識別客戶或員工資料,均受《個人資料(私隱)條例》規範,涵蓋收集限制、準確性、保留期與保安原則。
香港的監管姿態在 2026 年明顯收緊。個人資料私隱專員公署於 2026 年 1 月對 60 間機構展開循規審查,5 月公布的結果顯示 95% 在日常營運中使用 AI。公署建議機構建立治理架構、進行私隱影響評估與 AI 審計、開展員工培訓、制定事故應變計劃,並特別要求對 agentic AI 採取審慎控制。
記憶層把上述其中幾項建議,由文書工作變成了工程要求。
--- 保留期:沒有到期政策的記憶儲存,預設就是無限期保留個人資料。
--- 準確性:三月為真、八月已錯的一條記錄,仍會被檢索並以十足信心陳述。
--- 存取權:若每位使用者的代理都能檢索全部記憶,你等於建立了一條無人批准的橫向資料存取路徑。
--- 刪除權:查閱或改正要求,如今需要你在向量資料庫內找出並修改條目,而不只是改一行資料表記錄。
更完整的香港治理脈絡,可參考 UD 的AI 資料落地指南。
跳過記憶層會出現什麼問題?
四種失敗模式反覆出現,而每一種呈報到董事會時,看起來都不像它真正的樣子。及早辨認,是「調整方向」與「撇帳」之間的分別。
失敗一:無休止的重新交代。員工花在重述背景的時間,比代理省下的時間更多。採用率悄然崩塌,項目卻被報告為「使用者參與度偏低」,而非設計缺陷。
失敗二:上下文膨脹。團隊以塞入更多歷史來補救,token 支出攀升、延遲惡化,當初支撐項目的投資回報模型大約在第五個月失效。
失敗三:上下文污染。早期的一個錯誤被儲存、被檢索、被不斷強化。代理變得「自信地錯」,而且難以追溯,因為問題出在儲存層而非提示詞。
失敗四:無界限保留。沒有人設定到期政策,於是十八個月的客戶對話堆積在一個從未納入私隱影響評估的向量資料庫裡。
失敗一與二是預算問題;失敗三與四是監管問題,而且浮現得更遲,這正是它們昂貴的原因。
香港企業應如何安排記憶相關決策的次序?
把記憶排在規模化之前,而非之後。真正跨進生產環境的機構,是在試點啟動之初就把記憶當作設計決策處理,預先定義保留期、存取範圍與評估標準,而不是等到採用率停滯才補救。
未來兩季一個可行的執行次序:
--- 第 1 至 2 週:把代理必須記住的內容歸入四種記憶類型,並標示哪些類別含個人資料。
--- 第 3 至 4 週:在寫入第一條記錄之前,為每個類別訂立保留期與刪除程序。
--- 第 5 至 8 週:界定存取範圍。記憶的可見度應跟隨既有角色權限,而不是另立一套。
--- 第 9 至 12 週:以你自己營運中的時序與多跳問題進行記憶專項評估,而不是採用供應商的示範題目。
--- 持續進行:監察「每宗已解決任務」的 token 成本,而非「每次查詢」的成本。單次查詢成本上升而單宗任務成本下降,是健康訊號。
評估環節值得特別強調,畢竟有 64% 的主管把評估能力缺口列為首要障礙。UD 早前關於CLEAR 企業 AI 代理評估框架的文章,正好與這一步互相銜接。
策略總結
決定你代理項目成敗的問題,不是「選哪個模型」,而是「這套系統記住什麼、記多久、誰可以看見」。這個問題在為期兩週的工作坊內是可以回答的;但累積了十八個月生產數據之後,就無法回答了。
在這個技術堆疊裡,模型能力已經是商品。記憶架構才是差異化所在,因為它是唯一一層編碼了你的組織、而非供應商的組織。
把這一層做對,需要的不只是技術選型,而是一個同時理解架構與監管環境的夥伴。懂AI的冷,更懂你的難。UD 同行28年,讓科技成為有溫度的陪伴。
本文由 UD 企業 AI 團隊審閱,資料核實日期為 2026 年 8 月 26 日。
從哪裡開始
設計記憶架構之前,你需要先誠實掌握組織的實際起點。UD 團隊手把手帶你完成每一步,由 AI 準備度評估、架構設計,到部署上線與成效追蹤,28 年企業服務經驗,全程陪你走。