香港大部分準備把 AI 代理推上生產環境的企業,手上都拿着兩份看起來可以互相取代、實際上不能的報價。一份測試代理所運行的基礎設施,另一份測試代理的判斷。先買錯那一份,結果就是通過了保安審查,卻依然上線了一套可被利用的系統。
這篇文章的目的,是把這個決定一次講清楚:比較準則、香港的成本現況、按買方類型的結論,以及兩種做法各自失效的地方。
AI 紅隊測試與滲透測試的實際分別是什麼?
滲透測試攻擊的是 AI 周邊的系統:伺服器、API、身分驗證、網絡路徑。AI 紅隊測試攻擊的是 AI 的決策過程,途徑是語言,包括提示注入、越獄、工具誤用與資料抽取。前者針對確定性基礎設施,結果非黑即白;後者針對機率性行為,結果只能以統計方式表達。
這個分別並非學術問題。傳統滲透測試的前提是「已知輸入產生已知輸出」,正因如此,發現才可以重現,修補才可以驗證。
AI 紅隊測試沒有這種保證。同一段提示可能前三次失敗、第四次成功,因為漏洞是由模型、系統提示、可呼叫的工具,以及執行時讀入的資料四者互動而產生的。
滲透測試覆蓋哪些 AI 紅隊測試無法覆蓋的範圍?
滲透測試覆蓋的是 AI 承繼而非創造的攻擊面:外露的管理介面、模型前端 API 的薄弱驗證、未修補的主機、存放訓練資料而設定錯誤的雲端儲存,以及由被攻陷的代理主機橫向移動至公司其他網絡的路徑。
--- 基礎設施與網絡層。主機、通訊埠、網絡分段,以及在代理伺服器取得立足點後能否觸及財務系統。
--- 身分驗證與存取控制。代理使用的 API 金鑰與服務帳號是否已限定範圍、定期輪換並可即時撤銷。
--- 應用層缺陷。代理背後的網頁應用是否存在傳統注入、存取控制失效與工作階段處理問題。
--- 可審計的二元結果。一項發現要麼能重現,要麼不能,而這正是監管機構與審計師有能力閱讀的格式。
UD 公開的滲透測試服務涵蓋網站、網絡與流動應用測試,由內部測試員以人手方式進行,並明確與自動化漏洞掃描區分,一般於四至五星期內交付並附修補建議。
AI 紅隊測試覆蓋哪些滲透測試無法覆蓋的範圍?
AI 紅隊測試覆蓋的是「因為有模型在做決定」才會存在的失效類別:透過代理讀取的文件或電郵植入的提示注入、解鎖受禁行為的越獄、說服代理把合法功能用於非法目的的工具誤用,以及跨多個串連代理的權限提升。
參考框架都是公開的,值得寫進你的測試範圍文件。OWASP GenAI Security Project 維護 OWASP Top 10 for LLM Applications 2026,並另設一份 2026 年針對自主系統的 OWASP Top 10 for Agentic Applications。
實際方法論是自動化工具求廣度、人手測試員求深度。自動化部分最常被引用的兩個開源框架,是 Microsoft 的 PyRIT 與 NVIDIA 的 garak。
大部分供應商略過的一點
模型供應商早已對模型本身做過加固,未經加固的是你的應用:你的系統提示、你的工具允許清單、你的檢索資料庫。測試模型而不測試應用,只會換來一份乾淨的報告,以及零保護。
兩者在香港各需多少成本?
滲透測試在香港有可查的市場價格區間,AI 紅隊測試則暫時沒有,因為範圍會隨代理可呼叫的工具數量大幅波動。以下數字請當作規劃基準,並在比較報價前先要求書面範圍。
--- 滲透測試的市場區間。Astra 的香港滲透測試指南列出典型項目成本為 10,000 至 50,000 港元,視目標、資產類型、時程與測試員經驗而定。
--- UD 本身的價格。UD 並未公開滲透測試的標價,成本按資產數量與測試深度逐案評估。任何在網上出現、卻沒有範圍文件支撐的 UD 滲透測試價格,都不是真實價格。
--- AI 紅隊測試的成本驅動因素。代理可呼叫的工具數量、寫入操作是否納入範圍、是否測試多代理串連,以及合約約定的攻擊迭代次數。
--- 受監管金融機構。對銀行而言,金管局「網絡防衞評估框架 2.0」下的 iCAST 是獨立且強制的預算項目,不能取代上述任何一項。被評為中度或高度固有風險的機構,必須在風險與成熟度評估之外進行 iCAST 演練。
預算排序備註。滲透測試是範圍明確的採購,可以按價格橫向比較供應商。AI 紅隊測試更接近研究型項目,交付質素取決於測試員的創造力,而非清單覆蓋率。
你的組織該先做哪一項?
答案取決於你允許 AI 做什麼,而不是 AI 有多先進。分界線是寫入權限。只讀取與草擬的代理屬於基礎設施風險;能夠對系統紀錄採取行動的代理屬於行為風險,而行為風險需要紅隊測試。
按買方類型的結論
--- 你正在部署一個只讀的內部助理。先做滲透測試。現實中的損失情境是透過周邊基礎設施造成資料外洩,而這正是滲透測試最擅長找出的問題。
--- 你的代理可以寫入系統紀錄。先做紅隊測試,並在同一季度安排滲透測試。針對退款或付款功能的一次成功工具誤用攻擊,代價高於兩項測試的總和。
--- 你是銀行或持牌法團。C-RAF 2.0 下的 iCAST 義務決定你的時間表。把 AI 紅隊測試視為額外項目,因為 iCAST 重現的是針對你機構的攻擊者工具與戰術,而非探測模型的語言行為。
--- 你是使用舊有系統的專業服務或物流公司。先做滲透測試,因為代理真正的影響半徑,其實跑在多年未經測試的系統整合之上。
--- 你是為董事會採購,而非為某個系統採購。請要求一次範圍評估,而不是一次測試。在未界定代理可以做什麼之前買測試,只會換來一份講錯對象的報告。
決定任何一項發現能造成多大損害的關鍵控制是身分,這一點在我們關於代理身分與每個 AI 代理背後治理落差的解析中有詳述。若特別關注金管局方面的要求,可參考我們關於金管局開放 API 保安策略與滲透測試的指南。
兩種做法各自的不足在哪裡?
兩者都有真實的限制,任何告訴你「沒有限制」的供應商都在賣東西。有四項限制值得寫進範圍文件,而其中幾種情況下,比付費項目更值得先買的是別的東西。
限制一:滲透測試完全不測試模型行為。一份針對代理式部署的乾淨滲透測試報告,對提示注入風險而言幾乎沒有意義。如果提示注入是你的主要顧慮,由你自己團隊以 garak 或 PyRIT 運行的自動化紅隊測試框架,每一元的價值可能高於傳統滲透測試。
限制二:AI 紅隊測試的結果會過期。改動系統提示、更換模型版本或加入一件工具,原有發現就不再描述現時的系統。每星期發布更新的組織,更適合在自己的持續整合流程中建立評估管線,而非購買一年一次的項目。
限制三:兩者單獨都不足以應付審計。ISO 27001 認證、金管局的監管期望,以及客戶的保安問卷,一般要求的是傳統測試證據。如果你的驅動力來自客戶問卷而非真實的代理風險,範圍明確的滲透測試才是較便宜的正確答案,紅隊測試則屬言之過早。
限制四:單一時點的項目無法覆蓋無邊界的工具面。如果代理可以呼叫二十件工具,任何定額項目都不可能測試每一條路徑。在測試之前收窄工具允許清單,比購買更多測試人日更能可靠地降低成本並提升覆蓋率。
UD 不是正確選擇的情況。如果你需要的是模型層面的安全研究、嵌入開發流程的評估框架,或純自動化的持續掃描,專門的 AI 評估供應商或你自己的平台團隊會更適合。UD 的強項是香港企業基礎設施與應用測試,具備人手深度與本地監管理解。
正確的下一步是什麼?
不要先買測試,先買範圍。決定你需要哪一項的唯一關鍵,是代理被允許寫入什麼,而這個決定屬於你,不屬於測試供應商。先把它寫下來,再據此議價。
具體做法只需一項簡短練習:列出代理可以呼叫的每一件工具,逐項標明是讀取還是寫入,再標明哪些寫入牽涉金錢、客戶資料或受監管紀錄。若清單中出現任何一項寫入受監管紀錄,你的第一筆採購應是紅隊測試,並同步安排滲透測試;若一項也沒有,範圍明確的滲透測試就是誠實的答案,而且更便宜。
懂AI的冷,更懂你的難。UD 同行28年,讓科技成為有溫度的陪伴,這也包括在較便宜的方案才是正確答案時,直接告訴你。
本文由 UD 網絡安全及企業 AI 團隊(香港)審閱。價格與框架資料核實日期:2026 年 8 月 24 日。
強化企業安全 🛡️ 立即行動
UD 是值得信賴的託管安全服務供應商(MSSP)
擁有 20+ 年經驗,已為超過 50,000 家企業提供解決方案
涵蓋滲透測試、漏洞掃描、SRAA 等全方位網絡安全服務,全面保護現代企業。
告訴我們你的代理被允許寫入什麼,UD 團隊手把手帶你完成每一步,由範圍界定、測試、修補到覆測。