為什麼今天替你接電話的 AI,聽起來忽然像一個人,而一年多前同類系統卻像港鐵廣播?答案是一項名字相當不起眼的工程改動:全雙工(full-duplex)。
2026 年 9 月 10 日,OpenAI 把旗下全雙工語音模型 GPT-Live-1 正式開放至公開 API,語音層定價為每分鐘 0.05 美元,資料來自 OpenAI 官方公告。這個價錢,把「會說話的 AI 電話」第一次放進了一間普通香港小店的預算之內。本文說明全雙工到底指什麼、它改變了什麼,以及它至今仍然做不到什麼。
什麼是全雙工語音 AI?
全雙工語音 AI,是一種能夠同時聆聽與說話的語音系統。它在播放自己回覆的同時,仍然持續處理對方傳入的聲音,因此當客人插嘴,它可以在句子中途立即停下。半雙工系統則嚴格輪流:先聽後講,說話期間完全聽不見你。
這個詞來自電訊業,而非 AI 業。電話線是全雙工,因為雙方可以同時開口;對講機是半雙工,因為同一時間只有一方能發話,講完還要說一句「完畢」。
在這一代之前,幾乎所有 AI 電話助理,本質上都是一部披著電話外衣的對講機。
全雙工語音 AI 如何運作?
全雙工模型同時運行兩條音訊通道:一條承載客人正在說的話,另一條承載模型正在說的話。兩條通道持續開啟,因此模型可以在不足一秒之內偵測到對方插話,並即時切斷自己的語音。
舊式系統則是三段接力,每一段都必須等上一段完成:
--- 語音轉文字:偵測到靜音之後,才把客人的聲音轉成文字。
--- 語言模型:讀取文字,寫出回覆。
--- 文字轉語音:把回覆合成音訊,並完整播放。
這條接力線,正是兩個人人討厭的毛病的來源。第一,每次回答之前都有一至三秒空白。第二,它會不斷蓋過你說話,因為它早已決定要把整段音訊播完。
全雙工模型把這三段壓縮成一個持續聽、持續講的系統。在 OpenAI 的架構中,語音層只負責對話本身,較複雜的思考交由後端另一個模型處理,這也是語音層可以單獨、廉價計費的原因。
全雙工能處理哪些舊系統做不到的情況?
全雙工與半雙工之間,有四種具體的對話行為差異。單看描述似乎瑣碎,但在真實通話中,這四項正是「勉強可用」與「請幫我轉真人」之間的全部距離。
處理插話
客人在助理仍在介紹第一間分店時說「不是,我問另一間」。全雙工助理會在不足一秒內停下;半雙工助理則會把整段話講完。
處理停頓
客人低頭看收據,靜了三秒。半雙工系統會把靜音當成「講完了」而搶著開口;全雙工系統則能分辨「思考中的停頓」與「完整的句子」。
回應式應聲
人類在聽對方講話時會發出細小的聲音表示仍在線上。全雙工助理不但能發出這類聲音,更重要的是能夠辨識它們,而不會誤當成新問題。
輪次判斷
決定什麼時候開口才不會打斷客人。這是四項之中最難的一項,也是決定一通電話聽起來自然還是令人疲累的關鍵。
香港中小企可以用它來做什麼?
只要有電話在響、而沒有人騰得出手去接,語音 AI 就值得考慮。在香港,這份清單既具體又昂貴,因為電話最多的那一小時,通常正是服務最忙的那一小時。
晚上七時的餐廳
訂座電話在所有人手上都端著碟子時打進來。電話漏接,那一枱客人就去了先接電話的那一家。語音助理可以接下訂座、確認人數,並直接寫進系統。
將近收工的診所或髮型屋
改期的電話總在下班後湧來。每一通進了留言信箱的電話,翌日早上都要回撥一次,等於同一件事花掉兩次人手。
不停回答「還有貨嗎」的店舖
存貨與營業時間,是零售業重複最多的電話。它們同時也是最容易自動化的,因為答案本質上只是一次資料查詢。
外撥確認
預約前一天的提醒電話能有效減少爽約,而幾乎沒有一間小店抽得出人手去打。
第一次部署,務實的目標是一項窄任務,而不是一個全能接待員。只做訂座,或只答存貨。窄的助理會成功,貪心的助理只會被不斷轉真人。
全雙工語音 AI 實際運行成本是多少?
語音層的牌價是每分鐘 0.05 美元,按現時匯率約為每分鐘 0.39 港元。這只是前端語音成本。負責思考的後端模型要另外計費,承載通話的電訊線路亦是獨立收費。
以一間每月接 300 通電話、每通約三分鐘的小店粗略估算:
--- 900 分鐘語音,以 0.05 美元計約 45 美元,折合約 350 港元。
--- 後端模型與工具呼叫另計,實際金額視乎助理需要查多少資料,量級通常相近。
--- 香港本地電訊線路與號碼月費,屬於另一筆由電訊商收取的支出。
把這個數字與一位兼職接線人員相比,差距並不接近。但必須誠實指出:決定這類項目成敗的,很少是軟件的價錢,而是把它接上你訂座系統所需的功夫。
關於全雙工語音 AI,人們最常誤解什麼?
三個誤解造成了大部分失望。
誤解一:全雙工代表 AI 變聰明了。
並非如此。全雙工改變的是對話的時間感,而不是答案的質素。一個接上劣質知識庫的全雙工助理,只會很有禮貌地讓你插嘴,然後告訴你一個錯誤答案。
誤解二:廣東話、英文、普通話都會一樣流暢。
香港的電話往往一句之內就轉語言,而中英夾雜至今仍是所有供應商最難處理的情況。決定採用之前,請用你自己客人的真實錄音去測試,而不是看一段照稿演出的示範。
誤解三:一個下午就能上線。
語音模型是最容易的部分。真正的工作在於接駁:你的訂座系統、你的存貨資料、客人動氣時的升級規則,以及助理曾經承諾過什麼的紀錄。一個沒有升級機制的語音助理,本質上是一部投訴製造機。
你的業務現在適合用全雙工語音 AI 嗎?
對於窄範圍、重複性高、數量大的來電,答案是適合。凡涉及判斷、金錢,或情緒不佳的客人,它都應該交回真人處理,而這條交接路線必須在上線之前就設計好。
合理的推進次序是這樣的:
--- 先數清楚你一星期到底漏接多少通電話。若數字不足十通,這並不是你最該先解決的問題。
--- 選一種答案屬於事實查詢的來電類型。
--- 寫下助理在「不知道」時說的那一句話。那一句是整個部署裡最重要的一行字。
--- 錄下並檢視首兩星期的通話。每一次失敗,都是一條你還未寫下的規則。
如果你的客人主要用訊息而非電話找你,同樣邏輯適用於文字渠道,而那邊的成本結構今年同樣改變了。可參考我們關於 WhatsApp 回覆對香港企業的新收費 的說明。
技術終於聽起來像人。但它能否幫到你的生意,取決於一件比 AI 古老得多的事:清楚知道你請它來做哪一份工。懂AI,更懂你 UD相伴,AI不冷。
由 UD AI 團隊(香港)審閱。
想知道語音 AI 是否適合你的業務?
哪些電話該交給 AI、哪些必須留給真人,正是最值得做對的一步。UD 陪伴香港企業走過 28 年,最熟悉這類決定。我們手把手教你,由評估通話量到正式上線,全程陪你走每一步。