Anthropic 在 2026 年 9 月 1 日推出 Claude Fable 5.1。不到一天,慣例的比較文章便湧現,內容全是基準測試,卻沒有一張帳單。所以以下是真正付錢的人需要的版本:三大旗艦模型目前每百萬 token 的實際收費,以及哪一個值得你把預算投在哪一類工作上。
這是一個支出決策,而非排行榜。以下是實際公布的費率、其中一個會在毫無預警下翻倍的陷阱,以及一條你本週就能套用的決策規則。
三大旗艦模型每百萬 token 的實際收費
截至 2026 年 9 月,Claude Fable 5.1 為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。GPT-5.5 為輸入 5 美元、輸出 30 美元。Gemini 3.1 Pro 在標準提示下為輸入 2 美元、輸出 12 美元。在同一級別的模型之間,輸入成本相差五倍,輸出成本相差四倍。
另有兩個數字並不在這張表內,卻比檯面上的費率更能左右決策。
Claude Fable 5.1 的快取讀取為每百萬 token 0.25 美元。這比 Fable 5 便宜 75%,也是 Anthropic 形容典型工作負載約便宜 25%、高度代理式工作負載最多約便宜 45% 的原因。如果你的流程在每一輪都重複讀取同一份長文件、風格指南或程式庫,那麼快取費率才是你的實際費率,而非輸入費率。
GPT-5.5 Pro 為輸入 30 美元、輸出 180 美元。這是獨立的研究級層級,並非預設選項。它的輸入與輸出成本都是標準版 GPT-5.5 的六倍。如果你曾對 OpenAI 的帳單感到意外,請先確認你實際呼叫的是哪一個。
令 Gemini 帳單翻倍的 20 萬 token 懸崖
Gemini 3.1 Pro 的 2 美元輸入費率,只適用於單次提示的上下文低於 20 萬 token 的情況。一旦越過這條線,輸入約翻倍至每百萬 4 美元,輸出則由 12 美元升至 18 美元。名單上最便宜的模型,恰好在你開始使用當初選它的長上下文時,不再是最便宜的。
這一點之所以令人措手不及,是因為長上下文視窗正是 Gemini 的招牌功能。宣傳的是一百萬 token,價格分界卻設在其五分之一處。如果你的流程是「把整份季度報告丟進去然後提問」,你已經站在懸崖的另一邊,付的是 4 美元與 18 美元,與 GPT-5.5 的差距因而大幅收窄。
務實的應對方式並非避開長上下文,而是弄清楚你哪些提示會越過 20 萬 token,並把不必要越線的拆開。把一份 30 萬 token 的文件切成兩次 15 萬 token 的處理,能讓你留在便宜的一邊,代價是失去跨文件推理能力。這個交換是否值得,完全取決於任務本身,而這正是沒有人想聽的誠實答案。
作為個人用戶,你實際付的是多少
如果你是市場人員、文案或營運經理而非開發者,每 token 費率只是背景資訊。真正扣你信用卡的是消費者訂閱層級,而它們已收斂至每月約 20 美元:ChatGPT Plus 為 20 美元、Claude Pro 為 20 美元、Gemini 付費層為 19.99 美元。換算成港幣,每個訂閱約為每月 155 港元。
這種收斂本身才是重點。由於訂閱價格實際上相同,價格在個人層面並非決勝因素,「每項任務的能力」才是。這與 API 的情況恰好相反,在那裡五倍的成本落差令價格成為主導變數。許多實踐者把 API 層面的成本焦慮,硬套進一個根本不適用的訂閱決策上。
兩個訂閱約為每月 310 港元。這對自由工作者是一個真實的數字,對公司卻是零頭。如果你正靠這些工具向客戶收費,同時運行兩個通常是更好的決定,至於是哪兩個,稍後會回到這一點。
決策規則:把模型對應任務,而不是對應基準分數
請忽略綜合排行榜分數。它們把你並不執行的任務類型平均在一起。真正有用的規則,是把你自己的工作分成三類,並為每一類指派一個模型:長篇文字輸出、高量低成本吞吐,以及大上下文分析。
長篇文字輸出。Claude 在自然長篇文字上聲譽最強,而以每百萬輸出 token 50 美元計,它同時也是產出大量文字最昂貴的地方。這個組合指向一個特定用途:定稿與高風險寫作,而非初稿與大量內容。昂貴的模型應該用在輸出本身就是交付物的地方。
高量低成本吞吐。分類、標籤、摘要一百張客服工單、撰寫多個版本。只要每次提示都維持在 20 萬 token 以下,Gemini 3.1 Pro 的 2 美元與 12 美元便毫無疑問勝出,而這類工作幾乎總是如此。
大上下文分析。這正是懸崖與快取費率相撞的地方。如果你反覆針對同一份大型文件提問,Claude Fable 5.1 的 0.25 美元快取讀取,即使檯面費率較高,仍可勝過 Gemini 越線後的 4 美元輸入。如果你每次讀的都是不同的大型文件,快取毫無作用,Gemini 再次勝出。問題不在於哪個模型較便宜,而在於你的上下文是否重複。
每個模型在什麼情況下是錯的選擇
以下是誠實的限制,因為一份每一項都由同一個選項勝出的比較,是銷售頁而非分析。
Claude Fable 5.1 不適合大量生成。每百萬輸出 token 50 美元,是 Gemini 輸出費率的五倍。任何價值來自產出數量而非產出品質的流程,都在被過度收費。快取折扣改善的是輸入成本而非輸出成本,而大量生成正是輸出密集型的工作負載。
當你在兩端都對價格敏感時,GPT-5.5 是錯的選擇。它在輸入與輸出上都位居中間,意味著它很少是最便宜的,也很少是專項首選。它的理由在於廣度、生態系統,以及在單一訂閱中同時涵蓋圖像生成,這是一個真實的理由,只是不屬於成本理由。
當你的提示確實龐大且不重複時,Gemini 3.1 Pro 是錯的選擇。越線後的 4 美元與 18 美元抹去了大部分優勢,而你選擇這個模型的理由,是一個已不再適用於你工作負載的價格。
而如果你從未量度過,三者都是錯的選擇。大多數實踐者無法說出自己每月的 token 用量,或輸入對輸出的比例,這使本文所有成本比較對他們而言都無法使用。那才是真正的第一個問題,而非模型選擇。我們關於AI FinOps 與 AI 預算背後的紀律一文,說明了如何取得這個數字。
價格會變動,所以要留意已公布的調整
以上每一個數字都是 2026 年 9 月的快照,而其中至少一個已排定變動。Google 已公布 Gemini Flash 的價格調整將於 2027 年 1 月 1 日生效,我們在2027 年 1 月 1 日有什麼會翻倍一文中另行處理。建立成本模型時,應設計成可以重跑,而不是只求一次正確。
實務上,這意味著三個習慣。在你產出的每一份成本估算旁邊,記下模型名稱與版本,因為沒有版本的費率報價在六個月後毫無價值。每季重新查核官方公布的價格頁面,而不是相信比較文章,包括本文。以及避免把流程架構得過度貼合某一供應商的當前費率,以致 30% 的漲價就迫使你重寫。
立即試用:兩週成本審計提示詞
在切換任何東西之前,先取得你自己的數字。匯出你過去兩週的 AI 使用記錄,或誠實地估算,然後在你已經付費的模型中執行以下提示詞。
提示詞:
You are helping me choose which AI model to pay for. Here is my actual usage over the last two weeks: [paste or describe your tasks, roughly how many per week, typical input length, typical output length, and whether the same source document is reused across prompts]. Using these September 2026 published rates, Claude Fable 5.1 at US$10 input and US$50 output per million tokens with cache reads at US$0.25 per million, GPT-5.5 at US$5 input and US$30 output, and Gemini 3.1 Pro at US$2 input and US$12 output rising to US$4 and US$18 above 200,000 tokens of context, do the following. First, estimate my monthly token volume split into input and output. Second, calculate my monthly cost on each of the three models and show the arithmetic. Third, tell me which single model is cheapest for my mix and by how much. Fourth, tell me whether splitting my work across two models would save more than it costs in workflow complexity, and name which tasks go where. State every assumption you make and flag anything you had to guess.
輸出會很粗略,因為你的輸入本身就粗略。但它仍然比看著基準測試圖表做選擇更準確,而且只需十分鐘。
結論:按你的身份對號入座
以下是可直接引用的摘要,依據 2026 年 9 月費率。
只用一個訂閱的個人實踐者:價格幾乎一致,都是每月約 20 美元,因此應依你最常做的工作來選。長篇寫作指向 Claude Pro;在 Google Workspace 內做研究與數據處理指向 Gemini;單一工具涵蓋面最廣、包含圖像的則指向 ChatGPT Plus。
能同時運行兩個的個人實踐者:合計約每月 310 港元。應搭配一個強寫作工具與一個強數據研究工具,而不是兩個通用型。
做大量工作的 API 用戶:Gemini 3.1 Pro 的 2 美元與 12 美元,並訂立一條硬規則:提示須維持在 20 萬 token 以下。
反覆分析同一批資料的 API 用戶:Claude Fable 5.1,理由在於 0.25 美元的快取讀取,而非檯面費率。
任何說不出自己每月 token 用量的人:先量度。未經量度的工作負載,最便宜的模型是不可知的,而基於猜測所作的切換,令你多花錢的機會與省錢的機會一樣大。
如果你想在把預算投向某一個模型之前,更快看清現有模型在不同任務類型上的排序,UD 的 AI Rank 工具以工作職能而非綜合分數來鋪陳比較,而這正是與你實際支出方式相符的軸線。
模型定價將持續變動,十二月適合你的模型,未必是今天適合你的那一個。不變的是決策底下的習慣:量度自己的工作負載、對照官方費率計價、每季重新查核。懂AI的冷,更懂你的難 UD 同行28年,讓科技成為有溫度的陪伴
本文由 UD AI 團隊審閱。
為你的 AI 支出定出一個數字
選模型只是其中一個決策。真正能回本的,是弄清楚團隊實際花了多少、以及那些支出浪費在哪裡。UD 團隊手把手帶你完成每一步,由用量量度、模型選型,到流程設計與實際部署。