2026 年 9 月 1 日究竟有什么改变?
Claude Sonnet 5 的 API 推广价为每百万输入 token 2 美元、每百万输出 token 10 美元,有效期至 2026 年 8 月 31 日。由 9 月 1 日起,价格转为标准定价:每百万输入 token 3 美元、每百万输出 token 15 美元。表面涨幅为 50%,这一点在 Anthropic 官方发布文中已明确列出。
所有人都把它读成一次 50% 的加价。但对真正跑生产工作负载的实务工作者而言,实际涨幅比这个数字更高,而原因藏在一则脚注里。
可直接引用的事实
--- 模型:Claude Sonnet 5,2026 年 6 月 30 日发布,API 名称为 claude-sonnet-5。
--- 推广价,至 2026 年 8 月 31 日:每百万输入 token 2 美元,每百万输出 token 10 美元。
--- 标准价,由 2026 年 9 月 1 日起:每百万输入 token 3 美元,每百万输出 token 15 美元。
--- 表面涨幅:输入与输出同为 50%。
--- 对照 Opus 4.8:每百万输入 token 5 美元,每百万输出 token 25 美元。
--- Anthropic 关于分词器的说明:相同输入内容在 Sonnet 5 上可能对应约 1.0 至 1.35 倍的 token 数。
--- 聊天订阅方案用户并非按 token 计费,不会直接受此次调整影响。
以上内容全部载于 Anthropic 的 Claude Sonnet 5 官方公告,包括其「可用性与定价」章节及脚注。
为何实际冲击比表面的 50% 更重?
Sonnet 5 采用了更新的分词器。Anthropic 明确指出,相同输入内容可能对应约 1.0 至 1.35 倍的 token 数,具体视内容类型而定。由于 token 数正是计费单位,50% 的费率上调叠加最高 35% 的 token 膨胀,效果是相乘而非相加。
Anthropic 在这一点上相当坦白。推广定价的设定目的,正是让用户由 Sonnet 4.6 过渡至 Sonnet 5 时大致成本中性。换言之,推广期本身就是分词器变更的缓冲垫。
当这块缓冲垫在 9 月 1 日被抽走,两项变动会同时落在你的账单上。
你会感受到接近 1.35 倍还是接近 1.0 倍,取决于你的内容。密集的技术文字、代码、表格与中文输入的表现,与纯英文散文并不相同。这里没有捷径,你必须量度自己的工作负载。
这项量度是你在未来三星期内最有价值的动作,而它大约只需十分钟。
这对你的实际成本影响有多大?
一个每月消耗 2,000 万输入 token 与 400 万输出 token 的工作负载,在推广价下为 80 美元。由 9 月 1 日起,相同用量将变成 120 美元,增加 40 美元。若你的分词器膨胀为 1.25 倍,实际数字会接近 150 美元,约合每月港币 1,170 元。
以上数字假设没有使用缓存与批次处理,而这正是大多数无代码自动化流程的默认状态。
标准定价下的计算示例
--- 轻度使用,每月 500 万输入、100 万输出:推广价 15 美元,标准价 30 美元。
--- 中度使用,每月 2,000 万输入、400 万输出:推广价 80 美元,标准价 120 美元。
--- 重度使用,每月 1 亿输入、2,000 万输出:推广价 400 美元,标准价 600 美元。
--- 若在输入端叠加 1.25 倍的分词器膨胀,每项标准价数字会再上升约 12 至 20%。
如果你透过 Zapier、Make 或 n8n 等无代码平台,或透过转售 API 访问权的封装工具使用 Claude,请确认你的供应商会在 9 月 1 日直接转嫁此次调整,还是暂时吸收。不是每一家都会主动告诉你。
在 9 月 1 日之前如何压低账单?
三个杠杆承担了大部分工作:针对重复上下文的提示缓存、可容忍延迟时使用的 Batch API,以及调整 effort 等级,令你不再为简单任务支付高阶推理的价格。Anthropic 的文档指出,提示缓存可将重复输入成本削减最多 90%,批次处理则有五折优惠。
次序很重要:先量度,再缓存,然后批次,最后才考虑换模型。先换模型的人,通常会得到一张更便宜的账单和更差的输出。
立即试用这个提示
把以下内容连同你其中一段生产环境提示一并贴给 Claude 或 ChatGPT。
你是一位 LLM 成本审计师。我会贴上一段我重复执行的生产环境提示。请分析并直接回复以下项目,不要任何开场白。
1. 估算输入 token 数,并指出提示中哪些部分在每一次执行时都完全相同。
2. 一份改写版本:把所有不变的部分集中到顶部的单一稳定区块以便缓存,只把变动部分留在底部。
3. 三段在不影响输出质量的前提下可以缩短的最长段落,并为每一段提供建议替代写法。
4. 用「是」或「否」回答:此任务是否可以容忍数小时延迟,因而属于批次处理的候选。
5. 假设每月执行 [X] 次,以每百万输入 3 美元、每百万输出 15 美元计算我的估算月度成本。
我的提示:[在此粘贴]
第 2 项的输出通常就是省钱的所在。大多数生产环境提示都带着一大段不变的指令区块,而它在每一次调用时都被重新传送、重新计费。
应该转用其他模型吗?转去哪一个?
只有在你已完成量度之后才应该转。以 3 美元与 15 美元计算,Sonnet 5 仍然明显低于 Opus 4.8 的 5 美元与 25 美元;而 2026 年公开的业界比较表把 Gemini 3.1 Pro 列在约 2 美元与 12 美元、GPT-5.6 Sol 列在约 5 美元与 30 美元。更便宜的模型确实存在,但当一项任务需要重试三次时,它们就不便宜了。
要诚实面对竞争对手胜出的地方。在大量上下文的工作上,Gemini 3.1 Pro 在输入端是更便宜的选项。DeepSeek 与 Amazon Nova 系列等预算型模型,每 token 成本低得多,对分类、标记这类高用量而低判断力的任务确实合适。
Sonnet 5 站得住脚的地方是持续性的代理工作:涉及工具调用的多步骤任务,一个中途放弃的模型所造成的损失,远超它在 token 上省下的金额。
一条经得起现实检验的决策规则
--- 大量的分类、标记、抽取:用预算型模型。这类任务有可核对的标准答案。
--- 反正会有人复核输出的撰稿与编辑:中阶模型足够。用十件真实工作测试两个模型。
--- 含工具调用且无人在环的多步骤自动化:付钱用更强的模型。失败的代价高于 token。
--- 任何你无法评估质量的任务:不要换。你不会察觉质量下降,直到客户察觉为止。
第三方模型的报价来自 2026 年公开的比较表,而非各供应商官方页面,因此在做决定前请向供应商核实。
这一切解决不了什么?
成本优化无法修复一个本来就不值得跑的工作流程。如果某个自动化产出的内容根本没有人用,替它加上缓存,只是让浪费便宜了 90%。任何定价练习之前那个令人不安的问题是:你的 AI 工作流程之中,上个月有哪几个真正改变了一个决定,或替某个人省下了时间。
各项替代方案也有诚实的限制,包括我们自己的。
替代方案的不足之处
--- 提示缓存只有在被缓存的区块确实重复且稳定时才划算。若你经常改动它,就等于白付写入溢价。
--- Batch API 完全不适用于有人在等待结果的情况。客户回复与实时研究都不符合条件。
--- 预算型模型的劣化并不均匀。它们很少大声失败,而是在那最关键的 5% 个案上失败。
--- UD 的 AI 员工招聘处 每月港币 0 元,提供 8 位预建 AI 员工与 24 项技能,但它是预建的。若你的流程需要针对自有数据的定制逻辑,它是起点,而不是自行建置的替代品。
--- 以上任何一项都无法免除你自己评估输出质量的责任。没有任何定价页面能替你做这件事。
我们较早前比较 每月 20 美元在 ChatGPT、Claude 与 Gemini 上实际买到什么 的文章,处理的是订阅层面的问题,与按 token 计费的 API 决策并不相同。
8 月 31 日之前正确的下一步是什么?
这星期做三件事:从供应商后台拉出你 7 月的实际 token 用量;用上文的审计提示分析你用量最高的两段提示;然后以 3 美元与 15 美元推算 9 月成本,并在有具体数字摆在眼前的情况下,决定是优化、转换,还是接受加价。
你的期限是 8 月 31 日,距今大约三星期,而这份工作只需一个下午。
9 月会感到意外的团队,是那些把这件事当成一则新闻标题而非一笔账目的团队。愿意量度的人会发现,加价从来不是真正的问题,那个从未被检视过的工作流程才是。
成本压力总是令科技显得冰冷,但它不必如此。懂AI的冷,更懂你的难 UD 同行28年,让科技成为有温度的陪伴。
由 UD AI 团队审阅。
想在 9 月 1 日之前为你的 AI 账单取得第二意见?
如果你的 token 账单即将上升,而你不确定哪些流程值得保留,不妨由免费选项开始。UD 的 AI 员工招聘处为香港企业提供 8 位预建 AI 员工、24 项技能,每月港币 0 元,无需薪金,也无需入职培训。我们更会手把手带你完成每一步:由量度目前用量,到判断哪些工作应该放上 API、哪些不应该。