2026 年 7 月 30 日,AI 模型定价究竟改了什么?
OpenAI 于 2026 年 7 月 30 日将 GPT-5.6 Luna 降价 80%,GPT-5.6 Terra 降价 20%。Luna 现时每百万输入词元收费 0.20 美元,每百万输出词元 1.20 美元;Terra 则为 2.00 美元与 12.00 美元。Sol 定价维持不变。
先说一句诚实的前提。没有人会因为一篇文章叫他转,就换掉自己的默认模型。你会转,是因为便宜的选项在你的具体工作上不再明显较差,而这次降价,是这道门槛首次为一大批实务使用者移动。
问题在于,「更便宜」和「便宜得足够」是两个不同的问题,而大部分关于这次公布的报道只回答了第一个。
本文回答第二个:你每项任务实际付多少、便宜档次在哪里真的会失效,以及以你的工作性质而言,哪一个模型值得成为默认。
GPT-5.6 与 Claude 各模型每百万词元收费多少?
截至 2026 年 7 月 31 日,GPT-5.6 Luna 为每百万输入词元 0.20 美元、输出 1.20 美元;Terra 为 2.00 与 12.00 美元;Sol 列价为 5.00 与 30.00 美元。Anthropic 于 7 月 24 日推出的 Claude Opus 5 为 5.00 与 25.00 美元,Claude Fable 5 则为 10.00 与 50.00 美元。
现行列价,每百万词元
--- GPT-5.6 Luna:输入 0.20 美元 / 输出 1.20 美元(7 月 30 日前为 1.00 / 6.00 美元)
--- GPT-5.6 Terra:输入 2.00 美元 / 输出 12.00 美元(前为 2.50 / 15.00 美元)
--- GPT-5.6 Sol:输入 5.00 美元 / 输出 30.00 美元(不变)
--- Claude Opus 5:输入 5.00 美元 / 输出 25.00 美元(2026 年 7 月 24 日推出)
--- Claude Fable 5:输入 10.00 美元 / 输出 50.00 美元
以 1 美元约兑 7.8 港元计算,Luna 的输出词元约为每百万 9.40 港元,Fable 5 约为 390 港元。同一段代码可以调用的模型之间,价差达 41 倍。
OpenAI 的官方公告同时以 Fast mode 取代原有的 Priority Processing,Sol 在此模式下速度最高提升至 2.5 倍,价格为两倍,智能水平不变。这是购买延迟,而不是购买智能,很容易被误读为升级。
一项重要的适用范围说明:以上为 API 与平台的词元价格。如果你付的是 ChatGPT 或 Claude 的固定月费,这次降价改变的是你的额度消耗速度,而不是账单金额。关于按席位计算的部分,可参考我们的企业 AI 席位定价分析。
降价后,一项真实任务实际成本是多少?
一项典型的实务任务,例如摘要一份 20 页文件并撰写 900 字输出,大约消耗 15,000 输入词元与 1,500 输出词元。以 Luna 计算约 0.0048 美元,即 0.04 港元;Terra 约 0.048 美元,即 0.37 港元;Opus 5 约 0.11 美元,即 0.87 港元。
把它放大到真实工作量,画面就清晰得多。
每月 500 项同类任务的成本,以 1 美元兑 7.8 港元计
--- GPT-5.6 Luna:约 2.40 美元,即 19 港元
--- GPT-5.6 Terra:约 24 美元,即 187 港元
--- GPT-5.6 Sol:约 83 美元,即 645 港元
--- Claude Opus 5:约 56 美元,即 437 港元
--- Claude Fable 5:约 150 美元,即 1,170 港元
以上为根据公开列价的算术推算,并非基准测试结果;你的实际词元数会因提示长度与推理深度而有差异。请视之为量级参考,而非报价。
真正应该重设你直觉的,是第一行与最后一行之间的落差。同样 500 项任务改用 Fable 5 而非 Luna,每月成本大约高出 60 倍。对于大部分内容、分类与摘要工作而言,这笔溢价买到的东西非常有限。
OpenAI 自己的说法也支持这一点。该公司指出,Luna 的表现可媲美一年前属于前沿级别的模型,而每项任务成本大约只有当年的百分之六水平,速度接近九倍。
按工作性质,哪个模型该成为你的默认?
高量、规格明确、错误容易发现的工作,默认用 Luna。经人工复核的日常专业输出,默认用 Terra。至于 Sol、Opus 5 或 Fable 5,应保留给「答错的代价高于模型成本」的工作,而这类任务所占的比例,远低于大多数人的想像。
按使用者类型的建议
--- 高量内容或运营工作(标签分类、摘要、初稿、数据清理):Luna。在规格明确的任务上,质量差距已不足以支撑十倍价钱。
--- 面向客户、由人工复核的写作与分析:Terra。Notion 表示在其评估中,Terra 在每项任务成本减半、耗时减少 60% 的情况下,达到与 GPT-5.5 相若的质量。
--- 长文件推理与精细编辑:Claude Opus 5。以 5 美元与 25 美元计,价格为 Fable 5 的一半,而 Anthropic 将其定位为接近 Fable 5 的前沿智能。
--- 单一错误代价高昂的工作(法律摘要、财务数字、监管条文、未经复核即发布的内容):Sol 或 Fable 5,并且仍然要加上人工复核。
--- 对延迟敏感的交互式工作:Sol 配合 Fast mode,以两倍词元价格换取最高 2.5 倍速度。
值得内化的模式是:正确答案很少是单一模型。OpenAI 引述的多个团队都描述了「路由」做法,由强模型制定计划,由便宜模型执行规格明确的部分。Cognition 便将 Luna 纳入 Devin Fusion,专门与较大模型分工处理例行工作。
如何测试便宜模型是否够用?
取二十项你已经完成的真实任务,交给较便宜的模型重跑一次,数一数有多少输出你会不经修改就直接发送。如果通过率高于大约 80%,而且失败是明显而非隐蔽的,这个便宜模型就适合成为默认。
失败的隐蔽程度,比通过率更重要。会大声失败的模型,比会似是而非地失败的模型安全,因为前者你会抓到,后者你会照样发出去。
试试这个提示来做比较:
--- 你正在接受一次路由决策评估。我会提供一项我已经以专业水准完成的任务。
--- 任务:[在此粘贴你的真实任务与原始材料]
--- 请就此任务产出你最好的成果。
--- 然后另外回答三个关于你自己输出的问题。第一,列出你不确定、希望由人工核实的部分。第二,指出输出中有哪些说法无法由所提供的原始材料支持。第三,以 1 至 5 分评估你的信心水平,并用一句话说明理由。
--- 不要美化这份自我评估。一个诚实的低分,对我而言比一个自信的错误答案更有用。
自我评估的部分,正是把这件事从质量测试变成路由测试的关键。一个能稳定标示自身不确定性的便宜模型,可以承担的工作量,比一个从不标示的昂贵模型更多。
便宜档次究竟在哪里失效?
便宜模型会在四类任务上失效:需要持续多步推理的工作、需要诠释的含糊指令、正确答案本身存在争议的专业判断,以及任何「似是而非的错误能通过复核」的工作。降价不会改变这些失效模式,只会改变你遇上它们的代价。
有四项限制值得诚实指出。
含糊之处是便宜模型输得最多的地方。面对模糊简报,较强的模型会提出澄清问题或保留余地;较便宜的模型则会自信地押注在单一诠释上。如果你的提示本身松散,省下的钱会全数消耗在返工上。
输出词元数的波动比你预期的大。一个写得啰嗦的模型,实际成本可能高于一个名义上较贵但下笔精简的模型。Blitzy 表示 Luna 在处理多 2.2 倍脉络的同时,输出词元比他们原本使用的模型少 8.5 倍。这提醒我们,单价只是等式的一半。
Fast mode 买的是速度,不是质量。以两倍 Sol 价格换取最高 2.5 倍速度,对交互式产品合理,对通宵批次运算则毫无意义。
价格会变。Luna 在单一次公布中降价 80%。你今天写死的任何路由逻辑,都应该每季重新检视;你建立的任何成本模型,都应该从配置文件读取价格,而不是依赖你对本文的记忆。
还有一项针对本文的说明。UD 并不公布 AI 工作流程部署的固定价格,因为每个客户的范围都不同,在此列出一个数字等于凭空捏造。上文的模型价格是公开、可核实、截至 2026 年 7 月 31 日有效的资料;至于 UD 自身的收费,应该来自一次对话,而不是一张表格。
正确的下一步是什么?
在改动任何东西之前,先做那二十项任务的比较。如果 Luna 通过你的标准,就把高量工作转过去,并为失败的任务保留较强的模型。如果通不过,你至少确切知道自己在为哪一项能力付钱,这比笼统地觉得「贵的比较好」有用得多。
从降价中得益最多的,不是转得最快的人,而是早已清楚自己哪些任务规格够明确、可以低成本路由的人,因为正是这份认识,把价格变动转化为实际节省。
模型价格会持续下跌。不会下跌的,是「不知道自己哪些流程可靠到足以自动化」所付出的代价。这才是本季真正值得投入的功课。
懂AI的冷,更懂你的难 UD 同行28年,让科技成为有温度的陪伴。
算清楚你的 AI 工作量到底该花多少
选一个模型是一个决定;建立一套能把任务路由到正确模型、并在价格变动后仍然运作的流程,才是更难的那个。UD 团队手把手带你完成每一步,由任务盘点、模型路由设计,到部署与成本监控。
由 UD 香港 AI 团队撰写及审阅。价格已于 2026 年 7 月 31 日对照 OpenAI 与 Anthropic 官方公布资料核实。