对推理模型说「一步一步思考」,究竟发生了什么?
在推理模型的提示中加入「一步一步思考」,准确度几乎不会提升,但回应时间会增加 20 至 80%。推理模型在输出答案之前,本身已经生成内部推理过程。你的指令只是重复它已经安排好的工作,在部分模型上更会令答案变得不稳定。
这并非个人猜想,而是宾州大学沃顿商学院 Generative AI Labs 的《Prompting Science Report 2》的实测结论,作者为 Lennart Meincke、Ethan Mollick、Lilach Mollick 及 Dan Shapiro。
这句提示语当年确实名副其实。2022 年它是真正的突破,因为那个年代的模型如果你不要求,就不会把推理过程写出来。
模型变了,习惯却没有变。
一句话定义
思维链提示(Chain-of-Thought)是指令模型在给出最终答案之前先叙述推理过程,藉此提升多步骤问题的准确度。到了 2026 年,前沿模型预设已在内部完成这个动作,因此这道明示指令已经不再划算。
沃顿的实测数据到底显示了什么?
沃顿以 GPQA Diamond 的 198 道博士级题目,每题重复 25 次,横跨推理与非推理模型测试。即是每个模型、每种提示各 4,950 次运行。结果是:在推理模型上,思维链令平均准确度在两个模型上升约 3 个百分点,在第三个模型上却下跌。
具体数字值得记住,因为它们既细微,方向亦不一致。
--- o3-mini:加入「一步一步思考」后平均准确度上升 2.9 个百分点(p = 0.024)
--- o4-mini:上升 3.1 个百分点(p = 0.003)
--- Gemini Flash 2.5:下跌 3.3 个百分点(p = 0.005)
--- 推理模型的延迟代价:回应时间增加 20 至 80%,即每题多花 10 至 20 秒
更值得注意的结果出现在非推理模型:思维链拉高了平均分,却严重破坏稳定性。沃顿另外设定了一项名为「100% Correct」的指标,即同一道题在 25 次试验中全部答对才算成功。
在这项稳定性指标上,Gemini Pro 1.5 加入思维链后下跌 17.2 个百分点,Gemini Flash 2.0 下跌 13.1 个百分点。平均分升,一致性跌。
如果你对 AI 的抱怨是「昨天很好用,今天完全不行」,这个取舍正是问题的形状。
2026 年取代思维链的是什么?
是推理强度设定。你不再用文字编写思考流程,而是用参数设定模型应该思考多深,然后写一段简短提示,直接说明你要的输出。Google、OpenAI 与 Anthropic 都提供了某种形式的这个控制项。
Google 在自己的迁移指引中写得很白。最后更新于 2026 年 8 月 18 日的Gemini 3 开发者指南直接告诉开发者:如果你过去用思维链这类复杂提示工程去迫使 Gemini 2.5 进行推理,改用 Gemini 3 时应该把 thinking_level 设为 high,并简化提示。
同一页列出四个等级:minimal、low、medium、high。Gemini 3.1 Pro 与 Gemini 3 Flash 预设为 high。
Google 亦指出,OpenAI 的 reasoning_effort 参数会透过兼容层自动对应到 Gemini 的 thinking_level,换言之这个概念在不同供应商之间是通用的。
如果你从不接触 API
你依然拥有这个控制项,只是换了外观。在消费者版应用中,它以模型或模式选单的形式存在:思考模式或延伸思考的开关、模型清单中的推理型号、「快速」与「仔细」的选择。选择模式就是现代版的「一步一步思考」,而且不用付出额外 token 成本。
一道好的推理模型提示长什么样?
2026 年的好提示是简短的:先说任务,再定义完成品,列出限制,然后对「如何思考」完全不提。Google 针对 Gemini 3 的指引明确警告,模型可能会过度分析那些为旧模型而设的冗长提示工程。简洁现在是一项效能特征,不是懒惰。
以下模板在 Claude、ChatGPT 及 Gemini 的推理模式中都可用。直接复制,替换方括号内容即可。
立即试用这道提示
--- 任务:[一句话说明你要的唯一结果]
--- 输入:[贴上原始素材,或写「见附件」]
--- 输出格式:[精确形状,例如「六行表格,栏位为 X、Y、Z」、「三段各 60 字」、「包含这些键值的 JSON 物件」]
--- 必须包含:[令成品可用的两三项要素,例如「每一行都要有港元金额」、「每项主张标明来源行数」]
--- 不得出现:[你反覆遇到的失败,例如「不得虚构输入资料中没有的数字」、「不要加总结段」]
--- 验收标准:[你将如何判断,例如「我可以直接贴进简报,不用修改」]
留意缺少了什么。没有「你是世界级专家」,没有「深呼吸」,没有「一步一步思考」,没有奉承,没有角色扮演的铺垫,也没有任何关于推理过程的指令。
取代这一切的是「验收标准」那一行。写明验收标准,就把模糊的要求变成可检查的要求,而推理模型特别擅长针对已明示的标准去优化。
Google 指引中还有一项小细节,效果比大多数人预期更明显:当你贴上长文件时,把指令放在资料之后而不是之前,并以「根据以上资料」这类句式开始你的问题。
如何把这套方法套用到实际工作?
以一个常见任务为例:把 40 页季度报告变成给客户看的摘要。旧写法会叠上人物设定、逐步思考指令与客套铺陈。新写法只陈述成品与验收标准,让推理模式自行完成思考。
旧版提示通常是这样:「你是资深商业分析师。请仔细阅读附件报告。一步一步思考。然后撰写摘要。」它会产出一段合格但毫无形状的文字,你之后还要重写一次。
用上面模板写的 2026 版本是这样。
--- 任务:撰写季度回顾简报中面向客户的摘要部分。
--- 输入:附件的 40 页第二季报告。
--- 输出格式:四个要点,每点最多 25 字,然后一段 60 字的段落,指出唯一最大的风险。
--- 必须包含:每个要点都要有带单位的数字,以及该数字出自的页码。
--- 不得出现:任何报告中没有出现的数字;不得淡化风险段落。
--- 验收标准:我可以直接把四个要点读给客户听,中间不需要查证任何东西。
页码那项要求是低调的关键。它令输出可以在 30 秒内被核查,而这一点才真正决定你是否信任这个工具到愿意每周使用。
如果你想处理另一种可靠性问题,可以参考我们早前关于验证链提示法的文章,那是专门抓出虚构事实的第二轮提示。
这套建议在什么情况下会失效?
它在较旧、较小的模型上会失效,在你需要看见推理过程的任务上会失效,以及在任何需要向人类审核者展示思考过程的场景都会失效。沃顿发现思维链在非推理模型上依然能提升平均表现,换言之这条建议取决于模型,并非普世通则。
在你把这句提示从所有存档中删掉之前,请先看三项诚实的限制。
小型与廉价模型依然需要铺垫。如果你为了控制成本而使用 mini 或 flash-lite 等级的模型,又或者在自己电脑上运行开放权重模型,思维链往往仍然值得那些 token。沃顿在较旧的非推理模型上量到 11 至 14 个百分点的平均准确度提升。
有时推理过程本身就是交付物。如果你在审视一项论证、教授一套方法,或需要查清模型错在哪里,要求它列出步骤是完全合理的。此时你不是为准确度而提示,而是为一件成品而提示,那是另一份工作。
不要摆向另一个极端。沃顿同时发现,强迫模型「只回答答案,不要其他内容」很可能损害非推理模型的表现,因为这阻止了它原本会自行进行的推理。「用一个词回答」是有真实代价的,不是免费的效率。
还有一项香港本地观察。中英混用的提示依然可行,但短提示原则令语言混用的影响,变得不如结构重要。一份干净的双语模板,胜过一段文采优美的单语段落。
接下来 20 分钟可以做什么?
挑一项你每周都会重复的任务,做一次对照实验。取你目前最好的提示,再造一个版本,把所有推理指令与人物设定删掉,两个版本各在推理模式下运行三次,然后用你自己的验收标准比较输出。每边三次已足够看出规律。
评分要用两个轴,不是一个。第一,最好的那次输出有没有变好?第二,也是更重要的,最差的那次输出有没有变好?一致性才是决定一道提示能否在截稿压力下存活的因素。
多数实务使用者会发现,精简版即使在第一个轴上打成平手,在第二个轴上仍然胜出。整套论证就在这一次实验里。
更大的教训是:提示技巧有保鲜期。2022 年不可或缺的技巧,2024 年变成可选,2026 年变成一种税,而且没有人发通告。唯一耐用的能力,是用你真正付费的那个模型,针对你自己的工作去测试自己的提示。
懂AI的冷,更懂你的难 UD 同行28年,让科技成为有温度的陪伴。
由 UD AI 团队审阅。
找出哪个模型值得你的提示
懂得如何提示推理模型只是一半功夫,知道该把提示指向哪个模型才是另一半。UD 的 AI 排行榜把当前主流模型放在真实商业任务上并列比较。如果你想把这套技术嵌入一个每周都以同样方式运行的工作流程,UD 团队手把手带你完成每一步,由选模型、写提示模板,到实际部署。