大多数每日使用 AI 的人,仍然习惯在提示词的开头写上一句「请一步一步思考」。在 2026 年 8 月你正在使用的模型上,这句话最好的结果是毫无作用,最坏的结果是让输出质量明显下降。
这不是风格偏好的问题。过去一年,各大模型家族都悄悄完成了一次架构转变,而 API 圈子以外的使用者几乎没有察觉。
以下是实际改变了什么、哪些提示词习惯应该淘汰,以及可以直接复制使用的替代模板。
什么是推理模型?2026 年到底改变了什么?
推理模型是指在输出可见答案之前,先自行生成一段内部思维链的语言模型。你看不到这些内容,但你要为它付费,而它直接决定回应的质量。到了 2026 年,这已经是默认行为,而不是一个需要你开启的选项。
最清楚的例子是 Claude Sonnet 5。根据 Anthropic 的 adaptive thinking 官方文档,一个没有指定 thinking 字段的请求,现在会自动以自适应思考模式运行。同一个请求在 Claude Sonnet 4.6 上,是完全不会启动思考的。
Anthropic 的 Sonnet 5 更新说明写得更直接:手动设定 extended thinking 现在会返回 400 错误;把 temperature、top_p 或 top_k 设为非默认值,同样返回 400 错误。你以前习惯调校的旋钮,已经被移除。
OpenAI 的方向一致。GPT-5.6 系列的推理深度,是通过 reasoning effort 参数设定,而不是靠你在提示词里写的一段文字。
为什么「一步一步思考」现在反而有害?
让一个推理模型「一步一步思考」,等于要求它做一件它已经完成的事。这句指令会落入两种坏结果之一:模型把推理过程直接写进可见答案,或者把内部推理限制在你写的框架之内。
第一种情况是你会立即察觉的。你要求一段 200 字的产品描述,结果收到 700 字的「首先,让我考虑目标受众。其次,让我思考语气」。这段推理你本来已经付过一次钱,现在以输出的形式再收你一次。
第二种问题更安静,代价也更高。你列出的步骤其实是一个上限。模型在处理定价分析时可能想检查五项因素,但你的提示词只让它检查三项,于是它只检查三项。
实务上有一个非常常见的情境:你把 2023 年写下的提示词模板贴进 2026 年的模型,得到一段冗长的回应,然后结论是「这个模型变差了」。模型并没有变差,是你的提示词在跟它对抗。
2026 年应该淘汰哪五个提示词习惯?
以下五种技巧在 2023 年的模型上确实有效,但在推理模型上,效果已经变成中性或负面。每一项在当时都是正确建议,现在则是你在 token、延迟与偏移上白白付出的成本。
一、「一步一步思考」及其变体。包括「请仔细推理」「慢慢想」「想深入一点」。OpenAI 对现行推理模型的官方建议,就是不需要让模型想得更用力,也不需要让它展示思维链。
二、冗长的条列式规则清单。四十行的「应该/不应该」,是以前从非推理模型手上换取一致性的方法。在推理模型上,它会与任务本身争夺注意力,而且你每加一条规则,真正重要的那几条就被稀释一分。
三、调高 temperature 追求创意。在 Claude Sonnet 5 上,这已经不是坏主意,而是一个错误:非默认的采样参数会返回 400。创意上的变化,现在来自你要求什么,而不是来自一个滑块。
四、单独写一句「请简洁」。这句话既模糊,方向也错。「请简洁」是让模型把所有内容平均压缩;「最多 150 字,不要开场白,不要总结段落」才是告诉它应该砍哪里。
五、把角色扮演当成整套策略。「你是一位世界级的营销策略师」在 2023 年是关键一句。在 2026 年,它只是一个轻微的框架提示。真正的工作已经转移到上下文与约束:模型看得见什么,以及怎样才算完成。
那应该怎么写?结果导向提示词模板
用结果规格取代过程指令。推理模型不需要你教它怎么思考,它需要知道自己在看什么、在优化什么,以及一份完成品应该是什么样子。六个区块已经足够:目标、上下文、约束、证据、成功标准、输出格式。
以下是一份完整、可以直接复制使用的提示词,当中没有任何一句推理指令。
直接试用这个提示词:
目标
撰写新功能「在线预约」的发布通知邮件。
上下文
对象:2,400 位现有客户,主要是香港的诊所与美容院店主,平均 4 名员工。
他们每日使用我们的排程产品,并已要求在线预约功能两年。
品牌语气直接、实用,不使用感叹号。
产品事实:客户只需分享一条预约链接;客人无须注册账户即可预约;预约会在 5 秒内出现在原有日历;所有付费方案免费包含此功能。
约束
正文最多 180 字。主题一句,最多 20 字。
邮件前不要开场白,邮件后不要解释。
不得声称任何我们未曾实测的省时数字。
证据
邮件中每一项产品声明,都必须对应「上下文」中列出的事实。若你需要一项我未提供的资料,请在原位写上 [需要:所需资料],不要自行编造。
成功标准
一位只看主题与第一句的诊所店主,能够明白在线预约功能已经推出,而且不需额外收费。
输出格式
第一行为主题。空一行。然后是邮件正文。不要有其他内容。
留意这里缺少了什么:没有角色设定,没有「请仔细思考」,没有编号方法论。怎么抵达由模型决定,抵达哪里由你定义。
证据区块是整份模板中杠杆最高的一句。要求模型写出 [需要:⋯⋯] 而不是自行补上空白,等于把一次幻觉转化成一项看得见的待办事项。
如何把它套用在每周重复的工作上?
这套模板在你每周重复的任务上回报最高,因为固定的提示词会让输出的波动变得可诊断。当结果不稳定时,原因就是上下文区块的改动,而不再是一个谜。
以每周业绩摘要为例。2023 年的做法是一大段指令:扮演数据分析师,逐步检视数字,先找出趋势,再解释原因,然后提出建议,要简洁但全面。
2026 年的做法,是把目标、约束、成功标准与输出格式永久固定在一份已保存的提示词中,每周只更换上下文区块,贴上新的数字。
成功标准是大多数人投入不足的一环。「帮我总结本周的数字」没有终点线;「一位只读前三行的主管,能够说出本周唯一有明显变化的指标,以及本周唯一需要做的决定」则有一条模型可以瞄准、你也可以据此评分的终点线。
这也解释了为何一份重复使用的提示词,胜过一份灵光一闪的提示词。你用四十次、改六次的提示词,会赢过一次性的神来之笔,因为你看得见哪一次修改改变了哪一种行为。
这个建议在什么情况下会失效?
舍弃推理指令,对现行的前沿推理模型是正确的,但并非放诸四海皆准。以下三种情况仍然适用旧习惯,假装它们不存在只会让你吃亏。
小型模型与旧模型。如果你在跑轻量的本地模型或较旧的非推理模型,思维链提示依然有效,而且效果很好。本文的建议,范围仅限于默认就会推理的模型。
当你需要审核逻辑时。有些情况你确实需要在可见输出中看到推理,因为你要检查它,例如合规计算或会被人质疑的定价决策。这时应该把它当成交付项目来要求:「答案之后,列出你所使用的假设。」这是输出要求,不是推理指令,两者的分别很重要。
结构化抽取与格式化工作。从 300 张发票中抽取字段,完全不会因为推理而受益。在 Claude Sonnet 5 上,你可以传入 disabled 的 thinking 设定将它关闭,同时省下成本与延迟。选择最便宜而足够的模式,与选择最便宜而足够的模型等级是同一种纪律,我们在如何在 GPT-5.6 Luna、Terra 与 Sol 之间选择一文中详细谈过。
还有一项提醒:模型行为与版本绑定。本文所述的 400 错误行为,是 Claude Sonnet 5 截至 2026 年 8 月的官方记载。在你把生产流程建基于此之前,请先查阅你实际调用的那个模型字符串的最新更新说明。
立即试做:20 分钟提示词审计
你可以用手上现有的提示词,在大约二十分钟内验证本文的每一项说法。重点不是相信这套论证,而是在你自己的任务、自己的输出上看见差别。
打开你重复使用得最多的三份提示词,逐一做以下四步:
--- 删除每一句告诉模型「怎么思考」的指令,包括「一步一步」「仔细地」「以专家身份」,以及任何编号方法论。
--- 加入一个约束区块,写明硬性字数上限,以及明确的「不要开场白」规则。
--- 加入一句成功标准,描述读者看完输出之后应该能够做到什么。
--- 在两个独立对话中,用同一份输入分别执行原版与改写版,比较长度、准确度,以及各自需要多少修改。
在我们自己的测试中,改写后的提示词输出更短,需要的修改更少;差距在有明确交付物的任务上最大,例如邮件、简报大纲与摘要。开放式头脑风暴的差别则最小。
哪一版胜出就保留哪一版。整套方法就是这样,而且每当你依赖的模型推出重大版本更新时,都值得重做一次。
核心结论:不要再管理模型,改为定义结果
2023 年重要的技能,是懂得如何让模型思考。2026 年重要的技能,是懂得把一份完成品描述得够精确,让一个本来就会思考的模型可以准确命中。
这是一种截然不同的技能,它更接近「写好一份工作简报」而不是「写程序」。如果你曾经为自由职业者写过一份清晰的简报,你其实已经掌握了大部分。
这也解释了很多有能力的人现在的挫败感:你落后,不是因为你欠缺某个秘密技巧,而是因为你学过的技巧,适用于一代已经被悄悄替换掉的模型。
要跟上这种变化,正是同行者发挥价值的地方。懂AI,更懂你 UD相伴,AI不冷。
测试你的 AI 实力
改写提示词只是第一步。把它变成每星期都稳定运作的工作流程,才是真正的收获所在。UD 团队手把手带你完成每一步,由提示词设计、模型选型,到部署进你日常使用的工具之中。
由 UD AI 团队审阅。本文引用的模型行为,依据截至 2026 年 8 月 6 日的官方文档,并与版本绑定。