为什么 AI 会忽略长提示中段的信息?
大语言模型对提示开头和结尾的内容记得最牢,对中段内容的把握却明显更弱。研究者把这种现象称为「中段遗失」(lost-in-the-middle)。你粘贴一份 40 页的报告,追问第 22 页的某项条款,模型很可能改用第 2 页和第 40 页的内容作答,尽管第 22 页明明就在它的上下文窗口之内。
先坦白承认 AI 的一个弱点:它并不会平均地阅读整段输入。上下文窗口填满之后,注意力集中在前后两端,你最需要的那个事实,就在中段悄悄输掉了争夺焦点的竞赛。你的提示词没有写错,只是把最重要的部分放在了错误的位置。
定义:中段遗失是指语言模型对放在输入开头或结尾的信息,比放在中段的相同信息使用得更可靠,形成一条随位置变化的 U 形准确率曲线。
核心文献是 Nelson F. Liu 等人于 2024 年发表在 TACL 的论文 Lost in the Middle: How Language Models Use Long Contexts。在多文档问答测试中,答案位于第一份或最后一份文档时准确率最高,同一答案移到中段时准确率骤降。
更大的上下文窗口能解决问题吗?
不能。更大的窗口让你可以粘贴更多内容,却不会让模型平均地关注每一个 token。容量变大,多数只是增加了干扰的空间。真正该问的不是模型接受多少 token,而是它一次能准确运用多少,而这个数字远低于宣传数字。
宣传数字仍在攀升。2026 年 9 月 14 日,ChatGPT 把手动选择 Thinking 模式时的总上下文窗口提升到 256K token(输入 128K 加输出 128K),此前为 196K,AI 研究者 Tibor Blaho 记录了这项变更。Gemini 的 Pro 级模型和 Claude 的顶级方案,则标榜百万级 token 的窗口。
可用数字却落后于宣传数字。Chroma 的 context rot 研究测试了 18 个模型,包括 GPT-4.1、Claude 4 和 Gemini 2.5,发现没有一个模型能均匀地使用长输入,而且输入越长,可靠性越低。另一篇 2025 年关于「最大有效上下文窗口」的论文指出,受测模型在部分任务上的有效窗口,比宣传上限低了最多 99%。
提示词中最重要的信息应该放在哪里?
把长期有效的规则和决定答案的关键事实放在最前面,把真正的问题和输出要求放在最后面,绝不要让决定答案的那一句话留在长文本的中间三分之一。如果关键段落必须留在文档内部,就在问题旁边再引用一次。
可以把一段长提示想成阅读质量不同的三个区域。
--- 前区(记忆力强):角色、常设规则、整份文档所依赖的定义或数字,以及一句话预告你最后会问什么。
--- 中区(记忆力弱):粘贴的大部分材料。只存在于这里的内容都有风险。
--- 后区(记忆力强):问题本身、输出格式、限制条件,以及再次引用的决定性段落。
最实用的单一技巧来自 Anthropic 针对 Claude 2.1 发布的长上下文指引。在提示中加入一句 「以下是上下文中最相关的句子:」,并要求模型先抽出该句再作答,长文档检索准确率从 27% 升至 98%,详见 Anthropic 的公开说明。模型版本虽已过时,但「先强制抽取、再回答」这个习惯,在 2026 年的模型上日常使用依然有效。
如何搭建长文档提示词,确保没有内容被遗漏?
使用固定顺序的标签区块:规则、关键事实、完整文档、抽取步骤,最后是问题和格式。「规则」「关键事实」「文档」「任务」这些标签是路标,而抽取步骤则强迫模型在动笔之前先找到决定性的段落。
下面是一个可以直接复制使用的完整模板,适用于 ChatGPT、Claude 或 Gemini 的普通对话界面,无需 API。
试试这个提示词:
【规则】
你是一位严谨的分析员。只根据下方【文档】作答。若文档中没有答案,请回答「文档中未找到」。除非被要求,不要总结整份文档。
【关键事实】
1. 合同续期日为 2027 年 3 月 31 日。
2. 终止合同须提前 90 日书面通知。
3. 逾期付款利息为每月 1.5%。
【文档】
[在此粘贴完整文档]
【抽取步骤】
作答之前,先逐字引用【文档】中与【任务】最相关的一至三句,并标明条款编号。
【任务】
问题:如果我们在 2027 年 1 月 15 日发出通知,能否在续期日之前退出?会产生什么罚款?
输出格式:(1)引用的句子;(2)一段文字的答案;(3)一行置信度评级并附原因。
这个模板有效的关键在于三个细节。【关键事实】位于前区,模型在进入大段文本之前已先锁定正确的数字。【抽取步骤】把检索问题转化为抄写任务,而抄写正是模型的强项。【任务】位于最底部,最接近生成答案的位置。
如果你已经在使用结构化的输出约定,这个模板可以直接嵌入;格式方面可参考 UD 的 输出契约指南。
这套方法如何应用于报告、会议和数据等实际工作?
只要你粘贴的内容超过大约十页或一小时的会议记录,就套用同一套三区结构:把重要事实钉在最前面,加入抽取步骤,在最后提问。无论是董事会报告、会议转录、导出为文本的电子表格,还是多封往来邮件,都同样适用。
客户会议准备。你粘贴一段 90 分钟的会议转录,问客户承诺了什么。承诺多数集中在最后 15 分钟,这没有问题,但客户的预算上限是在第 40 分钟提到的。把「第 40 分钟左右提及预算上限:120 万港元」写进【关键事实】,否则模型会围绕错误的数字拟定方案。
季度报告审阅。一份 60 页的 PDF,唯一的收入重述藏在第 31 页的脚注里。把该脚注引用在前区,并在问题之前再引用一次。否则模型会很乐意替你核对一堆早已被取代的数字。
长对话。你在 40 条消息之前给出的指令,现在已经处于窗口中段。每 15 到 20 轮重申一次常设规则,或者新开一个对话并把规则放在最顶部。长对话中的「跑题」,多数只是换了面貌的中段遗失。
哪些错误会让中段遗失问题更严重?
最常见的错误包括:粘贴超出任务所需的内容、把规则和数据混在同一段、一次问多个问题,以及在没有核对来源段落的情况下相信一个自信的答案。每一项都会加剧上下文窗口内的竞争,并掩盖模型跳过关键事实的那一刻。
--- 「以防万一」把所有东西都贴上。文字越多,干扰越多。Chroma 的数据显示,即使额外的文字与任务相关,可靠性仍会随长度下降。只保留问题真正需要的部分。
--- 近似重复的段落。同一段文本里有两个相似的定义是经典陷阱,模型可能因为旧版本更靠近边缘而选了它。粘贴之前先删除已被取代的版本。
--- 规则埋在文档之后。如果你的格式规则排在 30 页文本之后,在模型眼里它们就是中段。规则放最前,格式放最后,绝不放中间。
如何用十分钟测试你的 AI 工具是否存在这个问题?
选一个模型理应答对的事实,把它分别藏在同一份长文档的三个位置:靠近开头、正中间、靠近结尾,然后用完全相同的问题问三次。如果中间那次答错或含糊,你就已经在自己的工具和自己的文档上测出了这个效应。
一个现在就能做的十分钟版本:
--- 选一份你熟悉的长文档,大约 20 页。
--- 在第 2 页插入一句虚构但合理的话,例如「本项目代号为海港灯笼」,然后问「本项目代号是什么?」记下答案。
--- 新开对话,把那句话移到第 10 页,再问一次。然后移到第 19 页。
--- 把第 10 页的版本再跑一次,这次加入【抽取步骤】,并把问题放在最底部。
多数人会看到中间那次失败或含糊其辞,而加入抽取步骤的那次则恢复正常。这就是你在自己的模型、自己的内容上取得的证据,不需要任何基准论文。随之养成的习惯很简单:每次粘贴长内容,都刻意安排位置,并在提问之前先抽取。
今年真正拉开差距的从业者,并不是拥有最大上下文窗口的人,而是明白 AI 的阅读方式与人不同,并确保它的冷区永远不会承载决定性事实的人。懂AI的冷,更懂你的难,UD 同行28年,让科技成为有温度的陪伴。
本文由 UD AI 团队审阅。
看看你的 AI 协作成果,与 AI 员工对决会是什么结果
你已经学会如何让模型读到真正重要的内容,下一步是把它变成可重复的工作流程,并看清 AI 同事在哪些环节确实胜过人类、哪些环节仍然落后。UD 免费的 AI Battle Staff 让人类岗位与 AI 员工在 20 个真实商业场景中正面对决,UD 团队手把手带你完成每一步,把对决结果转化为你团队可以实际运行的配置。