研究机构 Chroma 曾把 18 个当时最强的 AI 模型,放进同一项简单的检索任务做两次:一次输入很短,一次很长。任务完全没变,改变的只是准确率,而在部分模型上,跌幅以十个百分点计。
没有东西坏掉,也没有哪个模型“今天状态不佳”。这个现象叫 Context Rot,可理解为“上下文衰减”。它解释了很多老板都经历过的事:早上觉得 AI 精明伶俐,到了同一段对话的第四十个消息,你开始觉得它靠不住。
什么是 Context Rot?
Context Rot 是指 AI 助理的答案质素,随著它需要重读的对话越来越长而下降。模型并非疲倦,也不是故障。它只是被要求在一堆不断变厚的文字中,找出真正相关的那一句,而它做这件事的准确率,会随文字变厚而下跌。
名称来自 Chroma 于 2025 年 7 月发表的研究报告 《Context Rot: How Increasing Input Tokens Impacts LLM Performance》,作者为 Kelly Hong、Anton Troynikov 与 Jeff Huber。团队测试 18 个主流模型,涵盖 GPT、Claude、Gemini 与 Qwen 等系列,结论相当直接:模型不会平均地处理一段长输入,即使是短输入下能完美完成的任务,只要输入变长,表现就会显著波动。重点是:任务一模一样,改变的只是周边文字的份量。
AI 到底怎样“记得”你们的对话?
它并不记得。每次你按下发送,助理都由第一句开始重读整段对话,然后才写下一个回复。这里没有人类意义上的记忆,只有一份被反复重读的纪录,而纪录每一回合都变长。
可以这样想像:每个消息都由一位全新的临时员工回答,能力不错但完全是新人,回答前必须读完至今所有对话。第三个消息时档案只有一页,几秒读完,答得准确;第六十个消息时已经四十页,同样几秒,总有东西只能粗读。
这也解释了为何订阅页上的数字比表面重要。OpenAI 官方商业定价页列明,ChatGPT Business 座位的 GPT Instant 总脉络上下文窗口为 54K,可输入上限约 40 页;Enterprise 方案则为 128K 与约 250 页。同一页补充:上下文窗口中真正留给你输入的部分比总数更小,因为系统指令、已储存的记忆与模型内部处理都要占用同一空间。那个上下文窗口里的住客,不只你一个。
为什么对话越长,答案越差?
Chroma 的三个发现,已足够解释你日常见到的大部分情况。
长输入不会被平均阅读。可靠度随输入长度增加而下降,所以同一任务在一万个 token 时做得漂亮,到十万个 token 却会出错。
位置决定什么会被记住。模型对放在开头与结尾的资讯,回忆得远比埋在中段可靠。你在第十二个消息辛苦谈定的规则,如今正位于文件中段,那是全场最差的座位。
触发条件不是难度,而是长度。测试中包括刻意设计得很简单的任务,例如把字词原样重复。即使如此,输入越长,输出越不稳定。一个简单要求,可以纯粹因为之前内容太多而失手。
Context Rot 在香港中小企是什么样子?
它很少大声宣告自己,通常表现为细微而昂贵的偏移。
忘记毛利的报价单。贸易公司老板开头说明所有报价须保持 15% 毛利,然后逐一处理十一条产品线。做到第九条,报价看起来正常,实际毛利只有 11%,直到客户接受才有人发现。
不再像你家店舖的回复。零售商开头定好语气:亲切、简短、每次提供到店自提。五十个回复后,草稿变得冗长,再没提过自取。指令没有消失,只是沉了下去。
悄悄变样的译名表。餐饮集团在第六个消息谈定双语菜单译名,不得变动。到第六十个消息,市面已流通三个版本,印刷厂用了其中两个。三件事都不算灾难,却都真金白银地亏钱,而且当下看不出来,因为输出看起来依然是完成品。
大多数人对长对话的误解在哪里?
误解一:换更大的脉络上下文窗口就解决了。上下文窗口更大代表可接收更多文字才被迫丢弃内容,但不代表模型会平均细读。容量与可靠度是两件事,空间更多不等于更用心。
误解二:AI 在骗你。当模型推翻稍早谈定的内容,它并非存心欺瞒。站在它的角度,那条指令只是刚粗读过的长文件中段的一行淡字。它不是抗命,是真的没有给予足够权重。
误解三:换更新的模型就没事。Chroma 在全部 18 个受测模型都观察到衰减,包括当时最强的几个。这是固有特性,并非某一家厂商的缺陷。
如何避免 Context Rot?五个步骤
解决这件事不需要技术能力,只需要一个习惯。
--- 一段对话只做一件事。报价一个对话,客户回复另一个,排班表再开一个。三件工作混在一起,等于把模型每次要重读的份量乘以三。
--- 把规则放在最前面。不能移动的条件要写在第一个消息:毛利、语气、译名表、截止期限。开头正是回忆最可靠的两个位置之一。
--- 重开前先要一份交接笔记。输入:“请把我们已达成的决定与规则,整理成可贴进新对话的编号清单。”读一次、改正、贴进新对话。没有简报的新对话不是解决方案,那叫失忆。
--- 重申三条不能移动的规则。每隔约十个消息用一句短句重复,把它们送回结尾这个高回忆位置。
--- 留意信号。当助理重问你已答过的问题,或重复早前写过的段落,衰减已经开始。停手、取交接笔记、重新开始,不要硬撑。
至于一开始该喂什么给模型,可参考 上下文工程;答案里的事实从何而来,可参考 AI Grounding。
关于 Context Rot 的常见问题
开新对话会不会把之前的工作丢掉?
只有开空白对话才会。交接笔记就是转移工具:让它给一份编号清单、自己核对、贴进新对话,你保留结论,同时甩掉产生结论的四十页讨论。
多长才算太长?
没有通用数字,取决于模型与方案。实用准则是:如果你无法在两三下滑动内回到对话最顶,就该做交接笔记。
这跟 AI 幻觉是同一回事吗?
不是。幻觉是凭空捏造的事实;Context Rot 是真实存在的指令因位置而被低估权重。幻觉靠提供已核实来源处理,Context Rot 靠管理对话长度处理。
付费方案也会有吗?
会。付费方案买到更大上下文窗口,只会延后文字被丢弃的时间点,不会改变模型在上下文窗口内阅读的均匀程度。
给老板的结论
现时香港办公室最常听到的 AI 抱怨都是同一句:开头很好,之后开始敷衍。大多数个案里,退步的只有一样,就是对话的长度。
这其实是好消息,因为修正成本是零。不用加订阅,不用换工具,不用请顾问,三个习惯一个上午就能学会。
这也对应了香港中小企一直在说的、AI 卡住的真正原因。大新银行 2026 年 5 月访问超过 340 间本地中小企,约 23% 已采用 AI 或生成式 AI,45% 完全未开始;而未开始的一群中,57% 指主要障碍是缺乏相关知识或技能。不是价钱,不是技术,而是不懂得怎样用得好。
这是一个教学问题,而长期同行,正正就是为了解决教学问题。懂AI,更懂你 UD相伴,AI不冷。
本文由 UD AI 团队审阅,香港,2026 年 9 月。
想把这套方法带回你的团队?
知道 AI 为何走样只是第一步,把它变成员工真的会照做的日常流程,才是真正的难处。UD 在香港做了 28 年技术,最擅长让科技真正落地。我们手把手教你,由用日常语言评估 AI 在你业务中的位置,到建立一套你团队自己就能运作的做法。