如果你在同一类任务上,AI 的输出时而出色、时而不堪使用,问题几乎从来不在你的措辞。你已经懂得写像样的提示。在好日子与坏日子之间改变的不是指令,而是模型执行那条指令时,眼前摆着什么信息。这就是「上下文工程」(Context Engineering)的核心概念,也是为什么这项原本属于 AI 工程师的技术,在 2026 年成为非技术背景的从业者最值得学的一件事。
什么是上下文工程?
上下文工程是控制模型回答时能看见哪些信息的做法,而不只是控制你如何措辞。提示是指令,上下文是窗口里的其他一切:文件、记忆、对话历史、工具输出、自定义指令。你优化的是信息,不是句子。
这个区分之所以重要,是因为两种做法的失败方式完全不同。提示工程失败时,你的判断是「提示写得不够好」。上下文工程失败时,你的判断是「模型没有拿到正确的信息」。只有后者能解释为什么同一条提示在早上十点给你精彩的答案,下午四点却只给你套话。
这不是行销词汇的更替。2026 年第一季,Neo4j、Elastic、ByteByteGo 与 Firecrawl 各自独立发表的指南,主题都是上下文工程而非提示工程;LangChain 更把这套做法整理成四个操作:写入、筛选、压缩、隔离。Anthropic 自己的 2026 年提示工程指引 现在也把提示定位为更大的上下文问题中的一块积木,并明确指出「把上下文放在问题之前」是核心技巧之一。
为什么「把提示写得更好」已经无法解决输出不稳定
提示的边际效益递减得很快。一旦你的指令已经清晰、具体、有结构,再加字就没有作用。然而模型的其他所有输入,你上传的文件、专案记忆、对话历史,却在每一次会话之间持续变动,而这正是输出质量持续变动的原因。
三件事让「只调提示」失效。第一,工具的活动部件变多了:专案、记忆、连接器、文件上传与网页搜索,全都会注入你并未亲手输入的内容。第二,上下文窗口变得极大,却没有变得更聪明。一百万个 token 的窗口听起来像是可以把所有东西贴进去的许可证,但模型的注意力会随窗口填满而衰退,所以硬塞的结果是成本更高、答案更差。第三,工具调用成为常态,而每一次工具回传的结果,不管有没有帮助都会落进上下文里。
换成实务版本就是这样。好日子那次,你刚好开了一个新对话,只附上一份干净的简报。坏日子那次,你已经在同一条对话里走到第四十则讯息,里面还混着一段无关的跑题、三份已被取代的草稿,以及一份你为另一个客户上传的 PDF。提示相同,上下文不同,答案自然不同。
上下文的五个层次,翻译成你手上真的有的按钮
上下文工程把模型看见的一切拆成五个层次。工程师用程式码组装这五层,你则用 ChatGPT、Claude 与 Gemini 里已经存在的设定组装同样的五层。知道是哪一层出问题,就能一步修好一份糟糕的输出,而不是改写十次。
第一层:系统上下文(你的常设指令)
这是永远不变的部分:模型扮演什么角色、你的规则、你的输出格式。在消费级工具里,这就是自定义指令、专案说明,或 Claude Project 的描述栏。要写得短。这里每一个 token 都在跟其他四层抢注意力。典型的失败是冗余膨胀:你不断加规则,却从不删掉过时的,直到模型悄悄开始忽略其中一半。
第二层:使用者上下文(你是谁、你怎样工作)
你的职能、行业、受众、惯用文风、反复出现的限制。这正是记忆功能的用途。好好设定一次,你就不必在每次对话里重新解释自己的工作。它的失败模式是塞进与任务毫无关系的个人细节,既浪费窗口空间,又把模型拉离目标。
第三层:检索上下文(你附上的文件)
工程师称之为 RAG,你称之为上传文件、把来源加进专案,或开启网页搜索。你的质量大部分住在这里,你的错误也大部分发生在这里。陷阱在于「相似」与「有用」是两件事:旧版的品牌指南跟现行版本高度相似,却会实质污染答案。
第四层:工具上下文(你允许模型做什么)
连接器、网页搜索、代码执行、文件存取、自定义 GPT 的操作。生产系统里那条反直觉的规则同样适用于你:模型只需要五个工具时,不要给它五十个。可用工具愈多,选错工具的机率愈高。如果你的助手一直跑去搜索网页,而你其实要它读你附上的文件,那就在这项任务中把搜索关掉。
第五层:对话上下文(对话本身)
这是唯一会在你工作过程中不断长大的一层,也是大多数人从不管理的一层。每一则讯息、每一份被否决的草稿、每一段跑题,都留在窗口里。在一段长对话中,这一层可以吞掉大部分可用空间,把你在第二则讯息附上的文件挤出去。这就是你在第四十则讯息时感受到的那种「跑题」背后的机制。
如何为上下文窗口做预算,而不是把它填满
生产团队会为每一层分配窗口的百分比,而不是让它们互相抢夺。常见的起始配置大约是系统 5%、使用者 5%、附加文件 40%、工具 10%、对话 40%,再依任务类型重新调整。你在 ChatGPT 里无法设定百分比,但你可以用同一套逻辑,去决定什么该离开窗口。
三个操作几乎完成了全部工作。任务改变时就开新对话,因为新对话是收回第五层最便宜的方法。只附上那一份现行来源,而不是五份互相重叠的,因为专业系统用重排序(reranking)来避免的正是这件事,而你是在手动做同一件事。当一条长对话确实累积了有用的历史时,请模型把「到目前为止的决定」整理成摘要,把摘要贴进新对话,然后放弃旧的那条。这就是渐进式摘要,与代理框架内部使用的技术相同。
就方向而言,成本逻辑对你和对工程师是一样的,即使你付的是固定月费而非按 token 计价。上下文愈大,速度愈慢、准确度愈低,所以删掉无关上下文不是做家务,它就是优化本身。
任何重复性任务都能用的上下文模块(可直接复制)
大多数从业者已经有提示模板,却极少人有上下文模板。下面这个区块明确覆盖五个层次,设计上就是要贴在一个新对话的最上方,把你的细节换进去即可。它在 ChatGPT、Claude 与 Gemini 上都无需修改就能用。
试试这个上下文模块:
角色:你是我的[内容策略师/分析师/营运助理]。你按我的标准工作,而不是通用的最佳实务。
常设规则:[最多三条。例如:使用规范书面中文。不使用破折号。绝不编造统计数字;若缺数字,写「待补」并列在「缺漏」栏下。]
关于我:我在[市场]从事[行业]。我的受众是[受众]。我反复遇到的限制是[限制,例如:所有内容必须让非技术背景的客户读得懂]。
来源:只使用附件与本则讯息中的事实。若某项信息不在来源中,不要用一般知识补上,请说出缺了什么。
工具:本任务不要搜索网页,不要浏览,只依来源作业。
任务:[实际的请求]
输出:[格式、长度、结构]
回答之前:用一行列出你将依赖哪些附加来源、将忽略哪些,以及原因。然后才产出结果。
最后一行正是大家会略过、却最划算的一行。强迫模型先宣告它要用哪些来源,可以在坏草稿成形之前就把第三层的问题揭露出来。如果它告诉你它打算倚重那份过期文件,你在五秒内就抓到了错误,而不是在整篇改写之后。
上下文工程在什么情况下会失效
这不是万灵丹,假装它是,正是技术在第二周被放弃的原因。在你围绕它重建工作流程之前,有四个诚实的限制值得知道。
硬塞上下文感觉很有生产力,其实不是。「以防万一」把所有东西载入,会提高成本与延迟,并透过「中段遗失」效应削弱质量,也就是埋在长窗口中央的材料得到最少注意力。如果你附了十份文件而质量下降,这就是机制。
持久记忆是双面刃。记忆是把第二层做好的方式,直到它默默留着你三月完成的专案里某项偏好,并把它套用在一个要求相反做法的客户身上。如果你的输出带着一种你解释不了的一致偏向,先读你的记忆设定,再谈改写。
互相矛盾的来源会产出自信的胡说。附上两份彼此不一致的文件,模型通常会选一份而不告诉你。专业流水线会为此执行矛盾侦测,你没有这个机制,所以你的版本是:每一项事实只附一份权威来源,并删掉被取代的版本,而不是两份都留。
有些任务确实是提示问题。如果你想要更有力的标题或不同的语气,那属于第一层,改措辞才是正解。上下文工程修的是错误或缺漏的信息,它修不了品味。
立即试做:二十分钟上下文盘点
挑出你最常做、每周重复的那项 AI 任务,也就是输出质量最难预测的那一项。打开你最近三次执行它的纪录,逐一列出当时窗口里究竟有什么:哪些自定义指令生效、工具对你保留了哪些记忆、附了哪些文件、开启了哪些工具,以及对话走到第几则讯息。
你几乎总会发现,成功那次的对话比较短、来源集比较干净。这就是你的答案,而它只花了二十分钟,而不是再花一个月调提示。用上面的上下文模块把那次成功的执行重建成模板,然后在三份不同的输入上各跑一次,确认结果站得住脚。
模板稳定之后,自然的下一步是让它可移植,使同一套设定能在工具之间搬移,而这正是 Agent Skills 开放标准 的用途。如果你想证明而不只是感觉到改善,AI 评测(evals) 这套方法论能让你用固定测试集,为同一流程的两个版本打分。
重点回顾
提示只占决定输出质量的一小部分。其余是你摆在模型面前的信息,而与模型质量不同,这部分完全在你掌控之中。别再改写句子,开始盘点窗口。2026 年拉开差距的从业者,不会是措辞更巧妙的那些人,而是让 AI 始终拥有正确信息的那些人。
懂AI,更懂你 UD相伴,AI不冷。
本文由 UD AI 团队审校。
🚀 想让这套方法变成稳定的工作流程?
掌握了技术之后,下一步是把它整合成每次都可靠运作的工作流程。UD 团队手把手带你完成每一步,从工具配置、上下文设计到实际部署,让你的 AI 不再靠猜,而是真正交付结果。