资讯 Anthropic 砍掉 80% 系统提示词后,Claude Code 评测没掉分

2026-09-11 23:25:55

Anthropic 砍掉 80% 系统提示词后,Claude Code 评测没掉分

过去三年,AI 圈最火的手艺叫提示词工程——怎么措辞、怎么设角色、怎么加一句"让我们一步步思考"。网上流传着成百上千套模板,有人靠这套手艺拿到了月薪两三万的岗位。

可如果你天天用 AI,大概也遇到过:同一个提示词,上个月效果惊艳,这个月却平淡无奇。更奇怪的是,有时候你写得越细,它答得越差。

这不是错觉。今年 7 月,Anthropic 公布了一组实验结果:他们把 Claude Code 的系统提示词砍掉了 80% 以上,跑在最新的 Opus 5 和 Fable 5 上,编程评测成绩没有出现可测量的下降。

一句话概括这组实验指向的变化:提示词工程为什么在退场,真正决定 AI 输出质量的是什么,以及今天就能改的四个习惯。

01|规则删掉八成,模型反而更好了

先看这个实验。

Anthropic 复盘内部使用日志时,发现了一件挺尴尬的事:同一个请求里,经常同时塞着互相打架的指令。系统提示词写着"不要写注释",某个 Skill 里写着"文档该写就写",用户自己又在提问里要求"加详细说明"。三条规则同时存在,模型得先花力气判断到底听谁的,才能开始干活。

这些规则的初衷不算错。两年前的模型确实不听话,你不把边界写死,它就乱来。于是大家养成一个习惯:把能想到的约束全写进提示词,像给实习生写家具组装说明书——步骤编号、大写警告、第 9B 步别跳过。

问题是模型变了。Anthropic 新版系统提示词里,那条"默认不写注释、绝不写长 docstring"被换成了一句:

写和周围代码风格一致的代码,注释密度、命名习惯、写法都对齐。

一句判断,替掉一堆规则。官方原文的说法很直接:我们之前是在"过度约束"(overconstraining)Claude Code。

这件事对个人用户同样成立。你收藏的那些"万能提示词",本质上是给弱模型打的补丁。补丁越厚,强模型越要花推理去消化它们。

02|提示词管"怎么问",上下文管"它看到什么"

那提示词是不是没用了?

不是,是它的位置变了。Anthropic 在自己的工程博客里把这件事定义为"提示词工程的自然演进",并给了个更准确的名字:上下文工程(context engineering)。

两者的区别可以压成一句话:

提示词工程管的是"怎么问",上下文工程管的是"它看到什么"。

说得再具体点:

  • 提示词是指令,上下文是事实。
  • 提示词是一次性的,写得越具体越好;上下文要跨很多次请求复用,你没法预知用户会问什么,只能准备一个通用的信息底座。
  • 提示词管的是一条消息,上下文管的是整个上下文窗口。

一个 Agent 真实看到的 token 里,人手写的那部分通常只占 5% 上下。剩下 95% 是系统提示词、工具返回、检索结果、历史对话、记忆——全是运行时由代码拼进去的。

这就解释了一个常见的困惑:为什么你把指令改得再清楚,AI 还是答不到点子上?因为它不是没听懂,而是它手里的事实是错的、旧的,或者太多了。

03|为什么是现在:三件事同时发生

模型变强了,措辞的边际收益塌了。

2023 年,一句好措辞能让回答质量翻倍,因为当时的模型容易被含糊指令带偏。"让我们一步步思考""你是一位有二十年经验的专家"这类技巧,被公开讨论了三年,早就进了训练数据,变成新模型的默认行为,不再是特殊开关。有些推理型模型甚至因为你要求它"一步步思考"而表现变差。

上下文窗口从几千 token 涨到了上百万。

以前你得精打细算每个 token,现在你要做的是取舍和排序。"我该放什么进去"从一个不存在的问题,变成一个真实的设计问题。

Agent 接管了大部分上下文。

模型一旦能调搜索、读文件、跑命令,落进窗口里的内容大部分就不是人写的了。

三件事合起来,重心从"改措辞"转到了"管信息"。Anthropic 顺带点出了六条正在反转的旧习惯,挑三条对普通人最有用的:

过去的做法现在的做法
把能想到的规则都写死给出判断标准,让模型自己判断
塞一堆示例教它怎么做把工具和接口本身设计清楚
所有资料一次性全塞进去需要的时候再加载

但上下文不是越多越好。Anthropic 在博客里提到一个反复被验证的现象叫上下文腐化(context rot):窗口里的 token 越多,模型准确回忆其中某条信息的能力就越低。

原因在注意力预算上。transformer 里每个 token 都要和其他所有 token 建立关联,n 个 token 就是 n² 组关系,窗口一拉长,注意力就被摊薄了。

配套有三个坑:

  • 中间迷失:埋在长上下文中段的关键信息容易被跳过,模型对开头和结尾最敏感;
  • 注意力涣散:看着沾边其实无关的材料会把推理带偏,十份七分相关的资料不如两份九分相关的;
  • 上下文污染:一个早期混进来的错误事实,会在后面每一轮里被反复引用、不断放大。

成本和延迟是看得见的代价,准确率下降是看不见的,而后者大得多。

04|普通人今天就能改的四个习惯

不用懂架构,这四个动作立刻有效:

  1. 粘原始文档,别转述。
    你复述一遍就会丢信息,AI 拿着二手描述再推理,误差翻倍。
  2. 话题变了就开新对话。
    旧上下文不会帮你,只会干扰。
  3. 给一个标准答案样例,比写十句格式要求管用。
  4. 明确告诉它忽略什么,不只是关注什么。
    "参考这份文档,但忽略第三章里那批已经过期的价格",比笼统说一句"参考文档"好得多。

四条里只做一条的话,建议做第一条。

05|"提示词已死"说得太早

"提示词已死"是现在最流行的说法,但这个判断下得早了。

Gartner 把 2026 年称作"上下文之年",也有人在公开嘲讽"上下文工程师"这个头衔——说这活拆开看是数据工程师、图书管理员兼心理咨询师的混合体,实际工作是维护一个 YAML 文件。这类吐槽里有部分是真的:自动压缩、按需检索确实把很多手工活自动化了,独立岗位也还在萌芽阶段,远没到标准化。

但有三个判断没被自动化掉:决定往记忆文件里写什么、决定检索器只允许碰哪些信源、决定告诉 Agent 忽略什么。管道自动了,判断没自动。

所以更准确的说法是:提示词工程没死,它被降级了——从"全部工作"变成了"其中一部分"。清晰具体的指令永远好用,只是它不再是那个最难、最值钱的部分。

06|一张表看清区别

对比提示词工程上下文工程
你调的是什么那句话怎么写模型看到的整份输入
工作单元一条消息每一步的整个上下文窗口
主要手段措辞、角色、格式、示例检索、压缩、排序、隔离
典型失效模型没听懂你的要求听懂了,但拿到的是错数据、旧数据,或者太多数据
什么时候够用单轮、任务窄(分类、改写、提取)多轮、要调工具、要记忆
靠什么增长练习量架构能力

提示词告诉模型该做什么,上下文告诉模型什么是真的。前者的收益在递减,后者才刚开始。

推荐文章

程序员茄子在线接单