别再给 Anthropic 送钱了!官方支招:同一任务成本能差 10 倍
Anthropic 官方拆解 Claude Code 的 token 计费机制:同一任务成本可相差 10 倍。重发税、缓存杠杆与六条省钱心法,逐条拆解什么时候做、怎么做、为什么省。
8 月 14 日,Anthropic 官方发了一篇博客,把这件事彻底讲透了:你付给 Claude Code 的钱,九成不在"思考",而在把已经读过的东西一遍又一遍重新发出去。官方还给了六条操作,照做就最大程度节省Token。
这篇先带你读懂机制(为什么同样的任务,会差出 10 倍),再把官方六条心法逐条拆开。
第一层:消耗token的不是"功能",是把读过的文件再读一遍
Claude Code 按 token 计费。你每次发给它的消息、读进来的文件、它吐出的回答,都以 token 计。一次请求的成本由两个阶段决定:
- 预填充(prefill):读你的输入和上下文。GPU 可以并行处理这一大块文本,所以相对便宜。
- 解码(decode):逐 token 生成回答。生成是串行的——一个 token 生成完,才轮到下一个——所以输出 token 大约比输入贵 5 倍。
多数人以为贵在"输出多",但真正的坑在别处:一个 token 一旦进入对话,后续每一轮都会被重新发送一次。第 40 轮,前 39 轮读过的文件、跑过的命令输出,全部要再发一遍。官方给出的完整公式:上下文中的 token 数 × 它们停留的轮数 × 并发上下文数。
举个具体的:你让它读了一个 5000 行的配置文件,又让它改了三个文件。这个配置文件会留在上下文里,后面每一轮都重发一次。任务拖得越久、读过的文件越多,这个"重发税"就越高——直到某轮你发现,大部分 token 都在给历史付运费。
更糟的是"搜出来"的污染。一条含糊的指令——"把失败的测试修一下"——会让 Claude 先 grep、再打开好几个文件试探、还可能拉一堆搜索结果,这些操作全部进入对话历史,让后面每一轮都更贵。
这还不是最反直觉的。
第二层:缓存是最大的省钱杠杆,也是最脆的开关
为了不让你真把同样的东西付好几次钱,Anthropic 做了提示缓存:同一段上下文,如果之前算过,再读只需要 1/10的价——直接节省 90%。
这是整个省钱体系里最划算的一笔,但它脆弱得离谱:
- 切换
/model:每个模型独立缓存,一切换整段重读(opusplan 模式也算)。 - 调
/effort:推理强度是缓存键的一部分,调一次,缓存作废。 - 切换快速模式:同样参与缓存键,要开就开局开。
/compact:它用更短的对话替换旧对话,等于主动作废一次缓存。- 时间:缓存会过期。据官方原文,订阅用户约 1 小时;API Key 用户更短,设
ENABLE_PROMPT_CACHING_1H=1可延长到 1 小时。
所以会有这种荒诞:你辛辛苦苦让缓存跑起来了,一个随手 /model 切换,整段历史全价重算;你休息一小时回来,缓存过期,又全价重算。官方甚至点名,恢复一个巨大的旧会话,可能是你花得最冤枉的一次请求。
明白了这两个机制,再看六条心法,就都说得通了。
六条省钱心法,理解开始省钱!
官方给的六条,每一条都能落成一个具体动作。下面逐条拆开:什么时候做、怎么做、为什么省、能省多少、最常见的坑。
心法 1:任务间 /clear
- 何时做:一个任务完成、开始下一个之前。
- 怎么做:输
/clear,开一页干净的对话。 - 为什么省:上一个任务读过的文件、跑过的命令输出,全都留在上下文里,之后每个轮次都要重新发送一次(就是第一层说的"重发税")。清空,等于让新任务只为自己付费,不替旧任务的历史还账。
- 省多少:旧任务越长、读过的东西越多,清空的收益越大;这是六条里唯一"越用越赚"的一条。
- 常见坑:怕会话找不回来。想保留,先
/rename起个名字再/clear,之后随时能找回;别因为"可能还用得上"把残骸一路带到新任务里。
心法 2:开局定好 /model 和 /effort
- 何时做:每次新会话开始前。
- 怎么做:用
/model选模型,用/effort设推理强度,定完别再动。 - 为什么省:模型、推理强度都参与缓存键。中途一换,已积累的缓存全部作废,整段对话按全价重新预填充——你在旧模型上攒下的"折扣"瞬间清零。
- 省多少:一次误切换的代价,约等于整段历史按全价重读,经常比你省下的还贵。
- 常见坑:开到一半觉得"换个更强的模型试试"。真要换,趁
/clear之后换,损失最小;每个模型各有独立缓存,opusplan模式也算一次切换。
心法 3:用 @ 引用文件,别手打路径
- 何时做:要在对话里提到任何文件时。
- 怎么做:直接
@文件名,文件会作为附件随消息进入,一步到位。 - 为什么省:
@直接附加,省掉一次文件读取的工具调用;而只打文件名,Claude 得先搜索定位、还可能试探性打开好几个文件——这一串动作全部进入对话历史,变成后续每一轮都要背负的永久污染。 - 省多少:省掉的是"搜索 + 试探打开"整串动作;这些动作单独看不贵,但会留在上下文里拖累之后所有轮次,累积起来很可观。
- 常见坑:“反正就一个文件,手打也找得到”——搜索过程本身会进历史,你不是在省调用,是在给历史添堵。
心法 4:给嘈杂命令加静默参数,或扔给子代理
- 何时做:跑输出量大的命令时,尤其是测试、构建、日志类。
- 怎么做:给命令加只输出摘要的参数,比如测试用
--reporter=dot,并把每天要跑的静音命令写进 CLAUDE.md 让它固定生效;或者把这类任务扔给子代理在独立上下文里跑。 - 为什么省:命令输出会像文件一样进入对话历史,并且停留整场会话——几百行日志,后续每一轮都带着。静默输出,历史就轻;子代理有独立上下文窗口,读的文件和跑的命令不污染主对话,只把结论传回来。
- 省多少:一行
--reporter=dot,可能让一场测试会话少带大量重复 token 的赘肉。 - 常见坑:输出超过一定规模会自动写文件、只留预览(可用
BASH_MAX_OUTPUT_LENGTH调),但默认预览也占上下文——该静默的还是要静默。
心法 5:新会话先跑 /context
- 何时做:每次新会话开头。
- 怎么做:跑
/context,看看当前加载了什么:CLAUDE.md、MCP 工具定义、技能等。 - 为什么省:加载进来的每一项都会占用上下文并被反复发送。看到不必要的大头,就把它移除,别让"环境税"一直压着。
- 省多少:一个 MCP 服务器的工具定义就可能吃掉不少 token;挂了一堆服务器,光环境加载就是一笔固定开销。
- 常见坑:把 CLAUDE.md 当杂物间越写越长。精简、稳定的 CLAUDE.md,是缓存里最值得留的"黄金地段"。
心法 6:休息前 /compact
- 何时做:要离开电脑、会话还开着的时候。
- 怎么做:趁缓存还热,先
/compact,把对话压缩成一份摘要。 - 为什么省:压缩的成本取决于上下文是否还在缓存里——缓存有效时压缩,成本约十分之一;等缓存过期(订阅约 1 小时,API Key 更短)再压,就按全价把整段重新读一遍。
- 省多少:缓存内的十分之一 vs 缓存外的全价,同一件事差 10 倍。
- 常见坑:只想去掉最近几轮,却用了
/compact。这种场景用/rewind就够了,它只是退回几步,不重写历史,在缓存上几乎免费。
三个流传很广的误解
- "模型越大一定越贵"? 不一定。大模型可能用更少轮数解决问题,总成本反而低;小模型做例行工作,复杂问题再上大模型。
- "有缓存,上下文多长都行"? 不是。过长的上下文让模型低效推理,代码质量也下降。
- "自动化循环是免费跑的"? 不是。循环的每一轮迭代都携带完整对话上下文,放会话里跑等于把成本叠了几层。
会话模板:把六条串成一条时间线
开局(每次新任务)
/clear,只留该任务的东西- 定好
/model和/effort,中途别换 - 跑一次
/context,清掉不必要加载
过程中
- 一律用
@引用文件,不手打路径 - 输出多的命令加静默参数,静音命令写进 CLAUDE.md
- 高频、输出大的子代理任务,单独配个小模型(Haiku 或 Sonnet)
- 想丢弃最近几轮用
/rewind,别/compact - 低强度机械活,可用
MAX_THINKING_TOKENS=0关掉思考 token
休息前
- 趁缓存还没过期,
/compact压一遍
一句话总结:让每一轮发的 token,都只服务于你当前真正要解决的问题。
怎么确认省到钱了么
/cost或/usage:看当前会话消耗和缓存命中率。命中率低,说明你可能在频繁打碎缓存——回顾一下是不是老切模型、老调 effort。/usage-credits(订阅 Pro/Max):设月度支出上限,给自己踩刹车。/status:核对当前模型、effort、快速模式等配置,确认开局姿势对不对。
判断标准很简单:同一类任务,改造前后各跑一次,看 /cost 的数字和缓存命中率,而不是靠感觉。
收尾
同一任务成本差出 10 倍,差的从来不是模型,是你和会话相处的方式。官方把机制拆明白了,接下来就轮到你的习惯——把 /context 和 /cost 变成开机动作,这篇才算真的读完。
参考来源
📌 相关文章
Cursor 高级使用技巧
开发者&创业者们👭快码住!Cursor这几个AI神仙功能让你效率翻倍⚡️ 嗨!是你的代码搭子来分享啦~💻 写代码总是慢吞吞?Debug抓狂? 别愁啦!今天挖到了Cursor编辑器的几个💎高级隐藏神技💎,用上它们,感觉coding开了挂!🚀 保姆级分享,码住不亏!✨ 别只会聊天啦!
Cursor 0.50+ 模型选择实战指南:性能与成本的最优平衡
融合 Cursor 0.50(2025-05)及后续小补丁(至 0.50.3)的模型选择实战指南,涵盖新功能、计费与模型池变化,帮你在开发效率与成本之间找到最优平衡。
Loop Engineering
导读 过去两年,我们大部分时间都在学怎么提示 AI:怎么写 prompt,怎么补上下文,怎么让它按格式输出。 但最近几个月,硅谷 AI 圈开始频繁讨论另一个词:Loop Engineering。
评论 (无需注册,匿名即可)
还没有评论,来抢沙发~