0to1 .site

别再给 Anthropic 送钱了!官方支招:同一任务成本能差 10 倍

10 分钟阅读 次阅读
📌 摘要

Anthropic 官方拆解 Claude Code 的 token 计费机制:同一任务成本可相差 10 倍。重发税、缓存杠杆与六条省钱心法,逐条拆解什么时候做、怎么做、为什么省。

8 月 14 日,Anthropic 官方发了一篇博客,把这件事彻底讲透了:你付给 Claude Code 的钱,九成不在"思考",而在把已经读过的东西一遍又一遍重新发出去。官方还给了六条操作,照做就最大程度节省Token。

这篇先带你读懂机制(为什么同样的任务,会差出 10 倍),再把官方六条心法逐条拆开。

第一层:消耗token的不是"功能",是把读过的文件再读一遍

Claude Code 按 token 计费。你每次发给它的消息、读进来的文件、它吐出的回答,都以 token 计。一次请求的成本由两个阶段决定:

  • 预填充(prefill):读你的输入和上下文。GPU 可以并行处理这一大块文本,所以相对便宜。
  • 解码(decode):逐 token 生成回答。生成是串行的——一个 token 生成完,才轮到下一个——所以输出 token 大约比输入贵 5 倍。

多数人以为贵在"输出多",但真正的坑在别处:一个 token 一旦进入对话,后续每一轮都会被重新发送一次。第 40 轮,前 39 轮读过的文件、跑过的命令输出,全部要再发一遍。官方给出的完整公式:上下文中的 token 数 × 它们停留的轮数 × 并发上下文数。

举个具体的:你让它读了一个 5000 行的配置文件,又让它改了三个文件。这个配置文件会留在上下文里,后面每一轮都重发一次。任务拖得越久、读过的文件越多,这个"重发税"就越高——直到某轮你发现,大部分 token 都在给历史付运费。

更糟的是"搜出来"的污染。一条含糊的指令——"把失败的测试修一下"——会让 Claude 先 grep、再打开好几个文件试探、还可能拉一堆搜索结果,这些操作全部进入对话历史,让后面每一轮都更贵。

这还不是最反直觉的。

第二层:缓存是最大的省钱杠杆,也是最脆的开关

为了不让你真把同样的东西付好几次钱,Anthropic 做了提示缓存:同一段上下文,如果之前算过,再读只需要 1/10的价——直接节省 90%。

这是整个省钱体系里最划算的一笔,但它脆弱得离谱:

  • 切换 /model:每个模型独立缓存,一切换整段重读(opusplan 模式也算)。
  • /effort:推理强度是缓存键的一部分,调一次,缓存作废。
  • 切换快速模式:同样参与缓存键,要开就开局开。
  • /compact:它用更短的对话替换旧对话,等于主动作废一次缓存。
  • 时间:缓存会过期。据官方原文,订阅用户约 1 小时;API Key 用户更短,设 ENABLE_PROMPT_CACHING_1H=1 可延长到 1 小时。

所以会有这种荒诞:你辛辛苦苦让缓存跑起来了,一个随手 /model 切换,整段历史全价重算;你休息一小时回来,缓存过期,又全价重算。官方甚至点名,恢复一个巨大的旧会话,可能是你花得最冤枉的一次请求。

明白了这两个机制,再看六条心法,就都说得通了。

六条省钱心法,理解开始省钱!

官方给的六条,每一条都能落成一个具体动作。下面逐条拆开:什么时候做、怎么做、为什么省、能省多少、最常见的坑。

心法 1:任务间 /clear

  • 何时做:一个任务完成、开始下一个之前。
  • 怎么做:输 /clear,开一页干净的对话。
  • 为什么省:上一个任务读过的文件、跑过的命令输出,全都留在上下文里,之后每个轮次都要重新发送一次(就是第一层说的"重发税")。清空,等于让新任务只为自己付费,不替旧任务的历史还账。
  • 省多少:旧任务越长、读过的东西越多,清空的收益越大;这是六条里唯一"越用越赚"的一条。
  • 常见坑:怕会话找不回来。想保留,先 /rename 起个名字再 /clear,之后随时能找回;别因为"可能还用得上"把残骸一路带到新任务里。

心法 2:开局定好 /model/effort

  • 何时做:每次新会话开始前。
  • 怎么做:用 /model 选模型,用 /effort 设推理强度,定完别再动。
  • 为什么省:模型、推理强度都参与缓存键。中途一换,已积累的缓存全部作废,整段对话按全价重新预填充——你在旧模型上攒下的"折扣"瞬间清零。
  • 省多少:一次误切换的代价,约等于整段历史按全价重读,经常比你省下的还贵。
  • 常见坑:开到一半觉得"换个更强的模型试试"。真要换,趁 /clear 之后换,损失最小;每个模型各有独立缓存,opusplan 模式也算一次切换。

心法 3:用 @ 引用文件,别手打路径

  • 何时做:要在对话里提到任何文件时。
  • 怎么做:直接 @文件名,文件会作为附件随消息进入,一步到位。
  • 为什么省:@ 直接附加,省掉一次文件读取的工具调用;而只打文件名,Claude 得先搜索定位、还可能试探性打开好几个文件——这一串动作全部进入对话历史,变成后续每一轮都要背负的永久污染。
  • 省多少:省掉的是"搜索 + 试探打开"整串动作;这些动作单独看不贵,但会留在上下文里拖累之后所有轮次,累积起来很可观。
  • 常见坑:“反正就一个文件,手打也找得到”——搜索过程本身会进历史,你不是在省调用,是在给历史添堵。

心法 4:给嘈杂命令加静默参数,或扔给子代理

  • 何时做:跑输出量大的命令时,尤其是测试、构建、日志类。
  • 怎么做:给命令加只输出摘要的参数,比如测试用 --reporter=dot,并把每天要跑的静音命令写进 CLAUDE.md 让它固定生效;或者把这类任务扔给子代理在独立上下文里跑。
  • 为什么省:命令输出会像文件一样进入对话历史,并且停留整场会话——几百行日志,后续每一轮都带着。静默输出,历史就轻;子代理有独立上下文窗口,读的文件和跑的命令不污染主对话,只把结论传回来。
  • 省多少:一行 --reporter=dot,可能让一场测试会话少带大量重复 token 的赘肉。
  • 常见坑:输出超过一定规模会自动写文件、只留预览(可用 BASH_MAX_OUTPUT_LENGTH 调),但默认预览也占上下文——该静默的还是要静默。

心法 5:新会话先跑 /context

  • 何时做:每次新会话开头。
  • 怎么做:跑 /context,看看当前加载了什么:CLAUDE.md、MCP 工具定义、技能等。
  • 为什么省:加载进来的每一项都会占用上下文并被反复发送。看到不必要的大头,就把它移除,别让"环境税"一直压着。
  • 省多少:一个 MCP 服务器的工具定义就可能吃掉不少 token;挂了一堆服务器,光环境加载就是一笔固定开销。
  • 常见坑:把 CLAUDE.md 当杂物间越写越长。精简、稳定的 CLAUDE.md,是缓存里最值得留的"黄金地段"。

心法 6:休息前 /compact

  • 何时做:要离开电脑、会话还开着的时候。
  • 怎么做:趁缓存还热,先 /compact,把对话压缩成一份摘要。
  • 为什么省:压缩的成本取决于上下文是否还在缓存里——缓存有效时压缩,成本约十分之一;等缓存过期(订阅约 1 小时,API Key 更短)再压,就按全价把整段重新读一遍。
  • 省多少:缓存内的十分之一 vs 缓存外的全价,同一件事差 10 倍。
  • 常见坑:只想去掉最近几轮,却用了 /compact。这种场景用 /rewind 就够了,它只是退回几步,不重写历史,在缓存上几乎免费。

三个流传很广的误解

  • "模型越大一定越贵"? 不一定。大模型可能用更少轮数解决问题,总成本反而低;小模型做例行工作,复杂问题再上大模型。
  • "有缓存,上下文多长都行"? 不是。过长的上下文让模型低效推理,代码质量也下降。
  • "自动化循环是免费跑的"? 不是。循环的每一轮迭代都携带完整对话上下文,放会话里跑等于把成本叠了几层。

会话模板:把六条串成一条时间线

开局(每次新任务)

  • /clear,只留该任务的东西
  • 定好 /model/effort,中途别换
  • 跑一次 /context,清掉不必要加载

过程中

  • 一律用 @ 引用文件,不手打路径
  • 输出多的命令加静默参数,静音命令写进 CLAUDE.md
  • 高频、输出大的子代理任务,单独配个小模型(Haiku 或 Sonnet)
  • 想丢弃最近几轮用 /rewind,别 /compact
  • 低强度机械活,可用 MAX_THINKING_TOKENS=0 关掉思考 token

休息前

  • 趁缓存还没过期,/compact 压一遍

一句话总结:让每一轮发的 token,都只服务于你当前真正要解决的问题。

怎么确认省到钱了么

  • /cost/usage:看当前会话消耗和缓存命中率。命中率低,说明你可能在频繁打碎缓存——回顾一下是不是老切模型、老调 effort。
  • /usage-credits(订阅 Pro/Max):设月度支出上限,给自己踩刹车。
  • /status:核对当前模型、effort、快速模式等配置,确认开局姿势对不对。

判断标准很简单:同一类任务,改造前后各跑一次,看 /cost 的数字和缓存命中率,而不是靠感觉。

收尾

同一任务成本差出 10 倍,差的从来不是模型,是你和会话相处的方式。官方把机制拆明白了,接下来就轮到你的习惯——把 /context/cost 变成开机动作,这篇才算真的读完。

参考来源

  1. Anthropic 官方博客:Maximizing the Value of Your Claude Code Sessions
  2. 36kr:相关报道
次阅读
分享:

📌 相关文章

订阅更新

留下邮箱,订阅最新文章与项目进展;也可以用 RSS 阅读器订阅

0to1.site/rss.xml 添加到 Feedly、Inoreader 等 RSS 阅读器

评论 (无需注册,匿名即可)

还没有评论,来抢沙发~