Claude Opus 5.5 的降价不是简单的"便宜 40%",而是 Anthropic 在 9 月 24 日发布的官方博客里,把这笔账拆开算给了开发者:典型按 token 计费的工作负载,运行成本比 Opus 5 低约 40%;其中输入、输出 token 降价 20%,缓存读取直接降价 60%。对每天长时间泡在 Claude Code 里写代码的人来说,真正的省钱项是缓存。
长会话正在变成主流,账单结构也变了
Anthropic 统计了 2026 年 3 月到 9 月 Claude Code 的使用数据,发现开发者的编码会话越来越长、上下文越来越重:每个 prompt 背后,Claude 的工作时长是过去的 3.3 倍,模型调用次数多 40% 以上,中断少了 68%;每次请求的上下文量增长了 2.6 倍,输入输出 token 比例从 189:1 拉到 324:1。
这意味着账单里的大头,已经从"新输入"变成了"反复读取的上下文"。缓存降价 60% 正好打在这一点上:同样的降价,用在今天的 Claude Code 流量上,比半年前省得更多,因为账单里可复读的上下文占比更高了。
三笔账:定价、缓存命中、更少轮次
第一笔是定价本身。缓存读取是智能体和编码工作成本的大头,降价 60% 之后,官方称 Opus 5.5 的缓存 token 价格只有竞品的五分之一左右,同时性能不输。
第二笔是缓存更好用了。过去半年 Claude Code 的一系列改进,让"缓存未命中"的输入下降了 50% 以上:刷新登录这类小动作不再轻易打断缓存,会话中途切换 effort level 也不会重置缓存(Opus 5.5 和 Fable 5.1 支持);API 和云厂商用户现在可以把缓存有效期设为 1 小时,分叉出的子智能体直接继承父智能体的缓存,不用为同一份上下文付两次钱。
第三笔是轮次更少。Zeta Labs 的测试显示,完成同样任务时,Opus 5.5 的轮次和工具调用比 Opus 5 更少,成本接近减半,最难的任务完成数量翻了一倍。官方也提醒,这不是对所有任务都成立:范围明确的小任务两者轮次差不多,差距最大的是开放式难题。另外,Opus 5.5 的输出速度比 Opus 5 快 30% 以上,长任务的等待时间更短。
三个官方建议的省钱习惯
Anthropic 在博客末尾给了三个习惯:在 Claude Code 里运行 /usage,看一眼自己的缓存读取占比;会话开始就选定模型,中途少切换;离开前先 compact,而不是回来再做;用 API 或云厂商的话,给长会话打开 1 小时缓存有效期。
对重度 Claude Code 用户和按 token 结算的团队来说,这篇博客的价值在于把"怎么省"说具体了。下一步值得看的是真实账单:降价 60% 的缓存读取、更高的缓存命中率,叠加到各家真实工作负载上,到底能兑现多少。