2026 年 9 月 22 日,OpenAI 在官网宣布为 GPT-6 系列推出改进的提示词缓存系统。核心变化有三点:新系统默认带来更高的缓存命中率;符合条件的共享前缀在 30 分钟窗口内被复用时,缓存输入 token 最高可享 90% 折扣;同时上线两款新工具,帮助开发者监控缓存表现、诊断未命中原因。如果你用 API 跑 Agent 或长上下文应用,这次升级最直接的意义是:同一套提示词结构下,重复计算更少,账单更低,响应更快。
这次升级瞄准的正是 GPT-6 主打的场景。OpenAI 在公告中写道,GPT-6 让持久型 Agent 可以连续工作数小时,处理重构代码库、撰写研究报告、制作演示文档这类复杂任务。这类应用的特点是一连串 API 请求层层递进,每次都把相同的指令、工具定义和前几轮的上下文带上。缓存的本质就是把这部分共享上下文的计算结果存下来复用,既降延迟又降价。
默认命中率更高,折扣窗口 30 分钟
新缓存系统的第一个变化是"默认更高命中率"。OpenAI 没有公布具体的命中率数字,但明确表示 GPT-6 家族上线的新系统在默认配置下就能比以往命中更多。对开发者来说,这意味着不需要改代码、不需要调参数,就能吃到一部分优化红利。
第二个变化是折扣规则更明确:符合条件的共享前缀,在 30 分钟窗口内被复用时,缓存部分的输入 token 最高享受 90% 折扣。注意两个限定词——"符合条件的共享前缀"和"30 分钟窗口"。前缀必须稳定、可复用才算数;超过 30 分钟没复用,缓存就失效了。写 Agent 时把系统指令、工具定义这些稳定内容放在提示词最前面、把易变的用户输入和检索结果放在后面,依然是提高命中率最有效的做法。
两款新工具:看板看趋势,诊断找原因
工具层面,OpenAI 推出了 Prompt Caching Dashboard(提示词缓存看板)和一套诊断工具。看板展示应用输入中有多少比例走了缓存,可以按时间追踪命中率变化,还有一张输入构成图,把缓存 token 和未缓存 token 并排对比。当你发现命中率突然下跌,或者改了一版提示词想评估效果,看板是第一站。
诊断工具解决的是更具体的问题:某次请求明明应该命中缓存却没命中,到底哪里变了。它可以把这次请求和一条近期的响应做对比,指出是模型、工具、设置还是输入发生了变化导致无法复用,并且估算出受影响的 token 数量。有了这个数字,你能判断值不值得为这次未命中去改集成代码——影响几千个 token 和影响几十万个 token,优化优先级完全不同。
谁最受益,谁先别急
受益最大的是三类人:跑多轮 Agent 的团队,提示词里带着大段系统指令、工具定义或文档的开发者,以及做批量任务、反复调用同一模板的场景。这些场景的共享前缀又大又稳定,命中率提升和 90% 折扣会直接反映在账单上。
但也要看清边界:缓存只解决"重复"的问题,不解决"贵"的问题。输出 token 不在折扣范围内,推理型任务的大头往往在输出侧;前缀本身一直在变的场景(比如每轮都换全新检索结果的 RAG),命中率天然上不去。升级前先去看板里看一眼自己的缓存占比,再决定要不要为缓存专门重构提示词结构。
下一步值得关注的是 OpenAI 会不会把这套缓存能力下放到更便宜的模型档,以及 30 分钟窗口未来是否会放宽。对开发者而言,现在就可以做的只有一件事:打开看板,确认自己的共享前缀到底有多"共享"。
Q:缓存命中需要手动开启吗?
A:不需要。新系统默认提供更高的缓存命中率,符合条件的共享前缀会自动被缓存,复用时自动享受折扣。
Q:30 分钟窗口是从什么时候开始算的?
A:从共享前缀首次被缓存开始算。在这 30 分钟内复用该前缀的请求可以享受缓存折扣,超过窗口则需要重新缓存。
Q:诊断工具能告诉我具体哪个参数导致未命中吗?
A:可以。它会对比当前请求与一条近期的响应,指出是模型、工具、设置还是输入的变化阻止了复用,并估算受影响的 token 数量,帮你判断是否值得优化。