AI导航

OpenAI 升级 GPT-6 提示词缓存系统:默认命中率更高,缓存输入最高 90% 折扣

AI资讯
3 min read
0 次阅读

2026 年 9 月 22 日,OpenAI 在官网宣布为 GPT-6 系列推出改进的提示词缓存系统。核心变化有三点:新系统默认带来更高的缓存命中率;符合条件的共享前缀在 30 分钟窗口内被复用时,缓存输入 token 最高可享 90% 折扣;同时上线两款新工具,帮助开发者监控缓存表现、诊断未命中原因。如果你用 API 跑 Agent 或长上下文应用,这次升级最直接的意义是:同一套提示词结构下,重复计算更少,账单更低,响应更快。

这次升级瞄准的正是 GPT-6 主打的场景。OpenAI 在公告中写道,GPT-6 让持久型 Agent 可以连续工作数小时,处理重构代码库、撰写研究报告、制作演示文档这类复杂任务。这类应用的特点是一连串 API 请求层层递进,每次都把相同的指令、工具定义和前几轮的上下文带上。缓存的本质就是把这部分共享上下文的计算结果存下来复用,既降延迟又降价。

默认命中率更高,折扣窗口 30 分钟

新缓存系统的第一个变化是"默认更高命中率"。OpenAI 没有公布具体的命中率数字,但明确表示 GPT-6 家族上线的新系统在默认配置下就能比以往命中更多。对开发者来说,这意味着不需要改代码、不需要调参数,就能吃到一部分优化红利。

第二个变化是折扣规则更明确:符合条件的共享前缀,在 30 分钟窗口内被复用时,缓存部分的输入 token 最高享受 90% 折扣。注意两个限定词——"符合条件的共享前缀"和"30 分钟窗口"。前缀必须稳定、可复用才算数;超过 30 分钟没复用,缓存就失效了。写 Agent 时把系统指令、工具定义这些稳定内容放在提示词最前面、把易变的用户输入和检索结果放在后面,依然是提高命中率最有效的做法。

两款新工具:看板看趋势,诊断找原因

工具层面,OpenAI 推出了 Prompt Caching Dashboard(提示词缓存看板)和一套诊断工具。看板展示应用输入中有多少比例走了缓存,可以按时间追踪命中率变化,还有一张输入构成图,把缓存 token 和未缓存 token 并排对比。当你发现命中率突然下跌,或者改了一版提示词想评估效果,看板是第一站。

诊断工具解决的是更具体的问题:某次请求明明应该命中缓存却没命中,到底哪里变了。它可以把这次请求和一条近期的响应做对比,指出是模型、工具、设置还是输入发生了变化导致无法复用,并且估算出受影响的 token 数量。有了这个数字,你能判断值不值得为这次未命中去改集成代码——影响几千个 token 和影响几十万个 token,优化优先级完全不同。

谁最受益,谁先别急

受益最大的是三类人:跑多轮 Agent 的团队,提示词里带着大段系统指令、工具定义或文档的开发者,以及做批量任务、反复调用同一模板的场景。这些场景的共享前缀又大又稳定,命中率提升和 90% 折扣会直接反映在账单上。

但也要看清边界:缓存只解决"重复"的问题,不解决"贵"的问题。输出 token 不在折扣范围内,推理型任务的大头往往在输出侧;前缀本身一直在变的场景(比如每轮都换全新检索结果的 RAG),命中率天然上不去。升级前先去看板里看一眼自己的缓存占比,再决定要不要为缓存专门重构提示词结构。

下一步值得关注的是 OpenAI 会不会把这套缓存能力下放到更便宜的模型档,以及 30 分钟窗口未来是否会放宽。对开发者而言,现在就可以做的只有一件事:打开看板,确认自己的共享前缀到底有多"共享"。

Q:缓存命中需要手动开启吗?

A:不需要。新系统默认提供更高的缓存命中率,符合条件的共享前缀会自动被缓存,复用时自动享受折扣。

Q:30 分钟窗口是从什么时候开始算的?

A:从共享前缀首次被缓存开始算。在这 30 分钟内复用该前缀的请求可以享受缓存折扣,超过窗口则需要重新缓存。

Q:诊断工具能告诉我具体哪个参数导致未命中吗?

A:可以。它会对比当前请求与一条近期的响应,指出是模型、工具、设置还是输入的变化阻止了复用,并估算受影响的 token 数量,帮你判断是否值得优化。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。