GPT-6 Astra Ultrafast 在 2026 年 10 月 1 日正式上线。NVIDIA 当天在官方博客宣布,OpenAI 为 GPT-6 Astra 新增的 Ultrafast 推理模式已经可用,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra 标准模式的 8 倍。该模式即日起通过 OpenAI API 提供,符合条件的 ChatGPT Work 和 Codex 用户也能用上。
对写代码的人来说,这个数字的意义不在“生成更快”,而在 agent 的工作循环被压缩了。NVIDIA 在博客里算了一笔账:一个编码 agent 的典型循环是写代码、调工具、看结果、再决策,循环里每一步的等待都被缩短,edit-test-debug 的整体周转就会明显变快,交互式应用在工具调用之间的停顿也会变短。
8 倍加速从哪来
Ultrafast 的加速不是靠堆更多显卡,而是靠吃透 Blackwell 架构的推理优化。OpenAI 推理负责人 Philippe Tillet 在博客中表示,NVIDIA 在工具链和文档上的投入,让 OpenAI 的模型“非常擅长为 Blackwell 和 Rubin GPU 编程”,Astra 能把这种能力转化成高性能计算 kernel,在延迟、吞吐和成本三条线上同时压榨硬件。
有意思的是,这个优化过程本身也在用 AI 加速:OpenAI 用自家模型持续打磨跑在 NVIDIA GPU 上的推理软件。OpenAI 计算 CTO Uday Ruddarraju 说,正是 NVIDIA 平台的可编程性,让 Ultrafast 背后的加速得以交付。换句话说,模型越会给 GPU 写 kernel,同一块卡就越快,而这个过程还在持续——部署之后性能仍可能继续提升。
谁能用,价格去哪看
目前 Ultrafast 通过 OpenAI API 直接可用,ChatGPT Work 和 Codex 的符合条件用户也在覆盖范围内。NVIDIA 博客末尾指向了 OpenAI 开发者站点的 Ultrafast 指南,接入方式、定价和实现细节以那份指南为准。
值得开发者关注的一点是基础设施的复用性:NVIDIA 强调同一套可编程平台可以横跨训练、推理和强化学习复用,团队能按需调配算力,避免为每种负载单独超配。对跑 agent 业务的团队来说,这意味着延迟优化和成本优化第一次被放进了同一个技术动作里。
下一步值得盯的是两件事:Ultrafast 的实际定价(速度提升是否伴随溢价,指南里会有答案),以及这种“模型自己优化推理”的路线能把 Blackwell 的利用率再推高多少。