GPT-6 Astra Ultrafast 已于 2026 年 10 月 2 日上线:NVIDIA 在官方博客宣布,这一模式运行在 NVIDIA Blackwell GPU 上,现已通过 OpenAI API 开放,并面向符合条件的 ChatGPT Work 和 Codex 用户提供。与 Astra 的 Standard 模式相比,Ultrafast 的令牌生成速度最高快 8 倍,主打的就是编程智能体这类需要反复调用工具、等待模型回应的任务。
快在哪里:模型没换,推理被重新优化
NVIDIA 博客写得很明确,这次加速来自推理层面的优化:OpenAI 让模型充分利用 Blackwell 架构的特性,还用自家模型参与编写和改进运行在 GPU 上的高性能内核。OpenAI 推理负责人 Philippe Tillet 表示,Astra 能把对 Blackwell 和下一代 Rubin GPU 的编程知识转化成高性能内核;OpenAI 计算技术负责人 Uday Ruddarraju 则提到,团队用内部模型持续优化 GPU 上的推理软件,模型上线后性能还能继续提升。也就是说,Ultrafast 卖的不是一个新的模型名字,而是同一能力在更低延迟下的交付。
对编程智能体来说,快比峰值分数更实在
编程智能体的工作方式是连环的:写一段代码、调用工具、看运行结果、再决定下一步。每一步都要等模型生成完毕,单步慢一点,几十步叠加就是明显的等待。Ultrafast 把单步生成时间压下来,直接缩短“编辑—测试—调试”的循环,也让交互式应用的响应更跟手。对每天跑大量智能体任务的团队,这类延迟下降会同时影响开发节奏和单次任务的实际体验,不只是跑分表上的数字变化。
使用前先核对资格和计价
需要注意两个边界。第一,开放范围有条件:API 用户可以直接使用,ChatGPT Work 和 Codex 侧只面向符合条件的用户,自己账号里没看到入口不等于功能故障。第二,“最高快 8 倍”是与 Standard 模式对比的官方上限值,自己的任务能快多少取决于提示长度、工具调用次数和工作流结构。NVIDIA 博客文末指向了 OpenAI 的 Ultrafast 指南,接入前应先在那里核对访问方式和定价,再拿自己最典型的三个编程任务实测延迟和完成质量,确认收益后再把默认模式切过去。