AI导航

GPT-6 Astra Ultrafast 上线:Blackwell 加速,token 生成最高快 8 倍

AI资讯
2 min read
0 次阅读

GPT-6 Astra Ultrafast 在 2026 年 10 月 1 日正式上线。NVIDIA 当天在官方博客宣布,OpenAI 为 GPT-6 Astra 新增的 Ultrafast 推理模式已经可用,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra 标准模式的 8 倍。该模式即日起通过 OpenAI API 提供,符合条件的 ChatGPT Work 和 Codex 用户也能用上。

对写代码的人来说,这个数字的意义不在“生成更快”,而在 agent 的工作循环被压缩了。NVIDIA 在博客里算了一笔账:一个编码 agent 的典型循环是写代码、调工具、看结果、再决策,循环里每一步的等待都被缩短,edit-test-debug 的整体周转就会明显变快,交互式应用在工具调用之间的停顿也会变短。

8 倍加速从哪来

Ultrafast 的加速不是靠堆更多显卡,而是靠吃透 Blackwell 架构的推理优化。OpenAI 推理负责人 Philippe Tillet 在博客中表示,NVIDIA 在工具链和文档上的投入,让 OpenAI 的模型“非常擅长为 Blackwell 和 Rubin GPU 编程”,Astra 能把这种能力转化成高性能计算 kernel,在延迟、吞吐和成本三条线上同时压榨硬件。

有意思的是,这个优化过程本身也在用 AI 加速:OpenAI 用自家模型持续打磨跑在 NVIDIA GPU 上的推理软件。OpenAI 计算 CTO Uday Ruddarraju 说,正是 NVIDIA 平台的可编程性,让 Ultrafast 背后的加速得以交付。换句话说,模型越会给 GPU 写 kernel,同一块卡就越快,而这个过程还在持续——部署之后性能仍可能继续提升。

谁能用,价格去哪看

目前 Ultrafast 通过 OpenAI API 直接可用,ChatGPT Work 和 Codex 的符合条件用户也在覆盖范围内。NVIDIA 博客末尾指向了 OpenAI 开发者站点的 Ultrafast 指南,接入方式、定价和实现细节以那份指南为准。

值得开发者关注的一点是基础设施的复用性:NVIDIA 强调同一套可编程平台可以横跨训练、推理和强化学习复用,团队能按需调配算力,避免为每种负载单独超配。对跑 agent 业务的团队来说,这意味着延迟优化和成本优化第一次被放进了同一个技术动作里。

下一步值得盯的是两件事:Ultrafast 的实际定价(速度提升是否伴随溢价,指南里会有答案),以及这种“模型自己优化推理”的路线能把 Blackwell 的利用率再推高多少。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。