AI导航

GPT-6 Astra Ultrafast 上线:Blackwell 加速,令牌生成最高快 8 倍

AI资讯
2 min read
0 次阅读

GPT-6 Astra Ultrafast 已于 2026 年 10 月 2 日上线:NVIDIA 在官方博客宣布,这一模式运行在 NVIDIA Blackwell GPU 上,现已通过 OpenAI API 开放,并面向符合条件的 ChatGPT Work 和 Codex 用户提供。与 Astra 的 Standard 模式相比,Ultrafast 的令牌生成速度最高快 8 倍,主打的就是编程智能体这类需要反复调用工具、等待模型回应的任务。

快在哪里:模型没换,推理被重新优化

NVIDIA 博客写得很明确,这次加速来自推理层面的优化:OpenAI 让模型充分利用 Blackwell 架构的特性,还用自家模型参与编写和改进运行在 GPU 上的高性能内核。OpenAI 推理负责人 Philippe Tillet 表示,Astra 能把对 Blackwell 和下一代 Rubin GPU 的编程知识转化成高性能内核;OpenAI 计算技术负责人 Uday Ruddarraju 则提到,团队用内部模型持续优化 GPU 上的推理软件,模型上线后性能还能继续提升。也就是说,Ultrafast 卖的不是一个新的模型名字,而是同一能力在更低延迟下的交付。

对编程智能体来说,快比峰值分数更实在

编程智能体的工作方式是连环的:写一段代码、调用工具、看运行结果、再决定下一步。每一步都要等模型生成完毕,单步慢一点,几十步叠加就是明显的等待。Ultrafast 把单步生成时间压下来,直接缩短“编辑—测试—调试”的循环,也让交互式应用的响应更跟手。对每天跑大量智能体任务的团队,这类延迟下降会同时影响开发节奏和单次任务的实际体验,不只是跑分表上的数字变化。

使用前先核对资格和计价

需要注意两个边界。第一,开放范围有条件:API 用户可以直接使用,ChatGPT Work 和 Codex 侧只面向符合条件的用户,自己账号里没看到入口不等于功能故障。第二,“最高快 8 倍”是与 Standard 模式对比的官方上限值,自己的任务能快多少取决于提示长度、工具调用次数和工作流结构。NVIDIA 博客文末指向了 OpenAI 的 Ultrafast 指南,接入前应先在那里核对访问方式和定价,再拿自己最典型的三个编程任务实测延迟和完成质量,确认收益后再把默认模式切过去。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。