GPT-6 家族的选型问题有了官方答法:OpenAI 在 2026 年 10 月 2 日发布 GPT-6 家族实用指南,系统讲清 Astra、GPT-6.1 Sol 和 Luna 三款模型各自适合什么任务、推理档位怎么设、运行数小时甚至数天的长任务怎么管。指南面向正在用 API 和 Codex 构建应用的开发团队,核心主张是把选模型和选推理档位看成同一道权衡题,按能力、成本和延迟三者平衡,而不是默认全用最强的模型。
三款模型先按任务分工,价格差距拉得很开
指南给出的分工很直接。Astra 是家族里最强的,留给最难的推理工作,模型卡标价为输入 10 美元、输出 50 美元、缓存输入 1 美元。Sol 的智能接近 Astra,价格只有其五分之一,输入 2 美元、输出 10 美元,主打复杂编码、研究和计算机操作,还能在 Responses API 里以测试版形式跑多智能体工作流。Luna 最便宜,输入 0.10 美元、输出 0.50 美元,负责目标明确的大批量日常活,比如抽取发票字段、给请求分类、生成结构化摘要。换算下来 Astra 的输入价是 Luna 的一百倍,选错模型,账单差距比性能差距更先被感受到。
推理档位可以中途改,别一开始就拉满
指南把推理档位分成 Low、Medium、High 和 Extra high/Max 四档:Low 应付提取事实、小幅编辑这类常规任务,Medium 处理需要判断的规划和比较,High 留给困难调试和深度审查,最高档只在 High 确实不够、且提升能抵偿额外时间和成本时才保留。两个细节值得注意:一是 API 允许在对话中途调整推理档位,且不会破坏已缓存的上下文;二是 Codex 侧建议先用模型默认档位跑,简单任务调低、深度分析再调高。成本侧还有一组配套手法:剪掉任务用不到的上下文、把稳定指令放在提示词前段以复用缓存(缓存输入最高可便宜 95%)、长对话及时做上下文压缩。
长任务多了三种管法,提示词反而要写得更松
针对跨小时甚至跨天的任务,指南给了三个机制。中途纠偏:通过 Responses WebSocket API 在模型工作时发去更正,消息会排队生效,不会取消正在运行的工具,也不会撤销已完成的动作。异步工具调用:测试这类慢任务运行时,模型可以先去做不依赖结果的工作。任务委派:Sol 可以把独立子任务分给多个子智能体并行调查,再合并成最终回复。提示词部分的风向变了:OpenAI 开发者体验负责人 Eric Provencher 在指南中表示,模型理解细微差别的能力变强后,过于具体的指令反而会拖累效果。官方建议是把任务交代清楚——想要什么结果、给谁用、有哪些约束、什么算完成——再写明决策边界和完成标准,把具体的组织方式留给模型自己决定。