GPT-6 Sol 跑一个 Agent 任务,现在中位成本只要 0.75 美元——这是 Arena 在 2026 年 9 月 26 日公布的 Agent Arena 新数据:OpenAI 的 GPT-6 Sol(Max)正式登陆该榜单,在 4000 多个真实 agentic 会话中拿下 +7.7% 的净改进,排到第 6 名,并直接重塑了榜单的性价比 Pareto 前沿。
和前代对比:净改进涨 1.5 个点,token 价格减半
和上一代 GPT-5.6 Sol(xHigh)相比,Sol 这次是双线进步:净改进从 +6.2% 提升到 +7.7%,排名从第 8 升到第 6,而每 token 价格只有前代的一半。在“任务确认成功”这个细分信号上,Sol 以 +11.4% 排到第 4,前代在这个信号上只排第 20(+2.9%)——说明它在“真正把任务做成”的能力上有实质提升,不只是变便宜了。
Pareto 前沿的对比更直观:排在它前面的 Claude Fable 5(High)净改进 +8.3%,只高出 0.60 个百分点,但每任务成本是 1.72 美元;Sol 的 0.75 美元便宜了 56%。性能差距不到 1 个点,成本差出一倍多,这就是 Sol 这次想讲的故事。
Agent Arena 到底在测什么
和拼单轮对话偏好的 Text Arena 不同,Agent Arena 评估的是模型“编排工具、完成真实任务”的能力:能不能可靠地调用工具、把多步骤任务走完、过程中听不听指挥。榜单基于 200 多万个会话、44 个模型,是目前最贴近真实 Agent 工作流的公开评测之一。
所以第 6 名的含金量要放在场景里看:对跑自动化客服、批量文档处理、编码流水线这类“量大、步骤多”的任务,Sol 的定位就是“够智能、够便宜”,而不是去和 Astra、Fable 5.1 拼极限智能。榜单名次和任务成本,要按你的场景分开看。
对跑 Agent 的人意味着什么
如果你已经在用 API 跑 Agent,结论很直接:同档智能下,Sol 的任务成本大约是前代的一半,是 Fable 5(High)这类旗舰的四成左右。OpenAI 这次降价的底气是缓存和推理效率的改进——Sol 的 API 定价是每百万 token 输入 2 美元、输出 10 美元,榜单上的 0.75 美元/任务是包含多次工具调用的实测中位数,不是理论值。
接下来值得关注的是 Sol 何时进入 ChatGPT 的对话入口。目前它主要通过 API 和部分开发渠道提供;以及随着评测会话继续累积,它的排名和成本数字会不会有变化。