AI导航

GPT-6 Sol 登陆 Agent Arena:第 6 名背后,单任务成本只要 0.75 美元

AI资讯
2 min read
0 次阅读

GPT-6 Sol 跑一个 Agent 任务,现在中位成本只要 0.75 美元——这是 Arena 在 2026 年 9 月 26 日公布的 Agent Arena 新数据:OpenAI 的 GPT-6 Sol(Max)正式登陆该榜单,在 4000 多个真实 agentic 会话中拿下 +7.7% 的净改进,排到第 6 名,并直接重塑了榜单的性价比 Pareto 前沿。

和前代对比:净改进涨 1.5 个点,token 价格减半

和上一代 GPT-5.6 Sol(xHigh)相比,Sol 这次是双线进步:净改进从 +6.2% 提升到 +7.7%,排名从第 8 升到第 6,而每 token 价格只有前代的一半。在“任务确认成功”这个细分信号上,Sol 以 +11.4% 排到第 4,前代在这个信号上只排第 20(+2.9%)——说明它在“真正把任务做成”的能力上有实质提升,不只是变便宜了。

Pareto 前沿的对比更直观:排在它前面的 Claude Fable 5(High)净改进 +8.3%,只高出 0.60 个百分点,但每任务成本是 1.72 美元;Sol 的 0.75 美元便宜了 56%。性能差距不到 1 个点,成本差出一倍多,这就是 Sol 这次想讲的故事。

Agent Arena 到底在测什么

和拼单轮对话偏好的 Text Arena 不同,Agent Arena 评估的是模型“编排工具、完成真实任务”的能力:能不能可靠地调用工具、把多步骤任务走完、过程中听不听指挥。榜单基于 200 多万个会话、44 个模型,是目前最贴近真实 Agent 工作流的公开评测之一。

所以第 6 名的含金量要放在场景里看:对跑自动化客服、批量文档处理、编码流水线这类“量大、步骤多”的任务,Sol 的定位就是“够智能、够便宜”,而不是去和 Astra、Fable 5.1 拼极限智能。榜单名次和任务成本,要按你的场景分开看。

对跑 Agent 的人意味着什么

如果你已经在用 API 跑 Agent,结论很直接:同档智能下,Sol 的任务成本大约是前代的一半,是 Fable 5(High)这类旗舰的四成左右。OpenAI 这次降价的底气是缓存和推理效率的改进——Sol 的 API 定价是每百万 token 输入 2 美元、输出 10 美元,榜单上的 0.75 美元/任务是包含多次工具调用的实测中位数,不是理论值。

接下来值得关注的是 Sol 何时进入 ChatGPT 的对话入口。目前它主要通过 API 和部分开发渠道提供;以及随着评测会话继续累积,它的排名和成本数字会不会有变化。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。