AI导航

编程智能体榜单更新:Sonnet 5.5、GPT-6.1 Sol、Gemini 4 Argon 冲上前列,任务成本差十几倍

AI资讯
3 min read
0 次阅读

2026 年 10 月 2 日,Artificial Analysis 更新了 Coding Agent Index(编程智能体指数)榜单:Claude Sonnet 5.5、GPT-6.1 Sol 与 Gemini 4 Argon 三款新模型集体冲上榜单前列。有意思的是,这三款模型的 API 定价都在同一档(每百万 token 输入 2 美元、输出 10 美元),但跑完一个榜单任务的实际成本能差出十几倍。

先看数字。榜单展示的结果里,Claude Code 搭配 Sonnet 5.5(max 档)以 0.684 的指数得分领跑,但单个任务成本约 14.19 美元;Codex 搭配 GPT-6.1 Sol(xhigh 档)得分为 0.629,只低了约 0.05 分,单个任务成本约 1.04 美元,不到前者的十三分之一。Gemini 4 Argon 按 introductory 价格算,单个任务约 1.99 美元,大约是 GPT-6 Astra 最高档成本的六成。Artificial Analysis 的另一组数据也值得看:GPT-6.1 Sol 在 max 努力度下比 GPT-6 Sol 高出 3 分,只比 GPT-6 Astra 低 2 分。

分数测的不是裸模型,是“组合”

理解这份榜单要先理解它的方法论。Coding Agent Index 是三个公开基准的简单平均:DeepSWE v1.1(真实代码库的软件工程任务)、Terminal-Bench 4.0(终端多步操作)、SWE-Atlas-QnA(代码库理解问答)。它测的不是某个模型本身,而是一个完整组合:agent 框架加模型加推理努力档位。比如同样是 GPT-6.1 Sol,xhigh 档和 max 档的分数、token 消耗和成本完全不同。

成本数字同样要看口径:榜单成本按当前 API 按量定价算,包含缓存读写折扣。但 Artificial Analysis 自己也在官网 FAQ 里提醒,很多人实际是通过订阅套餐用这些编程 agent,而不是按 token 付费,榜单成本不直接等于你的账单。

选型时真正要看的三件事

第一,看推理档位。Sonnet 5.5 的榜首成绩来自 max 档,也就是最高努力档,而 GPT-6.1 Sol 的 0.629 来自 xhigh 档。档位决定了 token 消耗量,也就决定了成本。同一个模型换一档,性价比可能完全反转。

第二,看框架搭配。Claude Code、Codex 这些 harness 本身的设计(工具调用策略、上下文管理)会显著影响最终成绩和耗时。榜单里同一个模型家族在不同框架下会出现多个版本,选型时要认准“框架加模型加档位”的完整组合,而不是只看模型名。

第三,看价格有效期。三款模型的 2 美元/10 美元都是“当前价”:Gemini 4 Argon 明确是 introductory 价格,之后要涨到 4 美元/20 美元;GPT-6.1 Sol 的缓存输入折扣给到了 95%。按优惠价算出来的成本优势,有效期是有限的。

对日常写代码的人来说,这份榜单的实用结论是:2 美元档已经能买到接近旗舰的编程 agent 效果,贵的不一定是智商税,但便宜的档位选对了,省下来的钱是实实在在的。下一次更新值得关注各家会不会把正式版配置推上榜,以及订阅制用户在真实工作流里的体感是否和榜单一致。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。