2026 年 10 月 2 日,Artificial Analysis 更新了 Coding Agent Index(编程智能体指数)榜单:Claude Sonnet 5.5、GPT-6.1 Sol 与 Gemini 4 Argon 三款新模型集体冲上榜单前列。有意思的是,这三款模型的 API 定价都在同一档(每百万 token 输入 2 美元、输出 10 美元),但跑完一个榜单任务的实际成本能差出十几倍。
先看数字。榜单展示的结果里,Claude Code 搭配 Sonnet 5.5(max 档)以 0.684 的指数得分领跑,但单个任务成本约 14.19 美元;Codex 搭配 GPT-6.1 Sol(xhigh 档)得分为 0.629,只低了约 0.05 分,单个任务成本约 1.04 美元,不到前者的十三分之一。Gemini 4 Argon 按 introductory 价格算,单个任务约 1.99 美元,大约是 GPT-6 Astra 最高档成本的六成。Artificial Analysis 的另一组数据也值得看:GPT-6.1 Sol 在 max 努力度下比 GPT-6 Sol 高出 3 分,只比 GPT-6 Astra 低 2 分。
分数测的不是裸模型,是“组合”
理解这份榜单要先理解它的方法论。Coding Agent Index 是三个公开基准的简单平均:DeepSWE v1.1(真实代码库的软件工程任务)、Terminal-Bench 4.0(终端多步操作)、SWE-Atlas-QnA(代码库理解问答)。它测的不是某个模型本身,而是一个完整组合:agent 框架加模型加推理努力档位。比如同样是 GPT-6.1 Sol,xhigh 档和 max 档的分数、token 消耗和成本完全不同。
成本数字同样要看口径:榜单成本按当前 API 按量定价算,包含缓存读写折扣。但 Artificial Analysis 自己也在官网 FAQ 里提醒,很多人实际是通过订阅套餐用这些编程 agent,而不是按 token 付费,榜单成本不直接等于你的账单。
选型时真正要看的三件事
第一,看推理档位。Sonnet 5.5 的榜首成绩来自 max 档,也就是最高努力档,而 GPT-6.1 Sol 的 0.629 来自 xhigh 档。档位决定了 token 消耗量,也就决定了成本。同一个模型换一档,性价比可能完全反转。
第二,看框架搭配。Claude Code、Codex 这些 harness 本身的设计(工具调用策略、上下文管理)会显著影响最终成绩和耗时。榜单里同一个模型家族在不同框架下会出现多个版本,选型时要认准“框架加模型加档位”的完整组合,而不是只看模型名。
第三,看价格有效期。三款模型的 2 美元/10 美元都是“当前价”:Gemini 4 Argon 明确是 introductory 价格,之后要涨到 4 美元/20 美元;GPT-6.1 Sol 的缓存输入折扣给到了 95%。按优惠价算出来的成本优势,有效期是有限的。
对日常写代码的人来说,这份榜单的实用结论是:2 美元档已经能买到接近旗舰的编程 agent 效果,贵的不一定是智商税,但便宜的档位选对了,省下来的钱是实实在在的。下一次更新值得关注各家会不会把正式版配置推上榜,以及订阅制用户在真实工作流里的体感是否和榜单一致。