2026年9月24日,Claude Opus 5.5 在一天之内拿下两个编程榜单的冠军:LMArena 官方宣布它以 1818 分登顶 Code Arena: WebDev 榜;Artificial Analysis 也在官方渠道更新,Opus 5.5 以 66 分拿下 Coding Agent Index 历史最高分。发布还不到一周,Opus 5.5 已经把"最强编程智能体模型"的头衔坐实了。
两个榜单分别测了什么
Code Arena: WebDev 是 LMArena 的网页开发赛道,靠真实开发者的盲测投票排名,测的是"写出来的网站人喜不喜欢";Opus 5.5 拿下 1818 分登顶,说明它在前端代码生成上的直觉被最多人认可。Coding Agent Index 则是 Artificial Analysis 的硬核工程基准,三项等权重:Terminal-Bench 4.0、DeepSWE v1.1、SWE-Atlas-QnA,跑的是 Claude Code 最高强度配置下的真实 Agent 任务。Opus 5.5 在这三项上全面超过上一代:Terminal-Bench 从 54.5% 涨到 63.1%,DeepSWE 从 62.5% 涨到 68.4%,SWE-Atlas-QnA 从 62.1% 涨到 66.4%,涨幅最大的是终端任务,足足 8.6 个百分点。相比 Claude Fable 5.1 的 62 分,Opus 5.5 也领先了 4 分。
强,但是贵
Artificial Analysis 同时算了一笔账:Opus 5.5 的单任务成本是 13.04 美元,比 Opus 5 的 10.79 美元贵了约两成。原因是它每个任务要吃掉约 1560 万 token,其中输出 token 是 Opus 5 的约 2.4 倍——想得越多、写得越细,账单越长。不过 Anthropic 已经把 API 降了价:输入输出价格从 5/25 美元降到 4/20 美元,缓存读取更是从 0.5 美元降到 0.2 美元,降幅六成。等于说模型变贵了,但单价变便宜了,最终账单的涨幅被部分对冲。
对开发者意味着什么
如果你在 Claude Code 里跑长任务、复杂重构,Opus 5.5 目前是纸面最强选择,但要盯住推理强度档位:max 档拿最高分,也烧最多钱。对预算敏感的团队,xhigh 或更低档位可能是更划算的甜点。另外值得提醒的是,榜单第一不等于对所有人都最优——不同任务类型下,各家模型的性价比排序并不一样,具体选型还是要按自己的任务实测,而不是只看冠军名字。