2026年9月26日,众包模型评测平台 Arena(原 LMArena)在官方 X 账号宣布:Claude Opus 5.5(High)以 1509 分(±12)首次登顶 Text Arena,成为该榜单的新任榜首。距离 Opus 5.5 在 9 月 22 日正式发布,仅仅过去了四天。
1509 分的分量:领先上代 18 分,前六全是 Anthropic
官方公布的几个数字值得细看。Opus 5.5(High)这一成绩比上一代 Opus 5(High)高出 18 分,后者目前排在第 11 位;紧随其后的 Opus 4.6(High)只差 4 分,守住第 2 名。更少见的是,Text Arena 的前六名被 Anthropic 一家包揽。
Text Arena 是 Arena 的旗舰文本榜:真实用户提交真实 prompt,两个模型匿名对打、由投票者盲选,覆盖数学、编码、创意写作等多个领域。1509 分本质上是一次大规模人类偏好投票的汇总结果,±12 的置信区间说明这个第一在统计上站得住脚,不是靠少量投票侥幸刷出来的。
榜单名称里的“High”也值得解释一句:它指的是算力档位,1509 分代表 Opus 5.5 在最高努力档位下的上限表现,而非成本最优档的成绩。看榜时,档位和价格要放在一起看。
容易忽略的细节:16 美元混合价格也进了 Pareto 前沿
Arena 这次还公布了一个容易被忽略的细节:按 Opus 5.5 每百万 token 输入 4 美元、输出 20 美元的定价折算,它的混合价格约为 16 美元/MToken,这个位置同样进入了 Text Arena 的 Pareto 前沿——在“又强又便宜”这个维度上,目前没有其他模型能全面压制它。
这延续了 Opus 5.5 发布时的核心卖点:性能看齐更高阶的 Fable 5.1,定价却比 Opus 5 低 20%,典型工作负载的运行成本低约 40%。榜单成绩和价格曲线,第一次在同一个画面里对上了。
接下来看什么:Astra 会回应吗,分数会回落吗
对正在选型的人来说,Text Arena 的价值在于它测的是真实用户的真实任务偏好,而不是实验室里的标准考题。一个发布四天的新模型直接空降第一,说明它的综合文本能力在真实场景里确实打动了投票者。但也要清醒:偏好榜不等于能力基准,它不告诉你模型在代码、数学等硬指标上的具体短板,选型时还要结合 Artificial Analysis 智能指数、Terminal-Bench 这类结构化评测一起看。
接下来值得盯两件事:GPT-6 Astra 会不会在文本榜上做出回应——它在编程榜上依然强势;以及随着投票量继续累积,Opus 5.5 的分数是继续拉开还是小幅回落。新王登基的第一周,榜单通常还会有波动。