AI导航

Claude Opus 5.5 登顶 Text Arena 榜首:1509 分首秀,Anthropic 包揽前六

AI资讯
2 min read
0 次阅读

2026年9月26日,众包模型评测平台 Arena(原 LMArena)在官方 X 账号宣布:Claude Opus 5.5(High)以 1509 分(±12)首次登顶 Text Arena,成为该榜单的新任榜首。距离 Opus 5.5 在 9 月 22 日正式发布,仅仅过去了四天。

1509 分的分量:领先上代 18 分,前六全是 Anthropic

官方公布的几个数字值得细看。Opus 5.5(High)这一成绩比上一代 Opus 5(High)高出 18 分,后者目前排在第 11 位;紧随其后的 Opus 4.6(High)只差 4 分,守住第 2 名。更少见的是,Text Arena 的前六名被 Anthropic 一家包揽。

Text Arena 是 Arena 的旗舰文本榜:真实用户提交真实 prompt,两个模型匿名对打、由投票者盲选,覆盖数学、编码、创意写作等多个领域。1509 分本质上是一次大规模人类偏好投票的汇总结果,±12 的置信区间说明这个第一在统计上站得住脚,不是靠少量投票侥幸刷出来的。

榜单名称里的“High”也值得解释一句:它指的是算力档位,1509 分代表 Opus 5.5 在最高努力档位下的上限表现,而非成本最优档的成绩。看榜时,档位和价格要放在一起看。

容易忽略的细节:16 美元混合价格也进了 Pareto 前沿

Arena 这次还公布了一个容易被忽略的细节:按 Opus 5.5 每百万 token 输入 4 美元、输出 20 美元的定价折算,它的混合价格约为 16 美元/MToken,这个位置同样进入了 Text Arena 的 Pareto 前沿——在“又强又便宜”这个维度上,目前没有其他模型能全面压制它。

这延续了 Opus 5.5 发布时的核心卖点:性能看齐更高阶的 Fable 5.1,定价却比 Opus 5 低 20%,典型工作负载的运行成本低约 40%。榜单成绩和价格曲线,第一次在同一个画面里对上了。

接下来看什么:Astra 会回应吗,分数会回落吗

对正在选型的人来说,Text Arena 的价值在于它测的是真实用户的真实任务偏好,而不是实验室里的标准考题。一个发布四天的新模型直接空降第一,说明它的综合文本能力在真实场景里确实打动了投票者。但也要清醒:偏好榜不等于能力基准,它不告诉你模型在代码、数学等硬指标上的具体短板,选型时还要结合 Artificial Analysis 智能指数、Terminal-Bench 这类结构化评测一起看。

接下来值得盯两件事:GPT-6 Astra 会不会在文本榜上做出回应——它在编程榜上依然强势;以及随着投票量继续累积,Opus 5.5 的分数是继续拉开还是小幅回落。新王登基的第一周,榜单通常还会有波动。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。