AI导航

Claude Opus 5.5 登顶 Artificial Analysis 智能指数:58 分领先 5 分,价格同步下调 20%

AI资讯
3 min read
1 次阅读

2026 年 9 月 23 日凌晨(北京时间),第三方基准机构 Artificial Analysis 更新评测报告:Anthropic 的 Claude Opus 5.5 在最高推理强度下跑出 58 分,登顶其智能指数(Intelligence Index)榜首。之前的榜首 GPT-6 Astra 和 Claude Fable 5.1 都是 53 分,Opus 5.5 一次拉开 5 分差距,是该榜单上少见的大幅领先。报告同时确认,Anthropic 已把 Opus 系列定价从每百万 token 输入 $5、输出 $25 下调到 $4、$20,缓存读取从 $0.50 降到 $0.20。

58 分是怎么拿到的

智能指数由 10 项评测综合而成,Opus 5.5 在其中 6 项拿到第一:Humanity's Last Exam 61.4%(前纪录 59.1%,由 Fable 5.1 保持)、SciCode 66.9%(前 63.1%)、GDPval-AA v2.1、AA-Briefcase v1.1、AA-Omniscience 和 AutomationBench-AA。在 Terminal-Bench 4.0 上它拿到 59.6%,与 GPT-6 Astra 并列榜首,比 Opus 5 高出 11 个百分点。

落后的 3 项也要看到:CritPt、AA-LCR 和 GDP.pdf 上 Opus 5.5 仍不是第一,说明领先是综合分上的领先,不是全方位碾压。值得单独一提的是 AA-Briefcase——这是测智能体知识工作的私有评测,Opus 5.5 跑出 1822 的 Elo,比 Fable 5.1 高 143,也是 Anthropic 第一次在呈现质量上超过 GPT-5.6 Sol。

便宜了,但它很吃 token

名义降价 20% 的另一面是 token 消耗:Opus 5.5 完成一项指数任务平均要用约 119k 输出 token,而 GPT-6 Astra 只要约 27k,Opus 5 约 73k,Fable 5.1 约 78k。Artificial Analysis 的测算显示,Opus 5.5 的 max、xhigh、high、medium 四个推理强度档全部落在“智能 vs 单任务成本”的前沿线上——也就是说按任务实际成本算,它依然划算,但前提是你别只看单价。

对开发者的实际意义:复杂任务的账单要按自己的工作负载重算一次;中等强度档(medium/high)落在前沿线上,可能是多数场景的性价比甜点,没必要一上来就开 max。

下一步值得看什么

一是 OpenAI 会不会跟进:它刚把 GPT-6 Sol 和 Luna 的价格腰斩,榜单被反超后是否再出招,决定下一轮价格战的走向。二是真实负载验证,Anthropic 自己在发布时提醒过“榜单差距不等于真实差距”,选型前最好用自己的代表性任务实测。三是智能体编码场景的持续对比,Opus 5.5 在 AA-Briefcase 上的领先如果能在生产环境复现,对知识工作类智能体的选型影响会比榜单分本身更大。

FAQ

Q:58 分领先 5 分,实际用起来会强很多吗?

A:不一定。这是 10 项评测的综合分,Opus 5.5 在其中 3 项仍落后。Anthropic 在发布时自己也提醒过榜单分和真实差距不完全对应,做选型最好用自己的代表性任务实测后再定。

Q:Opus 5.5 现在到底降价到多少?

A:按 Artificial Analysis 报告引用的 Anthropic 官方定价,输入 $4、输出 $20 每百万 token(Opus 5 是 $5/$25),缓存读取从 $0.50 降到 $0.20。不过它输出 token 消耗大,实际按任务成本要结合你的工作负载算。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。