AI导航

ARC Prize 2026 高分榜更新:TUFA Labs 以 88.06% 登顶 ARC-AGI-2

AI资讯
2 min read
7 次阅读

ARC Prize 在 2026 年 10 月 9 日公布了 2026 赛季 ARC-AGI-2 高分榜的最新成绩:TUFA Labs 以 88.06% 登顶第一,成为目前唯一突破 85% 的参赛队伍。ARC-AGI-2 是 ARC Prize 基金会的抽象推理评测,题目是参赛系统从未见过的新图案推理题,专门用来检验系统能不能现场归纳规则,而不是靠记忆和蛮力算出答案。

前五名拉开了明显梯度

这次公布的高分榜前五名依次是:TUFA Labs 88.06%、Rabbithole 80.56%、Yi-Chia Chen 77.22%、Nubanana 77.08% 和 _hans 67.64%。第一名和第二名之间差了 7.5 个百分点,第四名之后又掉了一个台阶,说明头部方法目前仍有独到的东西,还没有被普遍复制。

需要分清的是,这份高分榜是 ARC Prize 2026 竞赛(在 Kaggle 上进行)的参赛系统成绩,和各家实验室模型在官方排行榜上的分数不是同一张榜:竞赛允许参赛者围绕评测做专门的系统设计、搜索策略和脚手架优化,拼的是整套解题系统;实验室模型榜拼的则是单个模型的原生能力。把 88.06% 直接和某个大模型的分数对比,会得出错误结论。

奖金规则里藏着一条 85% 的线

本赛季除了 10 万美元的常规奖金,ARC Prize 还另设了 15 万美元的 Bonus Prize,由所有得分超过 85% 的队伍分享。按这次公布的成绩,目前只有 TUFA Labs 一家过线。如果后续没有其他队伍冲过 85%,这笔奖金将由它独享;这也解释了为什么榜单下半段的队伍接下来会集中冲刺这条线——从 80.56% 到 85% 之间,只隔着 Rabbithole 一支队伍的距离。

分数应该怎么看

ARC-AGI-2 的设计初衷是防止系统靠堆算力穷举:题目每次都是新的,系统必须先看懂几个示例里的变换规则,再把规则用到新图上。竞赛系统能做到 88%,说明在脚手架、搜索和自我校验这些环节上,工程方法又往前走了一步,这对做推理智能体的团队有实际参考价值。

但也要保留一份谨慎:竞赛分数高,不等于系统具备通用智能。ARC Prize 官方此前也强调过,这类评测的范围是有限的,把某个基准刷满不代表通用智能已经实现。对普通读者来说,这份榜单更适合当作观察推理方法进展的窗口,而不是给某个模型或团队下结论的依据。赛季尚未结束,榜单还可能变化,最终名次和奖金归属要以 ARC Prize 的官方结算为准。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。