ARC Prize 在 2026 年 10 月 9 日公布了 2026 赛季 ARC-AGI-2 高分榜的最新成绩:TUFA Labs 以 88.06% 登顶第一,成为目前唯一突破 85% 的参赛队伍。ARC-AGI-2 是 ARC Prize 基金会的抽象推理评测,题目是参赛系统从未见过的新图案推理题,专门用来检验系统能不能现场归纳规则,而不是靠记忆和蛮力算出答案。
前五名拉开了明显梯度
这次公布的高分榜前五名依次是:TUFA Labs 88.06%、Rabbithole 80.56%、Yi-Chia Chen 77.22%、Nubanana 77.08% 和 _hans 67.64%。第一名和第二名之间差了 7.5 个百分点,第四名之后又掉了一个台阶,说明头部方法目前仍有独到的东西,还没有被普遍复制。
需要分清的是,这份高分榜是 ARC Prize 2026 竞赛(在 Kaggle 上进行)的参赛系统成绩,和各家实验室模型在官方排行榜上的分数不是同一张榜:竞赛允许参赛者围绕评测做专门的系统设计、搜索策略和脚手架优化,拼的是整套解题系统;实验室模型榜拼的则是单个模型的原生能力。把 88.06% 直接和某个大模型的分数对比,会得出错误结论。
奖金规则里藏着一条 85% 的线
本赛季除了 10 万美元的常规奖金,ARC Prize 还另设了 15 万美元的 Bonus Prize,由所有得分超过 85% 的队伍分享。按这次公布的成绩,目前只有 TUFA Labs 一家过线。如果后续没有其他队伍冲过 85%,这笔奖金将由它独享;这也解释了为什么榜单下半段的队伍接下来会集中冲刺这条线——从 80.56% 到 85% 之间,只隔着 Rabbithole 一支队伍的距离。
分数应该怎么看
ARC-AGI-2 的设计初衷是防止系统靠堆算力穷举:题目每次都是新的,系统必须先看懂几个示例里的变换规则,再把规则用到新图上。竞赛系统能做到 88%,说明在脚手架、搜索和自我校验这些环节上,工程方法又往前走了一步,这对做推理智能体的团队有实际参考价值。
但也要保留一份谨慎:竞赛分数高,不等于系统具备通用智能。ARC Prize 官方此前也强调过,这类评测的范围是有限的,把某个基准刷满不代表通用智能已经实现。对普通读者来说,这份榜单更适合当作观察推理方法进展的窗口,而不是给某个模型或团队下结论的依据。赛季尚未结束,榜单还可能变化,最终名次和奖金归属要以 ARC Prize 的官方结算为准。