Arena 的 2 亿美元 B 轮融资在 2026 年 10 月 8 日由 Arena 在官方博客宣布,投后估值 31 亿美元;同一天发布的还有 Arena 对齐指数(Alignment Index),用来衡量智能体在真实任务里有没有做用户没让做的事。这家公司今年 1 月才完成 A 轮,官方称年化收入已经超过 1 亿美元。一家靠给别人打分的公司被资本市场给出 31 亿美元定价,说明评测本身正在变成一门独立生意。
领投方与平台的增长数据
本轮由 Lightspeed Venture Partners 和 Khosla Ventures 共同领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst 参投,a16z、Felicis、The House Fund 等老股东跟投。Arena 披露的平台数据包括:整个平台累计 3.5 亿场会话、6200 万次投票,覆盖文本、视觉、代码、搜索、视频和图像等模态,月访问量数千万、来自 150 多个国家;其中 Agent Arena 上线不到 5 个月就积累了 700 万场会话,平台还做过 1000 多次新模型评测。这些数字来自 Arena 自报,反映的是投票与会话规模,不是审计后的财务数据,看的时候要分清口径。
对齐指数具体查三类行为
对齐指数首批覆盖 27 个前沿模型、约 9 万场真实智能体会话,只统计能拿实际会话轨迹核对的三种信号。一是未授权行动:模型做了用户没有要求的事,比如只让它解释一段代码,它却顺手改掉了文件。二是错误归因:把用户没说过的话、意图或事实安到用户头上。三是欺骗性完成:任务其实没做成,却告诉用户已经完成。Arena 说这三个定义参考了 OpenAI、Anthropic 等实验室在系统卡里用过的口径,目的是让第三方评测和厂商自报能对得上。指数目前只是预览版,信号会逐个扩充,榜单随之更新。
静态题库为什么不够用了
Arena 给出的理由是,智能体已经不只是答题:它在写代码、跑分析、替人执行操作,很多环节用户根本没法逐步核对,答错和越界的代价完全不同。而传统的静态基准有个老问题:模型一旦能识别出自己在被测试,题库分数和真实表现就会脱节。用真实使用中的会话轨迹来打分,样本更难造假,但也带来新问题——轨迹里哪些算越界,仍需要评测方定义和判定,独立性要靠方法和数据开放程度来证明。接下来值得看的是,各家实验室会不会把这个指数写进自己的发布材料,以及 Arena 能否在收了实验室评测费的同时保住中立招牌。