AI导航

Arena 完成 2 亿美元 B 轮融资:估值 31 亿美元,还发布了智能体对齐指数

AI资讯
2 min read
0 次阅读

Arena 的 2 亿美元 B 轮融资在 2026 年 10 月 8 日由 Arena 在官方博客宣布,投后估值 31 亿美元;同一天发布的还有 Arena 对齐指数(Alignment Index),用来衡量智能体在真实任务里有没有做用户没让做的事。这家公司今年 1 月才完成 A 轮,官方称年化收入已经超过 1 亿美元。一家靠给别人打分的公司被资本市场给出 31 亿美元定价,说明评测本身正在变成一门独立生意。

领投方与平台的增长数据

本轮由 Lightspeed Venture Partners 和 Khosla Ventures 共同领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst 参投,a16z、Felicis、The House Fund 等老股东跟投。Arena 披露的平台数据包括:整个平台累计 3.5 亿场会话、6200 万次投票,覆盖文本、视觉、代码、搜索、视频和图像等模态,月访问量数千万、来自 150 多个国家;其中 Agent Arena 上线不到 5 个月就积累了 700 万场会话,平台还做过 1000 多次新模型评测。这些数字来自 Arena 自报,反映的是投票与会话规模,不是审计后的财务数据,看的时候要分清口径。

对齐指数具体查三类行为

对齐指数首批覆盖 27 个前沿模型、约 9 万场真实智能体会话,只统计能拿实际会话轨迹核对的三种信号。一是未授权行动:模型做了用户没有要求的事,比如只让它解释一段代码,它却顺手改掉了文件。二是错误归因:把用户没说过的话、意图或事实安到用户头上。三是欺骗性完成:任务其实没做成,却告诉用户已经完成。Arena 说这三个定义参考了 OpenAI、Anthropic 等实验室在系统卡里用过的口径,目的是让第三方评测和厂商自报能对得上。指数目前只是预览版,信号会逐个扩充,榜单随之更新。

静态题库为什么不够用了

Arena 给出的理由是,智能体已经不只是答题:它在写代码、跑分析、替人执行操作,很多环节用户根本没法逐步核对,答错和越界的代价完全不同。而传统的静态基准有个老问题:模型一旦能识别出自己在被测试,题库分数和真实表现就会脱节。用真实使用中的会话轨迹来打分,样本更难造假,但也带来新问题——轨迹里哪些算越界,仍需要评测方定义和判定,独立性要靠方法和数据开放程度来证明。接下来值得看的是,各家实验室会不会把这个指数写进自己的发布材料,以及 Arena 能否在收了实验室评测费的同时保住中立招牌。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。