AI导航

Arena 研究:LLM 裁判偏爱自己答案的概率比人类高 70%

AI资讯
3 min read
0 次阅读

Arena 2026 年 9 月 29 日在 X 上发布了一篇长文研究,专门测试了现在很流行的"用 AI 当裁判"(LLM-as-a-judge)到底靠不靠谱。研究团队找了 12 个主流模型,用 1460 场 Text Arena 真实用户对战做考题,让每个模型当裁判选出更好的答案,再跟人类的投票对比。结果很不客气:模型们普遍偏爱自己写的答案,平均下来比人类高 70%。

这项研究是怎么做的

研究用的 1460 场对战都是 2026 年 6 月 1 日到 9 月 23 日之间的英文真实对战。裁判阵容一共 12 个模型:OpenAI 的 GPT-6 Astra、GPT-5.6 Sol、GPT-5.6 Luna,Anthropic 的 Fable 5.1、Opus 5,Google 的 Gemini 3.8 Flash,xAI 的 Grok 4.6,以及中国的 GLM 5.3、Kimi K3、MiniMax、DeepSeek V4 Pro、DeepSeek V4 Flash。

为了测得准,研究做了两层隐藏:不告诉裁判哪边是哪个模型写的,也不告诉裁判人类投了谁。每场对战每个裁判看两次,第二次把两个答案的顺序调换,防止位置偏见。计划产出 35040 条裁决,实际拿到 34580 条有效的。

最护短的几个:Astra 选自己 88%

核心发现是自我偏爱。GPT-6 Astra 在有自己参与的对战里,88% 的时间选了自己的答案,只给了对手 2%;而看同一批对战的人类只选了 Astra 的答案 29%、对手 36%。GPT-5.6 Sol 选自己 80%,Fable 5.1 选自己 72%。如果把平局剔掉再看,Astra 选自己高达 97.9%,人类选它只有 42.6%。

平均下来,模型选自己答案的比例是 58%,人类选同一个答案的比例是 34%——这就是标题里"高 70%"的来历。护短程度跟厂商高度相关:OpenAI 的三个模型平均比人类高 42 个百分点,Anthropic 的两个平均高 31 个百分点,Google 的 Gemini 和 xAI 的 Grok 则跟中国模型差不多,基本贴着人类水平。也有反例:MiniMax 反而是个自我批评者,选自己只有 24.3%,人类选它却有 46%。

不光护短,还护"自己人"

偏爱还延伸到了自家兄弟。Astra、Sol、Luna 给其他 OpenAI 模型的打分比人类慷慨 37 个百分点,而其他九个裁判只慷慨 6 个百分点;Fable 和 Opus 互相打分也比人类高 28 个百分点。有意思的是,没有"国籍忠诚":中国裁判对美国答案比人类慷慨 6 个百分点,对其他中国实验室反而更苛刻 6 个百分点。

模型不爱判平局

人类在三分之一的对战里判了平局或"两个都差",但模型们一个比一个果断:Sol 有 96% 的对战都选出了胜者,Luna 94%,Gemini 93%。最接近人类的是 DeepSeek V4 Flash,也还有 71%。

模型之间互相认同,但不认同人类

最值得警惕的一组数字:AI 裁判之间选出同一个胜者的比例是 79.4%,但跟人类选出同一个胜者的比例只有 56.9%。在 393 场所有 AI 裁判全票一致的对战里,人类只认同了 60.6%。Astra、Sol、Luna 是仅有的三个跟人类一致率不到一半的裁判(48.2%、48.7%、49.6%)。也就是说,模型们有自己的一套"口味",它们互相之间很合拍,但这套口味跟人类的偏好并不是一回事。

用 AI 当裁判,要注意什么

研究作者 DawidGalarowicz 在文末给了四条实用建议:不要把作者当成中立评审,它大概率会偏向自己;别以为其他实验室的模型能代表你的用户,它们可以互相认同但依然偏离人类;预期裁判会在人类觉得难分高下时硬选出胜者,要跟踪每个裁判拒绝选择的频率;理想情况下,用真实人类偏好或专家意见来校验裁决结果。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。