AI导航

Qwen-Image-2.1 登顶 LMArena 开源图像榜:编辑与文生图双第一,Elo 1367

AI资讯
3 min read
0 次阅读

2026 年 9 月 23 日,通义千问官方 X 账号宣布:9 月 20 日刚开源的 Qwen-Image-2.1,在 LMArena 的图像编辑(Image Edit Arena)和文生图(Text-to-Image Arena)两个榜单上,双双拿下开源模型第一。其中图像编辑榜 Elo 1367,总榜排名第 16,距离第 15 名的 GPT-Image-1.5-high-fidelity 只差 3 分。发布三天就登顶第三方人类投票榜,这是今年开源图像模型少见的开局。

1367 分:开源第一是什么概念

先说清这个榜的规则。LMArena 采用盲测投票:同一个提示词发给两个匿名模型,人投票选更好的输出,Elo 分数从投票结果里算出来。它不是实验室跑分,而是真实用户偏好的直接体现。

1367 分、总榜第 16 是什么水平?意味着它前面只有 15 个闭源商业模型,最近的一个 GPT-Image-1.5-high-fidelity 只领先 3 分,差距极小。而在开源阵营里,它是两个榜单的双料第一。对于 9 月 20 日才开源的模型,这个爬升速度说明早期体验者的投票相当集中。当然也要看到另一面:LMArena 的分数随投票样本波动,新模型的分数通常需要几周才能稳定,现在下"坐稳第一"的结论还太早。

2.1 这一版到底改了什么

根据 Qwen 团队 9 月 20 日的官方博客《Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation》,这一版有四个关键变化。第一,统一:文生图和图像编辑做进同一个模型,不用来回切换。第二,原生透明:直接生成带真实 Alpha 通道的 RGBA 图像,做电商产品图、贴纸这类需求不用再抠图。第三,参考图编辑:最多支持 10 张参考图,支持圈选、涂抹、蒙版三种局部编辑方式,人像保真和产品真实感是重点优化方向。第四,小而精:视觉生成部分只有 7B 参数,原生输出 2K 分辨率(2048×2048),参数量不大,对本地部署更友好。

Qwen 官方还公布了自有评测 Qwen-Image-Bench:2.1 以 60.28 分排第一,Nano Banana 2.0 是 59.82 分。但要注意,这是 Qwen 自己做的榜单,0.46 分的差距约 0.8%,可信度要打个问号。独立评测 GenAI Showdown 给它打了 7/15,比 1.0 代的 4/15 有进步,但样本还很少。

"开源第一"的两个限定条件

第一个限定是许可。Qwen-Image-2.1 采用研究许可(research licence),权重免费下载,但商业使用受限——你不能直接拿它生成的图去卖钱。想商用的团队,这个"第一"暂时用不上。

第二个限定是榜单本身。LMArena 测的是"人类更喜欢哪张图",不测提示词遵循精度、文字渲染准确率这些硬指标,也不测 API 稳定性、推理成本。不同榜单、不同投票人群,结论本就不同:在 Artificial Analysis 的图像编辑榜上,排第一的是微软的 MAI-Image-2.5-Pro(约 6100 票,Elo 1272)。Qwen-Image-2.1 真正要证明的,是在更多独立评测里复现这个位置。

对普通用户的意义更直接:想要一个免费、可本地部署、编辑能力强的图像模型,现在多了一个有第三方背书的选项。官方已邀请用户去 Arena 实测投票——榜单位置能不能守住,接下来几周见分晓。

Q:在哪里能体验 Qwen-Image-2.1?

A:模型已在 GitHub、Hugging Face 和 ModelScope 开源,可本地部署;也可以去 LMArena 参与盲测投票,亲手验证它的排名是否名副其实。

Q:开源第一等于综合最强吗?

A:不等于。它是 LMArena 两个榜单人类投票中的开源第一,前面还有 15 个闭源模型;且许可是研究许可,商业使用受限。综合最强要看更多维度的独立评测。

Q:和 Nano Banana 2.0 比谁更强?

A:目前没有公开的大规模独立直接对决数据。Qwen 自有榜单上 2.1 以 0.46 分微弱领先,但那是厂商自测,仅供参考。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。