2026 年 9 月 23 日,通义千问官方 X 账号宣布:9 月 20 日刚开源的 Qwen-Image-2.1,在 LMArena 的图像编辑(Image Edit Arena)和文生图(Text-to-Image Arena)两个榜单上,双双拿下开源模型第一。其中图像编辑榜 Elo 1367,总榜排名第 16,距离第 15 名的 GPT-Image-1.5-high-fidelity 只差 3 分。发布三天就登顶第三方人类投票榜,这是今年开源图像模型少见的开局。
1367 分:开源第一是什么概念
先说清这个榜的规则。LMArena 采用盲测投票:同一个提示词发给两个匿名模型,人投票选更好的输出,Elo 分数从投票结果里算出来。它不是实验室跑分,而是真实用户偏好的直接体现。
1367 分、总榜第 16 是什么水平?意味着它前面只有 15 个闭源商业模型,最近的一个 GPT-Image-1.5-high-fidelity 只领先 3 分,差距极小。而在开源阵营里,它是两个榜单的双料第一。对于 9 月 20 日才开源的模型,这个爬升速度说明早期体验者的投票相当集中。当然也要看到另一面:LMArena 的分数随投票样本波动,新模型的分数通常需要几周才能稳定,现在下"坐稳第一"的结论还太早。
2.1 这一版到底改了什么
根据 Qwen 团队 9 月 20 日的官方博客《Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation》,这一版有四个关键变化。第一,统一:文生图和图像编辑做进同一个模型,不用来回切换。第二,原生透明:直接生成带真实 Alpha 通道的 RGBA 图像,做电商产品图、贴纸这类需求不用再抠图。第三,参考图编辑:最多支持 10 张参考图,支持圈选、涂抹、蒙版三种局部编辑方式,人像保真和产品真实感是重点优化方向。第四,小而精:视觉生成部分只有 7B 参数,原生输出 2K 分辨率(2048×2048),参数量不大,对本地部署更友好。
Qwen 官方还公布了自有评测 Qwen-Image-Bench:2.1 以 60.28 分排第一,Nano Banana 2.0 是 59.82 分。但要注意,这是 Qwen 自己做的榜单,0.46 分的差距约 0.8%,可信度要打个问号。独立评测 GenAI Showdown 给它打了 7/15,比 1.0 代的 4/15 有进步,但样本还很少。
"开源第一"的两个限定条件
第一个限定是许可。Qwen-Image-2.1 采用研究许可(research licence),权重免费下载,但商业使用受限——你不能直接拿它生成的图去卖钱。想商用的团队,这个"第一"暂时用不上。
第二个限定是榜单本身。LMArena 测的是"人类更喜欢哪张图",不测提示词遵循精度、文字渲染准确率这些硬指标,也不测 API 稳定性、推理成本。不同榜单、不同投票人群,结论本就不同:在 Artificial Analysis 的图像编辑榜上,排第一的是微软的 MAI-Image-2.5-Pro(约 6100 票,Elo 1272)。Qwen-Image-2.1 真正要证明的,是在更多独立评测里复现这个位置。
对普通用户的意义更直接:想要一个免费、可本地部署、编辑能力强的图像模型,现在多了一个有第三方背书的选项。官方已邀请用户去 Arena 实测投票——榜单位置能不能守住,接下来几周见分晓。
Q:在哪里能体验 Qwen-Image-2.1?
A:模型已在 GitHub、Hugging Face 和 ModelScope 开源,可本地部署;也可以去 LMArena 参与盲测投票,亲手验证它的排名是否名副其实。
Q:开源第一等于综合最强吗?
A:不等于。它是 LMArena 两个榜单人类投票中的开源第一,前面还有 15 个闭源模型;且许可是研究许可,商业使用受限。综合最强要看更多维度的独立评测。
Q:和 Nano Banana 2.0 比谁更强?
A:目前没有公开的大规模独立直接对决数据。Qwen 自有榜单上 2.1 以 0.46 分微弱领先,但那是厂商自测,仅供参考。