Mellum2.1 在 2026 年 10 月 8 日由 JetBrains 在官方博客发布并以 Apache 2.0 许可证开源到 Hugging Face。它是 12B 总参数的混合专家模型,每个 token 只激活 2.5B 参数,上下文 131,072 个 token,架构和今年 6 月开源的 Mellum2 完全一样。这一版的全部看点在预训练之后:JetBrains 用一个夏天的大规模强化学习,把一个补全速度很快、却不会在仓库里干活的模型,练成了能自己翻代码、改文件、再跑测试核对的编码智能体。
强化学习从收尾工序变成了主菜
上一版里强化学习只是训练末尾的一小段,这次它成了后训练的主体。JetBrains 新加了数学、竞赛编程、科学、工具调用和软件工程等任务,开源数据先逐条过滤掉测试损坏、答案不可验证、难度失真的问题;软件工程任务直接放在真实仓库环境里练,模型带着 shell 和文件编辑工具做题,测试通过才有奖励。整个训练在数千个环境里跑了数百万次沙箱运行。这套做法的代价是算力和工程投入都不低,小团队很难原样复制。
分数该怎么读:涨幅惊人,对比仍输两项
按 JetBrains 自己的统一评测口径,Mellum2.1 在 SWE-bench Verified 上从上一版的 2.0 分涨到 47.0 分,LiveCodeBench v6 拿到 82.0 分、BFCL v4 拿到 62.3 分,在同组对比里领先 Qwen3.5-9B 和 Gemma 4 E4B。但同一口径下它也输得明确:SWE-bench Verified 仍低于 Qwen3.5-9B 的 50.0 分,Terminal-Bench 2.1 是 17.4 分对 21.7 分,知识类评测差距更大。还有一个口径提醒:各家自己模型卡上的分数和 JetBrains 这次实测的数字并不一致,横向比较只能在同一条流水线里看。自报分数打个折扣后,结论仍然成立的是涨幅方向:真实环境强化学习对仓库级编程的提升,比继续堆预训练更直接。
速度和部署才是它真正的卖点
架构没动,速度就没退步:单张 H200 高负载下,它的吞吐接近 Qwen3.5-9B 的两倍,单请求靠多 token 预测快约 1.6 倍,配套的推理加速组件还在路上。它适合的是明确的一类活:在自己的机器上跑一个便宜、够快、能干具体编程子任务的工人模型,代码和数据不出内网。不适合的也很清楚:需要最强复杂仓库任务成功率、或广泛知识问答的场景,它还不是首选。vLLM 和 SGLang 都能直接部署,想试的人先拿自己仓库的真实工单测,别先看榜单。