AI导航

Mellum2.1 开源发布:架构没变,JetBrains 靠强化学习练出仓库级编程能力

AI资讯
2 min read
2 次阅读

Mellum2.1 在 2026 年 10 月 8 日由 JetBrains 在官方博客发布并以 Apache 2.0 许可证开源到 Hugging Face。它是 12B 总参数的混合专家模型,每个 token 只激活 2.5B 参数,上下文 131,072 个 token,架构和今年 6 月开源的 Mellum2 完全一样。这一版的全部看点在预训练之后:JetBrains 用一个夏天的大规模强化学习,把一个补全速度很快、却不会在仓库里干活的模型,练成了能自己翻代码、改文件、再跑测试核对的编码智能体。

强化学习从收尾工序变成了主菜

上一版里强化学习只是训练末尾的一小段,这次它成了后训练的主体。JetBrains 新加了数学、竞赛编程、科学、工具调用和软件工程等任务,开源数据先逐条过滤掉测试损坏、答案不可验证、难度失真的问题;软件工程任务直接放在真实仓库环境里练,模型带着 shell 和文件编辑工具做题,测试通过才有奖励。整个训练在数千个环境里跑了数百万次沙箱运行。这套做法的代价是算力和工程投入都不低,小团队很难原样复制。

分数该怎么读:涨幅惊人,对比仍输两项

按 JetBrains 自己的统一评测口径,Mellum2.1 在 SWE-bench Verified 上从上一版的 2.0 分涨到 47.0 分,LiveCodeBench v6 拿到 82.0 分、BFCL v4 拿到 62.3 分,在同组对比里领先 Qwen3.5-9B 和 Gemma 4 E4B。但同一口径下它也输得明确:SWE-bench Verified 仍低于 Qwen3.5-9B 的 50.0 分,Terminal-Bench 2.1 是 17.4 分对 21.7 分,知识类评测差距更大。还有一个口径提醒:各家自己模型卡上的分数和 JetBrains 这次实测的数字并不一致,横向比较只能在同一条流水线里看。自报分数打个折扣后,结论仍然成立的是涨幅方向:真实环境强化学习对仓库级编程的提升,比继续堆预训练更直接。

速度和部署才是它真正的卖点

架构没动,速度就没退步:单张 H200 高负载下,它的吞吐接近 Qwen3.5-9B 的两倍,单请求靠多 token 预测快约 1.6 倍,配套的推理加速组件还在路上。它适合的是明确的一类活:在自己的机器上跑一个便宜、够快、能干具体编程子任务的工人模型,代码和数据不出内网。不适合的也很清楚:需要最强复杂仓库任务成功率、或广泛知识问答的场景,它还不是首选。vLLM 和 SGLang 都能直接部署,想试的人先拿自己仓库的真实工单测,别先看榜单。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。