AI导航

Nemotron 微调拿下 IOI 与 IMO 双料金牌:编程赛超人类冠军,数学赛过金牌线

AI资讯
3 min read
1 次阅读

Nemotron 在 2026 年 10 月 7 日由 NVIDIA 团队通过 Hugging Face 博客正式汇总了两项奥赛成绩:同一模型家族经过微调后,在国际信息学奥林匹克(IOI)2026 和国际数学奥林匹克(IMO)2026 都达到了金牌水平。这不是换了个新基础模型刷榜,团队想证明的是另一件事:一个足够强的通用模型,配上针对性的后训练和推理流程,可以被改造成不同领域的顶尖专家。两项成绩的细节如下。

赛事 系统构成 成绩 对照线
IOI 2026 Nemotron-3-Ultra-CC 微调加 GenCorrect 推理策略 535.4 / 600 金牌线 361.12,人类最高分 498.27
IMO 2026 通用、SFT、RL 三个检查点组成生成—核验—修正系统 30 / 42 官方金牌线 29

两块金牌的含金量要分开看

IOI 这次是在与人类选手相同的时间、联网和提交限制下做的一次实时前瞻测试,535.4 分不仅越过金牌线,还高于人类最高分;但团队也明确说明,这是一次非官方、无监督的基准运行,不计入 IOI 官方排名。IMO 的流程则更接近正式参赛:系统为每道题生成候选证明、打分、提出批评再修正,最后由高算力阶段挑选提交稿,全程只用自然语言,不用形式化证明工具、不联网、不调用外部工具,六道题里四道拿到满分,30 分的成绩由 IMO 官方阅卷人评出。读这类消息时,把这两条边界分清,才不会把宣传口径当成赛事纪录。

配方里真正起作用的不是堆采样

团队把方法拆成四步:选一个强基础模型,准备领域问题和高质量推理轨迹,用监督微调和强化学习做后训练,再配上能生成、评估、改进答案的推理循环。以小一号的 Nano 模型为例,它在 IOI 2025 题目上从微调前的 130 分涨到微调后 280 分,强化学习再推到 291 分,叠加 GenCorrect 的多轮反馈修正后达到 468 分、越过当年金牌线。IMO 系统里,SFT 检查点首轮最强、RL 检查点单模型最好,两者与通用模型组合使用,效果好过只对单个模型反复采样。结论很朴素:金牌来自模型、数据和推理流程的共同设计,不是某一招的功劳。

哪些东西已经开源出来

这次汇总同时把可复用的材料摆上了 Hugging Face:IMO 方向公开了 SFT 与 RL 两个检查点、两份训练数据和一个包含 200 道新题的 Nemotron-IMO-Bench,推理流水线、提示词和实际提交的证明放在 NeMo-Skills 仓库里;IOI 方向的 Ultra-CC 模型和 GenCorrect 方法说明也可以直接取用。对想做领域微调的团队来说,这套从数据、训练到推理的完整配方,比金牌本身更值得花时间研究。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。