Nemotron 经微调在 IOI 2026 与 IMO 2026 达到金牌水平
One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
从 Nemotron 3 出发,研究团队用监督微调、强化学习与反馈驱动推理做出专项系统,在 IOI 2026 和 IMO 2026 都达到金牌水平。
从 Nemotron 基座出发,用监督微调、强化学习以及生成评估修正循环做专项化,使信息学与数学奥赛系统都越过金牌分数线。
国际信息学奥林匹克竞赛(IOI)和国际数学奥林匹克竞赛(IMO)考查的是不同的能力。IOI 要求算法和代码在严格的时间与提交次数限制下通过隐藏测试。IMO 则要求严谨的自然语言证明。在其中任一竞赛中取得成功都很难。在两者中都取得成功,则指向更广泛的能力。
我们近期的结果表明,Nemotron 是构建世界级专用模型的强大且适应性强的基础。从 Nemotron 3 出发,我们的团队使用监督微调(SFT)、强化学习(RL)和反馈驱动推理,打造出在 IMO 2026 和 IOI 2026 均达到金牌水平的系统。
| 竞赛 | Nemotron 专项化 | 结果 |
|---|---|---|
| IOI 2026 | 采用 SFT 与 GenCorrect 的 Nemotron-3-Ultra-CC | 535.4/600,高于 361.12 的金牌分数线以及 498.27 的人类最高分 |
| IMO 2026 | 在生成—验证—改进系统中使用的 Nemotron 3 Ultra 通用、SFT 和 RL 检查点 | 30/42,高于官方金牌分数线 29 |
IOI 成绩来自一次实时、前瞻性的运行,其时间、互联网访问和提交限制与人类选手相同。这是一项非官方、无监督的基准测试,并未计入官方 IOI 排名。IMO 系统提交的证明由 IMO 官方阅卷人评分。
一套可复用的专项化方案
“易于微调”不应只意味着让检查点可以训练。它应当意味着一个有能力的基础模型能够借助清晰、可复用的方案适配到要求很高的领域。
在这两个项目中,该方案包含四个部分:
- 从强大的 Nemotron 基础模型开始。
- 整理特定领域的题目和高质量的推理轨迹。
- 采用 SFT 等标准后训练方法,并在有用时使用 RL。
- 将专用模型与一个生成、评估并改进候选答案的推理循环相结合。
训练和推理运行的规模很大,但底层方法是熟悉且可复现的。我们无需为每一项挑战都构建新的基础模型。我们针对任务对 Nemotron 进行了专项化。
从通用编程能力到 IOI 金牌
针对竞赛编程,我们整理了 22,000 道题目,并生成合成推理轨迹来训练两个专用模型。Nemotron-3-Nano-CC 的总参数量为 300 亿、激活参数量为 30 亿,同时接受了 SFT 和 RL。Nemotron-3-Ultra-CC 的总参数量为 5500 亿、激活参数量为 550 亿,接受了 SFT。
IOI 2025 上的进展让专项化的价值一目了然。Nano 从后训练前的 130 分提升到 SFT 后的 280 分和 RL 后的 291 分。借助 GenCorrect——我们的迭代式生成—评估—改进策略——它达到 468 分,并越过了 438.3 的金牌分数线。Ultra-CC 采用相同的测试时策略达到了 502 分。
这些实验还表明,适配不必在每个规模上看起来都一样。SFT 带来了 Nano 的大部分提升,RL 则带来了较小但稳定的改进。对于更强的 Ultra 模型,一个 SFT epoch 就足以在 IOI、ICPC 和 LiveCodeBench Pro 上超越经过完整后训练的 Nano 模型。这一发现指导了用于 IOI 2026 的竞赛专用 Ultra-CC 系统,其得分为 600 分中的 535.4 分。
教 Nemotron 证明、检查与修订
IMO 项目将同一思路应用于奥林匹克数学。我们从 Nemotron 3 Ultra 出发,用 SFT 训练了一个专家模型,并用 RL 训练了另一个。
SFT 语料包含 414,890 条经过质量筛选的样本,涵盖 15,818 道互不重复的证明题。它的作用不止于教授最终答案。数据覆盖了证明生成、改进、验证和元验证,因此模型学会了构建论证、发现漏洞、回应批评,并判断证明是否完整。RL 模型则在 9,597 道靠近模型能力前沿的证明题上接受训练。
在开发实验中,两个后训练检查点都优于通用可用模型。SFT 检查点在第一轮搜索中表现最强,而 RL 检查点取得了最佳的单检查点总体结果。二者优势互补,因此最终系统同时使用了这两个专家模型以及通用模型。
针对每道 IMO 题目,模型会生成候选证明、为其评分、提出批评,并改进最有希望的尝试。一个独立的高算力阶段负责选出最终提交。整个系统以自然语言工作,不使用形式化证明器、外部工具或互联网访问。它获得了 42 分中的 30 分,其中包括六道题中四道的满分,并超过了官方金牌分数线。
微调与测试时计算协同发挥作用
我们此前的 IOI 2025 Hugging Face 博文展示了测试时计算如何将开放权重模型推向金牌级表现。新结果补充了重要的一部分:更好的专业化为推理系统带来更好的候选、更好的批评者,以及更好的改进。
在 IOI 中,GenCorrect 将微调带来的收益转化为多轮反馈中更大的提升。在 IMO 中,使用互补的 SFT 与 RL 检查点,比单纯从一个检查点抽取更多样本更有价值。在这两种情况下,最佳结果都来自将一个能力强的专家模型与能够搜索、验证和改进的系统相结合。
这一区别很重要。奖牌并非仅靠微调获得,也并非仅靠暴力采样获得。它们来自对模型、数据和推理循环的协同设计。
Hugging Face 上的开放模型、数据与配方
我们希望这些成果的价值不止于竞赛。Nemotron Labs IMO 2026 合集汇集了 SFT 与 RL 检查点、两套训练数据集,以及 Nemotron-IMO-Bench——一个包含 200 道奥林匹克级别题目的新基准。IMO 论文介绍了训练方法以及生成—验证—改进系统,而 NeMo-Skills 仓库包含 IMO 推理流水线、提示词、提交的证明以及可复现的快速入门。在竞赛编程方面,Nemotron-3-Ultra-CC 模型已在 Hugging Face 上提供,IOI 论文则给出了训练配方和 GenCorrect 方法。IOI 评测与推理流水线也可在 NeMo-Skills 中获取。
IMO 与 IOI 共同为这样一个简单想法提供了异常严苛的证据:Nemotron 可以被微调成世界级领域专家,再与透明的推理工作流组合,从而解决处于人类竞赛前沿的问题。
我们期待看到 Hugging Face 社区接下来会构建出什么。
来源:Hugging Face Blog · huggingface.co


