跳到正文
原文
Hugging Face Blog·· 2 小时前精选AI 评分73

NVIDIA 发布 Nemotron 在 IOI 和 IMO 获金牌级结果的微调研究

One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO

AI 导读

NVIDIA 团队通过监督微调(SFT)、强化学习(RL)及反馈驱动推理,使 Nemotron 3 系列模型在 2026 年国际信息学奥林匹克(IOI)和国际数学奥林匹克(IMO)中均达到金牌水平。

推荐理由

原文公开了将 Nemotron 微调至竞赛金牌水平的完整配方,包括 SFT、RL 及推理闭环细节,为领域专家模型构建提供可复现路径。

来源:Hugging Face Blog · huggingface.co