AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

英伟达开源 IMO 金牌配方:不仅是「人海战术」,1.5TB 显存做实 AI「推恩令」?

事件

用三套 checkpoint 完成多轮证明搜索,用过程透明平息学术怒火,用 1.5TB 显存门槛锁定算力霸权。名为代码平权,实则算力集权。 作者丨 郑佳美 编辑丨岑 峰 9 月 9 日,NVIDIA 公布了 Nemotron 3 Ultra 在 2026 年 IMO 上使用的整套数学推理系统。 这套系统最终拿到 30/42 分,超过当届 29 分的金牌线。整个比赛过程中,模型只用自然语言写证明,没有调用 Lean 等形式化证明器,也没有借助外部工具或联网检索。 但这次发布的重点不只是成绩。NVIDIA 还把支撑这 30 分的两个数学专家 checkpoint、SFT 与 RL 训练数据、推理代码、训练配方、比赛提交证明,以及 200 道新的 Nemotron-IMO-Bench 一起开放了出来。 换句话说,这次公开的是一整套从训练到比赛推理的系统,而不是单独放出一个更强的数学模型。Nemotron 3 Ultra 只是底座,后面两个专家模型、大规模证明搜索、模型验证和多轮改写,共同组成了把成绩推到 IMO 金牌线的完整链路。 两天后的 9 月 11 日,陶哲轩、Peter Scholze、Maryna Viazovska 等 25 位菲尔兹奖得主联合发声,批评 AI 数学成果发布越来越快,而证明检查、方法梳理和复现往往没有足够时间展开。 放在这样的背景里,NVIDIA 这次开源比较少见的一点,是把一个 IMO 金牌级结果背后的模型、数据、推理流程和计算成本都留了下来。 而这套系统的技术起点,是 NVIDIA 没有继续对同一个 Nemotron 3 Ultra 反复采样,而是先训练了两个行为明显不同的数学专家。 01 两个专家 checkpoint Nemotron 里面一个比较核心的设计,是让后训练直接服务于后面的搜索。 SFT 数据里除了完整证明,还加入了大量证明修改、验证和再次验证的轨迹。这样训练出来的模型,学到的不只是从题目生成证明,还包括拿到一份已经写了一半、甚至局部存在错误的证明以后,怎样判断哪里出了问题,再沿着原来的路线继续修。雷峰网 放进搜索系统以后,这种能力会直接影响计算资源的利用方式。高难数学题很少只有会做和不会做两种状态,大量候选其实处在中间区域,主体结构已经接近可用,只在某个引理、边界条件或者推导闭环上出了问题。 一个只会重新作答的模型,每次失败后都要重新进入整个证明空间;接受过修改训练的模型,则可以把已有证明当成中间状态继续推进,相当于保留前一次计算里已经找到的有效结构。 RL 专家处理的是另一层问题:怎样改变这些证明路线被抽中的概率。IMO 级题目的证明空间非常稀疏。模型可能已经具备解决某类问题所需的局部能力,但正确组合只占生成分布里很小的一部分。 继续增加采样当然可能碰到这条路线,但如果大多数样本仍集中在相似区域,算力增加以后,实际覆盖范围扩大得并不会太快。雷峰网 强化学习在这里做的,是根据成功和失败轨迹重新调整生成分布。那些能够把证明完整闭合的思路获得更高权重,反复把模型带进死路的选择被压低。它并没有凭空增加新的数学知识,而是在重新安排模型已有能力出现的频率。 于是通用版、SFT 和 RL 三份 checkpoint 形成了三种不同的解题偏好。这个差异对后面的搜索很重要,因为搜索效果取决于有效样本量,而不只是表面上生成了多少份答案。 如果同一个模型连续生成 200 份证明,其中大部分围绕同几种构造打转,那么 200 份文本并不等于 200 条互相独立的路线。候选之间相关性越高,新增计算提供的新信息越少。加入经过不同后

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:雷锋网*

📎 原始来源:雷锋网
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容