该论文探索零样本LLM智能体管理长周期物理任务的可行性,设计融合规划、工具调用、观察与验证的多智能体框架,在农业任务中与强化学习智能体对比。结果显示,同天气下LLM智能体管理效果相当,环境变化时自适应能力更强。
英伟达开源 Nemotron 3 Ultra 的 IMO 数学推理系统,含两个数学专家 checkpoint、训练数据、推理代码与 200 道新基准,以 30/42 分超金牌线,但 1.5TB 显存门槛引发算力集权争议。
该论文提出广义智能体迭代(GAI)形式化框架,将迭代策略改进与递归自我改进(RSI)统一为同一学习范式的两种情形,通过两个关键维度区分GPI与RSI,并据此定位现有系统、分析RSI缺陷,为自主进化智能的研究与设计提供理论基础。