AREX-2:通过长程反思任务推进自我改进智能体
事件
研究团队发布 AREX-2,目标是提升大模型智能体的自我改进能力,即在测试阶段反复迭代、把答案越改越好。团队认为这种能力由两部分构成:反思,能产出比当前更好的解;长程执行,能让迭代在多轮之后依然有效。他们假设这两项能力与具体领域无关,因此可以在便于监督的场景中学习。
为此,团队从机器学习和算法编程两类任务中合成大量长程改进轨迹,这两类任务都能提供可验证的反馈,并奖励持续迭代。基于 Qwen3.8-27B 训练的智能体在 MLE-bench Lite 上取得 81.8 分,在 Frontier-CS 上取得 70.7 分;迁移到深度研究任务后,BrowseComp 得 84.0 分、HLE 得 52.6 分、GAIA 得 92.2 分、DeepSearchQA 得 93.8 分,并且随着允许的迭代轮数增加,成绩仍在继续上升。
这一结果说明,长程反思数据是通往自我改进智能体的一条有效路径。值得关注的是,该能力表现出跨领域迁移性,意味着在可验证任务上训练出的迭代反思习惯,可能被复用到缺乏明确奖励信号的开放研究场景中,为智能体在复杂任务上持续自我提升提供了可复制的训练范式。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*