✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

AREX-2:通过长程反思任务推进自我改进智能体

事件

研究团队发布 AREX-2,目标是提升大模型智能体的自我改进能力,即在测试阶段反复迭代、把答案越改越好。团队认为这种能力由两部分构成:反思,能产出比当前更好的解;长程执行,能让迭代在多轮之后依然有效。他们假设这两项能力与具体领域无关,因此可以在便于监督的场景中学习。

为此,团队从机器学习和算法编程两类任务中合成大量长程改进轨迹,这两类任务都能提供可验证的反馈,并奖励持续迭代。基于 Qwen3.8-27B 训练的智能体在 MLE-bench Lite 上取得 81.8 分,在 Frontier-CS 上取得 70.7 分;迁移到深度研究任务后,BrowseComp 得 84.0 分、HLE 得 52.6 分、GAIA 得 92.2 分、DeepSearchQA 得 93.8 分,并且随着允许的迭代轮数增加,成绩仍在继续上升。

这一结果说明,长程反思数据是通往自我改进智能体的一条有效路径。值得关注的是,该能力表现出跨领域迁移性,意味着在可验证任务上训练出的迭代反思习惯,可能被复用到缺乏明确奖励信号的开放研究场景中,为智能体在复杂任务上持续自我提升提供了可复制的训练范式。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容