该论文探索零样本LLM智能体管理长周期物理任务的可行性,设计融合规划、工具调用、观察与验证的多智能体框架,在农业任务中与强化学习智能体对比。结果显示,同天气下LLM智能体管理效果相当,环境变化时自适应能力更强。
HN 用户提出为学习场景设计专用 harness:与追求任务自动完成的现有 agent 相反,学习 harness 应记忆学习者理解状态、提供提示、调用题目/模拟/评估工具,并在结束时评估掌握度,而非直接给出答案。作者认为现有 AI 导师多为 LLM+提示词,harness 才是正确形态,并询问除 K12 外是否有人感兴趣。