Harness 即语言:极简智能体框架 JAZ 实现最大表达力
事件
现代语言模型智能体通常围绕「智能体循环」构建:LLM 处于暴露一组工具的环境中,通过交替调用工具与观察输出掌控整个工作流。但记忆系统、自我改进系统等特定工作流往往需要在此之外额外工程。为此,研究者构建了 LLM 智能体框架 JAZ,探索一个几乎只包含智能体循环本身的极简 harness 能在多大程度上完成这些专用系统的任务。
JAZ 只暴露一个基于 LLM 的原语 invoke,并提供一组内置钩子,让程序员施加约束与监控。invoke 是对现有代码模式智能体循环的推广,满足两个定义性质:LLM 可编写任意可执行代码,其中可包含递归 invoke;LLM 可见的一切——invoke 的全部输入及其与代码环境的交互历史——都是代码环境中的变量。研究者从第一性原理出发,把 invoke 视为一种语言原语,代表一个每次调用时由 LLM 在运行时提供实现的函数。
为验证核心原语设计,研究者在传统上依赖专用外部 harness 的工作流上评估 invoke,仅使用提示,不手工设计工具、harness 或外部系统(如记忆、文件系统)。在需要超出上下文窗口回忆的长程工作流中,JAZ invoke 在 StuLife 的回忆密集部分比 Letta(MemGPT)高 8%,成本仅为其一半;在持续自我改进任务上,JAZ invoke 在 AppWorld 上比 ACE 高 4%,成本更低。这表明极简 harness 在表达力上可能优于复杂专用系统,值得关注其对智能体架构设计思路的影响。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*