TwinCheck:面向有状态工具智能体的证据锚定负孪生验证
事件
智能体执行工具调用时,一个局部看似合理的动作就可能让整条轨迹失败。但仅凭怀疑就干预并不合理,因为替换动作本身也可能引入原本要防范的错误。为此,研究者提出 TwinCheck,一种推理时验证策略:只有当轨迹满足与局部失败假设相关的证据条件时,才考虑替换。
该方法会构造一个锚定于当前轨迹的反事实备选动作,即“负孪生”,仅当该孪生通过结构检查、且成对验证器在两种候选顺序下都更偏好它时,才替换智能体原本的提议。在配对评估中,精确重放会固定智能体已解析的响应与动作,直到第一次被接受的替换发生,从而把干预效果与重新采样区分开来。
在 159 个具有完整精确重放配对的 BFCL V4 多轮任务中,完整策略将 GPT-5.6 Sol 的任务成功率从 45.3% 提升到 58.5%,95% 任务自助法置信区间为 [8.2, 18.8],且未观察到成功转为失败的退化。这一结果把执行边界修复重新定义为受约束的比较,让反事实动作本身成为验证对象,对构建更可靠的工具调用智能体具有参考价值。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*