✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

TwinCheck:面向有状态工具智能体的证据锚定负孪生验证

事件

智能体执行工具调用时,一个局部看似合理的动作就可能让整条轨迹失败。但仅凭怀疑就干预并不合理,因为替换动作本身也可能引入原本要防范的错误。为此,研究者提出 TwinCheck,一种推理时验证策略:只有当轨迹满足与局部失败假设相关的证据条件时,才考虑替换。

该方法会构造一个锚定于当前轨迹的反事实备选动作,即“负孪生”,仅当该孪生通过结构检查、且成对验证器在两种候选顺序下都更偏好它时,才替换智能体原本的提议。在配对评估中,精确重放会固定智能体已解析的响应与动作,直到第一次被接受的替换发生,从而把干预效果与重新采样区分开来。

在 159 个具有完整精确重放配对的 BFCL V4 多轮任务中,完整策略将 GPT-5.6 Sol 的任务成功率从 45.3% 提升到 58.5%,95% 任务自助法置信区间为 [8.2, 18.8],且未观察到成功转为失败的退化。这一结果把执行边界修复重新定义为受约束的比较,让反事实动作本身成为验证对象,对构建更可靠的工具调用智能体具有参考价值。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容