智能体与工具交互中的静默失败:ToolUniverse 审计研究
事件
一项针对智能体与工具交互的研究对 ToolUniverse 环境中的 15 个科学工具及其 API 与工具文档进行了审计,共发现 91 处经人工验证的失败。这些失败被定义为「静默失败」:工具调用表面上返回成功,但通过 API 或封装层获取的信息或功能部分乃至全部缺失,系统既不通知用户也不通知智能体,导致双方都无从察觉。
研究围绕 7 个失败位点刻画失败在调用链中的发生位置。结果显示,91 处失败中有 51 处出现在 API 层,25 处出现在封装层,其余分布在下游环节。最常见的类型是数据或字段缺失,以及搜索、过滤、排序标准不一致。由于上游失败会随数据流向下游传递,最终可能生成看似有效、实则失真的科学结论,形成静默失败的放大效应。
作者据此提出「上下文可靠性」概念,主张在智能体与工具的交互管线中建立测试、披露、监控与度量机制,让缺失信息显式暴露而非被静默吞掉。对依赖自动化科研流程的研究者和工具开发者而言,这意味着仅看任务成功率并不足够,还需审计工具返回内容的完整性与一致性。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*