✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

智能体与工具交互中的静默失败:ToolUniverse 审计研究

事件

一项针对智能体与工具交互的研究对 ToolUniverse 环境中的 15 个科学工具及其 API 与工具文档进行了审计,共发现 91 处经人工验证的失败。这些失败被定义为「静默失败」:工具调用表面上返回成功,但通过 API 或封装层获取的信息或功能部分乃至全部缺失,系统既不通知用户也不通知智能体,导致双方都无从察觉。

研究围绕 7 个失败位点刻画失败在调用链中的发生位置。结果显示,91 处失败中有 51 处出现在 API 层,25 处出现在封装层,其余分布在下游环节。最常见的类型是数据或字段缺失,以及搜索、过滤、排序标准不一致。由于上游失败会随数据流向下游传递,最终可能生成看似有效、实则失真的科学结论,形成静默失败的放大效应。

作者据此提出「上下文可靠性」概念,主张在智能体与工具的交互管线中建立测试、披露、监控与度量机制,让缺失信息显式暴露而非被静默吞掉。对依赖自动化科研流程的研究者和工具开发者而言,这意味着仅看任务成功率并不足够,还需审计工具返回内容的完整性与一致性。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容