✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

快模型,慢证据:面向LLM智能体框架的系统1决策模型的配对自审评估

事件

智能体框架在执行任务时需要做大量细小的类型化决策:调用哪个模型、使用哪个工具、检索文本是否相关、输入是否携带注入攻击。系统1决策模型通过单次前向传播输出类别概率来回答这些问题,相比调用大模型有望大幅节省成本与延迟。研究团队对开源模型Laya与托管模型Jev进行了配对评估,覆盖来自18个公开来源构建的11个智能体决策点,包含7283个基础用例和6640个鲁棒性变体,输入逐字节一致,并做了跨硬件、跨日期的可复现性检查。

结果显示,Jev在11个决策点中的9个上显著更准确,领先幅度为10.8到46.0个百分点。两个模型在零样本模型路由任务上都没有超过随机水平,在RAG相关性门控上打成平手。Laya在选项顺序反转时会改变30%的答案,并且在候选数量多或彼此相似时性能急剧下降:在50个最近邻工具的场景下准确率仅31%,而Jev在存在唯一正确工具的条目上达到98%。

研究还审计了自身流程,发现三处分析错误和一处设计混淆曾夸大部署结论:遗漏预筛选成本使报告的23.9%节省实际只有4.3%;把门控准确率当作端到端质量报告(58%对98%);样本内阈值设定为5%目标却在留出集上最高漏掉17%;以及注入误报的“通道效应”在使用通道原生内容后消失。另有两点疑似混淆未改变结论。所有用例、原始输出与分析代码均已公开。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容