快模型,慢证据:面向LLM智能体框架的系统1决策模型的配对自审评估
事件
智能体框架在执行任务时需要做大量细小的类型化决策:调用哪个模型、使用哪个工具、检索文本是否相关、输入是否携带注入攻击。系统1决策模型通过单次前向传播输出类别概率来回答这些问题,相比调用大模型有望大幅节省成本与延迟。研究团队对开源模型Laya与托管模型Jev进行了配对评估,覆盖来自18个公开来源构建的11个智能体决策点,包含7283个基础用例和6640个鲁棒性变体,输入逐字节一致,并做了跨硬件、跨日期的可复现性检查。
结果显示,Jev在11个决策点中的9个上显著更准确,领先幅度为10.8到46.0个百分点。两个模型在零样本模型路由任务上都没有超过随机水平,在RAG相关性门控上打成平手。Laya在选项顺序反转时会改变30%的答案,并且在候选数量多或彼此相似时性能急剧下降:在50个最近邻工具的场景下准确率仅31%,而Jev在存在唯一正确工具的条目上达到98%。
研究还审计了自身流程,发现三处分析错误和一处设计混淆曾夸大部署结论:遗漏预筛选成本使报告的23.9%节省实际只有4.3%;把门控准确率当作端到端质量报告(58%对98%);样本内阈值设定为5%目标却在留出集上最高漏掉17%;以及注入误报的“通道效应”在使用通道原生内容后消失。另有两点疑似混淆未改变结论。所有用例、原始输出与分析代码均已公开。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*