多智能体代码评判何时真正有据可依?两项无标签测量与一个拒绝猜测的评判器
事件
当一个大语言模型评判另一模型生成的代码是否正确时,它不会报告证据不足,而是给出一个自信的结论并附上推理,与有依据的结论难以区分。多智能体验证将判断拆解为可核查的声明并逐一对照证据,在检索文档场景下效果良好,但作者指出这类方法对证据有两个要求:证据必须独立于被审查的答案,且必须在两个候选方案之间存在差异。第二个条件在检索文档中自动成立,在代码评判中却不再成立。
研究团队在两项代码评判基准上对已发表的MARCH框架进行了80组条件与单元格测量,未做任何修改。结果显示,MARCH在78%至95%的比较中判定两个解决方案同样好,准确率仅为4.4%;而同一模型直接回答时准确率达到43.7%。更简单的问题或更大的评判模型都无法改变这一结果。作者从流水线自身日志中提取了两项无需标签的测量指标,解释了这一现象。
基于其中一项指标进行门控后,流水线会主动拒绝无法完成的比较,准确率从20.7%提升至36.9%,同时仍能回答一半的比较。该工作的贡献并非更准确的评判器,而是一种无需标签即可判断评判器何时缺乏作答依据的方法,对依赖自动代码评审的工程团队具有直接参考价值。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*