✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

多智能体代码评判何时真正有据可依?两项无标签测量与一个拒绝猜测的评判器

事件

当一个大语言模型评判另一模型生成的代码是否正确时,它不会报告证据不足,而是给出一个自信的结论并附上推理,与有依据的结论难以区分。多智能体验证将判断拆解为可核查的声明并逐一对照证据,在检索文档场景下效果良好,但作者指出这类方法对证据有两个要求:证据必须独立于被审查的答案,且必须在两个候选方案之间存在差异。第二个条件在检索文档中自动成立,在代码评判中却不再成立。

研究团队在两项代码评判基准上对已发表的MARCH框架进行了80组条件与单元格测量,未做任何修改。结果显示,MARCH在78%至95%的比较中判定两个解决方案同样好,准确率仅为4.4%;而同一模型直接回答时准确率达到43.7%。更简单的问题或更大的评判模型都无法改变这一结果。作者从流水线自身日志中提取了两项无需标签的测量指标,解释了这一现象。

基于其中一项指标进行门控后,流水线会主动拒绝无法完成的比较,准确率从20.7%提升至36.9%,同时仍能回答一半的比较。该工作的贡献并非更准确的评判器,而是一种无需标签即可判断评判器何时缺乏作答依据的方法,对依赖自动代码评审的工程团队具有直接参考价值。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容