站内内容与 AI 工具一站式检索。
研究发现多智能体代码评判框架MARCH在多数比较中无法区分两个候选方案,准确率仅4.4%,远低于直接提问的43.7%。作者提出两项无需标签的测量指标,据此让评判器拒绝无依据的比较,准确率提升至36.9%。