预测智能体何时该推理?可靠性路由的行为压力测试
事件
在 ForecastBench 风格的二元预测任务上,一项研究把「检索、推理、采用市场先验、使用历史类比」当作可观测的智能体行为来考察,而非隐藏的实现细节。核心发现是机制选择依赖数据来源:对某些数据生成过程,结构化历史类比占优;对另一些,市场/群体式先验和保守基线更可靠。
为此研究者提出 ReliabilityRoute,一种结构性干预方法,依据历史覆盖率、市场先验可用性、来源先验锐度、证据强度、证据分歧和时间跨度等可靠性特征来引导预测智能体的行为。一个用 2024 年数据拟合的固定规则,无需硬编码来源名称即可接近人工分类的效果;而一个前向自调整规则会从已结算的历史批次中重新拟合阈值,在 16 个后续 LLM 版本上取得确定性系统中最优的平均 Brier 分数。
值得注意的是,增益幅度有限,历史与搜索基线依然极具竞争力。该研究的主要贡献是一个行为压力测试:更多推理并不总是更好,预测智能体应先估计哪类证据来源值得主导,路由策略本身也应在可审计约束下自适应调整。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*