✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

预测智能体何时该推理?可靠性路由的行为压力测试

事件

在 ForecastBench 风格的二元预测任务上,一项研究把「检索、推理、采用市场先验、使用历史类比」当作可观测的智能体行为来考察,而非隐藏的实现细节。核心发现是机制选择依赖数据来源:对某些数据生成过程,结构化历史类比占优;对另一些,市场/群体式先验和保守基线更可靠。

为此研究者提出 ReliabilityRoute,一种结构性干预方法,依据历史覆盖率、市场先验可用性、来源先验锐度、证据强度、证据分歧和时间跨度等可靠性特征来引导预测智能体的行为。一个用 2024 年数据拟合的固定规则,无需硬编码来源名称即可接近人工分类的效果;而一个前向自调整规则会从已结算的历史批次中重新拟合阈值,在 16 个后续 LLM 版本上取得确定性系统中最优的平均 Brier 分数。

值得注意的是,增益幅度有限,历史与搜索基线依然极具竞争力。该研究的主要贡献是一个行为压力测试:更多推理并不总是更好,预测智能体应先估计哪类证据来源值得主导,路由策略本身也应在可审计约束下自适应调整。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容