✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

从提案到验证效果:Praxa——面向受治理AI智能体执行的证据约束框架

事件

大语言模型智能体能够提出并执行动作,但提案、授权、调度、经核实的外部效果与服务上线是彼此不同的主张。研究者提出Praxa,一个智能体执行框架,通过确定性准入、代理执行、外部回读、对账与审核式上线,把这些状态显式表示出来,并报告了四条证据线。

第一,作者在固定版本上进行的仓库本地审计通过了1027/1027项单元测试和89/89项Workerd测试,对全部363个预期源文件完成插桩并满足四项覆盖率下限,但原始逐测试记录与独立复现不可得。第二,在供应商支持的Terminal-Bench Core 0.1.1试点中,12个精选任务上基线与可靠性层各通过17/36次严格试验,可靠性层多消耗37.49%输入与50.73%输出token,因此该试点不支持其更优。第三,在调试后的两阶协调代理开发对比中,基线与候选各完成180/180次试验,测得准确率相同,均实现完全隔离的崩溃恢复且零受保护违规;候选少用37.11%token、估算端点成本低33.84%、步骤少11.63%,但这并不证明质量、延迟或生产行为更优。第四,部署的源码与配置证据显示有界反思、召回核算、记忆编译与工具健康路径,但无生产结果提升。

Praxa可支持的贡献是一套证据约束架构,使从授权到效果的转换变得显式且可测试。当前证据尚不能确立对抗性安全、生产安全、通用专家优越性、自主递归优化或用户收益。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容