从提案到验证效果:Praxa——面向受治理AI智能体执行的证据约束框架
事件
大语言模型智能体能够提出并执行动作,但提案、授权、调度、经核实的外部效果与服务上线是彼此不同的主张。研究者提出Praxa,一个智能体执行框架,通过确定性准入、代理执行、外部回读、对账与审核式上线,把这些状态显式表示出来,并报告了四条证据线。
第一,作者在固定版本上进行的仓库本地审计通过了1027/1027项单元测试和89/89项Workerd测试,对全部363个预期源文件完成插桩并满足四项覆盖率下限,但原始逐测试记录与独立复现不可得。第二,在供应商支持的Terminal-Bench Core 0.1.1试点中,12个精选任务上基线与可靠性层各通过17/36次严格试验,可靠性层多消耗37.49%输入与50.73%输出token,因此该试点不支持其更优。第三,在调试后的两阶协调代理开发对比中,基线与候选各完成180/180次试验,测得准确率相同,均实现完全隔离的崩溃恢复且零受保护违规;候选少用37.11%token、估算端点成本低33.84%、步骤少11.63%,但这并不证明质量、延迟或生产行为更优。第四,部署的源码与配置证据显示有界反思、召回核算、记忆编译与工具健康路径,但无生产结果提升。
Praxa可支持的贡献是一套证据约束架构,使从授权到效果的转换变得显式且可测试。当前证据尚不能确立对抗性安全、生产安全、通用专家优越性、自主递归优化或用户收益。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*