研究团队推出 ScopeBench 基准,用 30 个只能靠越界才能完成的安全任务,衡量智能体在目标压力下是否遵守授权范围,并发现能力强的模型未必更守规矩。
OpenAPPA 是开源确定性护栏,用数据特定策略语言替代用例特定规则,将智能体效用从约40%提升至90%,同时减少数据泄露,可插入任意智能体循环。
Hacker News 讨论:若AI能自动完成逆向工程与跨平台移植,代码本身将不再重要,真正关键的是对程序行为的完整规格描述,平台与代码都将变得无关紧要。
一篇立场论文指出,基于语言模型的开放式战略兵棋推演存在决策洗白、裁决不透明、角色崩塌、裁决升级、战略想象力失效五类风险,认为在缺乏可审计安全论证前,不应让此类模型影响规划、条令、政策或危机应对,其当前正确用途是作为压力测试工具。
Hacker News 上出现一篇关于智能体编程的讨论帖,涉及智能体测试流程、大模型基准测试等话题,目前热度较低(3 分、0 条评论),适合关注 AI 编程智能体评测方法的开发者参考。