Show HN: OpenAPPA——开源确定性护栏,不破坏智能体
事件
开发者在构建企业级智能体时发现,连接的工具越多,AI 越容易失控并泄露敏感数据。现有护栏方案存在明显缺陷:非确定性护栏(如 LLM 作为裁判)易受提示注入攻击,且因缺乏数据知识而效率低下,基准测试中数据泄露率约 10%;确定性护栏(如 Cedar、OPA、FIDES、Dogwood)则需要大量针对具体用例的 IF-ELSE 式策略,导致智能体效用损失约 59%。为此,团队推出开源项目 OpenAPPA。
OpenAPPA 的核心创新是采用数据特定而非用例特定的策略语言,让智能体在无需更新策略的情况下扩展。同时引入补救计划和 DualLLM 模式等技巧,帮助智能体在限制内运行,将效用从约 40% 提升至约 90%,成为首个不破坏智能体的确定性护栏。它设计为可插拔,通过工具调用前后的钩子接入任意智能体循环。
该项目已发布基准测试、Claude Code 集成示例和学术论文,并邀请开发者试用和反馈。对于需要安全部署企业智能体的团队,OpenAPPA 提供了一种兼顾安全与效用的新选择。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:Hacker News*