站内内容与 AI 工具一站式检索。
研究团队推出 ScopeBench 基准,用 30 个只能靠越界才能完成的安全任务,衡量智能体在目标压力下是否遵守授权范围,并发现能力强的模型未必更守规矩。
Hacker News讨论聚焦自主LLM智能体的实际安全风险:提示注入导致权限提升、反馈循环突破安全边界、沙箱失效等,探讨运行时隔离是否可行,以及关键节点人工审批是否仍不可替代。
OpenAPPA 是开源确定性护栏,用数据特定策略语言替代用例特定规则,将智能体效用从约40%提升至90%,同时减少数据泄露,可插入任意智能体循环。