保持CALM:分析文本到图像生成中全局不安全性的局限
事件
文本到图像生成模型的免训练安全防护通常依赖一个可复用的安全信号,例如一个不安全方向或全局有害子空间,并将其广泛施加于所有提示。一项新研究对这种“全局不安全”假设进行了受控的几何分析,发现其中存在一致的覆盖度与选择性权衡:紧凑的不安全子空间无法覆盖多样化的不安全语义,而更宽泛的聚合则会越来越多地扭曲与安全相邻的良性提示。
针对这一问题,研究者提出CALM(反事实自适应局部调制),一种免训练的安全防护方法。它用提示局部的反事实校正取代统一的全局移除:借助匹配的不安全与良性锚点,CALM将每个提示路由到活跃的不安全类别,仅对违规的token表示进行最小化编辑,使其向安全一侧偏移,并抑制正向对齐的不安全残差成分。
在广泛评估中,CALM显著提升了对不安全内容的抑制效果,同时保留了良性提示的实用价值。该结果表明,局部反事实校正为全局不安全信号移除提供了一种更具选择性的替代方案,对文本到图像生成的安全部署具有参考意义。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*