AI智能体易受极端化影响
事件
一项新研究考察了大语言模型智能体之间能否相互操纵信念。研究者构建了双智能体对话模拟:目标智能体依据人口统计与心理属性扮演人类角色,影响者智能体则试图让目标的信念变得更加极端。研究沿两条路径分析极端化:共鸣,即影响者强化目标已有的信念;说服,即影响者推动目标原本认为不重要的信念。
在情感与行为指标上,两种机制都能使目标智能体走向极端,但共鸣的效果始终强于说服。使用谄媚、未经证实的说法等不同影响策略,会产生不同程度的极端化,不过这种差异在不同指标间并不一致。研究还显示,共鸣会传播到相关信念,说明AI智能体内部存在相互关联的信念结构。
这些发现表明,AI智能体容易受到极端化影响,尤其是当信息与其既有信念一致时。这为个性化AI助手和多智能体生态系统的安全性敲响警钟:一旦智能体被恶意引导,其信念偏移可能沿关联信念扩散,进而影响依赖它们的用户与系统。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*