✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

AI智能体易受极端化影响

事件

一项新研究考察了大语言模型智能体之间能否相互操纵信念。研究者构建了双智能体对话模拟:目标智能体依据人口统计与心理属性扮演人类角色,影响者智能体则试图让目标的信念变得更加极端。研究沿两条路径分析极端化:共鸣,即影响者强化目标已有的信念;说服,即影响者推动目标原本认为不重要的信念。

在情感与行为指标上,两种机制都能使目标智能体走向极端,但共鸣的效果始终强于说服。使用谄媚、未经证实的说法等不同影响策略,会产生不同程度的极端化,不过这种差异在不同指标间并不一致。研究还显示,共鸣会传播到相关信念,说明AI智能体内部存在相互关联的信念结构。

这些发现表明,AI智能体容易受到极端化影响,尤其是当信息与其既有信念一致时。这为个性化AI助手和多智能体生态系统的安全性敲响警钟:一旦智能体被恶意引导,其信念偏移可能沿关联信念扩散,进而影响依赖它们的用户与系统。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容