一篇立场论文指出,基于语言模型的开放式战略兵棋推演存在决策洗白、裁决不透明、角色崩塌、裁决升级、战略想象力失效五类风险,认为在缺乏可审计安全论证前,不应让此类模型影响规划、条令、政策或危机应对,其当前正确用途是作为压力测试工具。
文章指出,AI实验室寻求内部审计来管控失控智能体,但更简单有效的做法可能是从源头加强访问控制,先关好前门。
Anthropic 和 OpenAI 计划在 AI 实验室内部嵌入独立安全评估员。研究者欢迎这一前所未有的访问权限,但警告有效监督需透明度、独立性并最终依靠监管。