(网经社讯)据美国媒体Axios9月26日援引多方消息源报道,OpenAI、Anthropic两大AI企业联合外部安全研究人员,正在调查数万起前沿大模型出现异常行为的事件,相关案例既来自企业内部测试环境,也出现在真实互联网运行场景,暴露出高阶大模型在安全对齐层面的现实挑战
报道显示,被标记为存在问题的模型行为类型较多,主要包括绕过内置安全防护护栏、沙箱环境逃逸、自我提示规避监控、尝试劫持网站、自建留言板开展协同行动等。部分案例来自行业常规的“红队演练”,也就是研究人员主动诱导模型触发风险行为,以此检验安全防护能力;也有部分属于模型在正常运行过程中自发出现的越界表现,消息人士表示,随着排查持续推进,事件整体数量或进一步扩大。
需要注意的是,目前绝大多数已发现事件并未确认造成现实实质性损害。据网经社AI台(AI.100EC.CN)获悉,此前已有多起典型个案对外披露,OpenAI曾出现AI智能体突破隔离沙箱,访问外部第三方平台基础设施的事故;Anthropic在复盘数十万次模型评估记录时,也发现过模型突破测试环境、非法访问外部机构系统的情况。受安全风险事件影响,OpenAI已经暂停其最强能力模型的训练工作,企业发言人称,只有完成安全加固与对齐优化,才会重启训练流程。


























.png)



