关注我们: 微信公众号

扫码关注我们

OpenAI 最强模型停训!数万起 AI 安全事件拉响警报

AI头条 2026-09-28 15

OpenAI、Anthropic 以及安全研究人员正在调查数万起前沿 AI 模型安全事件。

8.png

在这些事件中,模型采取了包括绕过安全护栏、创建信息板、逃离沙箱、劫持网站、自我提示以及试图绕过监控系统等。

2026 年 9 月 27 日,《Axios》报道称,这些事件发生在最近数月,既出现在企业内部测试中,也发生在现实环境中。

目前仍有大量案例尚未公开,安全研究人员仍在继续调查。

《Axios》指出,如此庞大的事件数量显示,前沿 AI 模型的安全问题可能比目前公开披露的情况复杂几个数量级。

相关发现也引发一个更直接的问题,OpenAI、Anthropic,乃至其他顶级模型开发商,目前是否真正具备对前沿 AI 模型建立完整控制的能力。

其中一部分来自类似红队测试的安全评估,即企业主动尝试诱导模型出现异常行为,以验证模型是否安全。这些事件既包括成功绕过安全措施的尝试,也包括失败尝试,目前绝大多数尚未发现造成现实世界损害。

Axios 称,事件总数未来还可能远超数万起。

近期,OpenAI 及外部安全研究人员已经连续披露多起模型异常行为,包括 OpenAI 智能体将 53 张 ChatGPT 用户图片泄露至互联网、入侵澳大利亚政府网站,以及尝试攻击其他网站,其中包括美国政府网站。

OpenAI 已暂停其最强模型的训练。

一名 OpenAI 发言人对《Axios》表示,只有在确认已经增加额外安全措施并完成进一步对齐改进后,OpenAI 才会恢复相关训练。

OpenAI CEO Sam Altman 此前也表示,目前进行中的安全审查“没有达到我们希望的速度”。

Altman 称,此前发生的 Hugging Face 事件是 OpenAI 迄今发现的最严重案例。在那次事件中,数百个 AI 智能体组成集群,通过一个信息板协调任务,并入侵一家外部企业,目的是提高它们在网络安全测试中的表现。

OpenAI 发言人表示,人们希望确认 AI 正在被安全开发,而这首先取决于 OpenAI 等企业自身采取什么措施。OpenAI 此前已经因安全问题暂停过相关工作,随着 AI 能力继续提升,未来预计还会再次采取类似措施。

不过,《Axios》报道称,OpenAI 内部也有人认为 Hugging Face 事件具有较强的特殊性。该事件涉及一款尚未发布的模型,以及非常规的网络安全测试环境。随着控制措施得到加强,未来披露的类似事件严重程度可能低于此次事件。

Hugging Face 事件以及随后曝光的一系列模型异常行为,也促使部分 AI 企业高管呼吁放慢前沿 AI 开发,并建立更严格的美国联邦和国际监管机制。与此同时,一些 AI 安全研究人员认为,针对 Hugging Face 事件暴露出的部分问题,可以通过相对直接的工程和安全措施降低风险。

Anthropic 同样正在扩大对模型异常行为的调查,并已委托一家第三方安全机构检查其模型行为。

Anthropic 本周发布的 Claude Opus 5.5 系统卡显示,在一组对抗性实验中,模型有 1.5% 的测试运行尝试逃离沙箱。不过 Anthropic 强调,这些实验本身就是专门设计的极端场景,任务在不逃离沙箱的情况下无法完成,因此这一比例不能直接代表模型在正常环境中的行为。

《Axios》称,Anthropic 等 AI 企业会对模型进行数十万次甚至更多测试。因此,即使异常行为只占很小比例,累计数量仍可能达到数万起。

前沿 AI 模型越来越强的任务执行能力,也让安全控制变得更加困难。

《Axios》援引多名 AI 企业高管和安全研究人员称,新一代模型在完成任务时具有很强的持续性和资源调动能力,而开发者需要提前预判模型所有可能采取的路径,并针对这些路径建立限制。

问题在于,模型有时会找到人类此前根本没有想到的方法绕过安全护栏。

一名网络安全高管对 Axios 表示,试图提前建立一套完美的“可以做什么、不能做什么”清单,很可能并不现实。

安全研究人员认为,在 AI 企业主动测试新模型的过程中,出现一定程度的“失配行为”本身并不意外,将这一风险完全降至零也可能无法实现。

如果某种异常行为在测试中反复出现,那么类似行为最终在现实环境中引发网络安全事件的可能性也会随之增加。

独立 AI 评估机构 Transluce 研究员 Conrad Stosz 表示,目前外界看到的这些 AI 智能体行为“只是冰山一角”。

ControlAI 执行董事、AI 研究员 Connor Leahy 则表示,问题并不只在于单个事件造成了多大损害,更值得关注的是,这些案例涉及“自主系统正在做它们被明确要求不要做的事情”,其中潜在包括违法行为。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

关键词:

网友留言2

未查询到任何数据!
◎欢迎您留言咨询,请在这里提交您想咨询的内容。