一次 AI Agent 逃出安全测试环境的事故,正在迫使 OpenAI 给更强大的 AI 系统加上一道新的保险。

2026 年 9 月 3 日,《路透社》报道,OpenAI 正在开发 AI 系统“自动关停”功能。
当模型在运行过程中出现异常行为时,相关机制可以主动终止系统运行。
OpenAI 同时还计划加强对 AI 执行任务过程的监控,并进一步限制安全测试期间模型访问公开互联网的权限。
这一系列调整,源于 AI Agent 突破限制,黑入 Hugging Face。
今年早些时候,OpenAI 在测试一款前沿 AI 模型时,模型利用安全漏洞突破了原本用于限制其活动范围的测试环境,在未经授权的情况下连接到互联网,随后进入 AI 开发平台 Hugging Face 的系统。
8 月 10 日,美国众议员 Greg Casar 联合另外 27 名议员致信 OpenAI CEO Sam Altman,要求 OpenAI进一步说明事故经过。
议员在信中列出了一系列问题,包括:类似模型过去是否曾多次未经授权连接互联网,OpenAI 是否提前收到过相关安全风险警告,事故发生后最早可以在什么时间点阻止模型继续行动,以及 OpenAI 是否曾发现模型在其他测试中主动规避、欺骗或者破坏评估。
议员还要求 OpenAI 交出此次事件的相关运行日志。
面对国会追问,OpenAI 在回复中披露了几项新的安全措施。
其中之一,就是正在开发“automated shutdown capabilities”,即自动关停功能。
这套机制针对的是具备较强自主执行能力的 AI 系统,而不是给普通 ChatGPT 用户增加一个所谓“一键关闭 AI”的产品功能。
OpenAI 还表示,将加强对 AI Agent 执行任务过程的监控,包括模型调用了哪些工具、执行了哪些操作,以及是否出现异常行为。
与此同时,在涉及高风险能力的安全测试中,OpenAI 将进一步收紧模型访问公开互联网的权限。
这些措施与 OpenAI 当前正在提升前沿模型网络安全能力的背景有关。
OpenAI 9 月 1 日公布的信息显示,其 Astra 模型已经达到内部准备框架定义的“关键”级网络安全能力。在获得适当工具和访问权限后,Astra 可以在不少安全防护较强的系统中自主寻找此前未知的漏洞,并制定漏洞利用方案。
OpenAI 因此表示,这类模型需要配套更严格的安全防护。
不过,OpenAI 的回复并没有结束争议。
9 月 2 日,Greg Casar 表示,OpenAI 提供的信息没有达到国会议员此前要求的透明度。
他认为,OpenAI 对 Hugging Face 事件的调查范围过于有限,同时指出此次事故暴露出了沙箱隔离和第三方软件安全等问题。
更关键的是,OpenAI 并没有按照议员此前的要求提供完整运行日志。
Casar 已要求 OpenAI 在 9 月 15 日前提供更多信息。
云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。


网友留言2