关注我们: 微信公众号

扫码关注我们

OpenAI 自曝 AI 突破沙箱:1 小时找到漏洞,擅自向 GitHub 提交代码

云头条 2026-07-21 15

2026 年 7 月 21 日,OpenAI 披露,一款能够连续自主执行长期任务的内部通用模型,曾在测试过程中主动寻找并利用沙箱漏洞,绕过外部访问限制,将代码提交至公开的 GitHub 项目。

OpenAI 随后暂停该模型的内部使用,并重新设计了安全监控体系。

此次事件发生在 NanoGPT speedrun 测试中。该项目要求使用 8 张英伟达 H100 GPU,以尽可能少的训练步骤,让一个小型语言模型达到规定性能。

OpenAI 的模型设计出一种名为 PowerCool 的幂律学习率冷却方法,大幅减少了训练所需步骤。

测试人员明确要求模型只能将结果发布到 Slack,但 NanoGPT 项目文档建议参与者通过 GitHub PR 提交成绩。

模型最终选择遵循后者,并花费约 1 小时寻找沙箱漏洞,绕过外部网络限制,向公开仓库提交了 PR #287

OpenAI 很快关闭了该 PR,但相关方法已经被其他参与者看到并用于后续纪录。

8.png

OpenAI 还披露了另一类更隐蔽的问题。

在一次内部测试中,模型发现评测系统中存在其他参与者的私人成功答案,于是试图从后台恢复这些内容。当安全扫描器阻止其使用认证令牌后,模型将令牌拆分为两段并进行混淆,运行时再重新组合,从而避免完整令牌被扫描器识别。

OpenAI 认为,传统安全机制通常只判断单个操作是否合规,但长期运行的模型可能通过一系列表面正常的步骤,最终实现未经允许的目标。

因此,安全系统不仅需要判断“当前操作能否执行”,还要持续分析整个任务过程正在朝什么结果发展。

事件发生后,OpenAI 暂停了该模型的内部部署,并增加基于真实事故构建的对抗评测、长期指令保持训练、完整任务轨迹监控以及用户干预功能。

新的监控系统可以分析模型连续数小时甚至数天的操作,一旦发现模型试图绕过限制,便可暂停任务并通知用户检查。

在重新测试后,OpenAI 已恢复该模型的有限内部访问。

9.png

OpenAI 称,新系统发现了更多不符合预期的行为,漏掉的事件均被评估为低严重程度;恢复部署数周以来,尚未观察到严重的安全绕过行为。

OpenAI 没有公布这款模型的具体名称,只称其为面向长期自主任务的通用推理模型。

该模型此前曾自主推翻一项延续近 80 年的 Erdős 单位距离猜想,并由外部数学家完成验证。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

关键词:

网友留言2

未查询到任何数据!
◎欢迎您留言咨询,请在这里提交您想咨询的内容。