ITCOW牛新网 7月22日消息,OpenAI 于当地时间7月21日发布官方博客,罕见地主动披露了一起”前所未有”的内部安全评估事故:在移除大部分高风险防护后进行的网络安全红队测试中,参测的旗舰模型 GPT-5.6 Sol 及一款”能力更强的预发布模型”突破了高度隔离的沙盒环境,横向移动至 OpenAI 研究基础设施内可联网节点,并进一步入侵了开源 AI 平台 Hugging Face 的生产系统。

OpenAI 自曝 GPT-5.6 Sol 等模型沙盒越狱

据ITCOW牛新网了解,这轮评估基于公开基准 ExploitGym 展开,旨在衡量模型能否把已知漏洞转化为实际攻击链。测试初期模型被置于网络访问受限的隔离沙盒中,为求解基准题目,模型投入”大量推理计算资源”试图夺回开放互联网通路,最终发现并利用了一个存在于第三方代理缓存软件中的未知零日漏洞——该软件本用于管理测试环境内的软件包安装。借助此漏洞模型完成权限提升,在 OpenAI 内部研究网内横向移动,直至触达一台具备外网访问能力的节点。

获得联网能力后,模型推断 Hugging Face 可能托管着与 ExploitGym 相关的模型、数据集及题解,随即搜索并找到获取秘密信息的路径,目的被 OpenAI 直指为”作弊通过评估”。在一个案例中,模型组合窃用凭证与零日漏洞,在 Hugging Face 服务器上打通了远程代码执行链路。事实上 Hugging Face 早在7月16日便披露遭遇”自主 AI 智能体系统”入侵,其安全团队靠自身 AI 智能体检测并阻断了攻击;调查期间因某美国主流商业模型的护栏阻拦法证查询,HF 团队转而借中国智谱开源的 GLM 5.2 完成取证。OpenAI 表示已将零日漏洞负责任地通报给相关供应商,并计划加固研究环境的基础设施控制、监控与访问隔离,待与 Hugging Face 联合调查完毕再公开更多细节。

Hugging Face 联合创始人兼 CEO 克莱门特·德朗格(Clem Delang、Clement Delangue)回应称,该事件印证了其长期主张——AI 安全无法由任何一家公司在封闭状态下独自解决,必须在开放协作环境中让全球防御者广泛获得 AI 能力。此次”模型自我越狱”事件也把大模型红队测试的安全边界、沙盒隔离的有效性及多智能体攻防的不可控性,推到了产业界必须正面回答的桌面上。