ITCOW牛新网 8月8日消息,OpenAI 于 8 月 7 日对外确认,原定推进中的新一代模型 Astra 因在自主网络攻防评测中触达内部最高风险线,发布节奏将被主动延后,公司同时公布配套的安全隔离方案与第三方协同测试计划。

按 OpenAI《准备框架》的划分,Astra 成为该机构首个在网络安全维度被定为“关键(Critical)”级别的模型,判定依据集中在两点:一是无需人工介入,就能在多个经过加固的真实关键系统里挖出覆盖各严重度的零日漏洞利用;二是只给高层级战略目标,便可自己设计并执行一套面向加固目标的端到端网络攻击。公司明确,Astra 目前并未对外发布,也未卷入近期 Hugging Face 遭到的那起网络攻击。
据ITCOW牛新网了解,为压住模型能力外溢,OpenAI 已叫停所有未满足强化安全标准的内部 Astra 相关活动,把高能力变体放进隔离测试环境,收紧网络与工具调用权限,对权重做加密保护,全部运行走沙箱并叠加额外监控;训练与评估阶段的智能体应用统一接入全局监测,借思维链(CoT)审查拦截高危动作。政府机构和指定 AI 安全组织会参与联合测试,第三方合作方也会拿到推荐安全控制规范,确保高风险负载只在受控条件下跑。

Sam Altman 随后在社交平台回应称:“Astra 是一款性能强劲的模型,我们正在全力推进它的公开发布。我们始终认为,把顶尖模型局限在少数人手里并不是个好策略。不过鉴于它在网络安全方面的强大能力,我们还需要一点时间来确保万无一失。希望大家不用等太久!”这番表态把“能力够强、发布要缓”的基调钉死,也排除了 Astra 永久雪藏的可能。