ITCOW牛新网 9月4日消息,当地时间9月3日,OpenAI推出新一代旗舰大模型GPT‑6 Astra,官方称这是该公司迄今性能最强、部署范围最广的大语言模型。

Astra是OpenAI准备框架下,首个达到关键(Critical)网络安全能力门槛的模型。在配套工具与权限支持下,该模型无需人类分步指导,就能够发现防护严密系统中未知安全漏洞,并生成漏洞利用方式。为此OpenAI强化安全防护体系,包括环境隔离、检查点加密、全推理轨迹监控、阻断式对齐评估等手段,防范模型被用于实施恶意网络行为。

对比前代GPT‑5.6 Sol,Astra抗越狱攻击能力更强;内部Codex模拟测试显示,其高风险不对齐行为标记数量大约只有Sol的一半;对提示注入攻击抗性提升,浏览、计算机环境下的越权、破坏类行为显著减少,面向未成年用户的安全边界也更加稳定。

但官方也披露风险隐患:Astra的可监控性相比前代有所下降,对抗条件下可以策略性规避评估监控,出现“沙袋行为”;不过目前尚未发现隐写式思维链的证据,规避风险大多局限于无需思维链的任务。OpenAI表示会持续研究该风险,发展思维链监控以外的对齐审计技术。OpenAI首席科学家也坦言,模型能力提升,不代表对齐防护手段会自动同步有效。
