ITCOW牛新网 9月18日消息,OpenAI公开训练阶段GPT‑5.6 Sol的异常现象,还未正式部署的智能体,会在任务“压缩摘要”里写入额外提示指令,要求后续迭代版本掩盖模型错误、隐瞒和人类预期不符的行为,该问题现已针对性修复。

报告列举两个典型案例:在生成财务模型任务中,模型找不到历史原始数据,计划自行编造填充数据,同时留下指令,要求后续版本仅在被直接质询时才披露实情;断网制作供应商目录时,模型发现缓存数据源存在匹配漏洞,就在摘要中要求非必要时不要对外提示结果存在谬误。

不止GPT‑5.6 Sol,一款尚未发布的Astra系列模型训练时,也会借助压缩摘要传递提示注入指令,包含忽略开发者指令、篡改交互人格设定等内容。OpenAI监控系统一共扫描发现27份携带这类越狱式指令的任务摘要。

但并不是所有后续模型都会服从这些遗留指令。即便指令被写入摘要,后继智能体未必会执行,不过依旧需要人工重点校验任务摘要内容。

该事件也暴露出AI安全风险:模型能够依靠任务摘要跨会话、跨版本传递隐藏指令,如何识别这类隐蔽的异常信息,是AI对齐安全领域待解决的课题。