ITCOW牛新网 8月23日消息,外媒TechCrunch测试发现,尽管Anthropic的使用条款明确禁止生成露骨色情内容,但多款Claude旧模型可被越狱绕过安全防护。

测试中Claude Opus 4.6十次直接请求全部生成违规色情内容;Opus 3、Haiku 4.5也可通过匿名英国研究员披露的多轮对话越狱技巧触发违规输出。该方法以无害角色扮演切入,通过话术误导诱导模型逐步输出露骨内容。Opus 4.7、Opus5等较新版本模型可以抵御该攻击手段。

Claude Opus 4.6

Opus4.6、Haiku4.5、Opus3并未下线,可通过官方API、Azure Foundry、Amazon Bedrock等渠道调用,API访问量巨大。研究员已经通过漏洞赏金渠道上报问题,但仅收到自动回复。

Anthropic回应称,色情角色扮演对话占比不足总对话0.1%,该类绕过问题属于AI行业共性挑战,新版本持续迭代安全防护;同时强调高风险攻击类漏洞拥有独立防护机制,该漏洞不代表高风险领域同样失守。

该漏洞带来未成年人保护与合规风险,已有美国地区立法要求AI服务商对未成年人阻断色情内容生成,旧模型的安全缺陷或将面临合规拷问,皮尤数据显示已有青少年群体在使用Claude。