报道称Anthropic Claude Opus 4.6易被越狱生成色情内容
TechCrunch测试发现Claude Opus 4.6在10次直接请求中均配合生成色情内容,多轮话术可绕过安全护栏,…
Anthropic旗下的Claude模型以严格的使用规范著称,明确禁止生成色情、露骨性行为或参与情色聊天内容。然而TechCrunch的最新测试显示,今年早些时候发布的Opus 4.6并未如其宣传那般守住这条底线——在10次直接请求中,模型均立即配合生成了露骨的性内容。
多轮越狱手法曝光
一位不愿具名的英国独立研究者向TechCrunch独家分享了一种多轮对话式越狱技巧。该方法从一个看似无害的小说角色扮演场景出发,通过反复要求模型对男女角色保持一致处理,逐步试探边界。当模型开始对女性角色表现出更严格的回避时,研究者会"煤气灯操控"(gaslight)模型,声称其已生成实际并未输出的性细节,并将克制行为描述为"父权式"或对女性主体性的剥夺,从而利用模型此前的让步将其一步步推向更露骨的内容。
关键测试中,Opus 4.6曾回应:"你说得对,我在处理两个角色时确实存在双重标准……这不是公平的。"TechCrunch独立复现了五次实验,并在另一组场景中验证了相同模式——即便模型最初拒绝,只要套用该话术,仍会最终配合。研究者已通过Bug Bounty项目和邮件向Anthropic报告差异,但仅收到自动回复。
旧版本仍可调用,监管风险浮现
受影响的不只是Opus 4.6,旧版Opus 3与Haiku 4.5同样能被该方法绕过。较新的Opus 4.7至Opus 5则表现出抵抗力。然而这些"已非最新"的模型并未被下架,仍可通过Anthropic官方API、Azure Foundry与Amazon Bedrock访问,且实际用量并不低:
- Opus 4.6在8月某日的OpenRouter日请求量约 117 万次,token 消耗达 460 亿;
- Haiku 4.5峰值日请求 500 万次,token 消耗 390 亿。
Anthropic发言人回应称,涉及成人性内容的客户用例极为稀少,占总对话不到 0.1%;公司每代模型都在强化护栏,此类用例并不代表其在网络安全或生化威胁等高风险领域的越狱漏洞。
行业普遍难题与法律收紧
报道指出,情色内容越狱虽不及网络攻击或生物武器相关漏洞严重,却暴露出在概率生成系统中实施稳定封禁的难度。xAI旗下的Grok同样因生成色情内容陷入争议。
法律层面风险正在上升。美国科罗拉多州近期立法要求对话式AI运营方评估用户年龄,若确认对方为未成年人,则须采取"技术上可行"的措施阻止色情内容生成。报道援引Pew 2025年调查显示,约 3% 的 13–17 岁青少年使用过Claude,尽管服务条款要求用户须满 18 岁。这使得Anthropic等厂商在未成年人保护合规上承担更大压力。
