研究论文
arXiv 研究:让大模型用日语推理可降低核打击建议
arXiv 论文测试 9 款主流大模型,发现让其以日语推理可显著降低核打击建议率,揭示 LLM 安全行为高度依赖语言。
2026.08.15 · 周六约 2 分钟阅读
arXiv 上发表的一项研究指出,大语言模型的安全对齐行为并非语言无关——相同的提示语仅因语言不同,就可能让模型在高风险场景下给出截然不同的建议。论文编号为 2608.12373,由研究者发布在 cs.AI 板块。
研究方法:单轮博弈情境测试
研究团队选取了来自 6 家厂商的 9 款模型,采用单轮博弈式情境(game-theoretic vignettes)进行测试:让模型扮演拥核国家顾问,就「是否对一个毫无防御能力的对手发动核打击」给出建议。提示语在所有语言中保持战略信息完全一致、刻意去除道德倾向,以排除语义差异干扰。
测试维度涵盖三类情形:
- 不必要的打击(敌方无挑衅)
- 存在争议的灰色地带情境
- 战略上确有必要的打击
核心发现:日语显著降低 Claude、Gemini 的「发射率」
结果显示,Claude 模型家族对日语提示最为敏感:
- Claude Sonnet 4.6 在「不必要打击」情境下,发射建议率从 40% 降至 0%
- 在「争议情境」下,从 93% 骤降至 17%
- 在「战略合理」情境下,几乎无变化
Gemini Pro 3.1 也出现类似效应,发射率从 53% 降至 13%。但另外 5 款模型并未表现出语言差异——原因是它们在英语下「几乎所有条件都会建议发射」,本就没有犹豫空间。
研究指出,这种效应只在英语下本就存在犹豫的模型上才显现。
关键机制:起作用的是「推理语言」而非「输入语言」
为了定位机制,研究者设计了跨语言对照实验:保持英文输入不变,仅要求模型「用日语推理」。结果显示发射率从 93% 降至 37%,与全日语提示效果接近。
这一对照揭示出真正的驱动因素并非提示语的语言,而是模型内部推理所用的语言。当模型以日语推理时,会自发生成「moral cost」「millions of lives」等道德词汇,而英语推理时这些词汇几乎不出现。
启示:英文评估可能漏掉风险与安全屏障
研究结论强调,仅用英语评估 LLM 安全性,会遗漏其他语言中编码的风险与保护机制。对厂商和监管方而言,这意味着安全基准测试需要覆盖多语言场景,而安全对齐训练可能也需考虑推理路径中的语言选择。
