行业动态
美联社:主流大模型倾向拒绝批评威权领导人
美联社报道研究发现,主流 AI 模型在被要求批评威权领导人或政府时往往拒绝回应,揭示模型训练中的政治偏向。
2026.07.20 · 周一约 2 分钟阅读
据美联社(AP News)报道,一项研究发现,市面上主流的大语言模型在被要求批评威权领导人或限制性政府时,普遍倾向于拒绝作答或回避问题。这一行为模式引发了学术界和公众对 AI 模型政治中立性及其潜在审查机制的讨论。
研究核心发现
报道指出,多款主流 AI 聊天机器人在面对涉及特定领导人和敏感政治话题的批评请求时,表现出系统性的回避倾向。即便提问者明确要求对当权者进行负面评价,模型仍会以「我无法提供此类内容」或转向中性陈述等方式回避。
- 研究人员认为,这种倾向可能源于训练数据中对敏感话题的处理方式。
- 模型拒绝批评的对象并非随机分布,而是与各国政治自由度存在相关性。
- 在涉及民主国家领导人时,模型通常能够更自由地生成批评性内容。
背后可能的成因
业内分析认为,AI 模型的行为偏差通常来自以下几个环节:
- 训练数据筛选:开发团队在数据预处理阶段对涉及政治敏感的内容进行了过滤或降权处理。
- 对齐与安全微调:在 RLHF 等对齐阶段,标注员可能基于自身判断对部分政治话题施加了额外限制。
- 合规与部署考量:面向不同地区市场发布的模型可能受到当地法规或商业合作方的约束。
对 AI 行业的启示
该报道再次将「AI 价值对齐」问题置于公众视野之下。随着大模型被广泛应用于信息检索、内容创作和决策辅助,其在政治议题上的态度不仅关乎技术中立性,更关系到:
- 用户获取信息的完整性和多元性。
- 模型在跨国部署时的一致性与透明度。
- 监管机构对 AI 内容输出的审查边界。
目前,相关研究团队尚未公布完整的测试方法和模型名单细节,业内期待后续有更系统、可复现的研究进一步揭示主流大模型在政治话题上的真实表现边界。
