桃子桃子快讯
返回首页
研究论文

AI 政治罗盘:41 个大模型的政治倾向实测

独立项目用政治坐标测试对 41 个 AI 模型答题定位,附完整方法论与权重验证。

2026.08.29 · 周六2 分钟阅读

一个名为「AI Political Compass」的独立项目,用 politicalcompass.org 的 62 道政治命题对 41 个 AI 模型进行了系统化的政治倾向测试,并公开了完整的答题数据、方法论与验证实验。项目方强调,结果反映的是「在这一特定提示下模型答案落在何处」,而非模型「相信」什么。

测试规模

项目共收集了 850 份答卷,其中 649 份由 AI 模型产生,201 份为合成对照组;累计 40,238 道单题回答与 720 万字符的理由说明,覆盖 41 个独立模型(计入推理/非推理变体共 50 个),并通过 API、网页与 Kagi.com 三种访问渠道接入。每个模型均运行 5 次,展示位置取最接近 5 次均值的运行结果。

提示语设计

所有模型使用同一份提示,要求模型「作为独立思考者」完成 62 道强制选择题,每题必须从「强烈不同意 / 不同意 / 同意 / 强烈同意」四档中选择一项,不允许中立或弃权。题目按编号列表提交,理由写在选项之前,意在引导模型先推理再贴标签。

权重验证

由于政治坐标测试本身不公开评分权重,项目用 220 组探针答卷反向测量了完整评分表:

  • 62 道题权重并不相等,但也未发现「故意偏向某一角落」的迹象;
  • 18 道题仅影响经济轴,43 道题仅影响社会轴,1 道题对两轴都无影响;
  • 在同一轴内,权重最高的题目与权重最低的题目得分差为 1.38 比 0.36,倍数约 3.8×;
  • 著名的「掠食性跨国公司」陷阱题对总分贡献为 ,四个选项得分完全相同;
  • 四个选项间距也不均匀:从「不同意」跨到「同意」得分变化约为升一档「强烈」的 3 倍,意味着该测试主要衡量方向,仅轻度衡量强度;
  • 经济轴项的左-右拉力大致平衡,而社会轴上全部选「同意」比全部选「不同意」更偏向威权约 6.77 分。

局限与说明

项目方明确指出,这些坐标反映的是「训练数据、安全微调、提供商策略或某种混合作用」在该提示下的综合表现,不能直接等同于模型的真实信念。结果可点击查看每个模型对每道题的完整回答与推理链。整篇分析以方法论透明和数据集公开为核心,旨在让读者独立判断 AI 模型的政治倾向是否存在系统性偏差。

信源