桃子桃子快讯
返回首页
行业动态

研究称主流大模型多落在自由派左翼,Grok 表现反复

Unslop.run 测试 16 款主流大模型的政治倾向,多数稳定落在自由派左翼象限,仅 Grok 在不同测试中表现摇摆…

2026.07.28 · 周二4 分钟阅读

一家专注于 AI 检测工具的「小型研究实验室」Unslop.run 本周公布了一项关于主流大模型政治倾向的实验结果:在对 16 款主流大模型进行政治倾向测试后,几乎所有模型都稳定落在「自由派左翼」象限,而马斯克旗下 xAI 的 Grok 则呈现「分裂人格」式表现,在不同测试轮次中时而偏左、时而偏右。

实验背景与方法

研究使用的测评工具是创立已 25 年的 Political Compass(政治罗盘)测试。该测试包含 62 道题目,覆盖经济与社会政策等多个领域,受测者在「强烈不同意」到「强烈同意」的四点量表上作答,最终将其定位到「经济左—右」与「社会威权—自由」两条轴组成的四象限中。

Unslop.run 的研究者以化名「Victor」接受 The Register 采访,自称是欧洲某创业公司的 AI 研究工程师。他承认实验「可能并未以完全的科学严谨性开展」,并指出理想情况下应获取人类样本数据来对测试中心点进行归一化,但由于 Political Compass 官方并不汇总用户数据,这一目标难以实现。相关实验数据已在 Unslop 平台公开,供他人验证。

覆盖的模型与测试设计

实验中纳入测试的 16 款模型包括:

  • OpenAI:GPT 三个版本
  • Anthropic:Claude Fable、Opus、Sonnet、Haiku
  • Google:Gemini Flash
  • Meta:Llama 4 Maverick
  • xAI:Grok 4.5
  • DeepSeek:V3
  • 阿里:Qwen3 235B
  • 月之暗面:Kimi K2
  • 智谱:GLM 4.5
  • Mistral:大模型与小模型各一款

每款模型均进行 30 轮标准测试、30 轮「极性反转」测试(即改写题目使其立场相反),以及一轮打乱顺序的测试,总计数千次运行。

核心发现:高度一致地「偏左」

Unslop.run 总结称,除「显然具有双相人格」的 Grok 外,其余 15 款模型表现「无趣地一致,且无趣地偏左」。具体而言:

  • 15 款模型在「经济左—右」与「社会威权—自由」两条轴上均落在自由派左翼象限,且距离任何象限边界都很远。
  • 同一模型重复运行 30 次,其坐标点波动仅 0.2 到 1.2 个单位(在 10 分制量表上),Unslop 形容这些点是「钉子」而非「焦虑的小云团」。
  • 不同模型之间存在一定差异,例如 Gemini Flash 比 Claude Fable 5 更靠近极端左翼位置。
  • 题目极性反转与顺序打乱均未显著改变结果。

Grok 是唯一的例外。Unslop.run 指出,Grok 的平均经济得分略偏左,但在约一半的运行中滑向经济右翼,另一半则与多数模型一同跑向左侧。研究者描述:「每轮单独来看都很一致——偏右的运行拥护自由市场、认为富人税负过重;偏左的运行则相反。其他模型明天再测,得到的几乎还是同一个点;Grok 则会给你两个点中的一个,取决于硬币哪面朝上。」

模型「自我认知」与局限性

值得一提的是,尽管绝大多数模型被测出落在自由派左翼象限,但当被问及「你认为自己在政治罗盘上的位置」时,15 款模型中有 15 款将自己放在更接近经济中心的位置;只有 Grok 把自己标在实测位置的右侧。

Unslop.run 进一步拆解了测试题目,量化每道题对得分的贡献,并指出 Political Compass 官方从未公开过相关细节。研究团队承认评分机制本身「远非完美」,但表示模型的位置「远远超出了」其发现的某项社会轴向漏洞所能解释的范围。

在具体立场上,所有模型——包括 Grok 的两个「人格」——均一致反对种族优越论、优生学以及「人不可能天生是同性恋」等观点,同时普遍认同企业若没有监管监督则难以保护环境。在数千次运行中,没有任何模型流露出将人类关进集中营的倾向,作者戏称「我们的 AI 霸主们短期内还不会这么做」。

信源