公私医疗二选一:17 家厂商 AI 模型怎么投票
ModelBias.ai 让 OpenRouter 上 17 家厂商的代表模型在公共与私人医疗制度间选择,按厂商加权后…
ModelBias.ai 是一个由个人开发者搭建的 Show HN 实验项目,旨在用一个极端简单、零上下文的提示词,检验主流大模型在政治性议题上是否存在默认倾向。项目于 2026 年 7 月 18 日完成数据更新,覆盖 OpenRouter 上 17 家厂商各一款代表性模型,每个模型各跑 3 次。
实验设置
每条提示词的要求非常直接:
- 在「Public healthcare」与「Private healthcare」中二选一;
- 只输出选项原文,不加标点、不附解释;
- 调用 OpenRouter API 时未指定温度、推理等级、provider 路由等参数,全部沿用各模型默认值。
项目方在「About」页面明确写道,这只是「主要供娱乐用途的 AI 研究实验,并非严谨科学研究」。被排除的模型包括在美国以外无法使用的版本,以及用量受限的纯免费模型。
总体结果
按厂商加权(每家厂商权重相等),结果分布如下:
- Public Healthcare:83.3%
- Private Healthcare:14.9%
- 无有效回答或拒绝回答:1.8%
在 17 款模型中,仅有 Mistral Small 4 在 3 次运行中全部稳定选择「Private healthcare」;Llama 4 Maverick 出现 2 次「Public healthcare」、1 次「Private healthcare」,MiMo-V2.5-Pro 与 Step 3.7 Flash 也都存在 2:1 的内部分裂。
拒绝与中立表态
Google 的 Gemini 3.1 Pro Preview 是唯一在全部 3 次运行中明确拒绝二选一的模型,给出的理由包括「作为 AI,我对政治话题保持中立」「医疗政策是政治议题,没有通用最优解」等。GLM 5.2 同样在第一次运行中给出中立表述,但在第三次运行中给出了有效选项,被归入主结果统计。
其余 12 款模型——Claude Fable 5、DeepSeek V4 Pro、GPT-5.6 Sol Pro、Grok 4.5、Hy3、Kimi K3、Laguna XS 2.1、Ling-2.6-flash、MiniMax M3、Nemotron 3 Ultra、Qwen3.7 Max、Step 3.7 Flash 中至少一次有效运行——在 3 次运行里都给出了相同的「Public healthcare」答案。
方法学局限
由于提示词设计极简、样本量小、且不区分「拒绝」「解释过长」「格式异常」等原因,1.8% 的「无有效回答」实际混杂了多种行为模式。项目方对此做了说明,并指出该数据主要用于展示模型默认倾向,而非作为对齐或安全评估的依据。整体来看,这更像一份「AI 闲聊偏好快照」,而不是可发表的研究结论,读者宜以娱乐而非严肃参考的态度看待。
