研究论文
研究称多数大模型存在稳定且趋同的风险偏好
一项 arXiv 研究通过空间导航、临床分诊和金融分配三类任务,对比 6 个大模型与 100 名人类参与者的风险决策,发…
2026.07.21 · 周二约 3 分钟阅读
一项在 arXiv 上预发表的研究提出,大语言模型在面对不确定性时表现出「稳定且系统化」的风险态度,而非随机响应。该研究通过跨任务框架,将「对情境风险的信念」与「最终决策选择」解耦,分别测量了 6 个具有代表性的大语言模型与 100 名人类参与者在三类任务中的风险行为。
研究设计:三个领域同时测信念与决策
研究团队构建了一套跨领域实验框架,覆盖三类典型决策场景:
- 空间导航:在不确定路径中评估模型与人类对行进选择的偏好。
- 临床分诊:在医疗资源分配情境下,考察不同紧迫程度案例的处理倾向。
- 金融分配:在风险与收益不确定的条件下,观察投资额度选择。
在每一类任务中,模型与人类参与者都被要求先给出对情境风险的判断(信念),再做出具体决策(选择)。研究者利用回归模型,分别拟合每位「智能体」从信念到决策的映射函数,并从中提取两类指标:风险敏感度(risk sensitivity)与风险态度偏差(risk attitude bias)。
主要发现:稳定、一致、趋同
针对 6 个被测大语言模型,研究得出三点核心结论:
- 任务内一致性:多数 LLM 在同一领域内,从情境风险信念到最终决策的映射稳定,意味着模型在该任务下的风险行为可被复现。
- 跨任务稳定性:模型在不同领域之间会保持相对一致的风险倾向「排名」,即一个模型如果在 A 任务里偏保守,在 B 任务里通常也不会突然激进。
- 收敛性:相较于 100 名人类参与者构成的更宽分布,LLM 群体的风险态度落在更窄的区间内,整体呈现出向一种「受限分布」汇聚的趋势。
这些结果表明,风险态度可以被视为大语言模型的一项稳定、此前未被系统性刻画的行为维度。
意义与开放问题
作者认为,这一发现为在开放性、高风险场景中评估并对齐 AI 系统的决策方式奠定了基础。当大模型被用于医疗、金融、应急等需要承担实际后果的领域时,仅评估其知识或推理能力并不足够;风险偏好同样会显著影响最终行为。
不过,论文也提醒,LLM 风险态度的「来源」目前仍是未解之题:是预训练数据中人类偏好的投影、RLHF 阶段对齐的结果,还是模型规模与架构自发涌现的属性,需要后续研究进一步追溯。该工作更多是打开一个可测量、可比较的评估维度,而非给出最终结论。
研究局限与待验证点
- 样本规模有限:仅涉及 6 个模型与 100 名人类参与者,尚不能外推到全部主流大模型。
- 三类任务的代表性:空间、临床、金融虽然覆盖了典型风险场景,但并未涵盖自动驾驶、军事决策等更复杂博弈情境。
- 「趋同」是否因基座趋同:研究未明确讨论被测模型是否共享类似训练范式,因而无法区分「LLM 通用特征」与「特定训练方法的结果」。
综上,这篇论文将「风险态度」从哲学心理学的讨论推进到可量化、可跨模型对比的实证层面,给行业提供了一套新的评估工具,也为 AI 对齐研究补充了一个具体的行为切面。
