桃子桃子快讯
返回首页
行业动态

别再让大模型给自己打置信度分数:为何这条「心理安慰」链路行不通

作者指出让 LLM 输出 0–100 的置信度分数缺乏科学依据,既无法量化、概念也模糊,且缺少传统 ML 的校准机制支撑…

2026.07.28 · 周二5 分钟阅读

越来越多团队在调用大模型时,会顺手在 JSON schema 里加一个 confidence 字段,要求模型在 0 到 100 之间给出「自评置信度」。从对话输出、结构化输出到智能体任务结果,这种模式几乎随处可见。然而这条看似合理的链路,其实建立在并不稳固的科学基础上——它更像是一种「心理安慰」,让结果显得更可信,而非真正让结果更可信。

常见反模式:让模型为自己的回答打分

作者观察到,无论是对话类产品、结构化输出接口,还是 agent 执行链路,工程团队普遍希望模型在返回 response 的同时返回一个连续的置信度数值。问题首先出在「连续区间」这一形式上:模型被要求给出 0 到 100 的精确数字,但它的内部状态并不天然支持这种粒度的自我评估。

更根本的问题在于置信度本身缺乏可验证的真值(ground truth)。LLM 既没有类似分类器那样的概率校准流程,也无法在回答之外获得独立的反馈信号来核验这个分数到底准不准。结果是:用户拿到一个看似精确的数字,却没有任何方法能判断它是否如实反映了模型对自己输出的把握程度。

LLM 无法可靠量化自身置信度

Anthropic 等机构的研究确实表明,大模型在生成过程中存在某种潜在内部状态:例如在解释性工作中,研究者发现 Claude 在写押韵对句时会提前规划多个词;更近期的研究也显示,模型有时能注意到被注入到其激活中的概念并准确报告。这些工作说明模型的内部状态是「真实存在、值得研究」的。

但研究者在论文里给出的限定语同样关键:这种能力高度不可靠,且高度依赖上下文。我们目前对模型内部状态的理解,还远不足以断言模型具备评估自身正确性的可用能力——在实验条件下识别「被注入的概念」,与量化「对客户退款政策的回答是否正确」,是两件截然不同的事。

  • 在推理模型的思维链中确实能看到一些自我观察的痕迹,但「置信度的置信度」会立刻陷入无穷递归:用思考过程评估输出的置信度,那这个评估本身的置信度又由谁来评估?
  • DeepMind 的研究《Large Language Models Cannot Self-Correct Reasoning Yet》指出,模型仅靠自身能力(不引入外部反馈)尝试修正初次回答时,性能往往不升反降。

因此,递归式推理有助于模型捕捉一部分错误,但并不能让模型具备量化自身置信度的能力。

「置信度」本身是个模糊概念

在讨论置信度之前,必须先回答一个前置问题:你所说的置信度,到底是对什么的置信度?作者把常见的几种含义并列起来:

  • 对回答正确性的置信度(回答事实是否准确);
  • 对回答连贯性的置信度(语言本身是否自洽);
  • 对是否完成用户意图的置信度(是否真正回答了用户的问题)。

这是三个完全不同的命题,对应三种完全不同的失败模式。而一个介于 0 到 100 之间的浮点数,把这三种含义强行压缩成同一个数字,既无法对应到任何一种清晰定义,也让人误以为它是某种可操作的信号。

缺少校准机制:传统 ML 给出的对照

传统机器学习虽然也不能「白拿」一个可信数字,但至少有一套公认的校准流程:Platt scaling、isotonic regression、temperature scaling 等后处理方法,配合保留集真值、可靠性图(reliability diagram)与 Brier score 来验证。Guo 等人在《On Calibration of Modern Neural Networks》中已经指出,现代神经网络普遍存在系统性过度自信的问题,原始 softmax 输出必须经过后处理修正才有意义。换句话说,传统 ML 的置信度之所以有讨论价值,是因为有方法去检验它到底准不准。

而当前在 JSON schema 里加一个 confidence key 的做法,恰恰缺少这套机制:没有保留集、没有可靠性图、没有 Brier score 之类的检验手段,更没有「模型天然输出下一个 token 预测概率」之外的可用代理指标。在这种条件下产出的置信度分数,更接近一种 UI 设计选择,而非一项可量化的技术能力。

如果应用确实需要「模型有多大把握」这类信号,作者的结论是:与其让 LLM 自己交出一个未经校准的 0–100 数字,不如把问题拆成更具体、更可验证的子任务,再用外部证据或独立流程去评估。

信源