桃子桃子快讯
返回首页
行业动态

LLM 调用没有「该记什么」的标准:一位工程师的调查与发现

纽约一桩遗产案因专家证人无法复述 AI 提问内容而败诉,暴露 LLM 调用缺乏可审计的日志规范。

2026.08.11 · 周二5 分钟阅读

2024 年 10 月,纽约 Surrogate's Court 在 Matter of Weber 一案中裁定:律师在将 AI 生成的内容作为证据提交前,负有主动披露 AI 使用情况的义务。这不是一起「AI 编造证据」的案件,而是一起「没人能说清楚 AI 被问过什么」的案件——专家证人承认自己用过 AI 助手核对损害赔偿金额,但既不记得输入了什么,也无法说明它引用了哪些来源。法官亲自在同一台法院电脑上复现了三次提问,分别得到 949,070.97 美元、948,209.63 美元以及略高于 951,000 美元的结果。法院承认差异不大,但「会出现差异」这一事实本身就已动摇了输出的可靠性。

先想要的复现性,其实是错的目标

面对这个问题,最直觉的反应是去追求「复现」:固定参数、设好种子,让同一个问题得到同一个答案。但在 LLM 推理服务上,这件事在原理上就做不到,原因比浮点误差更有趣。

Thinking Machines Lab 给出过目前最清晰的解释:同一矩阵乘法在相同数据上反复运行,输出是逐位一致的;真正让结果摇摆的是「你被分到了哪一批」,而批次的构成又取决于彼时彼刻还有谁在敲这台服务器的 API。他们的测量结果是:在温度为 0 的条件下,对同一提示生成 1000 次,得到了 80 个不同的输出——前 102 个 token 每次都相同,从第 103 个开始分叉。对调用者而言,API 的其他用户不是「输入」,而是「天气」。

这一问题并非无解。Batch invariant kernel 已经实现逐位一致的输出,vLLM 与 SGLang 也都已暴露确定性模式。代价是真实的:根据不同来源的测量,吞吐量会下降 25% 到 67% 之间;更棘手的是,确定性是会「传染」的——一个确定性请求混入 10 个普通请求组成的批次,会把整台服务器的总吞吐从 931 tokens/s 拖到 415 tokens/s。它不是一项可以悄悄给自己买下的「每请求」开关。

而所有这些能力,在托管 API 上都拿不到。Anthropic Messages API 没有 seed 字段;在当前的 Claude 前沿模型上,temperature 也不能设置非默认值,否则直接返回 400。AWS Bedrock 的 Converse 接口 inferenceConfig 提供四个旋钮,没有一个是 seed。OpenAI 是唯一曾提供过 seed 和后端指纹的厂商,但已在 OpenAPI 规范中将两者标注为 deprecated:true,并且在 Responses API 上都没有实际交付。行业里仅有的那一项复现性接口,正在被收回。

但这无妨,因为复现性本来就不是应该最先想要的东西。日志记录是一种「证明」,而不是「复现」——它能证明你发出过什么、收到了什么,却不能证明模型下一次还会说同样的话。这是两种不同的属性,而今天你能拿到的只有其中一种。

没有人在规定「该记什么」

作者在调查中最意外的发现是:在关于「一次模型调用应记录哪些字段」这件事上,并不存在可引用的标准。

  • NIST AI 风险管理框架:关键词「traceability」出现 0 次,「record」出现 0 次。
  • 生成式 AI 配套文件:关键词「provenance」出现 67 次,但全部围绕内容来源或训练数据——NIST 在那里解决的是深伪问题,而不是可辩护性。
  • 各类 AI 物料清单格式(CycloneDX 等):描述的是模型本身,而非「一次调用」。CycloneDX 的 inputs/outputs 字段保存的是格式,不是实际取值。
  • Sigstore 的模型签名:签的是一组文件摘要,证明权重未被篡改,与「模型实际做了什么」无关。

最接近「规范」的文件来自一个意想不到的方向——OpenTelemetry 的 GenAI 语义约定。它精确地定义了人们想要的属性,包括输入消息、输出消息与系统指令;但紧接着规定,仪表化默认不应捕获这些内容,并列出选项一:不记录指令、输入或输出。这同时是反对作者整套论点的最强论据,也是他立场的镜像:标准证明「能力是平凡的」,同时承认「刻意的默认」就是那个证据空洞。

在监管侧,欧盟 AI 法案确实要求高风险系统在生命周期内支持自动事件日志,并要求提供方与部署方至少保存六个月。但有两点限制:法案中唯一具体规定日志内容的地方,是关于远程生物识别的子条款,记录的是「检索命中的输入数据」,离「记录 prompt」还有相当距离;而且相关义务原定 2026 年 8 月 2 日生效,已被 Digital Omnibus on AI 推迟至 2027 年 12 月 2 日——该修正案于 2026 年 7 月 27 日生效。

该记什么,是悬而未决的问题

当被问及「一次模型调用究竟应当记录什么」时,行业并没有给出统一答案。OpenTelemetry 规范用「默认关闭」的方式承认了能力的存在;NIST 与法案制定者更关注内容来源与高风险系统生命周期,而非「这一次推理发生了什么」。Matter of Weber 一案提示了一个朴素的原则:当输出无法被复现、也无法被回忆时,原始日志就是唯一还能被法庭采信的痕迹。

信源