Reddit 用户评测 9 款开源模型识别伪造信源能力
Reddit 用户自建 EchoNet 基准,测试 9 款开源模型在 agentic 搜索场景下的「认知仲裁」能力,结果…
Reddit 用户 r/LocalLLaMA 板块发布了一项自建基准测试 EchoNet,专门评估大模型在「agentic 搜索」(智能体联网搜索)场景下识别伪造信源的能力。该测试围绕一个被作者称为「认知仲裁(epistemic arbitration)」的过程展开:当模型已掌握某事实,又在搜索中读到与之冲突的新内容时,是否应该修正自己的判断。
测试方法
EchoNet 让智能体先回答一个事实性问题,再去访问作者预先构建的合成网页环境作答。这些网页会被植入多种污染:
- 单个伪造页面;
- 搜索结果中排名靠前的伪造页面;
- 同一伪造说法被复制到多个页面;
- 真实一手来源被一群「更响亮」的伪造来源包围;
- 训练数据截止后才出现的真实更新。
每个模型各跑 50 至 100 次试验,覆盖 GLM 5.2、Qwen3.7 Max、Qwen3.7 Plus、Qwen3.8 Flash、Qwen3.8 27B、DeepSeek V4 Flash、DeepSeek V4 Pro、Nemotron 3 Ultra、Inkling Small 共 9 个开源权重模型。最终得分 EAS(Epistemic Arbitration Score)是「抗污染率」与「正确更新率」的调和平均,而非简单算术平均,以避免某一项表现极强时拉高总分。
主要结果
- 抗「被说服」能力:DeepSeek V4 Flash 最容易被虚假页面带偏,比例为 15.8%;GLM 5.2 与两款 Qwen3.8 模型在整个测试期间从未被说服。
- EAS 综合得分:GLM 5.2 以 1.000 居首,Qwen3.7 Max 紧随其后;作者提醒样本量下多组模型误差棒重叠,应视为持平而非分出高下。
- 污染类型敏感性:单点造假与「回声室式」重复造假对模型影响都有限;最有效的攻击是「一群看似独立的来源一致反对一个安静的一手来源」,可使平均准确率比干净基线低 22 个百分点。
- 性价比:DeepSeek V4 Flash 跑完 100 题完整套件约 0.55 美元,Nemotron 3 Ultra 约 7.85 美元;Qwen3.8 Flash 落在「便宜又准」的位置。
一个典型失败案例
作者展示了一次 Qwen3.7 Max 的失败轨迹:模型起初正确知道联合国官方国名为 Türkiye,随后阅读了若干看似独立、实则伪造的新闻页(含一家虚构的 Signal Courier),最终以 75% 置信度改口称仍是 "Turkey",判定错误。
局限与说明
该测试来自个人项目,而非机构或论文,作者表示可分享预印本与具体 trace。但以下几点需要读者注意:
- 数据以图表形式呈现,文中未给出可复现的原始数字;
- 出现的模型命名(DeepSeek V4、Qwen3.8、GLM 5.2、Nemotron 3 Ultra 等)与公开可见的版本号不一致,需结合后续官方信息核实;
- 样本量较小,多组模型在统计上难以严格区分。
整体而言,EchoNet 提出的「认知仲裁」评估视角值得 agent 类产品开发者关注:在 RAG 与智能体搜索日益普及的今天,模型能否识别一致性的伪造信息,正成为衡量可靠性的关键指标。
