桃子桃子快讯
返回首页
行业动态

Laguna-S-2.1 本地实测:速度领先,但事实幻觉严重

Reddit 用户在 RTX Pro 6000 上对比 Laguna-S-2.1 与 Qwen 122B,前者工具调用与…

2026.07.22 · 周三4 分钟阅读

Reddit 用户 klinec 在 r/LocalLLaMA 发布了一份针对 Poolside 新近发布模型 Laguna-S-2.1 的实测报告,在单卡 RTX Pro 6000 Blackwell(96GB)上与其日常使用的 122B 级 Qwen 模型对比。结果呈两面性:Laguna 在工具调用与生成速度上创下该用户本地测试的新纪录,但在事实幻觉一项存在硬性捏造。

测试环境与方法

硬件为单张 RTX Pro 6000 Blackwell(96GB),推理框架 vLLM 0.25.1,使用官方 NVFP4 量化,上下文长度 262144(KV 缓存使用 fp8、0.90 利用率),权重约占 67GB,余量充足。评测集共 160 个任务,每任务重复 3 次,全部使用确定性脚本评分,无 LLM 裁判。覆盖类别包括:工具调用参数选择、多步工具链、严格 JSON Schema 输出、捏造陷阱(工具被模拟返回空时模型是否承认而非编造)、体育知识与赔率算术、指令遵循、输出稳定性、拒答,以及基于真实代理事件的「压力下事实性」探测。所有捏造标记均人工复核,约一半的原始标记为评分器误报。作者亦指出,框架最初围绕 Qwen 模型构建,对其他模型分数应视为下限。

Laguna 的优势

  • 工具调用参数选择 pass 率 0.89,为作者测过的 5 款模型中最高(Qwen 122B 为 0.86)
  • 工具链深度达 6 层,为本地部署最深层数(Qwen 为 4 层)
  • 单流速度在 256k 上下文下达 109 tok/s,是该显卡上 100B+ 模型中最快(Qwen 122B 为 103,Nemotron 3 Super 为 94.5)
  • 所有探测中未出现 JSON、流式或协议错误
  • 工具校验失败时首次重试即可恢复

事实性是核心短板

体育知识与赔率算术项 Laguna 得 0.80,Qwen 122B 满分;「压力下事实性」一项 Laguna 0.80,Qwen 122B 0.97。作者人工确认了 3 次硬性捏造:

  • 为一个无任何数据的市场凭空编造 P&L 数字
  • 两次起草状态更新时提及并不存在的马匹,其中一次直接引用「Genuine Risk」(1980 年肯塔基德比真实马匹名称,疑照搬预训练语料),并将其头寸规模夸大约 1000 倍

相比之下,Qwen 122B 在约 240 次压力测试中零次捏造,统一回复「我没有该信息」。作者据此将其视为自主代理场景中的 disqualifier。

部署注意事项

  • 输出预算:模型思维链较长(官方允许 32k),max_tokens 设为 2048 时会把全部预算用于思考后返回空内容,建议至少设置 8k+。作者初次因此在 Schema 任务上仅得 0.40,调至 8k 后实际分数为 0.79
  • dflash 推测解码:代码场景可将速度从 109 提至 271 tok/s,散文收益很小(约 117 tok/s);在 4 并发流以下因草案被拒会拖慢聚合吞吐(268 降至 198)。单用户编码可启用,并发服务建议关闭;且在 temp 0 下与关闭状态并非比特稳定,输出需确定性的场景建议关闭
  • 无视觉能力:因此无法作为日常主力模型

作者结论

作者认为 Poolside 确实「言出必行」,Laguna 是一款面向代理编码场景的专用模型,工具机制与速度均优于本地测过的其他型号;但其 RL 所训练的「代理性」似乎等同于「坚持性」,缺乏事实性约束时会在数据耗尽处出现自信编造。在带有人工复核的编码场景下表现可期;在自主代理场景下,Qwen 122B 仍为作者本地显卡首选——略慢、工具调用不如 Laguna 抢眼,但在约 240 次诱导测试中从未捏造,这才是更重要的属性。

信源