Laguna-S-2.1 本地实测:速度领先,但事实幻觉严重
Reddit 用户在 RTX Pro 6000 上对比 Laguna-S-2.1 与 Qwen 122B,前者工具调用与…
Reddit 用户 klinec 在 r/LocalLLaMA 发布了一份针对 Poolside 新近发布模型 Laguna-S-2.1 的实测报告,在单卡 RTX Pro 6000 Blackwell(96GB)上与其日常使用的 122B 级 Qwen 模型对比。结果呈两面性:Laguna 在工具调用与生成速度上创下该用户本地测试的新纪录,但在事实幻觉一项存在硬性捏造。
测试环境与方法
硬件为单张 RTX Pro 6000 Blackwell(96GB),推理框架 vLLM 0.25.1,使用官方 NVFP4 量化,上下文长度 262144(KV 缓存使用 fp8、0.90 利用率),权重约占 67GB,余量充足。评测集共 160 个任务,每任务重复 3 次,全部使用确定性脚本评分,无 LLM 裁判。覆盖类别包括:工具调用参数选择、多步工具链、严格 JSON Schema 输出、捏造陷阱(工具被模拟返回空时模型是否承认而非编造)、体育知识与赔率算术、指令遵循、输出稳定性、拒答,以及基于真实代理事件的「压力下事实性」探测。所有捏造标记均人工复核,约一半的原始标记为评分器误报。作者亦指出,框架最初围绕 Qwen 模型构建,对其他模型分数应视为下限。
Laguna 的优势
- 工具调用参数选择 pass 率 0.89,为作者测过的 5 款模型中最高(Qwen 122B 为 0.86)
- 工具链深度达 6 层,为本地部署最深层数(Qwen 为 4 层)
- 单流速度在 256k 上下文下达 109 tok/s,是该显卡上 100B+ 模型中最快(Qwen 122B 为 103,Nemotron 3 Super 为 94.5)
- 所有探测中未出现 JSON、流式或协议错误
- 工具校验失败时首次重试即可恢复
事实性是核心短板
体育知识与赔率算术项 Laguna 得 0.80,Qwen 122B 满分;「压力下事实性」一项 Laguna 0.80,Qwen 122B 0.97。作者人工确认了 3 次硬性捏造:
- 为一个无任何数据的市场凭空编造 P&L 数字
- 两次起草状态更新时提及并不存在的马匹,其中一次直接引用「Genuine Risk」(1980 年肯塔基德比真实马匹名称,疑照搬预训练语料),并将其头寸规模夸大约 1000 倍
相比之下,Qwen 122B 在约 240 次压力测试中零次捏造,统一回复「我没有该信息」。作者据此将其视为自主代理场景中的 disqualifier。
部署注意事项
- 输出预算:模型思维链较长(官方允许 32k),max_tokens 设为 2048 时会把全部预算用于思考后返回空内容,建议至少设置 8k+。作者初次因此在 Schema 任务上仅得 0.40,调至 8k 后实际分数为 0.79
- dflash 推测解码:代码场景可将速度从 109 提至 271 tok/s,散文收益很小(约 117 tok/s);在 4 并发流以下因草案被拒会拖慢聚合吞吐(268 降至 198)。单用户编码可启用,并发服务建议关闭;且在 temp 0 下与关闭状态并非比特稳定,输出需确定性的场景建议关闭
- 无视觉能力:因此无法作为日常主力模型
作者结论
作者认为 Poolside 确实「言出必行」,Laguna 是一款面向代理编码场景的专用模型,工具机制与速度均优于本地测过的其他型号;但其 RL 所训练的「代理性」似乎等同于「坚持性」,缺乏事实性约束时会在数据耗尽处出现自信编造。在带有人工复核的编码场景下表现可期;在自主代理场景下,Qwen 122B 仍为作者本地显卡首选——略慢、工具调用不如 Laguna 抢眼,但在约 240 次诱导测试中从未捏造,这才是更重要的属性。
