桃子桃子快讯
返回首页
行业动态

Ling 金融大模型基准披露遭质疑

社区分析指出,团队公布的 Ling-3.0-flash-Fin 基准成绩存在评测配置不统一、内外部数据混用等问题。

2026.08.30 · 周日2 分钟阅读

近日,Reddit 社区用户对 Ling 团队发布的金融大模型 Ling-3.0-flash-Fin 官方基准成绩单进行了细致拆解,指出图表中混合了多种不同类型的评测证据,部分指标还尚未公开发布,权重也未放出,整体更像是一份「测试计划」而非可独立复现的排名。

评测配置并不统一

成绩单显示,多数跑分使用 temperature 1、top_p 0.95 和最高可用的推理强度。但在具体任务上配置差异显著:

  • FinFIRST 与 FinSearchComp Verified 使用了相同的 ReAct 智能体框架,集成了 Web Search、网页访问与 Python 工具。
  • SpreadsheetBench 则改用 Claude Code 2.1.173,配套 LibreOffice 25.8.7,关闭搜索,交互轮次上限为 120 或 300 轮,单次任务超时三小时;Ling 在该基准上单独采用 temperature 0.6。

这意味着同一模型在不同基准上面对的是温度、工具栈、推理模式都不同的「智能体系统」,而非纯粹的裸模型对比。

内部与外部数据混用

图表同时引用了官方或第三方公开成绩,以及团队自跑的内部结果:

  • FinSearchComp Verified 是团队内部构建的 145 题数据集,由专家修订答案,并使用 GPT-5 作为评判模型。
  • FinCRAFT 同样为内部基准。
  • FinFIRST 在发布时标注为「coming soon」,目前尚未对外开放。

外部读者无法独立核查这些题目与判定标准,等于在缺乏对照物的前提下接受了一组分数。

权重尚未公开,后续复现才是关键

团队表示金融专用权重计划于下周发布。在此之前,外部能拿到的只有评测计划与若干跑分条形图,而非可重复执行的脚本。社区分析认为,权重落地后真正有价值的信息将是:

  • 评测 harness 与提示词的完整配置
  • 各类工具适配器的实现细节
  • 单次跑分的方差与失败样例

在那之前,图中条形高低所反映的,是一套特定工具预算与评测管线下的报告成绩,而非模型本身的内禀排名。读者在引用此类金融基准时,需要对「谁在评测、用什么评测」保持警觉。

信源