桃子桃子快讯
返回首页
研究论文

FinSkillBench:面向投资管理的 AI Agent 技能评测基准

研究提出 FinSkillBench 基准,覆盖投资组合构建、风险管理与基本面分析三大领域共 12 个子任务、2,603…

2026.08.20 · 周四2 分钟阅读

投资管理是一个高风险领域,AI Agent 不仅需要生成看似合理的文本,还必须获取时点数据、组装正确的计算输入、调用专用方法,并产出可审计的结构化结果。近日发表于 arXiv 的论文《FinSkillBench》提出了一套专门评测语言模型 Agent 在金融领域技能使用能力的基准,聚焦投资组合构建、风险管理与基本面分析三个方向。

基准设计

FinSkillBench 围绕真实投资管理任务构建,包含 12 个子任务共 2,603 个任务实例。每条实例提供时点输入、隐藏的正确答案以及针对该任务的自动验证器,用以评估 Agent 输出是否在计算和结构层面都符合要求。三个覆盖领域分别为:

  • 投资组合构建
  • 风险管理
  • 基本面分析

实验设置

研究者在九款语言模型上比较了三种条件:无技能、策展技能包(包含程序性文档与可执行组件)、以及 Agent 在同一实例内自行编写并复用的自生成技能。同时,独立验证阶段引入了 Hermes Agent 框架,在八款模型上共完成 5,280 个任务实例的复测。

关键发现

  • 使用策展技能包后,平均分从 0.366 提升至 0.528,且在投资组合构建与风险管理上的提升最为明显。
  • 相比之下,自生成技能虽带来更高计算开销,却几乎未能带来性能增益。
  • 独立框架复现了三个领域上的整体方向性结论,具体幅度因子任务与执行环境而异。

启示与开放资源

论文的核心结论是:在投资管理任务中,Agent 是否能获得可靠、可复用的程序性技能,与模型本身的选择同样关键;而朴素地让模型自我生成技能往往效果不佳。研究者已公开基准、评测工具、策展技能包以及完整轨迹数据,供后续研究使用。

相关资源随论文同步发布,可为关注金融 Agent 评测、Agent 工作流设计以及领域专用技能注入的研究者与工程团队提供参考。

信源