桃子桃子快讯
返回首页
模型发布

蚂蚁国际 Falcon TST 2.0 登顶时序预测基准,多家国际银行已落地

蚂蚁国际自研时序大模型「鹰序 TST」2.0 在 GIFT-Eval 类基准上以 MASE 0.666 取得 SOTA,…

2026.08.26 · 周三6 分钟阅读

蚂蚁国际日前正式发布自研时序 AI 预测大模型「鹰序 TST」(Falcon TST,Time-Series Transformer)2.0 版。该模型在全球权威基准测试中取得最优成绩(SOTA),平均绝对比例误差(MASE)降至 0.666,超越多家全球顶尖科技公司的时间序列预测模型。Falcon TST 2.0 专为跨境支付外汇风险管理打造,并将拓展至电商供应链需求预测、航空运营管理等更多行业场景。

蚂蚁国际披露,巴克莱银行、花旗银行、德意志银行、渣打银行等大型金融机构已将 Falcon TST 2.0 应用于现金流预测与外汇管理,提升流动性风险敞口的预测能力。该模型预测准确率已稳定超过 93%,具备向物流、航空、电商等金融以外行业拓展的应用能力。

金融场景对通用时序模型提出更苛刻要求

2025 年以来,Amazon Chronos-2、Google TimesFM 2.5、Salesforce Moirai 2.0 和 IBM FlowState 相继把多变量、长上下文、概率预测、跨采样率适配等能力推向前台。Salesforce AI Research 于 2024 年 11 月发布的 GIFT-Eval 基准覆盖 28 个数据集、超过 14.4 万条时间序列和 1.77 亿个测试数据点,并配套约 2300 亿个不与测试集重叠的预训练数据点,推动行业从「一个数据集训练一个模型」转向「预训练一次、跨任务零样本预测」。

然而,金融收益率通常具有低信噪比、厚尾、波动率聚集和机制切换等特征。曼彻斯特大学、伦敦大学学院等研究者 2025 年 11 月的工作论文发现,直接使用现成预训练 TSFM 进行零样本预测和常规微调整体效果较弱,在金融数据上重新预训练后预测表现和经济收益才明显改善。2026 年 6 月一项针对 5 只美国高流动性股票的独立研究也显示,TimeGPT、TimesFM 2.5、Moirai 2.0、Chronos、Chronos-2 等模型拿下 10 个任务中 8 个最优结果,但相对随机游走基准的增益总体较小,仅少数任务通过显著性检验。

Falcon 家族先做金融验证再公开模型

Falcon 的演进路径与典型「先刷公开基准、再找行业应用」的 TSFM 不同。2025 年 5 月,蚂蚁国际已与巴克莱银行开展 TST 外汇预测合作;7 月与花旗银行开展航空客户外汇风险管理试点;8 月与渣打银行把 TST 接入其 SCALE 流动性引擎;直到 2025 年 10 月 Falcon-1.0 才正式在 Hugging Face 开放权重。

  • Falcon-1.0:采用分层混合专家架构,通过 Patch 级专家特化和样本级层次路由处理不同时间尺度。
  • Falcon-2.0:2026 年 7 月开放 API,定位为基于 ORBIT 训练框架的 Encoder-Only 单变量 TSFM,可直接输出 0.01、0.05、0.10 至 0.95、0.99 共 21 个分位点,并提供 input_mask 显式标记缺失值。
  • Falcon-X:2026 年 5 月公开论文,最大公开实验版本 591M 参数,将不同物理含义的变量转换到统一隐空间,通过差分注意力识别正向与负向关联,在 GIFT-Eval 报告 0.687 的 MASE。

四家国际银行的落地细节

  • 巴克莱银行(2025 年 5 月):将 TST 模型接入 BARX NetFX 外汇对冲平台,用于蚂蚁国际外汇敞口预测,可按小时、日和周预测现金流及外汇敞口,蚂蚁国际自身场景准确率超过 90%。
  • 花旗银行(2025 年 7 月):联合试点将 Falcon TST 与花旗「固定汇率解决方案」(Citi Fixed FX Rates)结合,面向跨币种线上售票的航空公司客户,首个航空客户已降低对冲成本约 30%。
  • 渣打银行(2025 年 8 月):把 Falcon TST 接入 SCALE 聚合流动性引擎,实现实时 24 小时外汇敞口预测,覆盖蚂蚁国际超过 60% 涉及外汇转换的交易,对外披露外汇成本最高下降 60%、流动性管理成本最高下降 50%。
  • Capital A / AirAsia(2025 年 10 月):披露按小时、日、周的预测准确率达 90%,外汇对冲成本最高下降 40%,为 Falcon 首个商业部署案例。

通用榜单与金融业务不可直接划等号

GIFT-Eval 仍是观察 TSFM 通用能力的重要窗口,但 2026 年以来 Falcon-X、Falcon-2.0、FlowState 新版本及多种 Agent 模型持续加入,榜单排名频繁变化,部分后续论文还专门区分「可能与 GIFT 训练数据存在重叠」的 Chronos-2 结果与更严格的无泄漏版本。对于金融机构而言,固定引用某一时点「全球第一」容易失真,更具参考价值的是模型是否在自己的资产、频率、市场状态和回测窗口中保持稳定。

分位数预测虽可进入风险管理流程,但不能直接等同于监管意义上的 VaR 和 ES。仅凭 API 能输出 1% 或 5% 分位点,不能直接推导模型已满足风险价值或预期损失要求,仍需经过覆盖率检验、条件覆盖检验、压力情景和模型风险管理,才能判断分位数是否具备稳定校准能力。

信源