蚂蚁国际日前正式发布自研时序 AI 预测大模型“鹰序 TST”(FalconTST,Time-Series Transformer)2.0 版。“鹰序 TST”2.0 在全球权威基准测试中取得最优成绩(SOTA),平均绝对比例误差(MASE)降至 0.666,超越多家全球顶尖科技公司的时间序列预测模型。该模型专为跨境支付外汇风险管理打造,并将拓展至电商供应链需求预测、航空运营管理等更多行业场景。
目前,巴克莱银行、花旗银行、德意志银行、渣打银行等大型金融机构已将“鹰序 TST”2.0 应用于现金流预测与外汇管理,提升流动性风险敞口的预测能力。“鹰序 TST”2.0 的预测准确率已稳定超过 93%,具备向物流、航空、电商等金融以外行业拓展的应用能力。
2025 年以来,Amazon Chronos-2、Google TimesFM 2.5、Salesforce Moirai 2.0 和 IBM FlowState 相继将多变量、长上下文、概率预测、跨采样率适配等能力推向前台。与此同时,金融市场的低信噪比、机制切换、厚尾风险和跨市场联动,使通用榜单优势很难直接转化为稳定的金融预测收益。
蚂蚁国际 Falcon TST 的演进具有代表性:2025 年,该模型先在外汇敞口和资金管理中完成业务验证;2026 年,又以 Falcon-2.0 强化单变量预测效率,以 Falcon-X 补足异构多变量关系建模。Falcon TST 2.0 是“通用时序基础能力 + 金融流程验证”的专用化尝试,其持续迭代和稳定进步,展现了蚂蚁国际在 AI+金融领域的先锋力量。
一、金融时间序列正在检验通用基础模型的真实能力
**通用时间序列基础模型已经具备明显的跨数据集迁移能力。**Salesforce AI Research 于 2024 年 11 月发布的 GIFT-Eval 基准覆盖 28 个数据集、超过 14.4 万条时间序列和 1.77 亿个测试数据点,并配套约 2300 亿个不与测试集重叠的预训练数据点。该基准推动行业从“一个数据集训练一个模型”转向“预训练一次、跨任务零样本预测”。Google TimesFM、Amazon Chronos、Salesforce Moirai 等模型随后快速升级,核心目标已从单一预测精度扩展到跨频率、跨变量和不确定性输出。
**金融市场对通用模型提出了更为苛刻的检验。**金融收益率通常具有低信噪比、厚尾、波动率聚集和机制切换等特征。日内行情、日度收盘、利率曲线和宏观数据还存在频率不一致、节假日错位和缺失值等问题。曼彻斯特大学、伦敦大学学院等研究者于 2025 年 11 月发布的大规模金融实证工作论文发现,直接使用现成预训练 TSFM 进行零样本预测和常规微调,整体效果较弱;在金融数据上重新预训练后,预测表现和经济收益明显改善。该结果说明,通用预训练提供了有价值的时间模式先验,但金融领域仍高度依赖训练分布与目标任务的匹配。
**金融 TSFM 的价值应与“稳定产生交易收益”区分开来。**2026 年 6 月,一项针对 5 只美国高流动性股票的独立研究比较了 TimeGPT、TimesFM 2.5、Moirai 2.0、Chronos 和 Chronos-2 等模型。结果显示,TSFM 在 10 个任务中取得了 8 个最优结果,但相对随机游走基准的增益总体较小,只有少数任务通过显著性检验;此外,META 的两个任务仍由本地监督训练的 iTransformer 胜出。金融机构因此更适合把 TSFM 视为可迁移的预测底座和开发效率工具,再通过领域数据、滚动回测和风险约束完成二次验证。
二、主流 TSFM 已转向多变量、长上下文和概率预测
**Chronos-2 把 Amazon 的技术路线从单变量预测推进到通用上下文学习。**Amazon 于 2025 年 10 月 20 日发布了 1.2 亿参数的 Chronos-2。该模型原生支持单变量、多变量和协变量条件预测,并通过 Group Attention 在相关序列之间共享上下文信息。
需要区分的是,初代 Chronos 确实采用了“缩放和量化后转为离散 Token,再以语言模型交叉熵训练”的路线;Chronos-2 已经引入新的组注意力和通用上下文学习机制,不能简单沿用“数值分桶导致尾部精度受限”来评价新版本。Amazon 公布的“超过 90% 胜率”,指 Chronos-2 相对 Chronos-Bolt 的头对头比较,并非 GIFT-Eval 总榜胜率。Chronos-Bolt 的“最高 250 倍推理加速、20 倍内存节省”,同样是相对初代同规模 Chronos 的对比结果。
**TimesFM 2.5 用更小的参数量换取更长上下文和连续分位数预测。**Google Research 于 2025 年 9 月 15 日发布 TimesFM 2.5,将模型规模从 2.0 版的 5 亿参数降至 2 亿参数,上下文长度从 2048 扩展至最高 16384,并增加可选的 3000 万参数连续分位数预测头,最长支持 1000 步分位数预测。
此后,Google 于 2025 年 10 月恢复 XReg 协变量支持,2026 年 3 月增加 Agent 技能接口,4 月加入基于 LoRA 的微调示例。因此,“2.5 版在 2026 年一次性加入分位数、LoRA 和 Agent”的说法并不准确,模型发布与生态增强分属不同时间节点。
**Moirai 2.0 证明,时间序列基础模型并不需要持续堆叠大参数。**Salesforce 于 2025 年 8 月 8 日发布 Moirai 2.0,将早期 Moirai 的 Masked Encoder 改为 Decoder-Only Transformer,并把训练目标改为分位数损失和多 Token 预测,同时增加缺失值信息嵌入、随机 Patch 掩码和数据质量过滤。
Salesforce 公布的小型版本约有 1140 万参数,相比此前 Moirai Large 的参数量缩小约 96%,推理速度提高 44%,并在当时的 GIFT-Eval 无测试数据泄漏模型中取得领先 MASE。其意义在于,TSFM 竞争正在从“更大”转向“更合适的数据、目标函数和训练策略”。
**FlowState 用状态空间模型回应 Transformer 对采样频率变化适应不足的问题。**IBM Research 于 2026 年 7 月 6 日公布 ICML 2026 论文 FlowState。该模型以状态空间模型编码器和函数基解码器实现连续时间建模,可在输入采样率变化和预测区间变化时动态调整时间尺度。IBM 公开的 GIFT-Eval 提交中包含 910 万参数版本,规模显著小于主流 Transformer TSFM。
该路线更关注跨采样率和计算效率。目前,公开论文的重点并非复杂异构多变量关系,因此在金融场景中仍需要结合跨资产、跨因子建模能力进行评估。
三、Falcon TST 的差异化已有金融场景验证支撑
**Falcon TST 先形成金融业务验证,再逐步形成公开模型家族。**2025 年 5 月,蚂蚁国际已与 Barclays 开展 TST 外汇预测合作;7 月与 Citi 开展航空客户外汇风险管理试点;8 月与 Standard Chartered 将 TST 接入其 SCALE 流动性引擎;10 月,Falcon-1.0 才正式在 Hugging Face 开放。
由此可见,Falcon 的发展路径与典型的“先刷公开基准、再寻找行业应用”的 TSFM 不同,真实资金管理和外汇敞口预测在其公开发展史中出现得更早。
**Falcon-1.0 的核心设计是用层次化混合专家处理多尺度时间模式。**蚂蚁国际官方仓库将 Falcon-1.0 定义为分层混合专家模型,通过 Patch 级专家特化和样本级层次路由,处理不同时间尺度。
当前 Falcon 官网展示 3000 亿个时间点和 25 亿参数的产品口径,而 2025 年与多家银行的联合公告普遍表述为“接近 20 亿参数”。两组数字很可能对应不同模型阶段或统计口径。由于公开材料没有给出完整对照,因此本文不把参数规模作为 Falcon 优势的核心证据。更可靠的公开证据,是其对小时、日和周等多时间尺度现金流及外汇敞口的业务预测能力。
四、Falcon-2.0 和 Falcon-X 分别强化单变量效率与多变量关系建模
**Falcon-2.0 将模型重点转向单变量预测效率和概率输出。**蚂蚁国际于 2026 年 7 月开放 Falcon-2.0 API,官方将其定义为基于 ORBIT 训练框架的 Encoder-Only 单变量 TSFM。
相比初代层次化混合专家架构,Encoder-Only 更适合通过一次前向计算直接完成预测,减少自回归逐步生成带来的延迟和误差累积。公开 API 可直接输出 0.01、0.05、0.10 至 0.95、0.99 共 21 个分位点,并提供 input_mask 显式标记缺失值,对节假日、停牌或交易日错位等金融数据的处理更为友好。
**Falcon-X 补足了金融场景最关键的异构多变量建模能力。**蚂蚁国际团队于 2026 年 5 月 26 日公开 Falcon-X 论文,最大公开实验版本为 591M 参数。Falcon-X 将不同物理含义的变量转换为统一的隐空间表示,通过差分注意力同时识别正向和负向关联,再处理变量间关系并重建各变量轨迹。
论文在 GIFT-Eval 中报告了 0.687 的 MASE,并在 fev-bench 上进行多变量评测。对金融业务而言,更重要的意义在于,模型开始直接处理“汇率—利率—波动率—商品”等异构变量之间的关系,而不再只依赖单条序列自身的历史信息。
**多变量输入只有在变量关系真实有效时才会带来增益。**Santa Clara University 研究者于 2026 年 5 月使用 Chronos-2,对“美股科技龙头”和美国国债利率进行 2000—2025 年滚动预测。研究发现,相关变量联合输入总体优于单变量输入,但把股票和利率两个面板直接混合后,预测精度反而下降。
该结果对 Falcon-X 同样具有启示:共享隐空间能够扩大信息来源,但在金融生产环境中仍需严格控制变量选择、信息时点和滚动回测,避免无关因子将噪声带入模型。
**分位数预测可以进入风险管理流程,但不能直接等同于监管意义上的 VaR 和 ES。**Falcon-2.0 和 Falcon-X 均提供多分位数输出,可用于构造悲观、中性和乐观情景,也可作为风险价值和预期损失模型的重要输入。
若预测目标本身是资产收益或组合损益,低分位数可以用于估计尾部损失;但在真实风控体系中,仍需经过覆盖率检验、条件覆盖检验、压力情景和模型风险管理,才能判断分位数是否具备稳定的校准能力。仅凭 API 能够输出 1% 或 5% 分位点,不能直接推导出模型已满足 VaR 或 ES 要求。
五、金融机构合作开始把预测能力嵌入真实资金管理流程
**巴克莱银行合作验证了 Falcon 进入银行外汇对冲平台的可行性。**2025 年 5 月 7 日,蚂蚁国际宣布,巴克莱银行将 TST 模型接入 BARX NetFX 外汇对冲平台,用于提高蚂蚁国际外汇敞口预测的准确度。
公开材料称,TST 可按小时、日和周预测现金流及外汇敞口,蚂蚁国际自身场景的预测准确率超过 90%。合作的核心价值,是通过更准确的敞口预测减少不必要对冲和银行风险溢价,再由银行既有的 Guaranteed FX 流程执行风险管理。
**花旗银行试点将 Falcon 用于航空客户的线上售票外汇风险管理。**2025 年 7 月 18 日,花旗银行与蚂蚁国际宣布联合试点,将 Falcon TST 与花旗银行固定汇率解决方案(Citi Fixed FX Rates)结合,面向跨币种线上售票的航空公司客户。
花旗银行官方公告确认,首个航空客户已在实际交易中降低对冲成本,并援引蚂蚁国际数据称,试点客户的对冲成本节省约 30%。该合作表明,时间序列基础模型开始以“预测即服务”的方式进入银行产品,最终定价与交易仍由花旗银行既有外汇系统执行。
**渣打银行合作将 Falcon 接入 24 小时外汇流动性管理流程。**2025 年 8 月 25 日,渣打银行与蚂蚁国际宣布,将 Falcon TST 接入该行 SCALE 聚合流动性引擎,实现实时、24 小时外汇敞口预测。
渣打银行公告称,整合后蚂蚁国际外汇敞口预测准确率超过 90%,并披露 Falcon 当时已覆盖蚂蚁国际超过 60% 的涉及外汇转换交易;相关外汇成本最高下降 60%,流动性管理成本最高下降 50%。上述降本数据属于合作双方披露的业务口径,更适合作为商业落地成效,不宜与公开学术基准直接比较。
**Capital A 提供了目前较为清晰的第三方企业客户效果数据。**2025 年 10 月 7 日,Capital A 旗下 AirAsia 在官方新闻稿中披露,Falcon 用于多币种现金流和外汇敞口预测后,按小时、日和周计算的预测准确率达到 90%,外汇对冲成本最高下降 40%。
Capital A 称,该项目为 Falcon 首个商业部署,并披露航空行业版本加入了旅行行业相关数据。该案例说明,行业专用化的实际价值更多来自模型、行业数据、银行交易设施和企业资金管理规则的组合,而非由单个基础模型替代现有 Treasury 体系。
六、通用基准领先不能直接等同于金融业务领先
**GIFT-Eval 仍是观察 TSFM 通用能力的重要窗口,但榜单成绩需要结合时间和数据重叠情况解读。**Salesforce 建立 GIFT-Eval 的初衷,就是统一零样本测试、减少数据泄漏,并比较不同频率和变量数量。2026 年以来,Falcon-X、Falcon-2.0、FlowState 新版本以及多种 Agent 模型持续加入,榜单排名频繁变化。
部分后续论文还专门区分了“可能与 GIFT 训练数据存在重叠”的 Chronos-2 结果和更严格的无泄漏版本。对于金融机构而言,固定引用某一时点的“全球第一”容易失真。更有意义的是检查模型是否能在自身的资产、频率、市场状态和回测窗口中保持稳定。
**现阶段没有一条技术路线在金融任务上形成绝对优势。**Chronos-2 擅长将相关变量和协变量作为上下文;TimesFM 2.5 依托长上下文和成熟生态,保持较强的即插即用能力;Moirai 2.0 证明小模型也能在通用基准上保持竞争力;FlowState 突出跨采样率适应;Falcon-2.0 和 Falcon-X 则分别押注高效单变量预测与异构多变量关系建模。
金融任务对极端行情、时间对齐、外生变量、分位数校准和部署时延的要求各不相同,模型选择需要从具体业务目标倒推。
表 1 主流时间序列基础模型的公开技术路线与金融应用观察
| 模型 | 公开版本与规模 | 核心技术路线 | 多变量与外生信息 | 金融应用观察 |
|---|---|---|---|---|
| Falcon TST 2.0 | Falcon-2.0 最大实验版本为 585M;Falcon-X 最大公开实验版本为 591M | Falcon-2.0 为 Encoder-Only + ORBIT;Falcon-X 采用共享隐原型空间 | Falcon-X 原生支持异构多变量;两者均提供分位数预测 API | 已有外汇与 Treasury 场景验证;Falcon-2.0 完整论文尚待公开 |
| Amazon Chronos-2 | 120M | Encoder-based Group Attention 与上下文学习 | 原生支持单变量、多变量和协变量条件预测 | 独立金融研究显示,相关变量联合输入有效;无关跨市场变量可能引入噪声 |
| Google TimesFM 2.5 | 200M;可选 30M 分位数头 | Decoder-Only,最高支持 16k 上下文 | 原生以单变量为主,可通过 XReg 加入协变量 | 金融基准平均表现较强,但部分资产仍被本地监督模型超过 |
| Salesforce Moirai 2.0 | Small 版本约 11.4M | Decoder-Only,采用分位数损失和多 Token 预测 | Moirai 家族面向通用多序列预测,2.0 强化缺失值和鲁棒性处理 | 通用效率突出;公开训练语料并非金融专用 |
| IBM FlowState | GIFT-Eval 公开提交中包含 9.1M 版本 | 状态空间模型编码器 + 函数基解码器 | 重点解决跨采样率和可变预测区间问题 | 适合跨频率任务;复杂异构多变量关系仍需额外验证 |
数据来源:各模型官方论文、技术博客与 GIFT-Eval 公开资料
注:GIFT-Eval 为动态榜单,且部分提交存在训练数据重叠标记。为避免将阶段性排名固化为长期结论,表中不列统一的“当前排名”。
七、金融 TSFM 竞争将更多取决于数据适配、风险校准和工程落地
**金融 TSFM 的下一阶段竞争重点,将从“能否零样本预测”转向“能否在真实风险流程中稳定使用”。**通用模型已经证明,大规模跨领域预训练可以显著降低时间序列建模门槛;金融实证又反复显示,领域数据和任务适配仍然关键。
对于资金管理、流动性预测和外汇敞口等场景,衡量模型的核心标准应逐步转向滚动回测稳定性、极端行情失效边界、分位数校准、数据泄漏控制、推理成本和系统接入能力。通用榜单仍有价值,但只能回答模型“会不会预测”,无法单独回答“能不能进入风控体系”。
**Falcon TST 2.0 已经形成一条较为清晰的金融应用路径。**2025 年的主线,是将 TST 模型嵌入 Barclays、Citi、Standard Chartered 以及 Capital A 等机构的真实资金管理和外汇业务;2026 年的主线,则是以 Falcon-2.0 和 Falcon-X 分别解决高效单变量预测和异构多变量预测。
公开证据显示,这条路径具备较强的金融产品化基础。后续仍需补齐 Falcon-2.0 完整论文、预训练数据构成、可复现评测和极端市场压力测试等信息,才能进一步验证其领先能力的可持续性。
**时间序列基础模型正在形成“通用底座与行业专用模型并存”的市场格局。**TimesFM、Chronos 等通用 TSFM 适合低成本试验、冷启动和跨行业快速迁移;金融专用模型则更适合数据充足、指标明确、风险敏感的生产场景。
Falcon TST 2.0 的意义在于,将竞争焦点进一步推向真实金融流程:模型不仅要理解时间规律、变量关系和不确定性,还要被银行与企业既有的风控、对冲和流动性管理体系消化。金融机构最终购买的是一套能够被验证、被校准、被治理并持续产生业务价值的预测能力,模型规模只是其中一项技术参数。
八、主要资料来源
-
Salesforce AI Research,GIFT-Eval: A Benchmark for General Time Series Forecasting Model Evaluation,2024-11-12。
-
Amazon Science / GitHub,Chronos-2: From Univariate to Universal Forecasting / Chronos repository,2025-10-20。
-
Google Research / GitHub,TimesFM 2.5 release and 2026 updates,2025-09-15—2026-04-09。