蚂蚁鹰序TST 2.0登顶时序测评

蚂蚁国际近日发布鹰序TST 2.0,在全球权威时间序列基准测试中取得SOTA,MASE降至0.666,预测准确率稳定超过93%。模型的重点也从通用预测转向现金流、外汇风险和跨境业务管理。
蚂蚁鹰序TST 2.0登顶时序测评
蚂蚁国际近日发布自研时间序列预测基础模型“鹰序TST”(Falcon TST,Time-Series Transformer)2.0。根据蚂蚁国际及相关报道披露,鹰序TST 2.0在全球权威时间序列基准测试中取得最优成绩,平均绝对比例误差(MASE)降至0.666,预测准确率稳定超过93%。
这次更新的重点,不是把模型参数再做大一圈,而是把时间序列模型从“预测某个数值”推进到“辅助企业管理现金流、汇率和经营风险”。对于跨境支付、银行、航空和电商等业务来说,真正有价值的问题从来不是明天的交易量到底是100万还是105万,而是下周哪个币种会出现资金缺口、需要准备多少流动性、应该在什么时间进行对冲。
时间序列基础模型是能够从大规模连续数据中学习趋势、周期、季节性和突发变化,并迁移到不同预测任务的专用AI模型。 它处理的对象不是文本,而是按时间排列的交易金额、账户余额、订单量、客流量、库存和汇率等数据。

从1.0开源到2.0落地金融场景
鹰序TST的公开亮相并不是从2.0版本开始。2025年11月,蚂蚁国际在新加坡金融科技节上宣布开源首个版本。公开资料显示,1.0采用多分段模式(Patch)和混合专家(MoE)架构,参数规模超过25亿,并已在GitHub、Hugging Face及蚂蚁国际平台开放。
Patch是把连续的时间序列切成一段段“数据片段”的方法。对模型而言,这类似于阅读长文章时先按句子或段落理解,而不是逐字处理每一个时间点。这样做能够降低长序列计算量,也更容易识别“每天早晚高峰”“每周周期”和“季度性波动”等模式。
MoE则是一种按任务动态选择专家网络的架构。模型不需要让全部参数同时工作,而是根据输入数据选择更适合的“专家”。在跨境支付场景中,交易量、汇率、清算时间和节假日效应可能分别呈现不同规律,MoE的价值在于让模型针对不同模式进行更细分的处理。
2.0版本的公开信息显示,模型继续围绕跨境支付和外汇风险管理优化,并将应用范围扩展至电商供应链需求预测、航空运营管理、在线旅游和金融科技等高周转行业。蚂蚁国际没有在现有公开材料中完整披露2.0的参数规模、训练数据量和全部结构改动,因此不能简单把“2.0”理解成参数量翻倍的升级。
更准确的判断是,鹰序TST 2.0正在从研究型基础模型转向业务型预测系统:模型精度是基础,能否接入企业的资金、交易和运营流程,才决定它有没有商业价值。
MASE降至0.666意味着什么
MASE是通过与基准预测方法比较,衡量预测误差大小的指标,数值越低通常代表预测越准确。 鹰序TST 2.0披露的MASE为0.666,意味着其平均误差水平低于所采用的基准方法。
但这个数字不能脱离测试集、预测窗口和基准模型单独解读。时间序列预测不像语言模型跑一个统一的综合榜单:不同数据集的周期、噪声、缺失值和预测跨度差异很大。预测未来24小时,与预测未来12周,难度并不在同一个量级;稳定的零售销量,也不能直接类比高噪声的外汇市场。
因此,鹰序TST 2.0“登顶权威测评”的含义,主要是它在公开基准体系中取得了当前最优结果,而不是在所有真实金融市场中都能保证93%的准确率。蚂蚁国际披露的“预测准确率超过93%”,也应理解为其内部或具体业务场景中的统计结果,不能直接等同于外汇方向判断的胜率。
| 对比维度 | 传统单场景模型 | 通用大语言模型 | 鹰序TST 2.0 | |---|---|---|---| | 核心输入 | 单一业务历史数据 | 文本、指令和结构化数据的混合输入 | 多种时间序列数据 | | 擅长任务 | 固定行业、固定指标预测 | 分析、解释和生成文本 | 趋势、周期、季节性与波动预测 | | 跨行业迁移 | 通常需要重新训练 | 能理解业务,但数值预测稳定性有限 | 目标是跨行业迁移时间模式 | | 金融适配性 | 依赖人工设计特征 | 需要额外数据处理和工具链 | 原生面向现金流、汇率与流动性场景 | | 已披露指标 | 因项目而异 | 通常不以MASE为核心指标 | MASE 0.666,准确率稳定超过93% | | 主要短板 | 泛化能力弱、维护成本高 | 不是专门的预测模型 | 真实业务数据质量和部署条件仍是关键 |
金融场景真正需要的是“时间点”
现金流预测的核心不是知道企业未来会有多少钱,而是知道资金会在什么时间、以什么币种、以什么规模进出账户。
一家全球化企业可能在美元、欧元、英镑和新加坡元之间进行收付款。收入端来自不同国家的商户,支出端包括供应商结算、员工薪酬、清算准备金和金融机构费用。如果企业预计某个币种未来一周会出现缺口,就需要提前调拨资金或进行外汇对冲;如果预测偏高,企业可能过度持有资金,增加机会成本;如果预测偏低,则可能在最不利的汇率时间点被迫补仓。
传统的做法通常是为每个业务线单独训练模型,再由资金管理团队将结果汇总。它的问题是模型之间相互割裂:支付交易看交易历史,资金团队看账户余额,外汇团队看币种敞口,航空业务还要额外考虑航线、票务和租赁支出。
鹰序TST 2.0试图学习这些数据背后的通用时间模式。不同业务表面上差别很大,但它们都可能包含工作日效应、月末结算、节假日波动、促销周期和突发事件影响。模型如果能把这些模式迁移到新行业,就能减少每个企业从零开始建模的成本。
蚂蚁国际披露,鹰序TST最初用于内部现金流和外汇风险预测,支持小时、日和周级别的预测。相关报道还提到,巴克莱银行、花旗银行、德意志银行和渣打银行已将鹰序TST 2.0用于现金流预测或外汇管理。巴克莱将其整合进BARX NetFX,渣打则将其用于SCALE FX系统,并作为新加坡金融管理局PathFin.ai计划的一部分。
这些案例如果持续扩大,说明时间序列基础模型的竞争重点正在从“榜单上的误差”转移到“能不能嵌入已有金融系统”。不过,目前公开资料没有披露上述机构的完整测试集、部署规模、误差改善幅度和长期收益,因此外部读者仍应把它们视为厂商披露的应用信息,而不是独立审计结论。
为什么金融之外也能用
时间序列预测的跨行业能力,来自不同业务共享的时间结构,而不是来自行业名称本身。 电商的订单量、航空的客流量、银行的流动性和跨境支付的交易额,都可能受到周期性、季节性和突发事件的共同影响。
在电商供应链中,模型可以根据历史销量、促销节奏、区域订单和节假日因素预测未来需求,帮助企业减少缺货和库存积压。在线旅游平台可以预测目的地客流、酒店订单和跨境支付规模,以便调整营销和资源配置。航空公司则可以把客流、票务收入、燃油成本、飞机租赁和多币种支出放在同一套预测框架中。
天气变化和跨境人流也是典型的时间序列任务。天气数据有明显的周期和空间关联,人流数据则会受假期、赛事、签证政策和航班变化影响。模型可以提供趋势判断,但不能消除外部冲击带来的不确定性。遇到极端天气、突发政策或金融危机时,历史规律可能迅速失效,这也是企业不能把模型输出直接当成决策结果的原因。
开源是优势,也是考验
鹰序TST 1.0选择开源,降低了研究机构和企业试用时间序列基础模型的门槛。开发者可以通过GitHub查看项目资料,通过Hugging Face获取模型和相关资源,再根据自身数据进行评估和适配。
对于时间序列模型来说,开源的意义比“下载一个权重文件”更复杂。企业需要处理数据对齐、缺失值、异常值、节假日编码、预测窗口、回测方式和线上监控。金融数据还涉及权限、隐私、审计和监管要求。模型在公开基准上表现好,不代表它接入某家企业后马上能工作。
更现实的落地路径通常包括三步:先用历史数据进行离线回测,再进行小范围影子运行,最后才把预测结果接入资金调度或库存决策流程。线上系统还需要持续比较模型预测与真实结果,监测概念漂移,并在异常时期切换到人工或规则策略。
从开发者视角看,鹰序TST的价值在于提供了一个专门面向时间序列的基础模型起点。过去,团队往往要在ARIMA、Prophet、XGBoost和LSTM之间反复试错;现在可以先用基础模型获得一个跨场景基线,再判断是否值得为特定业务继续微调。它不一定替代传统模型,但有机会减少大量重复建模工作。
它能否成为金融预测的通用底座
鹰序TST 2.0目前最有说服力的方向是跨境支付和外汇风险管理,而不是泛化到所有预测任务。原因很简单:蚂蚁国际拥有高频、跨币种、长周期的真实业务场景,模型训练和验证都更接近金融机构实际使用方式。
它的优势也恰好构成限制。一个针对资金流和汇率敞口优化的模型,未必在制造业设备故障、能源负荷或科研观测数据上同样领先。不同领域的数据频率、噪声分布和因果关系差异很大,跨行业迁移需要经过严格回测,不能只看一个公开排行榜。
另一个问题是“准确率”本身。对于流动性管理,少数一次严重误判可能比一百次小误差更危险;对于库存预测,模型还要考虑缺货成本、仓储成本和供应商交付周期。因此,企业最终应同时关注MASE、MAE、分位数损失、置信区间覆盖率和极端事件表现,而不是只追逐一个SOTA数字。
我们的判断是,鹰序TST 2.0值得关注,但它的行业意义不在于宣称时间序列预测已经解决,而在于它把专用基础模型带入了更具体的经营流程。大语言模型解决的是“理解和生成信息”,时间序列基础模型解决的是“预判信息如何随时间变化”。当两者与企业的资金、订单和运营系统结合,AI才可能从分析工具变成经营基础设施。
对开发者而言,接下来最值得观察的不是模型榜单还能下降多少,而是三件事:2.0是否会公开更多训练和评测细节;开源版本能否在真实企业数据上复现披露结果;以及金融机构之外,航空、电商和旅游等行业是否会出现可量化、可持续的部署案例。
截至2026年8月26日,鹰序TST 2.0已经完成了从通用时间序列预测到金融应用验证的重要一步。它是否能成为跨行业的预测底座,还需要更多公开数据和长期运行结果来证明。至少在当前阶段,它比“又一个更大的AI模型”更值得企业技术团队认真评估,因为它瞄准的是预算、库存、流动性和风险这些能够直接影响经营结果的问题。
参考来源
- Hugging Face Falcon TST 模型搜索页:用于查看鹰序TST相关开源模型、权重和社区资源。
- GitHub Falcon TST 项目搜索页:用于查看鹰序TST相关代码仓库、文档和开发者讨论。
注:本文关于MASE 0.666、预测准确率超过93%、金融机构应用及业务降本效果的内容,依据蚂蚁国际公开信息和相关媒体报道整理;具体数据集、测试窗口、基准模型及部署口径以官方后续披露为准。



