AI 快讯TimesFM-3来了,预测不再只看一条线
模型上新

TimesFM-3来了,预测不再只看一条线

2026-09-01T09:03:44.030Z
TimesFM-3来了,预测不再只看一条线

Google今日发布第三代时间序列基础模型 TimesFM-3,拥有3.3亿参数,在超过1万亿个时间点上预训练,首次原生支持零样本多变量预测及历史、动态协变量。

TimesFM-3来了,预测不再只看一条线

Google今天(2026年9月1日)发布了第三代时间序列基础模型 TimesFM-3,模型规模为3.3亿参数,核心变化是从“预测一条时间序列”走向“联合预测一组相互影响的时间序列”。

**TimesFM-3是一款面向零样本多变量预测的时间序列基础模型。**它可以在不针对具体业务数据集进行微调的情况下,直接根据历史序列预测未来,并同时处理多个共同演化的目标序列、历史协变量以及已知的未来事件。

这不是一次简单的参数扩容。TimesFM-3真正值得关注的地方,是Google终于把时间序列基础模型从“一个更强的通用单变量预测器”,推进到了更接近真实业务数据结构的多变量预测框架:商品销量不再被当成互不相关的多条曲线,门店客流、促销、天气与库存也不再只能靠人工拼接成特征。

TimesFM-3多变量时间序列预测示意图:多个商品销量、客流、天气和促销序列共同输入模型并预测未来

从单变量到多变量,TimesFM补上了关键一课

**单变量预测是只根据一条历史序列推断未来,多变量预测则是同时建模多条序列之间的依赖关系。**例如,单变量模型可以预测某个品牌的冰淇淋销量;多变量模型则会同时观察多个品牌、多个门店或多个区域的销量,判断它们是否受到相同季节、天气、价格和促销因素影响。

过去的TimesFM模型主要解决的是“没有足够标注数据时,能不能直接预测一条新时间序列”的问题。Google此前发布的TimesFM 1.0包含约2亿参数,在超过1000亿个真实世界时间点上训练,定位就是通用的零样本单变量预测模型。它使用类似语言模型的解码器式Transformer,把连续时间点切成多个patch,再预测后续patch。

TimesFM-3则把预测对象从一条序列扩展为一个序列集合。以零售为例,模型不只是分别预测“可口味冰淇淋销量”“巧克力冰淇淋销量”和“香草冰淇淋销量”,而是会尝试学习这些序列之间的共同变化:高温天气是否会同时推高多个品牌销量,某个品牌促销是否会挤压其他品牌,某个区域的客流变化是否会提前反映在周边门店订单中。

这类关系如果完全交给传统机器学习流程处理,通常需要大量特征工程。工程师要决定哪些序列互相作为特征、如何对齐时间戳、怎样处理缺失值,还要为不同商品、门店和区域反复训练模型。TimesFM-3的目标,是把其中一部分工作交给预训练模型完成。

3.3亿参数,训练数据扩大到1万亿时间点

**预训练时间序列基础模型,是先在大规模跨领域时序语料上学习通用模式,再把模型直接应用到新数据集。**TimesFM-3拥有3.3亿个参数,并在包含超过1万亿个时间点的真实世界与合成时间序列语料库上进行预训练。

相比此前约2亿参数、1000亿级时间点的TimesFM 1.0,TimesFM-3的参数量约增加65%,预训练时间点数量至少增加一个数量级。需要注意的是,参数更多和数据更多并不自动等于预测更准,时间序列基础模型的难点还在于数据频率、季节性、缺失模式和预测目标差异非常大。

文本模型可以把“猫”“狗”“飞机”映射到统一的token空间,时间序列却没有这么整齐。一个序列可能按分钟采样,另一个按天采样;一个数据集有稳定的周周期,另一个数据集会受到突发事件影响;有些业务数据甚至存在大量零值、断点和临时促销。TimesFM-3要做的,是在这些差异中学习能够迁移的模式。

Google没有在目前公开信息中给出一个可以直接横向比较所有数据集的统一准确率数字。因此,现阶段更准确的判断是:TimesFM-3在能力边界上完成了重要扩展,但它是否全面超过专门训练的LightGBM、DeepAR、PatchTST、Chronos或企业自建模型,还需要等待官方论文和完整评测结果。

三个原生能力,决定它能否进入业务系统

1. 多目标预测:一次预测多个相关序列

**多目标预测是同时输出多个目标时间序列的未来值,并显式利用这些目标之间的相关性。**TimesFM-3支持对多个共同演化的序列进行联合预测,并为所有目标提供点预测和分位数预测。

点预测给出一个最可能的数值,例如明天某门店预计售出120箱;分位数预测则给出不确定性范围,例如P50为120箱、P90为155箱。后者对库存和容量规划更有价值,因为企业真正需要的往往不是一个“看起来准确”的数字,而是知道在高需求情境下需要准备多少库存。

假设一家零售商要同时预测1000家门店、5000种商品的销量,分别训练500万条独立序列会带来巨大的模型管理成本。联合预测的思路是让相关序列共享表示和参数,既减少训练与维护开销,也有机会通过相邻序列的信息改善冷启动商品的预测。

但这并不意味着序列越多越好。相关性弱、时间戳不一致或业务机制完全不同的序列被强行放在一起,反而可能引入噪声。实际部署时,商品、门店、区域等分组方式仍然需要业务判断。

2. 过去协变量:把历史上发生过的影响因素纳入预测

**过去协变量是只在历史阶段已知、未来值不可提前获得的辅助时间序列。**例如历史客流、过去温度、广告曝光、库存水位和设备振动,都可以帮助模型解释目标序列为什么发生变化。

过去协变量与目标序列的区别在于,它们通常不是最终要预测的对象,而是提供背景信息。比如预测某商场未来销量时,过去几周的人流量可以帮助模型判断销量变化是由季节趋势引起,还是由客流突然下降引起。

这项能力对于运维和供应链场景尤其重要。服务器负载预测可以结合过去请求量、网络流量和错误率;工厂设备预测可以结合过去温度、压力和振动;物流需求预测则可以纳入历史订单、退货和配送时效。

3. 过去-未来动态协变量:用已经知道的未来事件指导预测

**过去-未来动态协变量是未来时间段的取值在预测时已经可知,或者能够提前获得的外部变量。**计划中的促销、节假日、排班、价格调整和天气预报都属于这一类信息。

这是时间序列预测中非常实用、也很容易被误用的一类特征。以促销为例,企业通常提前知道下周哪些商品会打折,因此可以把促销计划输入模型,预测活动对销量的影响。天气预报同样可以提前提供未来几天的温度或降雨信息,用于预测饮料、空调和出行需求。

动态协变量的价值在于,它让模型不必假设未来只是历史的重复。没有促销信息时,模型只能根据过去销量和季节性猜测;有了未来促销计划,它可以针对计划中的变化调整预测。

不过,外部变量本身也会出错。天气预报会更新,促销可能临时取消,排班计划也可能变化。企业在评估模型时,不能把事后才知道的真实天气或最终促销结果偷偷输入过去,否则得到的准确率会虚高,实际线上效果却会明显下降。

双注意力与连续补丁掩码,解决的是什么问题?

TimesFM-3的公开信息提到双注意力机制和连续补丁掩码,但目前适合把它们理解为面向时序结构的建模设计,而不是简单照搬语言模型。

**注意力机制是一种让模型动态决定“当前预测应该重点参考哪些历史信息”的方法。**在多变量时间序列中,模型既要关注单条序列内部的时间依赖,也要关注不同序列之间的相互影响。双注意力机制的意义,很可能就在于分别处理时间维度和变量维度上的关系:一边看某个商品过去几周的变化,一边看其他商品或相关指标在同一时间段的变化。

这与把所有数据粗暴拼接成一条长序列不同。后者可能让模型看到更多信息,但也容易混淆“时间上的邻近”和“变量之间的关联”。如果一个门店的销量和另一个门店的销量在同一天变化,它们属于跨变量关系;同一个门店本周和上周的销量,则属于时间关系。两者需要不同的建模视角。

**连续补丁掩码是随机遮盖连续时间片段,让模型根据上下文恢复缺失片段的预训练方法。**传统语言模型经常通过遮盖token训练,但时间序列的局部连续性更强,随机遮掉单个点未必能逼迫模型理解趋势。连续遮盖一段patch后,模型需要利用前后变化、周期结构和相关序列来补全缺失内容,更接近真实预测任务中“根据过去推断未来”的难度。

TimesFM此前已经使用patch化思路处理时间序列。一个patch可以理解为一小段连续采样点:模型不必逐点处理每一个数值,而是先学习局部趋势、波动和形状,再在更高层次上预测后续片段。这种做法有助于减少长序列推理时的计算量,也更容易捕捉不同时间尺度的模式。

TimesFM-3与前代、传统模型怎么选?

目前公开资料没有给出TimesFM-3完整的统一基准成绩,因此不适合简单宣称它已经击败所有竞品。更有价值的比较,是看不同方案解决的问题和部署成本。

| 模型或方法 | 主要预测能力 | 是否需要针对任务训练 | 协变量支持 | 适合场景 | |---|---|---:|---|---| | TimesFM 1.0 | 零样本单变量预测 | 否 | 主要面向单变量输入 | 快速试验、单序列预测 | | TimesFM 2.5 | 单变量预测,并增强外部特征使用 | 可选 | 支持部分历史与外部协变量 | 电子表格、企业快速预测 | | TimesFM-3 | 零样本多变量预测 | 否,可按需适配 | 过去协变量、过去-未来动态协变量 | 零售、供应链、容量规划、运维 | | ARIMA、Prophet | 单序列统计建模 | 通常需要逐序列拟合和调参 | 依赖具体实现 | 数据量较小、趋势和季节性明确 | | 专用深度学习模型 | 可针对数据集优化 | 是 | 通常支持多种特征 | 数据规模大、追求特定指标 |

传统统计模型的优势仍然存在。ARIMA、Prophet等方法结构清晰、可解释性较强,在数据量不大、周期规律稳定的场景中往往是可靠基线。它们的问题是,当企业需要同时管理数十万甚至数百万条序列时,逐个拟合、调参和维护会变得非常繁琐。

专门训练的深度学习模型则可能在单一领域取得更高精度,尤其是拥有大量高质量历史数据和稳定反馈闭环的企业。但训练、验证、监控和重新部署都需要机器学习团队。TimesFM-3瞄准的正是两者之间的空档:数据已经很多,但还不值得为每一个业务线单独训练一套模型。

零样本不等于不需要数据治理

**零样本预测是模型不使用目标数据集的监督标签进行参数更新,直接将预训练能力迁移到新序列上的推理方式。**它降低了建模门槛,但没有消除数据治理问题。

首先,时间戳必须对齐。销量按天记录、天气按小时记录、促销按活动周期记录时,企业需要决定统一粒度以及聚合方式。其次,缺失值、异常值和库存断货会影响模型判断。某商品销量为零,可能代表没有需求,也可能代表仓库缺货;两者对未来预测的含义完全不同。

再次,预测目标必须定义清楚。预测“订单量”和预测“实际消费量”不是一回事,预测“设备告警数”和预测“故障发生概率”也不是一回事。基础模型可以提供通用推理能力,却不能自动理解企业指标背后的口径。

最后是数据泄露。任何未来协变量都必须保证在预测时确实可获得。把未来真实销量、事后确认的天气或最终库存状态作为输入,会让离线评估失去意义。

开发者真正应该关注的四个指标

TimesFM-3上线后,开发者不应只看参数量和预训练数据规模,更要关注以下四个问题:

  1. **零样本基线是否足够好。**先用同一批数据与季节性基线、ARIMA、LightGBM和现有深度模型比较,确认TimesFM-3是否值得引入。
  2. **多变量关系是否真实存在。**如果各序列彼此独立,联合预测的收益可能有限;如果存在明显的跨商品、跨区域或上下游联动,多变量建模才更有价值。
  3. **分位数预测是否校准。**P90预测不是简单地把点预测乘以一个系数。企业需要检查真实值落入预测区间的比例,判断不确定性是否可信。
  4. **推理成本是否能接受。**3.3亿参数并不算超大,但多目标预测会增加输入和输出规模。批量大小、上下文长度、预测跨度以及GPU显存,都会影响线上成本和延迟。

工程上更稳妥的路径,是把TimesFM-3当作一个强大的通用基线,而不是上线第一天就替换所有现有模型。先选一个数据质量较高、业务反馈周期较短的场景进行回测,再观察模型在节假日、促销、异常波动和分布变化下的表现。

Google的时间序列路线,正在从模型走向产品化

Google此前已经在BigQuery ML中提供内置TimesFM模型,并通过AI.FORECAST等能力降低时间序列预测的使用门槛。这个方向说明,Google并不只想把TimesFM做成一个研究项目,而是希望把它嵌入数据仓库、云平台和企业分析工作流。

TimesFM-3支持多变量和动态协变量后,潜在应用范围会进一步扩大。零售商可以把商品、门店、促销和天气放进同一套预测流程;云服务商可以把请求量、延迟、错误率和扩容计划联合起来;能源企业可以同时分析多个区域负荷与天气变化;制造企业则可以把设备传感器、产线计划和维护记录放在一起。

但基础模型不会自动解决因果关系。模型发现“促销和销量同时上升”,不代表它已经准确估计了促销带来的增量,也不代表下一次促销一定会产生相同效果。对于预算、库存和生产排程这类高风险决策,预测结果仍然需要结合因果分析、规则系统和人工复核。

结语:重要的不是3.3亿参数,而是预测对象变了

TimesFM-3的核心进展,不是把TimesFM从2亿参数扩大到3.3亿参数,而是让时间序列基础模型开始原生处理现实世界中的“关系网络”。现实业务很少只有一条独立曲线:商品会相互竞争,门店会相互影响,天气会改变需求,计划中的事件会重塑未来。

Google此次发布的模型,至少在产品能力上正面回应了这些问题。它可以零样本联合预测多个目标,支持点预测与分位数预测,并纳入过去协变量和已知未来事件;同时,通过双注意力机制和连续补丁掩码,尝试在时间依赖与变量依赖之间建立更合适的建模方式。

对于没有专门机器学习团队、却拥有大量时序数据的企业,TimesFM-3值得尽快进入评测清单。对于已经拥有成熟预测系统的团队,它更适合先作为通用基线、冷启动方案或跨业务迁移工具。最终能否替代专用模型,仍要看官方完整基准、真实数据上的回测结果以及线上推理成本。

截至今天,TimesFM-3最清晰的定位是:它不是一个保证所有场景都更准的“万能预测器”,而是一套把多变量零样本预测进一步产品化的基础模型。时间序列领域的竞争,也正在从“谁能拟合一条曲线”,转向“谁能理解多条曲线为什么一起变化”。

参考来源

相关推荐

查看全部