模型与研究

Google Research 发布 TimesFM 3.0:时间序列预测开始原生处理多变量信息

Google Research 发布 TimesFM 3.0,原生支持多变量时间序列、历史与已知未来协变量,并可在一次前向计算中生成整个预测区间。官方同时开放 PyTorch 权重(受非商业许可限制),并在多个公开基准上取得领先排名,BigQuery 集成将在随后推出。

Google Research 发布 TimesFM 3.0:时间序列预测开始原生处理多变量信息

Google Research 发布 TimesFM 3.0,原生支持多变量时间序列、历史与已知未来协变量,并可在一次前向计算中生成整个预测区间。官方同时开放 PyTorch 权重(受非商业许可限制),并在多个公开基准上取得领先排名,BigQuery 集成将在随后推出。

Google Research 发布了时间序列基础模型 TimesFM 3.0。与此前主要面向单变量预测的版本相比,新模型原生支持多变量时间序列、历史协变量以及已知的未来协变量,并可在一次前向计算中生成整个预测区间。

TimesFM 项目在 GitHub Release 页面显示,TimesFM 3.0 于 2026 年 8 月 28 日发布,内容包括新的模型权重及配套代码。Google Research 随后于 8 月 31 日发表了题为 “TimesFM-3: A zero-shot foundation model for multivariate forecasting” 的介绍文章,对模型架构和评测结果作了进一步说明。

从“预测一条曲线”转向联合建模

Google 表示,TimesFM 2.5 及此前版本严格限制在单变量预测场景,即主要依据单条时间序列的历史数据推断未来。这个设定适合部分任务,但现实中的预测往往同时受到多条相关序列和外部因素影响。

例如,零售商预测冰淇淋销量时,除了历史销量,还可能需要考虑相关商品的销量、客流量、促销安排、节假日和天气。TimesFM 3.0 的设计目标,就是让这些信息可以在同一个预测任务中被联合使用,而不是必须为每个任务单独训练一个模型。

根据 Google Research 的说明,TimesFM 3.0 支持三类输入:一是同时预测多个相互关联的目标序列;二是使用只在历史阶段可见的过去协变量,例如历史客流量;三是使用在预测区间内也已知的动态协变量,例如已经排定的促销活动或天气预报。

这一区分很重要。历史协变量只能帮助模型理解过去发生了什么,而未来协变量还可以在预测时提供计划性或外部信息。模型并不是“预知”未来,而是利用使用者已经掌握的未来安排来调整预测结果。

一次前向计算生成整个预测区间

TimesFM 3.0 延续了 TimesFM 系列的解码器式 Transformer 路线。官方介绍称,模型将连续的时间点组织成长度为 32 的数据块,并通过时间序列归一化处理不同序列之间的尺度差异。

在多变量建模中,模型交替使用两种注意力机制:因果时间注意力沿时间方向捕捉历史模式,同时避免看到不应提前获得的信息;变量注意力则在同一时间位置上关联不同序列,从而学习它们之间的关系。

此前版本逐个预测未来数据块,较长预测区间可能带来延迟和误差累积。TimesFM 3.0 使用 Contiguous Patch Masking,将未来区间作为被遮蔽的占位数据一次性送入模型。对于未来未知的目标序列和过去协变量,未来部分保持遮蔽;对于已知未来协变量,则保留相关信号。

Google 表示,这种非自回归解码方式可以在一次前向计算中填充整个预测区间。模型还会为每个目标序列和每个预测时间点输出从第 10 到第 90 百分位的 9 个分位数,以表达预测的不确定性,而不只是给出单一数值。

官方称三个基准测试平均排名第一

Google Research 表示,TimesFM 3.0 在 GIFT-Eval、FEV-Bench 和 TIME 三个公开时间序列预测基准中,均取得所有预训练时间序列基础模型中的最高平均排名;这一结论同时涉及点预测和概率预测指标。

项目 GitHub 仓库 将相关结果概括为:在 FEV-Bench 的 100 项真实世界预测任务中排名第一;在 TIME 的 50 个领域数据集和 98 项评测任务中排名第一;在 GIFT-Eval 中则在基础模型范围内排名第一。Google 也特别区分了单变量模式和完整多变量模式:即使不提供跨序列信息,TimesFM 3.0 也据称具有较强表现;加入协变量和跨序列信息后,平均排名进一步提升。

这些基准各自强调的重点并不完全相同。FEV-Bench 论文将其定义为覆盖 7 个领域、100 项任务的评测,并纳入了带协变量的任务;TIME 论文则介绍了由 50 个新数据集构成的 98 项任务,并强调通过数据筛选和任务设计降低数据泄漏风险。基准排名可以说明模型在这些测试设置下的表现,但不能直接推导出它在所有行业、所有预测周期或所有数据质量条件下都占优。

此外,Google 的结果目前主要是项目方对评测的发布。对于实际使用者而言,数据预处理、预测周期、协变量是否真正可用,以及模型在特定业务数据上的误差分布,仍需要独立复现和现场验证。

权重开放,但商业和生产使用受限

TimesFM 3.0 的 PyTorch 权重已上传至 Hugging Face 的官方模型页:google/timesfm-3.0-pytorch。模型卡显示,该版本包含 20 层 Transformer,模型维度为 1280、注意力头数为 16;上下文 patch 长度为 32,预测 horizon patch 长度为 64。

但“提供权重”并不等同于可以不受限制地部署。GitHub 仓库说明,TimesFM 项目源代码采用 Apache-2.0 许可证,2.5 及此前版本的权重也采用 Apache-2.0;TimesFM 3.0 的预训练权重则暂时采用单独的 TimesFM Non-Commercial License v1.0,并限制在非商业、非生产环境中使用。Hugging Face 模型卡同样标明了这一许可证。

这意味着开发者可以研究模型结构、下载权重并进行符合许可证范围的测试,但企业如果计划把默认权重接入收费服务、内部生产系统或面向客户的预测流程,就不能仅依据代码仓库的开源许可证作出判断。正式部署前,需要单独核对 TimesFM 3.0 权重许可证的具体条款和授权路径。

BigQuery 集成仍在后续安排中

Google Research 表示,TimesFM 3.0 已在 GitHub 和 Hugging Face 提供,BigQuery 集成将在未来几周陆续推出。在此之前,Google 建议用户先使用 TimesFM 2.5,通过 BigQuery 的 AI.FORECAST 命令熟悉时间序列预测流程。

TimesFM 3.0 的技术变化,反映出时间序列基础模型正在从“对一条序列进行零样本预测”,转向处理更接近业务实际的联合预测任务。对于零售、能源、制造、金融和运维等场景,多变量关系与未来已知事件往往比单条曲线本身更能决定预测是否有用。不过,模型能否在这些场景中带来稳定收益,最终仍取决于协变量的质量、未来信息的可靠程度、评测方法以及许可证允许的部署方式。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读