← All posts / Models

Google TimesFM-3:一次前向傳遞,完成多變量時間序列預測

Google Research 的 3.3 億參數時間序列基礎模型,能在單次前向傳遞中生成完整的多變量預測視界——目標序列、協變數與 9 個分位數一次到位,橫掃 Gift-Eval、FEV-Bench 與 Time 三大基準。

Google TimesFM-3:一次前向傳遞,完成多變量時間序列預測

當整個 AI 產業的目光都鎖定在越來越大的語言模型上時,Google Research 悄悄更新了一個遠不那麼炫目、但商業上至關重要的品類:時間序列預測。2026 年 8 月 31 日,TimesFM 背後的團隊發布了 TimesFM-3——一個多變量預測的零樣本(zero-shot)基礎模型,能在單次前向傳遞中生成整個預測視界,連不確定性區間都一併輸出。

這是一個密度很高的發布。在每家廠商的demo都圍繞聊天機器人打轉的時代,TimesFM-3 這類模型最終會進到零售需求規劃、財務部位管理、可觀測性儀表板與電網調度——那些從不上頭條、卻撐起經濟運作的決策基礎設施層。

問題所在:真實的預測都是多變量的

TimesFM 於 2024 年問世時,推廣了「時間序列基礎模型」的概念:一個在海量真實與合成時間序列上預訓練的 decoder-only transformer,能對從未見過的資料進行零樣本預測。Google 表示,此後該系列模型已在零售、金融、可觀測性、製造、醫療與自然科學等領域被廣泛採用。

但始終存在一個缺口。直到 TimesFM-2.5(2025 年 9 月發布)為止,整個系列都嚴格限定單變量——每次預測只依賴單一序列自身的歷史。現實世界很少配合這種假設。用 Google 自己的例子來說:只靠過去銷量來預測冰淇淋銷售,等於忽略了來客足跡、冰淇淋筒與糖漿的銷量、天氣預報、促銷檔期與節假日。真正有價值的預測問題,幾乎都涉及多條相互關聯的序列,加上共同塑造未來的外部特徵。

TimesFM-3 補上了這個缺口。它原生為多變量預測而預訓練,開箱即支援:

  • 多目標序列——同時聯合預測多條相關序列(例如不同品牌的冰淇淋),且每個目標都提供點預測與分位數預測
  • 過去協變數(past covariates)——只在歷史中已知的特徵,例如過去的來客流量
  • 過去—未來協變數(dynamic covariates)——已知的未來事件,如已排定的促銷或天氣預報,用來引導預測

技術核心:交替注意力與一次解碼

架構上延續了這個系列 decoder-only transformer 的血統,但兩項創新值得注意。

多變量 token 建構。時間序列被切成分塊(patch),每塊 32 個時間步,並對每條序列做常規化以處理尺度差異。對過去—未來協變數,TimesFM-3 用了一個「lookahead」技巧:每個 token 把當前 patch 與未來的 patch 拼接在一起,讓模型直接吸收即將到來的已知訊號。

交替注意力(alternating attention)。transformer 堆疊在(時間 × 序列)的二維網格上運作。因果時間注意力沿時間軸橫向運行——在每條序列內部嚴格因果,防止資料洩漏。全變量注意力(full variate attention)則縱向跨序列運行,任一 token 都能看到同一時間步上所有其他序列——跨序列相關性(例如某個促銷拉抬一項商品、卻排擠另一項)就是在這裡學到的。兩種機制在堆疊的 20 層之間交替(依 Hugging Face 模型卡:模型維度 1280、16 個注意力頭)。

非自回歸解碼是最大的改動。過去的 TimesFM 逐 patch 生成預測——自回歸式地——這意味著延遲、誤差逐步累積,且運算成本隨視界長度增加。TimesFM-3 改用 Contiguous Patch Masking:在觀測上下文之後,為整個未來視界附加遮罩的佔位 token,然後在一次前向傳遞中同時填滿所有被遮罩的 patch。過去—未來協變數在視界中保持可見,持續餵給模型已知的未來事件。每次預測的產出:從第 10 到第 90 百分位的 9 個分位數,無需任何迭代迴圈,就是完整的不確定性輪廓。

Google 的實例清楚展示了差異。把促銷排程作為過去—未來協變數輸入後,TimesFM-3 從歷史資料中學到「促銷→銷量提升」的關係,進而預期每個促銷日約有 20% 的銷量增幅。而單變量基準只會把每週規律向前投射,對行事曆一無所知。

基準測試:三個榜單全部第一

Google 在三個綜合性公開基準——Gift-Eval、FEV-Bench 與 Time——上評測 TimesFM-3,對手包括具備多變量能力的 Chronos-2 與 Toto 2.0 系列,以及前代 TimesFM-2.5。結果:在所有預訓練基礎模型中,三個基準的點預測與機率式預測指標均排名第一。

評測中有兩個細節值得注意。第一,每個基準都列入了 TimesFM-3 的兩個成績。在單變量模式下——不用協變數、不用跨序列資訊、每條序列獨立處理——它就已經追平或超越所有可複現的競爭基礎模型;切換到完整多變量模式後,又是一波躍升。第二,多變量的增益並不是靠堆參數換來的:模型僅 3.3 億參數,在超過 1 兆個真實與合成時間點上預訓練(GiftEvalPretrain 剔除與 FEV-Bench 重疊的資料集、截至 2023 年 11 月的維基百科頁面瀏覽量、截至 2022 年底的 Google Trends 熱門查詢,再加上合成與增強資料)。效率從一開始就是設計約束,而非事後補救——而單次解碼正是讓 3.3 億參數能快速交付全視界、9 分位數預測的關鍵。

但要注意:非商業授權

想直接抓權重的開發者,請先看清楚授權條款。TimesFM 1.0 與 2.x 採用 Apache-2.0 釋出;TimesFM-3 則改採 TimesFM Non-Commercial License v1.0——權重放在 Hugging Face(google/timesfm-3.0-pytorch),程式碼在 GitHub。對於想把它嵌入營收型產品的企業來說,這與前幾代是完全不同的命題,也讓 Apache 授權的競爭對手(包括 Amazon 的 Chronos 系列)在商業部署場景重新獲得空間。至於研究、評測與內部實驗,則完全開放可用。

BigQuery 整合「未來幾週內」上線;在此之前,Google 建議先用 TimesFM-2.5 走 AI.FORECAST 指令熟悉流程——言下之意,商業化的路徑將經過 Google Cloud,而不是原始權重。

為什麼重要

時間序列基礎模型這個品類正在悄悄整併到少數幾個玩家手中——Google(TimesFM)、Amazon(Chronos)與一群新創——而前沿正從「還可以的零樣本單變量預測」推進到「多變量、協變數感知、機率式、單次傳遞」。TimesFM-3 一次把所有格子都打勾,參數量還小到能塞進普通硬體。

單次解碼可能是最被低估的部分。預測是一種營運型工作負載——持續運行、大規模、橫跨數千條序列。把視界生成從迭代迴圈變成一次前向傳遞,改寫的是整個品類的成本曲線。再配上供不確定性規劃使用的分位數輸出,TimesFM-3 與其說是研究展示,不如說是企業級代理系統預測層的藍圖:一個要規劃庫存、排班或支出的 agent,需要的正是這種快速、校準良好、且能感知情境的預測。

TimesFM-3 現已於 GitHub 與 Hugging Face 開放。如果你的組織營運繫於預測——而大多數都是——趁 BigQuery 整合把門檻降到零之前,值得先做一次內部測試。