← All posts / Industry

Nvidia 將 AI 模型發布週期壓縮至 4–6 週 — 軟體衝刺,硬體慢走

Nvidia 應用深度學習研究副總裁 Bryan Catanzaro 證實,開放權重模型的更新週期已從每 6–8 個月縮短至每 4–6 週——約 5–8 倍的加速,但僅限軟體;Blackwell 與 Vera Rubin 矽晶片仍維持年度節奏。

Nvidia 將 AI 模型發布週期壓縮至 4–6 週 — 軟體衝刺,硬體慢走

過去十年,Nvidia 的生意建立在一個簡單的節奏上:每年推出新晶片,軟體準備好了再上線。這個節奏剛剛被打破——而且只往一個方向。2026 年 8 月 24 日刊出的專訪中,Nvidia 應用深度學習研究副總裁 Bryan Catanzaro 證實,公司已將 AI 模型的發布週期從每 6–8 個月壓縮到每 4–6 週。這相當於約 5 到 8 倍的發布頻率提升,而且只適用於一件事:開放權重的 Nemotron 模型家族。GPU 依然照表操課。這個「脫鉤」本身就是故事所在。

實際改變了什麼

這項宣布的範圍比標題看起来更窄,而正是這種「窄」讓它有趣。Nvidia 並沒有加快出貨晶片的速度。Blackwell,以及之後的 Vera Rubin 平台,仍然維持公司自從用科學家名字命名 GPU 架構以來的年度節奏。改變的是矽晶片之上的模型管線:Nemotron 檢查點(checkpoint)如今像 SaaS 產品一樣滾動更新——持續、迭代、由開發者回饋驅動——而不是一年兩次以研究成果之姿現身。

Catanzaro 領導三個 VP 級模型團隊之一,整個編制超過 500 名技術人員投入自家模型開發。根據 8 月 24 日的專訪與後續報導,他的定位很清楚:快速迭代不是 Nvidia 發明的——它是先追上競爭對手設定的速度,再設法超越。對一家絕大多數營收仍來自 GPU 銷售的公司來說,把模型發布當成快速移動的軟體產品經營,是策略性豪賭,不是行事曆上的微調。

解釋這次轉變的歷史

Nvidia 過去各次發布之間的間隔,讓這次改變的規模一目了然:

  • Nemotron-3 8B(2023 年 11 月)— 鎖定企業生成式 AI,家族的低調起點。
  • Nemotron-4 340B(2024 年 6 月)— 約 7 個月後;包含基礎、指令微調與獎勵模型,部分用於合成資料生成。
  • Llama Nemotron(2025 年)— 建構在 Meta Llama 權重之上的推理模型,用 Nvidia 自家的對齊配方調校。
  • Nemotron 3 Nano(2025 年 12 月)— 距 Nemotron-4 約 18 個月,現行世代的第一款。
  • Nemotron 3 Super / Ultra(2026 上半年)— Ultra 據報導為 550B 參數的混合專家(MoE)模型。
  • Nemotron 3.5 Lightning(2026 年 8 月 11 日)— 300 億總參數、約 30 億活躍參數,可在單張筆電 GPU 上運行。

把這幾列讀完,模式很刺眼:Nvidia 的旗艦世代跳躍間隔是 7 到 18 個月。把它壓縮成 4–6 週的滾動節奏,是 5 到 8 倍的加速——前提是公司在 2026 年底前真的守得住這個速度,而這正是最大的未定數。

晶片公司為何在乎模型速度

Nvidia 不靠賣模型權重賺錢。它靠的是開發者用來訓練與運行這些權重的 GPU、網路設備與軟體生態系。開放權重模型是漏斗,不是產品線。更快的發布讓更多開發者更頻繁地進入 Nvidia 生態系——NIM 微服務、CUDA 函式庫、Nemotron 訓練配方——讓 Nvidia 有更多機會成為預設選項,而非眾多選項之一。

還有一層防禦角度,而且踩在兩個痛點上。第一,Nvidia 最大的客戶們如今彼此加起來已在打造五條對抗性 AI 晶片產品線,降低超大規模資料中心對 Nvidia 矽晶片的依賴。第二,競爭對手正在設計以推論為主的晶片,明擺著要侵蝕 Nvidia 資料中心 GPU 約 75% 的毛利——OpenAI 的自研晶片計畫(代號 Jalapeño)是最知名的例子。當硬體選擇變得有爭議,更好、更新的開放權重模型就是 Nvidia 少數能拉的桿杆之一,而且不必依賴在每一條客製晶片戰線上都贏過對手。

市場背景放大了急迫性。2026 年 8 月最後一週,Nvidia 股價在 217–228 美元區間震盪,月初市值一度接近 5.3 兆美元。在這個規模下,股價反映的是 Nvidia 整個 AI 堆疊的預期——不只是 GPU 出貨量——所以開發者心智佔有率是財務指標,不是虛榮指標。

新節奏與同業的比較

Nvidia 並沒有創下產業紀錄;它在補進度。DeepSeek 和 Mistral 的名聲有一部分正是建立在頻繁的小型更新上。OpenAI 和 Google DeepMind 都已擁抱旗艦之間的迭代點版本——Google 的 Gemini 3.8 Flash 預覽版距離 Gemini 3.7 僅 14 天。在這個背景下,一個放了六個月的 Nemotron 檢查點每過一週就在公開排行榜上更顯疲態,就算它的架構從未改變。

更尷尬的對比是 Nvidia 正在追趕的開放權重浪潮。8 月下旬,中國實驗室在九天內發布了五個開放權重的準前沿模型——Z.ai 的 GLM-5.3-Flash、阿里巴巴的 Qwen3.8-Flash、騰訊的 Hy4、MiniMax 的 M3,以及 DeepSeek 的 V4 系列——幾乎全都配備百萬 token 上下文與侵略性定價。Nvidia 自家的下一代賭注走的是橫向而非縱向:路透社報導,公司正在打造超過 1 兆參數的 Nemotron 4,據報訓練投入約 60 億美元、訂購 10,000 顆 Blackwell GPU——這個單一模型的規模已被中國實驗室個別超越,這也讓「節奏」而非「峰值大小」成為 Nvidia 的差異化武器。

軟體衝刺,硬體仍然慢走

這項宣布裡最重要的但書,是沒有改變的部分。晶片設計週期包含數年的架構規劃、在台積電投片、封裝驗證,以及資料中心資格測試,然後才有一台機器進到客戶機房。這些時程不會因為軟體團隊加快出包而縮短。Vera Ruby 的 2026 下半年目標與 Rubin Ultra 的 2027 下半年目標,反映的是尖端半導體的物理現實,不是不夠積極。記憶體供應同樣關鍵:HBM4 良率(Rubin 上市前據報已接近 80%)直接決定 Nvidia 實際能出貨多少系統。

Nvidia 真正做的事,是把兩個過去同步移動的時鐘拆開——出晶片的速度,與出模型的速度。這讓它能像雲端業者經營 SaaS 一樣經營模型發布,同時硬體維持晶片製造所需的長週期、重資本節奏。這也意味著 Nvidia 現在同時並行兩種截然不同的組織節奏:一個規劃未來數年的硬體部門,和一個比多數軟體團隊出點版本還快的模型團隊。

還沒人定價的成本

更快的出包速度伴隨真實風險。壓縮的評測窗口提高了「帶著只在生產負載下才會現形的回歸上線」的機率。快速節奏也拉高向後相容的成本——針對特定檢查點開發的團隊,可能每隔幾週就發現腳下的行為變了。而採用模型於受監管場景的企業,要的是穩定與長期支援承諾,不是一列滾動發布列車。Nvidia 很可能得一條更清楚的線,區分快速移動的實驗性檢查點與 LTS 版本——就像 Linux 發行版區分滾動版與穩定版那樣。

對開發者來說,營運數學已經變了。過去按半年行事曆規劃升級的團隊,現在需要能吸收約每月一次檢查點 churn 的評測管線:每一輪都要跑新的 eval、對生產提示詞做回歸測試,然後決定升級或按兵不動。這是真實的工程成本,而且正在催生 AI 模型回歸測試工具的次級市場。

更大的圖像

Nvidia 的 4–6 週節奏,真正的目的不是在基準測試上贏過誰。它是要確保開發者在等待 Nvidia 下一個更新時,永遠沒有充分的理由另尋他處。晶片仍是本業;模型正在成為留存機制,把開發者留在生態系裡久到足以買下一個世代的 GPU。再搭配據報 129 億美元的 Hugging Face 收購案——那會讓 Nvidia 直接進駐開放權重實際流通的配發層——「更快的節奏」加上「配發控制」,是比任何單一舉動看起來都更連貫的策略。

未定數是可持續性。Nvidia 能否在沒有品質回歸、沒有企業客戶反彈的情況下無限期維持 4–6 週節奏,將由未來兩季給出答案。目前為止,公司已畫出一條清楚的線:晶片一年動一次,模型每一個半月動一次,而開發者應該要注意到兩者的差別。