← All posts / Models

NVIDIA Nemotron 3.5 Lightning:為 AI 代理苦差事而生的 30B 混合專家模型

NVIDIA 發布 Nemotron 3.5 Lightning——一個總參數量 30B、每 token 僅啟動 3B 的混合專家模型,專為常駐型 AI 代理的高頻執行層設計。輸出速度最快提升 4 倍、支援 100 萬 token 上下文,開源權重且可商用。

NVIDIA Nemotron 3.5 Lightning:為 AI 代理苦差事而生的 30B 混合專家模型

2026 年 8 月 11 日,NVIDIA 低調發布了一個並非以爭奪前沿智慧王座為目標的模型——而這正是關鍵所在。Nemotron 3.5 Lightning 是一個擁有 300 億參數的混合專家(MoE)模型,每個 token 僅啟動 30 億參數,其設計目的不是令人驚豔的一次性推理,而是真實 AI 代理實際從事的、大量而重複的執行工作:讀取檔案、呼叫工具、排序結果、重試失敗的操作,然後一個小時內再做一千次。

用 NVIDIA 自己的話來說,它是為「常駐型代理的執行層」打造的——在代理系統中,速度、成本和可靠性遠比頂尖的基準測試分數重要得多。

架構:混合 Mamba-2 + MoE + 注意力機制

Nemotron 3.5 Lightning 繼承了 NVIDIA 於 2026 年初 Nemotron 3 系列首次亮相的混合架構策略。該模型結合了三個組件:

  • Mamba-2 狀態空間層,用於高效的序列處理
  • 混合專家(MoE) 路由,總參數量 30B,但每個 token 僅啟動約 3B
  • 標準注意力機制,用於計算中仍具優勢的部分

這種混合方法意味著,在每次推理過程中,模型只需計算總參數量的一小部分。結果是:每個 token 的延遲和計算成本大幅降低——這正是代理在每個任務中需要進行數十次工具呼叫時所期望的。

該模型支援最高 100 萬 token 的上下文長度,在長上下文任務方面與前沿模型處於同一水準。它還內建了 NVFP4 量化支援,可以在消費級和工作站級 GPU 上部署——NVIDIA 特別強調了與 GeForce RTX 和 DGX 平台的相容性。

效能:快,但非前沿——不過夠快了

在 Artificial Analysis 智慧指數上,Nemotron 3.5 Lightning 獲得 24 分,較前身 Nemotron 3 Nano(15 分)提升了 9 分。這個成績扎實但並非頂尖——該模型並非在與 200B 以上的推理模型競爭。相反,NVIDIA 的賣點在於速度與智慧的比值。

關鍵數字說明了真正的故事:

  • 輸出速度比同類模型快 4 倍
  • 受惠於吞吐量優勢,代理任務完成速度提升 30%
  • 在單張 H100 上,比 Qwen 3.5 35B-A3B 快 57%,每位使用者輸出速度高出 50%

對於常駐型代理系統——想想持續監控程式庫的程式開發助手、處理數百張工單的客服代理,或編排基礎設施的 DevOps 代理——這些吞吐量優勢會不斷累積。當一個代理需要進行 50 次連續模型呼叫才能解決一個使用者請求時,將每次呼叫的延遲減半不僅僅節省時間,它讓過去不可行的工作流程變得可行。

NeMo Switchyard 的角色

Nemotron 3.5 Lightning 與 NeMo Switchyard 同步發布。Switchyard 是一個路由框架,NVIDIA 將其定位為多模型系統中決定哪個模型應處理特定任務的「大腦」。核心概念:在生產級代理系統中,你不想讓前沿推理模型處理每一步。你希望 80% 的常規步驟由一個快速、便宜的執行器處理,而 20% 需要深度思考的步驟才交給強大的推理模型。

Switchyard 是 NVIDIA 對「模型系統」論述的回應——這一論述在整個 2026 年獲得了越來越多的認同,即 AI 部署的未來不是一個巨大的模型,而是一組精心編排的專業化模型,每個模型都針對其角色進行了最佳化。Nemotron 3.5 Lightning 是該系統中的執行器,位於 Nemotron 3 Ultra 或第三方前沿模型等規劃/推理模型之下。

從 Nemotron 3 Ultra 蒸餾而來

NVIDIA 並非從零開始訓練,而是從 Nemotron 3 Ultra——2026 年 6 月發布的旗艦推理模型——蒸餾出 Nemotron 3.5 Lightning。這種蒸餾策略讓 NVIDIA 能將 Ultra 的大部分品質轉移到一個更小、更快的封裝中,同時保持權重開源且可用於商業用途。

build.nvidia.com 上的模型卡確認它「可用於商業用途」,這對企業採用至關重要。許多公司一直猶豫是否要在限制性授權的模型上構建產品;NVIDIA 對 Nemotron 系列採取的開源權重、允許商業使用的立場,一直是針對封閉供應商的有意競爭手段。

生態系首日上架:無處不在

讓這次發布與眾不同的是首日可用性的廣度。Nemotron 3.5 Lightning 同時登陸了:

  • Ollama,用於本地部署(nemotron-3.5-lightning:30b pull 指令)
  • build.nvidia.com,用於 API 存取
  • OpenRouter,用於按用量付費推理
  • DeepInfra、GMI Cloud 和 FriendliAI,用於雲端部署
  • Cline 和 OpenHands,用於程式開發代理整合

這正是 NVIDIA 展現其平台實力的地方。該公司不僅僅發布一個模型——它還確保開發者可以從他們已有的任何工具鏈中使用它。Cline 和 OpenHands 的整合尤其值得注意:兩者都是流行的開源程式開發代理框架,而擁有一個針對其高頻工具呼叫模式最佳化的模型開箱即用,消除了顯著的採用障礙。

為什麼叫「Lightning」?

「Lightning」是 Nemotron 命名體系中的新稱號,標誌著 NVIDIA 在其模型系列中創建不同效能層級的意圖。其中「Nano」表示最小的模型,「Ultra」表示最強大的推理模型,而「Lightning」則標誌著為吞吐量而非巔峰智慧打造的速度最佳化模型。預計這一命名慣例將會擴展——後續可能會出現 Nemotron 3.5 Super 或類似的更高容量變體。

更大的圖景:NVIDIA 的全端野心

Nemotron 3.5 Lightning 完全符合 NVIDIA 更廣泛的策略——不僅擁有硬體(GPU),還擁有整個 AI 軟體堆疊。透過發布針對自家硬體最佳化的開源模型——並確保它們在 RTX 和 DGX 上執行得最好——NVIDIA 創造了一個良性循環:開發者使用 Nemotron,因為它免費且夠好;部署在 NVIDIA GPU 上,因為那裡執行得最快;而 Switchyard 框架將他們鎖定在 NVIDIA 的編排層中。

這正是當年讓 CUDA 無所不在的同一套劇本,現在應用到了模型層。問題在於,Meta(憑藉 Muse Code 和 Muse Glimmer 系列模型)或各個開源社群能否提供足夠有吸引力的替代方案,阻止 NVIDIA 將其硬體壟斷延伸到模型和編排層。

目前為止,如果你正在構建代理系統,需要一個快速、便宜、可靠、可以本地或雲端執行的執行器,Nemotron 3.5 Lightning 是一個強而有力的選擇。它不會幫你寫系統架構文件——但它會樂意執行實現它所需的 200 次工具呼叫。