NVIDIA Nemotron 3.5 Lightning:擁有 300 億參數,卻只用 30 億在思考的開源 AI 模型
NVIDIA 發布 Nemotron 3.5 Lightning——一個擁有 300 億參數、但每次推論僅啟動 30 億參數的開源 MoE 模型,將 AI 代理推論成本降低 58%、執行時間縮短 33%,速度更比同等級密集模型快 4 倍。
NVIDIA 今天發布了什麼
2026 年 8 月 11 日,NVIDIA 正式發布 Nemotron 3.5 Lightning,一款開源 AI 模型,將 300 億參數模型的威力,壓縮到只有其十分之一大小的運行成本。此次發布瞄準的是企業 AI 中最昂貴的痛點:那些在每項任務中需要發出數千次推論呼叫的常駐型自主代理(autonomous agents)。
核心的工程突破在於其混合專家架構(Mixture-of-Experts, MoE)。雖然模型總共包含約 300 億個參數,但每次前向傳播(forward pass)只啟動約 30 億個。這意味著每生成一個 token 的計算成本相當於一個密集(dense)30 億參數模型,而知識容量和推理品質卻受益於完整的 300 億參數預算。NVIDIA 表示,與同等級的密集模型相比,該模型的輸出速度最高可達 4 倍。
此模型採用 NVIDIA 的開源模型授權,免費下載、使用和修改,並已立即上架於多家推論服務平台,包括 OpenRouter、DeepInfra、GMI Cloud、Amazon SageMaker JumpStart 以及 FriendliAI。
關鍵數據
NVIDIA 的發布內容以實際部署基準測試為基礎,而非合成測試分數:
- 成本降低 58%:在 Ramp 的 SWE-Bench 評估中,使用 NeMo Switchyard 將例行代理步驟交由 Nemotron 3.5 Lightning 處理,僅在需要複雜決策時才路由到前沿模型,總推論支出減少了 58%。
- 執行時間縮短 33%:同一項 Ramp 基準測試顯示,端到端任務完成時間縮短了三分之一。
- 輸出速度 4 倍:與同等級參數量的密集模型相比。
- 每百萬輸入 token 僅 0.10 美元:OpenRouter 上的目前定價,輸出 token 為每百萬 0.25 美元——在同級別中屬於最便宜之列。
Thoughtworks 在同一天發布的獨立評測中證實,將一個工作範例從同等級密集模型遷移到 Nemotron 3.5 Lightning(運行於標準 vLLM),每百萬輸出 token 的成本從 0.477 美元降至 0.250 美元。這是在無需任何架構更改的情況下,節省了 48% 的成本。
NeMo Switchyard:讓一切運轉的路由器
與模型同時,NVIDIA 也開源了 NeMo Switchyard,一套模型路由函式庫,該公司將其描述為多模型代理架構的結締組織。其概念簡單但強大:代理工作流程中的每一步,未必都需要前沿模型。Switchyard 會動態地將每次推論步驟路由到能夠勝任該工作的最具成本效益的模型——高頻率、專門化的呼叫交給 Nemotron 3.5 Lightning,真正需要深度推理的才交給前沿模型。
這是一個策略性舉措。NVIDIA 不僅僅在發布一個模型;它還在發布決定 哪個 模型在何時運行的基礎設施層。正如 Futurum Group 在首日分析中指出:「Nemotron 3.5 Lightning 將一個 30B 開源 MoE 模型與 NeMo Switchyard 結合——一個重塑代理式 AI 推論的開源路由器。」其言下之意是,NVIDIA 希望成為多模型 AI 部署的預設控制平面(control plane),而不僅僅是底層的 GPU 供應商。
Switchyard 與 NVIDIA 更廣泛的 DGX Cloud 和 RTX 工作站生態系統整合,意味著相同的路由邏輯可以運行在邊緣設備、本地工作站和雲端基礎設施上——從桌面到資料中心的統一模型服務堆疊。
從前沿模型蒸餾而來
Nemotron 3.5 Lightning 並非從零開始獨立訓練的模型。根據 GMI Cloud 的技術分析,該模型是 從 NVIDIA 的前沿模型 Nemotron 3 Ultra 蒸餾(distilled)而來——這是該公司於 2026 年 6 月發布的頂級推理模型。這意味著 Lightning 繼承了一個更大系統的知識表示和推理模式,然後將其壓縮到高效的 MoE 架構中。
模型架構採用交錯式混合設計,結合了 Mamba-2 狀態空間層(state space layers)和注意力機制(attention)。這種混合方法在代理工作負載中越來越受歡迎,因為它在處理長上下文場景時比純注意力模型更有效率,同時保持了工具使用和多步驟規劃所需的推理品質。
為什麼這對企業 AI 至關重要
代理式 AI 的經濟學已經失衡了好幾個月。一項複雜的代理任務——例如研究市場、匯整發現、生成報告——可能涉及數十到數百次模型呼叫。當每次呼叫都打到每百萬 token 成本 5 至 15 美元的前沿模型時,單一任務的成本在規模化時迅速變得令人望而卻步。構建生產級代理系統的公司被迫在品質和成本之間做出痛苦的取捨。
Nemotron 3.5 Lightning 直接解決了這一瓶頸。它提供了一個每 token 成本約為前沿模型十分之一的模型,同時保持了例行代理步驟所需的品質。這使企業能夠採用分層架構:用便宜、快速的模型處理 80% 機械性的工作,將昂貴的前沿模型呼叫保留給真正需要深度推理的 20%。
NVIDIA 發布內容中引用的西門子(Siemens)部署案例,展示了這一模式在工業場景中的應用——為製造和自動化代理運行模型路由,其中絕大多數推論步驟是可預測的,不需要前沿模型的全部能力。
更廣泛的競爭格局
此次發布將 NVIDIA 的定位推向了傳統硬體供應商之外。透過 Nemotron 3.5 Lightning 和 NeMo Switchyard,該公司不僅在 GPU 層面與 OpenAI、Anthropic 和 Google 競爭,還在模型服務和編排層正面交鋒。開源策略是刻意的對比:當 OpenAI 和 Anthropic 將客戶鎖定在專有 API 生態系統中時,NVIDIA 將模型和路由基礎設施免費提供,押注開放性將推動其運算平台的普及。
該模型也是對中國實驗室開源權重浪潮的回應。近幾週,DeepSeek 的 V4-Flash 和阿里巴巴的 Qwen 3.8-Max 一直在主導開源權重討論。NVIDIA——一家美國公司——現在提供了一個可靠的開源替代方案,專門針對企業競相部署的代理工作負載進行了優化。
生態系統的反應
首日即在多家推論服務平台上線,標誌著強大的生態系統支持。OpenRouter 在數小時內即以具競爭力的價格上架。DeepInfra 提供了搭配優化服務的首日存取。FriendliAI 宣布了利用其服務引擎的專屬推論優化。Amazon SageMaker JumpStart 將模型加入其目錄。這種部署選項的廣度本身就是一項競爭優勢——企業可以通過其現有的服務基礎設施來採用該模型。
對開發者而言,直接的實用結論很簡單:如果你正在運行自主代理,並為例行推論步驟支付前沿模型的價格,那麼 Nemotron 3.5 Lightning 結合 NeMo Switchyard 路由,提供了一條經過驗證的路徑,可以將這些成本削減一半以上——從今天開始。
Sources
- [1] https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/
- [2] https://www.cnbc.com/2026/08/11/nvidia-releases-nemotron-3point5-lightning-open-source-ai-model-.html
- [3] https://www.wsj.com/cio-journal/nvidia-releases-new-open-model-ee66e6a3
- [4] https://alphasignal.ai/news/nvidia-s-nemotron-3-5-lightning-cuts-agent-costs-58-running-4x-faster
- [5] https://aiweekly.co/alerts/nvidia-ships-30b-nemotron-lightning-opens-switchyard-router
- [6] https://futurumgroup.com/insights/who-decides-which-model-runs-nvidia-would-like-a-say/
- [7] https://deepinfra.com/blog/nvidia-nemotron-3.5-lightning-release
- [8] https://openrouter.ai/nvidia/nemotron-3.5-lightning
- [9] https://kingy.ai/blog/nemotron-3-5-lightning-review/
- [10] https://aws.amazon.com/about-aws/whats-new/2026/01/nvidia-nemotron-3.5-lightning-on-sagemaker-jumpstart/
- [11] https://friendli.ai/blog/nvidia-nemotron-3.5-Lightning
- [12] https://www.thoughtworks.com/insights/blog/generative-ai/putting-nemotron-3-5-lightning-test