← All posts / Models

NVIDIA Nemotron 3.5 Lightning:專門處理 Agent 苦差事的 30B 開源模型

NVIDIA 最新開源 30B MoE 模型僅啟用 3B 參數,專為常駐型 Agent 的高頻執行層而設計——輸出速度最快達 4 倍、SWE-Bench Verified 拿下 54.3%,支援 1M token 上下文,並採用寬鬆的 OpenMDW 授權。

NVIDIA Nemotron 3.5 Lightning:專門處理 Agent 苦差事的 30B 開源模型

2026 年 Agentic AI 有一個殘酷的事實:你的 Agent 燒掉的 token,大多數不是花在精彩的推理上,而是花在重複的中間雜務——摘要一份 PR、分類一條告警、驗證工具輸出、格式化結果、委派子任務。許多團隊至今仍把這每一步都丟給前沿推理模型,這就像派出貨櫃船去送一件快遞。

8 月 11 日,NVIDIA 給出了自己的答案:Nemotron 3.5 Lightning——一個開源的 30B 混合專家(MoE)模型,每個 token 僅啟用約 3B 參數,專為常駐型 Agent 的執行層而打造。它是 Nemotron 3 家族中最小的成員,從 550B 參數的前沿模型 Nemotron 3 Ultra 蒸餾而來,並與開源模型路由庫 NeMo Switchyard 同步推出,讓 Agent 系統能把每個請求送到最適合的模型手上。

它是什麼

Nemotron 3.5 Lightning 採用混合 MoE 架構:總參數 30B,但路由器只把每個 token 送進少數幾個專家,實際每 token 運算量約 3B 參數。這正是它經濟效益的核心——用接近小模型的運算成本,換到接近大模型的容量。

主要規格:

  • 架構:混合 Mixture-of-Experts,從 Nemotron 3 Ultra 蒸餾,與「Nemotron Coalition」夥伴共同開發
  • 啟用參數:30B 總參數中每 token 約 3B
  • 上下文長度:最高 1M token——足以裝下一整個程式碼庫、完整的告警歷史或多輪對話狀態而不需截斷
  • 精度:同時提供 BF16 與 NVFP4 檢查點,採用與 Nemotron 3 Ultra 相同的 NVFP4 專用核心,支援 Blackwell、Hopper 乃至 Ampere GPU
  • 授權:OpenMDW-1.1——權重、訓練資料與配方都以 NVIDIA 能做到的最寬鬆方式開放

最後一點值得強調。在「開源」常常只剩開放權重的這一年,Nemotron 3.5 Lightning 交付了完整整套:透過 NeMo Automodel 與 NeMo Megatron Bridge 提供 LoRA 與完整 SFT 配方、透過 NeMo RL 與 NeMo Gym 提供強化學習工具,甚至開源了用來訓練部分編碼 Agent 能力的 Agentic RL 資料集 Nemotron-RL Agentic Terminal Pivot。小模型微調更快、更便宜、對硬體要求更低——這正是這個量級模型值得客製化的原因。

速度即特色

速度是最大的賣點。NVIDIA 表示 Lightning 的輸出速度比同級模型快最高 4 倍,完成 Agentic 任務最多快 30%。在 PinchBench 上,它以 86% 的準確率,用比 Qwen3.6 35B 快 30% 的時間完成了一萬項任務。在結合九項評測(涵蓋 Agentic 任務、編碼、科學推理與一般智能)的 Artificial Analysis Intelligence Index 上,NVIDIA 更宣稱它定義了小型開源模型的「準確率—速度」帕累托前沿。

速度來自三項技術的協同。第一,多 token 預測(MTP)在預訓練階段就融入模型,之後另有專門的 MTP 強化階段,讓模型每次前向傳播能產出多個 token。第二,投機解碼:本版本附帶兩個草稿模型——DSpark(推薦用於 DGX Spark 與低併發資料中心場景)與 DFlash(團隊可針對自身工作負載自行評測)。第三,NVFP4 量化檢查點減少了現代 GPU 上的記憶體頻寬消耗,且無需額外轉換。

世代級的準確率躍升

與前一代 Nemotron 3 Nano 的對比相當懸殊。在衡量模型能否真正解決真實 GitHub issue 的 SWE-Bench Verified 上,Lightning 拿下 54.3%,前一世代僅 21%;在知識工作基準 GDPval-AA v2 上則是 924 ELO 對 479 ELO。編碼分數翻倍以上、知識工作評分近乎翻倍,夥伴還回報它在同級比較中擁有最強的抗幻覺表現。NVIDIA 特別註明這些是仍在訓練中的初步結果,正式 GA 數據預計還會更好。

NVIDIA 將部分成果歸功於針對框架的最佳化訓練(harness-optimized training):模型明確針對主流 Agent 框架訓練——官方部落格點名 OpenClaw 與 Hermes Agent,並由開源的 NemoClaw 安全管理堆疊支援——因此在高頻任務上能發出更準確的工具呼叫,同時維持低延遲。

一套模型系統,由 Switchyard 調度

更深層的故事在架構。NVIDIA 明白表示,開發者越來越多採用「一套模型系統」:前沿推理模型如 Nemotron 3 Ultra 負責編排與複雜規劃,小而快的模型負責執行層。與 Lightning 同步推出的 NeMo Switchyard 讓這種分工變得可行:它把 Lightning 註冊為路由目標,與你的開源與閉源模型並列——規劃向上送到前沿模型,執行向下落到 Lightning。由於兩端都說相同的 OpenAI 相容 API,路由器可以在不改一行應用程式碼的情況下搬移流量。

Launch 的合作夥伴生態系也展現了 NVIDIA 的企圖心:Agent 框架涵蓋 Cline、Factory AI、Kilo Code、LangChain、OpenClaw、OpenCode 與 OpenHands;推論軟體有 Ollama、LM Studio、llama.cpp 與 Unsloth;託管推論包括 Baseten、CoreWeave、DeepInfra、Fireworks AI、GMI Cloud、Modal、Nebius 與 Together AI;雲平台則橫跨 SageMaker JumpStart、Google Cloud、Microsoft Foundry 與 OCI。

在地優先的 Agentic AI

Lightning 同時是一步本地 AI 的棋。它可在 NVIDIA Jetson、GeForce RTX 5090 與 DGX Spark 上運行——換句話說,能幹的 Agentic AI 就放在桌上,而不只在資料中心裡。在 EXO Labs 的 local.ai 排行榜上,Lightning 同樣位於小型開源模型的帕累托前沿。對於不願把 Agent 流量送往外部 API 的團隊來說,30B MoE、3B 啟用參數正好是讓在地部署、常駐運行的 Agent 在經濟上成立的量級。

為什麼重要

前沿模型的討論總聚焦在排行榜頂端的推理模型,但已部署 Agent 的經濟學是在戰壕裡決定的——在長時間運行的 Agent token 預算中佔大宗的、數以百萬計的便宜、快速、可靠的呼叫。DeepSeek 週末剛上路的尖峰時段計費,更凸顯了前沿 token 的成本如今有多麼不穩定。一個擁有 1M token 上下文、前沿級蒸餾血統、誠實的基準提升與寬鬆授權的全開源模型,改變了 2026 年任何組建 Agent 機群的人的自建 vs. 外購算式。

Nemotron 3.5 Lightning 現已上線 build.nvidia.com 與 OpenRouter,權重可在 Hugging Face 與 ModelScope 下載。如果你的架構還在把每個工具呼叫都送去前沿模型,這次發布就是 NVIDIA 一句客氣的提醒:或許該停了。