八個聲音、一組權重:NVIDIA Nemotron 3 Diarization 改寫「誰在何時說話」
NVIDIA 新推出的開放權重 1 億參數模型可即時追蹤最多 8 位重疊說話者,在 DIHARD III 上將分離錯誤率降低三分之一,並以 14.72% DER登上 VoiceArena 新推出的 Diarization-Bench 榜首。
每一位語音 AI 工程師遲早都會撞上同一堵牆:轉錄文字完美、時間軸完美,產出卻依然不可用——因為沒人知道哪句話是誰說的。說話者分離(speaker diarization)這個不起眼的任務,專門回答「誰在何時說話」,它是會議轉錄、客服分析,以及任何得在真實對話中存活(充滿插話與串音)的語音助理的承重牆。9 月 23 日,NVIDIA 用一個開放權重模型認真地拆了這堵牆:可處理的說話者數量是前代的兩倍,參數量卻只有一億。
Nemotron 3 Diarization 是一個約 1 億參數的說話者分離模型,採用 NVIDIA 的開放模型與權重授權(OpenMDW 1.1)發布,明確允許商業使用。它能在真實音訊中判斷「誰在何時說話」,同時支援串流與離線推論,而最搶眼的特性是——最多可處理 8 位同時說話者,是前一代 Streaming Sortformer 四人上限的兩倍。此次發布還附上一個搭配串流 ASR 的 Hugging Face Spaces 線上 demo,以及一套名為 NeMo-Speech.cpp 的輕量級 C++ 執行環境,一行指令就能標記整場會議錄音。
一組權重,四種延遲檔位
技術上最有趣的設計,是單一 checkpoint 涵蓋所有操作點。同一份權值既能在離線組態下以 30.4 秒輸入緩衝執行,也能以 1.04 秒、0.64 秒、0.32 秒的輸入緩衝延遲進行串流推論——對延遲極度敏感的應用可低至 80 毫秒,但 NVIDIA 建議實務下限為 0.32 秒。輸出幀解析度以 10 毫秒為單位可調,搭配分段推論後,音訊長度不再有任何限制。
這不是容易做到的工程。串流分離的難點在於說話者身分必須跨越區塊延續:當第三個人在通話第 40 秒開口,模型得判斷這是新聲音,還是說話者二號回來了。Nemotron 3 沿用了 Streaming Sortformer 研究路線的解法——到達順序說話者快取(Arrival-Order Speaker Cache, AOSC)負責保留早期區塊中的說話者資訊,再搭配一條承載近期幀上下文的 FIFO 佇列。模型依每位說話者在音訊中首次出現的順序來排列輸出通道,藉此解決經典的說話者排列歧義。沿用 Sortformer 架構的意義在於:這套排序機制是內建於模型行為,而不是靠後處理硬接上去的。
數字會說話
在普遍被視為最困難的通用分離基準 DIHARD III(涵蓋 11 個領域)上,進步幅度相當大。離線組態(30.4 秒緩衝)下,Nemotron 3 的全量 DER 為 12.73%,對比前代 diar_streaming_sortformer_4spk-v2.1 基線的 19.09%,相對降低 33%。更關鍵的是,在串流壓力下模型依然保住大部分優勢:1.04 秒延遲時 DER 為 13.18%,即便降到 0.32 秒超低延遲也維持在 13.55%——兩者都低於舊基線的離線成績。DIHARD 中最難的 5–9 人片段,DER 從 40.21% 改善到 27.58%。說話者計數也更準:計數正確率從 75.29% 升至 81.47%,計數平均絕對誤差從 0.51 降到 0.27。
有一個 NVIDIA 自己特別強調的方法論細節:AMI、AliMeeting 與 NOTSOFAR1 的成績採用強制對齊(forced alignment)參考標籤,因為原始的段落級標註是為轉錄而非幀級分離評估而生,可能會懲罰模型正確預測靜音的行為。任何想重現這些數字的人,必須使用官方發布的參考 RTTM 檔——標籤不同即是不同協定,結果不可直接比較。
在學術基準之外,這個模型首次登場就拿下 VoiceArena 新推出的 Diarization-Bench 榜首:在 2 到 8 位說話者、超過 280 位不同說話者的測試集上,以 14.72% DER 領先 12 個受評系統,與第二名相比約有 24% 的相對差距。在 NVIDIA 列出的八個評估條件上,平均相對 DER 降幅為 41.0%。
訓練方式
訓練配方是兩階段流程,而且完全可以用公開程式碼重現。模型從一個基於 Transformer 的 NEST 自監督 checkpoint 初始化,接著在 8 節點、每節點 8 張 A100-80GB 的叢集上分兩階段訓練:第一階段僅使用模擬資料做離線訓練,第二階段以真實對話與模擬混合資料做串流微調。微調資料涵蓋 901 段針對特定條件的錄音——電話語音(CALLHOME)、遠場與耳機會議(AMI、NOTSOFAR1)、中文會議(AliMeeting),以及多語言的 DIHARD III 集合。兩個階段的範例腳本與基礎設定檔,都已公開在 NVIDIA-NeMo/Speech 儲存庫中。
推論端同樣親民。在 Python 中,模型透過 NeMo 以 SortformerEncLabelModel 載入;要在轉錄結果上加上詞級說話者標籤,基本上只是一行呼叫。新的 NeMo-Speech.cpp C++ 執行環境則瞄準本地部署:nemo-speech diarize meeting.wav 直接輸出分段,nemo-speech transcribe meeting.wav --diarize --json 則把分離與轉錄融合成帶說話者歸屬的 JSON。輸入就是普通的 16 kHz 單聲道音訊,輸出則是 10 毫秒級解析度的每說話者活動網格。
為什麼重要
語音技術棧裡最無聊的部分,正是部署現實所在。NVIDIA 自家的 12B 全雙工語音模型 Nemotron 3 VoiceChat 固然能原生處理輪流發言,但更大的市場——會議紀錄、客服品質監控、法庭與醫療轉錄、多人在場的機器人聽覺——跑的都是管線架構,而分離品質決定了整個系統的天花板。一個 1 億參數、0.32 秒延遲又不掉準確率的開放權重模型,把這項能力從「按分鐘計費的雲端 API」拉到「跟著你的 ASR 跑,ASR 在哪它就在哪」。第三方已經動起來:FluidInference 已將模型移植到 CoreML 並完整覆蓋 Apple Neural Engine,語音應用開發者在一天之內就推出了裝置端變體。
這也延續了 NVIDIA 刻意的布局:ASR 用 Parakeet、文字推理用 Nemotron、現在補上分離器——為語音技術棧的每一層都提供開放權重解答,而且每個都夠小、授權都夠寬鬆,利於快速擴散。前沿模型的討論總是圍繞兆級參數的推理系統打轉,但真正在默默標準化產業管線的模型,長得更像這一個:一億參數、專心做一件事、四種延遲檔位,外加一份讓你放心出貨的授權條款。
Sources
- [1] https://huggingface.co/nvidia/Nemotron-3-Diarization
- [2] https://huggingface.co/blog/nvidia/nemotron-diarization
- [3] https://www.marktechpost.com/2026/09/23/nvidia-releases-nemotron-3-diarization/
- [4] https://www.unite.ai/nvidia-releases-nemotron-3-diarization-open-weight-speaker-model/
- [5] https://alphasignal.ai/news/nvidia-s-nemotron-3-beats-12-rivals-with-a-14-72-speaker-error-rate