← All posts / Models

開源權重的逆襲:Nari Labs 的 Qwen3 語音端點登上 Coval 即時排行榜頂端

一家約十人的新創打造了專用推論引擎,讓阿里巴巴開源的 Qwen3-TTS/ASR 跑得比 ElevenLabs 和 Deepgram 更快、更便宜——而且把整套方法開源。

開源權重的逆襲:Nari Labs 的 Qwen3 語音端點登上 Coval 即時排行榜頂端

9 月 14 日,一位署名「toebee」的開發者在 Hacker News 發了一篇讀起來像經典小蝦米故事的 Show HN:「我們一直致力於讓開源語音模型變得超快……而且我們甚至已經打敗了閉源模型!」到了週二早上,這則討論串已爬升到 64 分,而背後的成績正掛在語音 AI 界最常被引用的排行榜之一的最頂端。

發文者是 Nari Labs 的 Toby。這家小團隊是開源對話式 TTS 模型 Dia(超過 200 萬次下載、GitHub 逾 2 萬顆星)與 Narvatar 虛擬化身系統的幕後推手。他們這次的最新動作其實不是新模型,而是為阿里巴巴開放權重的 Qwen3-TTS 與 Qwen3-ASR 家族打造的專用推論引擎——而且根據 Coval 獨立、持續更新的即時基準測試,這套端點已經能與 ElevenLabs、Cartesia、Deepgram 正面交鋒,並在多個指標上同時勝出。

排行榜上實際寫了什麼

Coval(YC S24)針對語音 AI 進行持續性、模擬真實世界條件的基準測試:TTS 延遲、以字錯誤率(WER)衡量的 TTS 品質,以及 STT 的準確度與延遲。由於測量是獨立且反覆進行的,它們已成為語音代理產業的事實參考標準。

Nari 目前的排名(見 Show HN 與即時排行榜):

  • Qwen3-TTS(Nari 端點):延遲第 2、準確度(WER)第 1——在品質上擊敗 ElevenLabs 與 Cartesia,同時依 Nari 的說法是全榜「最便宜的端點」。
  • Qwen3-ASR(Nari 端點):所有受測 STT 供應商中延遲最低、準確度第 2——僅落後榜首 0.1 個百分點——而且是全榜第二便宜的選項。

Nari 產品頁上的數字讓價格差距更具體:ElevenLabs 約 300 毫秒的首音延遲(TTFA)、每 100 萬字元約 50 美元;Nari Fast 則是 50 毫秒以下、每 100 萬字元 5 至 10 美元。STT 方面:Deepgram 約 90 毫秒、每小時 0.288 美元;Nari Fast 40 毫秒以下、每小時 0.06 至 0.12 美元。即使考量廠商自行框定的比較方式與地區差異,這仍是號稱「基礎商品」的服務上 5 到 10 倍的價差。

推論優先的論點

Nari 貼文中更深層的主張是架構性的。「市場仍由閉源模型主導。我們認為那是個推論問題,」Toby 寫道。vLLM、SGLang 這類通用服務框架是為文字 LLM 而生,用 Nari 的說法,「並不適合多模態推論」。

他們 8 月的工程部落格文章〈Pushing the Speed-Cost Frontier for Qwen3-TTS〉記錄了證明過程。團隊在單張 H100 SXM 上、以泊松開環流量基準測試了五種服務實作——自家引擎、vLLM-Omni、SGLang-Omni、VoxServe 與參考實作「M*」——發現預設配置遠遠落後:vLLM-Omni 的 p95 可聽見首音延遲約 278 毫秒、且 100% 的請求出現欠載(underrun);SGLang-Omni 超過 1.1 秒。

兩項優化貢獻最大。第一是動態修剪:用短 RMS 視窗偵測持續語音,把模型在真正發聲前吐出的數十毫秒前導靜音砍掉——不動模型就省下約 80 毫秒。第二是調校訊框累積:先以小塊 codec 訊框讓聲音盡快出來,再逐步增大區塊以保障播放連續性與批次效率。

調校後,只有 Nari 的引擎能在單張 GPU 上於每秒 10 個請求(RPS)下維持 50 毫秒以下的 p95 TTFA,甚至在 20 RPS 時仍低於 100 毫秒。這套實作與基準測試腳手架都以 Apache-2.0 授權開源在 GitHub 上。值得注意的是,阿里巴巴官方端點在這些指標上的表現似乎反而不如 Nari——HN 討論串裡的網友抓住這一點,認為差異化的關鍵是服務工程而非模型權重。

為什麼重要

「開源就是慢」的假設在語音領域已被實證推翻。 兩年來,選擇閉源語音 API 的實務理由是:開源模型無論論文數字多漂亮,都無法匹配生產環境的延遲與可靠度。如果一支約十二人的團隊能把開放權重推到「品質—延遲—價格」的帕雷托前緣,這個論述就在最關鍵的一層崩塌了。

推論工程成為新的護城河。 Nari 的故事呼應了 Baseten 在代管模型上、以及 DeepSeek 的系統工作在訓練上所證明的事:模型論文數字與實際服務數字之間的落差,如今是一門第一流的工程學科——核心運算核、批次調度、量化、靜音修剪、區塊排程。權重是 Apache-2.0 的;護城河是執行時期。

語音代理是需求端。 Coval 之所以存在,是因為串接式語音管線(STT → LLM → 工具呼叫 → TTS)會繼承上游每一段的延遲,而對話輪替的 TTS 總預算大約只有 200 至 300 毫秒。單張 H100 上、10 RPS 下的 50 毫秒以下 TTFA,改變了小團隊能做出的東西:全雙工代理、更便宜、不受廠商綁定。

但要注意

HN 討論串並不全是掌聲。有使用者回報影片播到一半聲音切換的 bug;有人要求對 TTS 品質主張進行獨立評測(「你絕對需要……能驗證你主張的獨立評測」);也有人指出 Qwen3-ASR 的推論引擎本身尚未開源——Nari 表示技術報告正在準備中。此外 Coval 的排名是移動標靶:Gradium 等對手過去也曾奪下延遲王座,排行榜持續更新中。免費公開測試版端點也不提供延遲或正常運作時間的服務水準保證(SLO)。

但方向很清楚。Show HN 貼出後幾小時內,就有 HN 使用者回報把 Nari 的 TTS 技術報告移植到自己的 Whisper 推論堆疊上,「並實作了若干改進」。無論每個 repo 是否釋出,這些技術正在擴散。

結語

開放權重運動的前線,已從「我們能追上模型」推進到「我們能把既得者打得更好」。當阿里巴巴的 Qwen3 權重、一流水準的推論技術與獨立基準測試出現在同一個頁面上,結果就是一份即時排行榜:一家大多數人沒聽過的新創,排名超越了世界上資金最雄厚的語音公司。對開發者而言,把語音當成固定 API 稅的時代可能正在結束;對既有廠商而言,每小時 0.288 美元與 0.06 美元之間的舒適價差,剛剛變成了一個戰略問題。