Meta Muse Voice Transcribe 像人類一樣聆聽:20+ 說話者分離、70+ 語言、一小時長音檔一次搞定
Meta 超級智慧實驗室推出首款即時語音感知模型:以強化學習訓練的自適應延遲串流 ASR、原生 code-switching,並宣稱登上 Artificial Analysis 語音轉文字排行榜第一。
Meta 超級智慧實驗室(Meta Superintelligence Labs, MSL)於 2026 年 9 月 1 日發布了 Muse Voice Transcribe——該實驗室首款即時語音感知模型。這篇公告讀起來不像是一次語音轉文字的小改版,而更像是在為 Mark Zuckerberg 今年稍早揭櫫的「個人超級智慧」(personal superintelligence)願景鋪下地基。模型即日起可透過 Meta Model API、Mac 版 Meta AI 以及 Muse Code 使用,Meta 全家桶的語音聽寫功能也已一鍵切換到這個模型——在 Mac 上按住 Fn 鍵就能體驗。
它做得到什麼
從規格表看,這份能力清單幾乎就是串流語音領域歷來所有難題的總集合:
- 串流 ASR——即時語音轉文字,而非事後批次處理
- 20+ 說話者分離(diarization)——在單次處理中即時標註「誰說了什麼」
- 端點偵測(endpointing)——判斷使用者何時開始、何時結束說話,這是語音代理的生死線
- 多語言輸入與無縫 code-switching——訓練涵蓋超過 70 種語言,其中 25 種在發布時經過深度驗證
- 長語境——原生支援超過一小時的音訊,無需任何後處理
- 情境偏置(context biasing)——透過語言、關鍵字與情境提示,讓模型認得你的聯絡人、術語和地名
Meta 宣稱該模型在 Artificial Analysis 的串流語音轉文字排行榜以及公開的說話者分離基準上均排名第一(排名資料截至 2026 年 9 月 1 日)。《The Information》的簡報點出了頭條數字:超過 70 種訓練語言、可處理 20 位以上說話者長達一小時的對話。Artificial Analysis 也獨立證實了 70+ 訓練語言與 25 種深度驗證語言的說法。
架構:把音訊當成 token 流
技術上最有意思的部分,是 MSL 如何定義這個問題。Muse Voice Transcribe 是 Muse Spark 家族的自回歸多模態模型——與 Meta 自 7 月起陸續上架 Meta Model API 的代理模型同出一脈。音訊以 80 毫秒為單位切片(12.5 Hz),每個切片被轉換成單一 soft token。在每一步,模型都要做一個決策:繼續聽,還是輸出一個文字 token。
這個決策由特殊 token 來中介。當模型想在下判斷前多聽一點上下文,它會預測一個 <|next_audio|> token,接著該 token 會被真實的下一個音訊切片替換。當音訊流停止時,一個 <|empty_audio|> token 會通知模型沒有更多音訊了,模型便把剩餘的文字預測全部輸出。
這個「延遲」(delay)正是串流轉寫的核心難題:模型等得越久,轉寫越準確——但延遲也越糟。Muse Voice Transcribe 的答案是自適應延遲:模型根據每個字的難度,動態調整等待時間。Meta 用強化學習(RL)訓練出這個行為,將字錯誤率(WER)獎勵與延遲獎勵以相乘方式結合。Meta 表示,其成果在「最終轉寫所需時間」這項指標上達到了速度—準確度取捨的 Pareto 前沿。
分離與端點偵測是「順便」做出來的
因為 ASR、diarization 與 endpointing 共用同一個自回歸骨幹,Meta 只要在 ASR 地基上疊加特殊 token,就把另外兩個任務做了出來:
- Diarization 引入
<|start_of_turn|>標記說話者切換點,以及<|speaker_{A-Z}|>標籤來區分是誰在說話。切換邊界在發生當下即刻預測,說話者標籤則延後到切片結束時才預測。同一位說話者的音訊可能被切成多個<|start_of_turn|>片段,但全部會掛上相同標籤。 - Endpointing 則加入
<|speech_onset|>與<|speech_endpoint|>token——這正是語音助理需要的資訊:知道你何時說完了「Hey Meta,Menlo Park 今天天氣如何?」,可以安全地開始回應。
所有任務與串流 ASR 一起共同訓練,並在基礎 ASR 獎勵之上分別為 diarization 與 endpointing 疊加額外獎勵。這正是近年 multimodal 研究中屢屢勝出的「單一骨幹、多重任務」哲學,也解釋了為什麼一個首發模型能在沒有獨立說話者驗證管線的情況下,繳出頂級的 diarization 數字。
Code-switching 才是殺手級展示
Meta 公開的展示對真實語言的還原度誠實得罕見。其中一段是八個人擠在同一個房間裡,互相搶話聊洛杉磯的登山步道——重疊、插話、口音、離題——模型即時追蹤並標註每句話是誰說的。另一段是一小時、十一位說話者的對話,端到端轉寫完畢,全程無後處理。
對雙語使用者而言,最亮眼的是 code-switching 展示:一句話裡中英夾雜(「昨天我在 local desktop 上用 Ollama 跑了下 Meta 的 Muse Glimmer… 整個 setup 非常 smooth」),還塞滿了 speculative decoding、4-bit GGUF 量化、VRAM 這類技術術語,轉寫結果依然乾淨。Meta 自己的研究員說得很直白:這是無法妥協的需求——如果一個「個人」助理聽不懂句子中間冒出的「明天九點有個 doctor appointment」,那它根本稱不上是 for everyone。
戰略解讀
有兩件事讓這次發布不只是一場基準測試的武力展示。
第一,這是 MSL 的第一款感知模型。Meta 超級智慧部門迄今為止發布的一切,都是生成式或代理式。要在 AI 眼鏡上「參與真實對話,而不只是接收語音指令」(Zuckerberg 的原話)的個人代理,需要的是耳朵,而不是嘴巴。串流 endpointing 與 diarization,恰恰是把聊天機器人變成能坐在會議或家庭晚餐中參與一員的關鍵零件。
第二,通路已經同步上線。Meta AI 與 Muse Code 的語音聽寫即日起由 Muse Voice Transcribe 驅動,而且模型沿用 Muse Spark 家族在 Meta Model API 上的定價——每百萬輸入 token 1.25 美元、每百萬輸出 token 4.25 美元,另有更便宜的 Contributor 方案。The New Stack 直接下了「Meta 剛在即時轉寫上擊敗 OpenAI 和 Google」的標題,理由是:這項能力(20+ 說話者的串流分離)目前 OpenAI 與 Google 都得靠多個模型縫合的管線來提供,且價格更高。
懸而未決的問題是開放性。官方部落格對開放權重隻字未提,而「Muse」品牌向來同時涵蓋開源與閉源發布。對於一路看著 Meta 免費開放 Llama、又傳聞可能對較小的 Muse 變體如法炮製的產業來說,一套閉源、僅限 API 的語音堆疊會是一個值得注意的戰略訊號——而對於想在它之上打造轉寫產品的開發者而言,這是需要計入成本的風險。
為什麼重要
轉寫這件事,在你嘗試「即時、滿屋子人、兩種語言、一小時」之前,看起來都像日用品。上述每一個限制條件,過去都意味著妥協,或是一串拼接模型的管線。如果 Muse Voice Transcribe 的宣稱能通過獨立驗證,這次發布等於把整條管線壓縮成單一模型的決策迴路——並在 OpenAI、Google、Anthropic 競相搶佔助理介面的此刻,把代理時代的輸入層交到了 Meta 手上。
Sources
- [1] https://research.meta.ai/blog/introducing-muse-voice-transcribe
- [2] https://9to5mac.com/2026/09/01/meta-launches-muse-voice-transcribe-for-real-time-voice-dictation-on-mac/
- [3] https://www.theinformation.com/briefings/meta-unveils-new-audio-ai-model
- [4] https://thenewstack.io/meta-muse-voice-transcribe/
- [5] https://x.com/artificialanlys/status/2094849283120128135