三菱電機 TUSS:讓實體 AI 長出一對耳朵
單一提示驅動的 AI 模型,同時搞定語音分離、語音強化與環境音抽取——瞄準工廠現場與公共空間,並將在 CEATEC 2026 現場實機展演。
當整個 AI 產業的目光都聚焦在聊天機器人與影片生成器上,另一個更低調、卻決定機器人與工業系統能否真正在真實世界存活的分支,正在穩步推進。今晨,三菱電機宣布開發出「任務感知統一音源分離」技術(Task-Aware Unified Source Separation,TUSS):單一 AI 模型就能從糾纏混雜的真實環境音中,挑出個別聲音——作業員的嗓音、快要損壞的軸承、經過的堆高機——再把乾淨的音訊交給下游 AI 系統。該公司將以「實體 AI 之耳」為題,於今年十月在千葉舉行的 CEATEC 2026 進行現場展演。
問題所在:機器在吵雜環境裡是聾的
人類做音源分離毫不費力。站在工廠車間,你可以在壓縮機轟鳴、背景音樂飄送的環境中專注聆聽某一段對話——這就是著名的「雞尾酒會效應」。機器長年來做不到。傳統管線一次只能處理一種任務:訓練來隔離語音的模型無法分開兩個同時說話的人;訓練來處理樂器的模型對偵測機器異音毫無用處。
這種僵固性對「實體 AI」——機器人、巡檢無人機、語音控制的廠區設備、環境監控系統——後果非常實際。過去每一項新的聲學任務,都意味著設計、訓練、部署一套全新的分離模型。一座想同時導入語音控制、異常偵測與現場感知監控的工廠,需要三套各自獨立的音訊堆疊,而且每一套在聲學條件偏離訓練資料時都會變得脆弱。
TUSS 的做法:用提示取代多個模型
TUSS 直接繞過了這整套做法。它不是一個任務配一個模型,而是運用數量可變的可學習提示(learnable prompts),告訴單一網路該聽什麼。用提示指定「兩個說話者」,它就執行語音分離;指定「語音加背景噪音」,它就執行語音強化;指定「機器聲」,它就執行供異常偵測用的環境音抽取。模型依據收到的提示,在推論階段改變分離行為——不需要重新訓練,也不需要分開部署。
這項研究由三菱電機美國研究實驗室(MERL,位於麻州劍橋)的 Kohei Saijo 與同事主導,已發表於 ICASSP 2025(arXiv:2410.23987)。研究團隊對一個真實的技術矛盾展現了少見的坦率:音樂音源分離希望把樂器拆開,電影音訊分離卻希望把它們歸成一組。過去的統一模型處理這種張力時表現不佳,因為單一無條件網路無法同時滿足互相矛盾的目標。TUSS 的解法是把「任務本身」變成輸入——提示向量決定網路表現出哪一種行為。
在實驗中,單一 TUSS 模型成功涵蓋五大分離任務:語音強化、語音分離、聲音事件分離、音樂音源分離,以及電影音訊分離。MERL 已在 GitHub 上開源訓練與評測程式碼,這些主張因此是可重現的,而非行銷話術。
為什麼對實體 AI 重要
新聞稿中「實體 AI 之耳」的框架不只是口號。三菱電機的核心事業是工廠自動化、電梯、空調與基礎建設設備,而新聞稿明確瞄準「製造現場與公共空間等聲學環境複雜的場域」。近期的整合路徑相当清楚:
- 異常偵測:持續從整片工廠噪音中抽取特定機器的聲學特徵,再細微的偏離也會變得清晰可見。
- 強健的語音控制:作業員不必走到安靜角落,直接開口就能操作設備。
- 現場感知:安防與監控系統能在無關雜訊中追蹤特定聲音事件——有人呼喊、玻璃破碎、馬達卡死。
- 作業記錄:乾淨分離後的音訊,餵給轉寫與日誌系統的準確度遠高於原始混音。
單看每一項應用都不驚人。但合起來,它們指向同一層基礎設施:設施裡每套實體 AI 系統都能查詢的單一音訊模型。這正是「展示品」與「可部署平台」之間的分界。
CEATEC 現場展演才是真正的考驗
三菱電機表示,CEATEC 2026 展位(幕張展覽館,10 月 13 日至 16 日)將進行現場實機示範:麥克風即時收錄會場裡的混合音訊——機械、樂器、多人同時交談——TUSS 將即時分離出提示指定的音源,並接入語音辨識與異音診斷。展場現場音向來是最不留情面的測試台;能在那裡站穩的模型,距離量產明顯更近一步。
脈絡:音訊 AI 正默默工業化
TUSS 處在一個更大的轉向之中。過去十年,音源分離多半是拿基準資料集打分數的學術子領域。如今,隨著多模態 AI 走進實體環境——機器人、車輛、智慧基礎建設——聲學理解已經成為瓶頸技術。同時擁有研究實驗室與部署通路的工業級玩家(MERL 在 ICASSP 發表論文的同時,三菱電機出貨工廠設備),在跨越「實驗室到產線」這道純 AI 實驗室往往跨不過的鴻溝上,位置格外有利。
剩下的當然還是實體世界 AI 的老問題:提示未調校過的聲學條件下,效能會多優雅地衰退;模型在邊緣端需要多少算力;以及單一提示條件化模型能否在極端情境下追上專用模型。但方向是對的——更少脆弱的單用途模型,一個靈活的聆聽者。
對一個花了兩年爭論 token 與上下文視窗的產業來說,這是個有用的提醒:AI 的下一批難題,可能是聲學的、具身的,而且就站在工廠車間裡。