六十個簽名,三十四億個聲音:蓋茲基金會號召的聯盟,要為 AI 打造一層開放語言底座
9 月 21 日於紐約宣布的「AI 語言夥伴聯盟」集結了 60 個組織——包括 Anthropic、Google、Microsoft、Amazon、NVIDIA、ElevenLabs 與 OpenAI 基金會——目標是在五年內,讓今日 AI 模型難以服務的 34 億人,能用自己母語與聲音使用 AI。
2026 年的前沿 AI 討論,多半圍繞著算力預算、放慢腳步的公開信與地緣政治角力打轉。9 月 21 日在紐約,一個作風很不一樣的聯盟,試圖把產業的目光拉回一個鮮少登上頭條的問題:大多數人類,根本無法用自己思考的語言使用這些系統。
由蓋茲基金會(Gates Foundation)號召的「AI 語言夥伴聯盟」(AI Language Partnership)是一份聯合承諾,首批有 60 個簽署組織——涵蓋前沿 AI 實驗室、政府部會、慈善基金會、研究機構與社區落實組織——共同支持一個為期五年的目標:讓估計 34 億、所說語言在今日 AI 模型中嚴重缺席的人口,能夠用自己的語言和聲音使用 AI 工具。
缺口有多大
承諾背後的數字,說明了基金會為何把這件事視為近迫的近用危機,而非產品路線圖上的一個項目。全球約有 7,000 種語言,但被認為資源充足、足以支撐高品質 AI 能力的只占一小部分。其餘的「低資源語言」,在用來打造與測試 AI 的資料、工具和基準裡都嚴重低度呈現。
後果會默默複合:系統變得更不精準、更不好用,甚至完全無法理解整個社群的表達方式。而由於語言的弱勢往往與科技弱勢重疊,語言缺口等於把所有其他數位落差再乘上一倍。
值得注意的是,「語音」在這份承諾裡被視為第一順位需求,而非加分項。在打字或文字介面不易使用的地方,自然的口語才是人們真正與 AI 互動的方式。蓋茲基金會執行長 Mark Suzman 先前就指出,非洲多數人用的是功能型手機而非智慧型手機,因此工具必須靠語音運作——這代表需要蒐集真實口說的錄音、各地的口音,甚至兒童的聲音,而不只是爬取文字。
語言表現不佳也絕非小事。方言、俚語、慣用語與文化脈絡都可能徹底改變語意——而在聯盟最在乎的醫療、教育、農業、金融與公共服務領域,精確度出了問題,代價可能很嚴重。
四個工作面向,一層共享底座
這份承諾並非單一巨型計畫,而是把各組織的資源與專長,組織進四個工作面向:
- 打造開放語言層——共享、安全的資料基礎設施,任何開發者都能以開放授權取用。這是最根本的承諾:把語言資料當公共財,而非護城河。
- 誠實追蹤進度——共享的評測與基準,實際衡量離全球目標還有多遠,讓「多語支援」變成可驗證的主張,而不是行銷話術。
- 把語言資料變成可用工具——任何 AI 開發者(而不只是資源最多的大廠)都能使用的模型與應用。這是基礎設施與慈善捐款的分界線。
- 安全地觸及人群——全程以保障隱私、知情同意與資料主權的負責實踐為指引。
簽署名單本身就是故事
除了蓋茲基金會,首批 60 個組織涵蓋幅度罕見地廣:科技側有 Anthropic、Google、Microsoft、Amazon、NVIDIA、Mistral、Zoom 與 ElevenLabs;還有 OpenAI 基金會;多邊與政府單位包括世界銀行集團、UNICEF、英國外交發展部(FCDO),以及塞內加爾數位事務部;更關鍵的是那些多年來在沒有前沿規模資金下持續耕耘的基層研究組織——非洲 NLP 的 Masakhane、印度語言的 AI4Bharat 與 BHASHINI,以及 Lelapa AI、Data Science Nigeria、Digital Umuganda、Mozilla Data Collective、Karya、CurrentAI 等。
這樣的組合很重要。聯盟明確把自己定位為「連結並加速」既有的資料集、模型、基準、應用與落實工作,而不是取而代之。Masakhane 這類組織花多年建立的社群自主語言科技規範,能否成為整個聯盟的規範,才是真正的考驗。
觀察重點:治理規則還沒寫
必須誠實地說,這是一份承諾,不是上線的產品——發表當天沒有任何多語資料集、模型或工具問世。聯盟表示,詳細的組織架構、治理與工作流程將在未來一年內協作敲定;美聯社報導並指出將設立秘書處追蹤各項承諾。
仔細讀細節的人已經點出了懸而未決的問題。OpenTools 的分析指出,四個工作面向對應的是截然不同的瓶頸:語音庫可以存在,但模型未必能駕馭那個語言;基準可以揭露精準度落差,卻不會自動補上縮小落差所需的授權資料;而一個技術上開放的資料集,仍然可能沒有回答:說話者是否了解資料的用途、能否撤回自己的貢獻、能否限制文化敏感知識的存取。開放授權與知情同意,並不等於社群掌控。
聯盟尚未公布逐語言的盤點、最低資料門檻、共享基準套件,或模型釋出時程。這些缺失不是失敗的證據——恰恰是下次進度報告應該被拿來檢視的里程碑。正如 OpenTools 那篇分析所言:有用的計分卡,算的應該是語言數與權利,而不是簽名數。
為什麼重要
這項倡議出現的時間點,正值 AI 近用已成為地緣政治的一級議題。它接續蓋茲基金會 9 月 14 日承諾的兩年至少 10 億美元公平 AI 投入——其中約一成正是瞄準語言資料這個地基——也把今年度 Goalkeepers 報告裡的警告化為行動:若放任市場自行運作,最強大的工具會先為付得起的人打造,而不是為最能受益的人打造。
對 AI 產業來說,「開放語言層」的概念,是對當前前沿訓練「抽取—囤積」資料經濟學的一次安靜挑戰。如果共享、開放授權的語言基礎設施,成了下一波數十億使用者的預設底座,囤積低資源語言資料的邊際優勢就會縮水。而對缺口另一端的 34 億人來說,事情簡單得多:當他們開口時,助理聽得懂嗎?
六十個簽名開了戶頭。未來一年的治理設計,決定這份承諾會不會生出利息。
Sources
- [1] https://www.gatesfoundation.org/ideas/media-center/press-releases/2026/09/ai-language-partnership
- [2] https://www.gatesfoundation.org/ideas/progress/ai-for-good/language-commitment
- [3] https://opentools.ai/news/ai-language-coalition-open-datasets-governance
- [4] https://abcnews.com/Technology/wireStory/gates-foundation-launches-coalition-build-representative-language-data-136622214
- [5] https://economictimes.indiatimes.com/tech/artificial-intelligence/gates-foundation-forms-global-ai-coalition-to-bridge-language-gap-anthropic-microsoft-google-among-signatories/articleshow/134426834.cms