← All posts / Models

78B 參數、3B 啟動、Apache 2.0 開源:Aleph Alpha 的 Kolibri 打響德國主權 AI 模型之戰

在德國統一紀念日這天,Aleph Alpha 開源了 Kolibri:一個 78B 總參數、3.5B 啟動參數的 MoE 模型,以 20T token 訓練、21.3% 原生德文資料、百萬級上下文,並內建拒答訓練,瞄準受監管產業。

78B 參數、3B 啟動、Apache 2.0 開源:Aleph Alpha 的 Kolibri 打響德國主權 AI 模型之戰

10 月 3 日——德國統一紀念日,這個日期是海德堡公司刻意挑選的——Aleph Alpha 發布了新世代主權語言模型 Kolibri,並在 Hugging Face 上以 Apache 2.0 授權公開完整模型權重。在多數目光都聚焦於兆級參數系統的今年,Kolibri 提出了相反的主張:對於它鎖定的公共行政、工業與航太客戶而言,最終勝出的不是最大的模型,而是那一個能讓部會在自己的硬體上、用自己的語言、依自己的法律運行的模型。

這次發布也是重組後組織的第一個重要產品。Aleph Alpha 正被併入加拿大 Cohere,雙方於 9 月 16 日簽署合併協議,整體估值約 200 億美元,並獲得擁有 Lidl 的 Schwarz 集團 6 億美元支持。創辦人 Jonas Andrulis 轉任董事會主席;在共同管理人 Reto Spörri 於 9 月離職後,Ilhan Scheer 成為唯一執行長。Kolibri 是新領導層立旗的第一步——不與 OpenAI 或 Anthropic 打規模戰,而是深耕 Schwarz 集團企業關係早已觸及、合規要求最嚴格、對基礎設施最敏感的市場區隔。

Kolibri 到底是什麼

Kolibri 是一個英德雙語的 Mixture-of-Experts(混合專家)Transformer,總參數 781 億,每個 token 約啟動 35 億參數。它支援最長 100 萬 token 的上下文,預訓練資料約 20 兆 token。Hugging Face 上提供兩個版本——Kolibri-1 與 BF16 版——且都原生支援 vLLM。

架構設計處處可見工程紀律。Kolibri 採用 384 個小型專家而非少數大型專家(Aleph Alpha 的測試顯示更細的切分表現更好),每 token 啟動 6 個專家,另在全 50 層共用一個共享專家。50 層中只有 10 層執行完整注意力,其餘 40 層使用 512-token 的緊湊滑動視窗,使解碼運算與記憶體開銷不隨上下文長度膨脹。在訓練時的專家路由上,團隊引入了「精確分位數平衡」——把 Kimi K3 原本以直方圖估算的全球分位數改為精確計算——並報告指出精確化同時改善了負載平衡與模型品質。

整個訓練在 768 張 B200 GPU 上分三階段完成:以 16k 序列長度訓練 20T token、歷時 21 天;接著以 64k 進行 3.44T token 的中段訓練;最後以 256k 進行 200B token 的長上下文適應——總計近 24T token。在 21 天的預訓練期間,任務遭遇 38 次非計畫中斷(約每萬 GPU 小時一次),全部由訓練管線自動處理,無需人工介入;叢集自動改在其他節點重啟,並從最多回退 250 步的檢查點續訓。

為德語而生,而非翻譯成德語

整個專案最獨特之處在於資料策略。Aleph Alpha 需要約 4T 德文 token 才能達成約 20% 德文占比的目標,但去重後整個開放德文網路只提供 390B。團隊不依賴機器翻譯——正如他們在先前《Sauerkraut, Not Burgers》研究中所論證,翻譯會產生「翻譯腔」並夾帶英文網路的文化指紋——而是用三種方式補足缺口。

第一,打造德語專用的 Common Crawl 管線:標準英文過濾器會悄悄刪掉德國行政文書,因為德文單字長度經常超出英文的平均長度上限,於是團隊重新調校過濾參數,回收了 1.3T 的原生德文網路 token。第二,改寫(rephrasing):用 LLM 把既有德文文件改寫成百科條目、對話或短文——同樣的事實、新的表面形式,文化上仍是德國的(如同官方部落格所說:「是總理,不是總統」),貢獻約 1T token。翻譯本身整體只占 6%,且在最終 Kolibri 訓練中完全未使用。最終,德文以 2.4T token 的獨特資料池進入訓練,其中 80% 為自建或自產,模型實際看到的德文占預訓練 token 的 21.3%。

團隊還以新方法 UniBPE 打造英德雙語分詞器,結合 BPE 的由下而上合併與 Unigram 的訓練目標。在德文網路文本上,Kolibri 的 128k 詞表分詞器達到每 token 4.90 位元組的壓縮率——優於他們比較中的 GPT-5(4.35)、DeepSeek V4(3.72)、Kimi K3(3.28)與 GLM 5.3(3.93)——而且它沿著詞素邊界切分德文複合詞:Bundessozialgericht(聯邦社會法院)被切成 Bundes+sozial+gericht+es,而不是對手分詞器切出的次詞素碎片。壓縮率不是表面功夫;每個任務需要的 token 愈少,推論就愈便宜、愈快。

基準測試:小啟動參數、逼近前沿的成績

與開放權重的同儕——Qwen3.6-35B-A3B、Nemotron 3 Super 120B-A12B、Mistral Small 4 119B-A6B——相比,Kolibri 交出亮眼成績:AIME 2025 拿下 96.9,AIME 2026 拿下 96.0(德文版 90.0),GPQA Diamond 84.3(德文版 81.3),LiveCodeBench v6 85.9,HumanEval+ 92.7。Aleph Alpha 宣稱 Kolibri 可匹敵啟動參數量四倍於它的模型,且在英德兩語的品質對服務成本帕累托前沿上。尺寸選擇的經濟學很直白:他們測試的 123B 版本在兩張 H100 上只能同時處理 3 個 256k-token 查詢,而 78B 的 Kolibri 能處理 18 個,解碼速度快 28%。

針對對幻覺極度敏感的部署場景,Kolibri 以拒答(abstention)資料與 Aleph Alpha 自家的 Merlin-Arthur 協議訓練——這是一場三人遊戲:「Arthur」(出貨的模型)必須回答「Merlin」提供的真實上下文,卻要對「Morgana」精心刪改過的上下文拒答,任何猜測、即使是矇對的猜測,都算錯。Kolibri 在 44% 的 AA-Omniscience 題目上選擇拒答而非答錯(前代只有 14.8%),在 Aleph Alpha 自有的 M/A 紮實度評分上拿到 0.23,而多數比較模型為 0。模型還提供四段可選的推論力度——無、低、中、高——讓客戶按請求權衡運算成本與答案品質。

為什麼主權本身就是產品

每個設計決策都指向同一個訴求:控制權。Kolibri 在德國打造、在德國與芬蘭的基礎設施上訓練、受歐洲與德國法律規範,公司形容整條管線從資料篩選到後訓練都不受外國控制。它從一開始就針對 EU AI Act、《通用目的 AI 行為準則》與 GDPR 設計。客戶獲得完整的部署自由——本地、氣隙隔離、任何地方——而且因為啟動參數量小,它無需把內部文件送往第三方推論雲端就能高效運行。

策略解讀:這是 Mistral 法國劇本的德國縮小版,聚焦於必須對德國資料保護法負責、無法把工作負載繞經維吉尼亞超大規模資料中心的 DACH 市場。德國政府機關是否真的會採用 Kolibri、它能否扛得住德國企業私下測試的開放權重中文模型,現在是客戶的問題,不是新聞稿的問題。但作為「主權 AI」實務上意味著什麼的宣示,Kolibri 罕見地具體:開放權重、可追溯的供應鏈、雙語設計的分詞器,以及一個被訓練成懂得說「我不知道」的模型。