← All posts / Models

Motif 3 正式版以 MIT 授權開放:韓國主權 AI 全面開源

韓國 Motif Technologies 低調釋出 314B 參數的 Motif 3 正式版權重,採 MIT 授權——從零打造的 MoE 架構,在 Artificial Analysis 智慧指數拿下 47 分。

Motif 3 正式版以 MIT 授權開放:韓國主權 AI 全面開源

2026 年 8 月 10 日當週末尾,Hugging Face 上出現了不尋常的一幕:三個模型儲存庫在幾分鐘內接連上線,伴隨同一時間發布的 arXiv 技術報告——卻沒有新聞稿、沒有部落格文章、公司官網上隻字未提。這場無聲的發布,正是 Motif Technologies 交付 Motif 3 正式版——韓國旗艦主權 AI 模型——的低調登場,而發布的安靜程度,恰恰與其重要性形成鮮明對比。

釋出了什麼

Motif 3 正式版包含 Hugging Face 上的三個成果:Motif-3-Base(預訓練基礎模型)、指令微調版 Motif-3,以及 Motif-3-NVFP4(供高效部署的量化版本)。三者皆採用 MIT 授權——現有最寬鬆的標準授權條款。這是對七月 Motif-3-Beta 的直接升級:Beta 版因帶有非商業研究限制,數週來一直阻礙企業採用。

實際差異相當可觀。在 MIT 授權下,任何微調服務商、企業或新創都可以自由使用、修改、再散布及銷售權重的衍生作品,無需向首爾申請許可——唯一義務是保留版權聲明。在 AI 模型授權光譜上,MIT 與 Apache 2.0 同級:自由微調、自由商用。

技術報告(arXiv:2608.09119,2026 年 8 月 10 日提交,Junghwan Lim 與 26 位共同作者)同週發布,正是這份文件讓此次發布在開放權重競賽中不僅僅是個註腳。

架構:從零打造

Motif 3 是解碼器架構(decoder-only)的混合專家模型(MoE),總參數量 3,140 億(314B),每個 token 僅啟動 132 億(13.2B) 參數。每個稀疏 MoE 層包含 384 個路由專家,每 token 選取 8 個,外加一個共享專家。實際效益:推論成本接近一個約 13B 的稠密模型,而知識容量卻動用完整的 314B 參數池。

模型在約 12.5 兆 token 上預訓練,涵蓋網頁文件、STEM、程式碼、數學、多語言內容及韓文語料,並原生支援 262,144 token(256K) 上下文視窗。

Motif 3 在架構上的獨特之處,是 Motif 稱之為全自研的設計——並非既有開源架構的重新參數化:

  • 分組差分潛在注意力(GDLA)。標準多頭注意力會產生「注意力沉澱」(attention sinks)——不相干 token 累積不成比例的注意力權重。Motif 的 GDLA 結合差分注意力機制(透過相減兩個 softmax 注意力圖來消除雜訊,源自微軟與清華 2024 年的 Differential Transformer 研究)與多頭潛在注意力的壓縮鍵值表示(首見於 DeepSeek-V2),運行 80 個查詢頭與 16 個鍵值頭。成果是更聚焦的注意力與更小的 KV 快取——這正是 256K 上下文視窗無需等比記憶體開銷的關鍵。
  • 專家專屬 PolyNorm。以可學習的多項式正規化函數取代每個專家前饋網路中的標準 SiLU 激活函數,係數依各專家獨立學習。這能減少激活離群值——大規模訓練中已知的數值不穩定來源——同時讓各專家發展適合自身 token 型態的正規化設定。
  • 修改版流形約束超連接(mHC) 以四條平行殘差流的雙隨機混合,取代傳統的殘差相加。
  • 多 Token 預測(MTP)頭實現自投機解碼:輔助頭提出草稿 token、由主模型驗證,無需獨立草稿模型即可提升吞吐量。

在訓練基礎設施方面,報告詳述了用於大規模穩定訓練的專家負載平衡與數值穩定技術、選擇性 MXFP8 運算與通訊、記憶體高效融合核心,以及支援 256K token 訓練的視窗感知上下文平行策略。

訓後流程:六位 RL 教師的蒸餾

訓後(post-training)流程與架構一樣值得關注。Motif 結合了一般性監督微調、六位以強化學習訓練的專家教師、一位以 SFT 訓練的軟體工程教師,以及他們稱為多教師在策略蒸餾(Multi-teacher On-Policy Distillation)的技術——將推理、程式編寫、工具使用、專業領域工作、長上下文理解、校準棄答與指令遵循等互補能力,整併進單一統一模型。值得注意的是「校準棄答」——知道自己何時不該回答——獲得明確重視,這也反映在模型於幻覺敏感評測上的強勁表現。

落點:智慧指數 47 分

正式版在 Artificial Analysis 智慧指數(AAII) 拿下 47 分,較 Beta 版估計的 45 分進步兩分。這讓它位居全球開放權重模型第三——僅次於 Kimi K3 與 GLM-5.2——並成為美國與中國以外地區開發的最高分模型。在韓國主權 AI 計畫第二階段評選中,Motif 3 的 47 分在四個參與的國內模型中居冠。

為什麼重要

背景故事讓此事意義更加鮮明。Motif 之所以獲選進入韓國「Dokpamo」主權 AI 計畫,正是憑藉獨立設計能力——這項要求在 2026 年 1 月淘汰了原本的領先者 Naver Cloud,原因是其模型嵌入了阿里巴巴 Qwen 的凍結編碼器權重。由據報約 30 人團隊打造的 Motif 3,是對這場豪賭的最好背書:幾乎所有帶寬鬆授權、接近前沿的開放權重模型——DeepSeek-V3、Qwen、多數 Mistral 發布——都源自既有的架構譜系。Motif 3 是極少數真正獨立的譜系之一,而且從基礎模型起就採 MIT 授權。

對開發者而言,這代表在 Motif-3-Base 上微調或續訓,能比一般選擇繼承更少的既有設計限制。對韓國而言,這代表一個全世界都能真正採用的主權模型——這是走向相關性的最穩路徑。對開放權重生態系而言,這證明了接近前沿的梯隊已不再是兩國俱樂部。

沒有新聞稿的正式發布,結果成了最響亮的宣言。