← All posts / Models

25B 活躍參數拿下 WMT26 83.6 分:Cohere 北極星小翻譯模型擊敗 DeepL 與 Google,還直接開源權重

Cohere 首款專用翻譯模型 North Small Translate 以 218B 總參數、僅 25B 活躍參數的 MoE 架構,在 WMT26 全語言基準拿下 83.60 分,超越 DeepL NextGen(81.37)、Qwen 3.5 397B(81.56)與 Google 翻譯(68.20),兩張 H100 就能跑,而且開放權重下載。

25B 活躍參數拿下 WMT26 83.6 分:Cohere 北極星小翻譯模型擊敗 DeepL 與 Google,還直接開源權重

多年來,機器翻譯的排行榜有一套固定的秩序:DeepL 與 Google 翻譯穩坐專用 MT 頭兩把交椅,通用大型語言模型在後面追趕,開源權重模型則明顯落後一個檔次。2026 年 9 月 10 日,Cohere 用一把大錘砸碎了這套秩序。該公司 North 模型家族中首款專用翻譯模型 North Small Translate,在 WMT26 全語言基準測試拿下 83.60 分——領先 DeepL NextGen(81.37)、Qwen 3.5 397B A17B(81.56)、GLM 5.2 FP8(76.50)、Gemma 4 31B(79.46),而 Google 翻譯以 68.20 分遠遠落在後頭。

然後 Cohere 做了最出乎意料的那一步:把模型權重以 CC BY-NC 4.0 授權(研究與非商業用途)公開在 Hugging Face 上。

是精準瘦身,不是閹割

這個模型的架構是效率的教科書範例。North Small Translate 採用混合專家(MoE)架構,總參數量 2,180 億,但每個 token 僅啟動 250 億——與 Cohere 今年稍早的 Command A+ 一脈相承的稀疏設計哲學。實際影響非常具體:

  • 16k 輸入/16k 輸出上下文——足以一次吃進份量可觀的文件
  • 支援 50 種以上語言——32 種高資源語言加上 18 種額外語言
  • 最低硬體需求:一張 B200 或兩張 H100(W4A4 量化),並同步發布多種近乎無損的量化版本

最後一點才是真正低調的頭條。一個在評測中打敗 Google 與 DeepL 專有系統的模型,現在跑得動的硬體放得進一張書桌底下——而這正是重點所在。

為主權 AI 而生

過去兩年,Cohere 一直把自己定位成「主權 AI」的選項:服務那些不願把資料送進美中超大廠 API 的政府與企業。North Small Translate 可說是這個策略迄今最尖銳的表達。翻譯是組織處理最敏感的資料類別之一——法律證據開示、專利、外交電文、病歷——而這恰恰是機構最想留在自己機房的工作負載。一個能在自家資料中心兩張 H100 上運作的一流翻譯模型,拿掉了把這些文字送往別人雲端的最後一個藉口。

這個模型承接了 Cohere 的多語言血統:Tiny Aya 模型家族、廣受引用的 Aya 研究計畫,以及去年的 Command A Translate。North Small Translate 是這些累積的翻譯功底第一次被封裝成專用、為翻譯而生的 MT 模型,而非通用 LLM 的一項附帶能力。

區域戰場才是精彩之處

總分會掩蓋地理分布。在區域層級,North Small Translate 在歐洲全面擊敗 Gemma 4 31B——82.2 對 73.9(Agentic 版在 EU 語言拿到 82.74)——在南亞則幾乎持平(86.2 對 86.7)。更值得注意的是:它在所有測試過的非歐洲區域——中東北非、南亞、東南亞、東亞——都勝過 DeepL NextGen,其中南亞與中東北非領先幅度最大(約 8 到 10 分),東南亞中等(約 4 到 5 分),東亞最接近(1 到 3 分,DeepL 在該區的 85.41 依然強悍)。

這個分布讀起來像一個刻意押注:DeepL 的傳統強項是歐洲語言對,而 Cohere 直接攻進 DeepLe 不在場的地方。對任何翻譯量偏重亞洲或中東的組織來說,這個開源權重模型不只是更便宜——它是可量測地更好。

Agentic 版本:會自己檢查作業的翻譯模型

83.60 分屬於標準版。但 Cohere 同時發布了 North Small Translate(Agentic) 的成績——在這個配置下,模型會在草稿譯文中主動找出錯誤並修正後才輸出。這個自我校對迴圈把分數推升到 84.36。在 WMT 的評分標準中,80 到 100 分代表「完美或僅有輕微錯誤」,兩個配置都落在最高區間。光靠自我審查就多拿近一整分——這是「代理式鷹架能把專用模型推多遠」的又一個早期數據點,而且完全不用動到權重。

吞吐量與成本:會複利的優勢

速度:在 Cohere 內部以相同硬體進行的測試中,North Small Translate 在低併發下每秒輸出 112 個 token,Gemma 4 31B 為 81;高併發下為 39 對 30——多出 30% 到 38% 的吞吐量,約 1.4 倍。

長文件——多數翻譯模型默默崩潰的地方:North Small Translate 在 Cohere 的長上下文評估中拿到 48.9 分——單次呼叫翻譯完整兩個書本章節——是 Google 翻譯(21.3)與 Gemma 4 31B(19.4)的兩倍以上,也領先所有受測的通用 LLM。

成本:在 Cohere 量測的商業配置中,這個模型以每項任務 0.000676 美元、平均 661 個 token 的代價交付 80.1 的品質分數。Cohere 挑出來對比的對象很嗆:Gemini 3.1 Pro Preview(high)每項任務要價 0.038928 美元——貴了 5,762%。Qwen 3.5 397B A17B(0.004525 美元)與 Cohere 自家的 Command A+(0.005158 美元)居中,大約是 7 到 8 倍。

與 RWS 的聯手

North Small Translate 是與 RWS 共同開發的。RWS 是語言服務巨頭,旗下的 Language Weaver 平台在企業在地化圈是老字號。RWS 的研究團隊與語言專家在整個開發過程中塑造了模型的實務翻譯表現——而對於需要商業授權、安全審查與完整在地化平台的企業,這個模型也透過 Language Weaver 提供。RWS 宣稱與全球前一百大品牌中超過 80% 有往來,這給了 Cohere 一條直通「真正花大錢翻譯的客戶」的通路。

為什麼重要

三件事讓這次發布不只是一場基準測試炫技。第一,開放權重的動作:這場評測中表現最好的專用 MT 模型現在可以下載、量化、自行部署,這會重置政府與企業對專用 MT 廠商的容忍底線。第二,效率敘事——一個打敗 397B 對手的次兆級 MoE,只跑在兩張 GPU 上——延續了今年一整年的趨勢:稀疏架構正在吃掉密集架構的午餐。第三,主權 AI 框架:隨著歐盟、加拿大與越來越多國家要求敏感 AI 工作負載在地控制,一個可以實體隔離(air-gap)的翻譯模型,本身就是一個排隊等著上門的市場。

基準分數由 GPT-5.6-Sol 擔任評審,講究的人可以質疑 LLM 評審的校準。但領先 DeepL 兩分、領先 Google 翻譯十五分,加上一個任何人都能自己驗證的 Hugging Face 儲存庫,讓這件事很難不服氣。翻譯的護城河——如果曾經有的話——剛被踩淺了一大截。