最強 AI 翻譯只拿 39 分:深入「最終翻譯基準」
244 位研究者在眾包平台上打造了一個收錄 3,456 個對抗範例的即時基準,證明機器翻譯仍會系統性出錯。最強模型 Gemini 3.1 Pro 的通過率僅 39.3%。
機器翻譯有一個不能說的秘密:如今已經沒有人能真正說清楚這些模型到底有多好。標準基準早已飽和、自動評分指標不可靠又容易遭到 reward hacking、就連專家人工評估也缺乏可重現性。由 Vilém Zouhar(蘇黎世聯邦理工學院/布拉格查理大學)領軍、共 244 位研究者組成的聯盟,近日發表了迄今最激進的回應——「最終翻譯基準」(Last Translation Benchmark, LTB):一個持續運作的眾包資料集,收錄 3,456 個能夠證明當代最強翻譯模型會出錯的範例,而且每個範例都附上一條手工打造的「驗證規則」,把令人難堪的失敗案例變成可重現的測試。
結論數字相當殘酷。在基準的主要「Blind」評估中,全世界最好的系統——Google 的 Gemini 3.1 Pro——只成功翻譯了 39.30% 的範例;人類在同一批題目上的通過率是 99.89%。這不是差距,這是一道深淵,而且量測時間就是 2026 年 9 月 4 日,不是什麼遙遠的過去。
最終翻譯基準到底是什麼
這篇論文(arXiv:2609.04173,2026 年 9 月 3 日提交)開頭先給出一份機器翻譯圈心照不宣的診斷書。隨著模型越來越強,傳統測試集——新聞體句子配上單一標準參考譯文——早已逼近飽和。BLEU 這類指標及其後繼的學習型指標可以被刷分;作者明確點名它們「容易遭到 reward hacking」而且「無法指出該修什麼」。即使花錢請專業譯者評分也不保證解決問題,因為人工判斷在 不同評測者與不同場次之間出了名地難以重現。
LTB 直接反轉了基準的設計哲學。它不抽取「具代表性」的文本,而是刻意收集難以翻譯的輸入,涵蓋文字、圖片、音訊、影片四種模態,由貢獻者提交,且提交者必須證明領先的翻譯模型在這些輸入上確實會出錯。每一筆提交都要經由通曉相關語言的貢獻者互相審查,通過後的範例都附帶一條驗證規則:一份具體、可自動檢查的規格,說明正確譯文必須(或不得)包含什麼。可以把它想成「翻譯的單元測試」——由人類撰寫,任何未來模型都能在沒有人類介入的情況下被自動評分。
眾包規模是這篇論文的第二個成就。LTBv1——第一個凍結版本,收錄 2026 年 9 月 1 日前通過審查的所有貢獻——列出了 244 位作者,其中多數人是靠著讓 10 筆以上提交通過審查而取得共同作者身分。整個計畫涵蓋從阿爾及利亞阿拉伯語到越南語的 39 種來源語言,目標語言有 14 種,包括白俄羅斯語、博多語、克羅埃西亞語和瑞士德語——刻意納入商業系統長期忽略的語言。
沒有人想拿第一的排行榜
因為每個範例都附帶可機器判定的通過/失敗規則,團隊得以經營一個即時排行榜,分數即驗證器通過率,並以 Gemini 3.1 Pro 作為評分引擎。Blind 模式(不給翻譯模型任何特權資訊)的結果,等於替整個領域拍了一張令人難堪的快照:
| 系統 | 機構 | 通過率 |
|---|---|---|
| 人類 | — | 99.89% |
| Gemini 3.1 Pro | 39.30% | |
| GPT-5.6 Sol | OpenAI | 28.10% |
| GPT-5.6 Luna | OpenAI | 15.37% |
| Gemini 3.5 Flash-Lite | 11.86% | |
| Kimi K3 | Moonshot AI | 11.75% |
| DeepSeek-V4-Pro | DeepSeek | 10.76% |
| Qwen3.7-Plus | Alibaba | 10.21% |
| Google Translate | 0.77% |
有兩個解讀特別值得注意。第一,通用前沿模型遠遠領先專用翻譯基礎設施——對數十億人來說幾乎等同「機器翻譯」代名詞的 Google Translate,在這套題目上的通過率不到百分之一。第二,即使是最好的前沿模型,在大多數人類只覺得「有點難」、而非「不可能」的題目上仍然失敗。基準還設有「Oracle」模式,讓模型取得驗證規則或人類譯文等特權資訊,用來衡量「把目標講明白之後」的進步空間——不過截至論文發布時,Blind 表格才是有完整資料的那張。
Zouhar 自己對研究發現的總結,直接打臉業界的慣常說法:「機器翻譯不只是在比喻性語言上出錯,這和大家直覺的不同。事實上,下一代模型可能需要大量投入多語言(及文化)推理能力。」失敗的根源不在詩詞與成語,而在模型缺乏世界知識、文化脈絡與刻意推理能力來應對對抗性輸入——對一個早已把翻譯當成「通用智慧順便解決掉的小問題」的產業來說,這是個尷尬的結果。
為什麼驗證規則比範例本身更重要
更深一層的貢獻在方法論。一個只收錄難題的基準,終將像前輩們一樣走向飽和。LTB 之所以能保持誠實,是因為每個範例都記錄了模型為什麼失敗:手工規則寫明了具體的失敗情形,所以當未來某個模型通過時,你確切知道是哪一項能力補上了缺口;當它失敗時,規則會告訴你該修什麼。這把評估從「排行榜儀式」變成「工程診斷」,就像可驗證程式碼基準為編程代理帶來的轉變一樣。
它同時繞開了指標危機。模型與分數之間不存在可以被駭的學習型指標,只有一條確定性的規則加上一個夠強的驗證器模型(Gemini 3.1 Pro),而驗證器本身可以隨更強模型推出而替換。較真的人會指出循環風險——用前沿 LLM 去評判前沿 LLM——但有了 99.89% 的人類錨點,驗證器自身的盲區是有界且看得見的。
一篇持續生長的論文
有別於靜態基準,LTB 明確定位為活資料集:貢獻持續受理,團隊計畫「以滾動方式推出新版資料集與更新版論文、並納入新作者,一路到 2026 年底」。任何人只要有 10 筆提交獲得核准,就能加入作者名單——這個機制已經催生出計算語言學史上數一數二大的作者群。提交易透過 magic link 平台完成審查,審查者可依語言對自我推薦,整條管線(LTBv1 資料集,90 MB;GitHub 儲存庫;排行榜提交)全部公開。
對模型開發者來說,現實的訊息並不舒服:你家旗艦模型的 39% 如今是一個公開、持續更新的數字,而想要推高它的唯一方法,是真的去補強多語言與文化推理,而不是對著靜態測試集調參。對其他人來說,這個基準提供了一張罕見而誠實的地圖,標示機器翻譯真正所在的位置——而地圖上寫著:機器還差得遠。