← All posts / Models

騰訊開源 Hy4 Preview:770B 參數 MoE 旗艦模型,支援百萬 token 上下文

騰訊混元團隊發布 Hy4 preview,770B 總參數的開放權重 MoE 模型,每 token 僅啟動 49B 參數,支援 100 萬 token 上下文,編碼表現超越 GLM-5.3 與 Kimi K3。

騰訊開源 Hy4 Preview:770B 參數 MoE 旗艦模型,支援百萬 token 上下文

2026 年 8 月 28 日,騰訊混元(Hunyuan)團隊悄然發布了今年最重要的開放權重模型之一:Hy4 preview。這是一個總參數量達 7,700 億(770B)的新世代旗艦語言模型,採用混合專家(Mixture-of-Experts, MoE)架構。與西方實驗室緊握不放的前沿模型不同,Hy4 preview 直接開放權重下載——而它的 benchmark 成績顯示,「開源」與「閉源」AI 之間的差距又再一次縮小了。

Hy4 Preview 是什麼

Hy4 preview 是由騰訊 Hy 團隊開發的新世代 MoE 旗艦模型。核心數字:總參數 770B,每個 token 約啟動 49B 參數,上下文視窗一路擴展到100 萬 token。這個啟動參數比例——不到全模型的 7%——正是現代 MoE 設計的精髓:你獲得相當於稠密 770B 模型的知識容量,卻只需支付小得多的推論成本。

這個模型的定位明確瞄準軟體工程、研究與分析型工作負載,而非日常聊天。騰訊官方強調的是代理式生產力(agentic productivity):工具呼叫、長鏈推理,以及橫跨整個程式碼庫的作業能力——這也是 100 萬 token 上下文真正發揮實用價值的地方。你可以把一個大型 monorepo、它的文件和 issue 歷史全部塞進同一個 prompt,還有餘裕空間處理實際任務。

模型現已上架 Hugging Face(tencent/Hy4-preview)與 ModelScope(Tencent-Hunyuan/Hy4-preview),vLLm 部署配方也同步發布,可直接投入生產環境。發布後數天內,社群追蹤頁面已收錄超過 40 項 benchmark 結果。

Benchmark 表現

真正引發關注的是編碼與工程類成績:

  • SWE-Bench Pro(Public):65.7%——這讓 Hy4 preview 成為 SWE-Bench Pro 上排名第一的開源模型(LLM Stats 排行榜總排名第 5,分數 0.657),領先所有其他開放權重競爭者
  • HLE(Humanity’s Last Exam):55.40——在現存最困難的推理評測之一上繳出強勢成績
  • GPQA Diamond 表現穩固,確立其科學推理能力
  • 在盲測工程評估中,Hy4 preview 平均得分 2.99/4.00,小幅超越 GLM-5.3(2.92)與 Kimi K3(2.94)——這兩個過去數月輪流坐擁開源王座的中國開放權重模型
  • 在 BenchAlign 等公開整合排行榜上,首發即以 79.16/100 排名 228 個模型中的第 7 名

這些數字的背景很重要。2026 年以來,GLM-5.3 與 Kimi K3 在開放權重榜單上你追我趕。Hy4 preview 不是加入這場競賽——它第一次出手就在盲測工程評估中同時小幅超越兩者。與 DeepSeek、Qwen 3.8 Max、GPT 5.6 Sol 和 Claude Opus 5 橫跨近三十項 benchmark 的獨立比較顯示,這是一個在編碼相關任務上能與全球前沿抗衡、同時可自由下載的模型。

為什麼這次發布重要

三個理由,說明這不只是一次例行性的模型上線。

第一,「開源/閉源」差距持續收斂。 一年前,「開放權重」幾乎等同於「可接受的落後」。今天,SWE-Bench Pro——這個由真實 GitHub issue、生產級儲存庫、多檔案 diff 構成的最困難編碼 benchmark 之一——排名第一的開源模型,是一個中國開放權重發布。前沿實驗室在絕對上限上仍然領先,但對大多數工程實務而言,差距已縮小到雜訊等級。

第二,MoE 的大規模效率獲得驗證。 從 770B 總參數中只啟動 49B,意味著每個 token 的服務成本遠低於同等能力的稠密模型。搭配上市即支援的 vLLM,Hy4 preview 可以部署在稠密前沿模型根本塞不進的硬體預算內。有報導指出,這個模型甚至參與優化了自身 的訓練與推論管線——一種狹義但真實的遞迴自我改進。

第三,中國開放權重生態正在複利成長。 DeepSeek、Qwen、GLM、Kimi,現在加上混元,已將開源發布變成穩定的節奏。每一次發布都抬高所有人的底線——研究者拿到可研究的權重,新創拿到可建構的模型,而發布本身也對閉源實驗室的定價形成壓力。Hy4 preview 帶著對 GLM-5.3 和 Kimi K3 的勝利登場,等於保證下一輪軍備競賽已經開打。

但要注意

它叫 preview 是有原因的。早期使用者指出,相較於原生多模態競爭者,其多模態支援仍有限制;而「preview」通常意味著最終版本可能與今天 Hugging Face 上的權重有顯著差異。benchmark 宣稱的獨立驗證仍在進行——部分排行榜條目的證據狀態仍標記為「估計」,等待重現。此外,即使有稀疏啟動,服務一個 770B 模型並非易事——想在生產延遲下自行架設的團隊,實際 GPU 需求依然可觀。

這些保留都不改變核心事實:一個 770B 參數、百萬上下文、編碼優先的旗艦模型,現在免費開放下載。

後續觀察

接下來的里程碑很明顯:未來數週的獨立評測重現、穩定版 Hy4 的發布(想必會補齊更完整的多模態能力),以及 GLM 與 Kimi 的回應——兩者都已證明自己迭代極快。如果 Hy4 正式版能守住或擴大目前的榜單位置,騰訊將在單一發布週期內,從雲端 AI 玩家躍升為真正的開放權重量級選手。

對工程師與研究者而言,實際建議很簡單:權重在 Hugging Face 上,vLLM 配方已發布,而 SWE-Bench Pro 的數字說明這是目前處理真實儲存庫規模工作最強的開源模型。這樣的組合,不是每個星期都會出現。