騰訊開源 Hy4 preview:770B 參數 MoE 旗艦模型,支援百萬 token 上下文
騰訊 Hy 團隊開源 Hy4 preview:770B 總參數、每 token 僅啟動 49B 的 MoE 旗艦模型,具備百萬 token 上下文視窗,評測成績超越 GLM-5.3 與 Kimi K3。
騰訊 Hy 團隊正式開源 Hy4 preview,一款新世代混合專家(Mixture-of-Experts,MoE)大型語言模型旗艦,直接站上開源前沿。此模型於 2026 年 8 月 28 日以寬鬆的 Apache 2.0 授權發布,擁有 770B 總參數、每 token 啟動 49B 參數,以及長達 100 萬 token 的上下文視窗——這樣的規格組合,直到不久前還是西方閉源前沿實驗室的獨佔領域。
模型權重現已上架 Hugging Face、ModelScope、GitCode 與 CNB,同時提供標準精度版本與 FP8 量化版本(Hy4 preview-FP8),後者專為實際的多 GPU 部署場景設計。以一個「preview」版本而言,這次發布的完整度罕見地高:官方 vLLM 與 SGLang 容器映像、完整微調流程,以及騰訊自家的 AngelSlim 量化工具鏈,全部隨權重一併公開。
架構解析:稀疏注意力,師法 DeepSeek
在亮眼數字之下,Hy4 preview 是今年技術上最有趣的开源架構之一。其骨幹共 78 層:第一層採用標準密集前饋網路,其餘 77 層皆為 MoE。每個 MoE 層包含 256 個路由專家與 1 個共享專家,每個 token 啟動 top-8 路由專家加上共享專家——這種稀疏化設計讓單 token 運算量維持在 49B 參數,同時整體模型保有 770B 的容量。
在注意力模組上,騰訊毫不掩飾其技術血緣。受到 DeepSeek 與 GLM 啟發,Hy4 preview 採用閘控 DeepSeek 稀疏注意力(Gated DSA),並結合 IndexCache 實作跨層稀疏索引複用;殘差路徑則採用具備四條殘差流的 identity Hyper-Connections(iHC),擴展層間資訊流。白話來說:模型不是靠密集算力硬堆能力,而是大幅剪枝每個 token 需要關注的範圍——這正是它能提供百萬 token 上下文、又不必負擔同等規模密集模型 KV-cache 記憶體成本的關鍵。
模型還內建了原生的 MTP(多 token 預測)層——總參數 10B、啟動 0.7B——用於投機解碼。在 vLLM 中只需一個參數即可啟用;騰訊公佈的部署配方將 MTP 草稿模型與 FLASHMLA_SPARSE 注意力後端結合,採 8 路張量並行。FP8 權重讓整個模型可在單一 8 GPU 節點等級的硬體上提供服務——這正是資金充足的新創或大學實驗室實際租得起的設備。
評測成績:超越 GLM-5.3 與 Kimi K3
騰訊以盲測對照評估驗證 Hy4 preview:163 位內部專家對 203 項真實工程任務的模型輸出進行評分。結果顯示 Hy4 preview 略微領先目前的中國開源權重雙雄:
- 對比 GLM-5.3:平均分 2.99 對 2.92,勝率 46.8% / 平手 12.8% / 落敗 40.4%
- 對比 Kimi K3:平均分 2.99 對 2.94,勝率 51.2% / 平手 7.9% / 落敗 40.9%
不過第三方評論提醒,全貌更為細緻——據報導,Kimi K3 在 GPQA Diamond、HLE、SWE-Marathon 等多項純推理基準上仍居領先,是更強的數學家與馬拉松程式工匠。但在騰訊評測所衡量的編碼、推理與代理式工作負載綜合表現上,Hy4 preview 目前在開源權重模型中握有最高的平均分。
這些數字背後的訓練哲學值得注意。騰訊表示,他們與公司內部的一線實戰者——軟體工程師、遊戲開發者、金融分析師與資安專家——合作,圍繞這些團隊實際交付的工作建構後訓練資料。騰訊宣稱模型在四個生產力領域有顯著推進:更具前端視覺品味的長時程軟體工程;將散落多檔案的混亂脈絡轉化為可分享的文件、試算表與簡報;從單一提示生成可玩的遊戲原型;以及橫跨分子動力學、凝態物理與純數學的科學研究。
對限制毫不諱言
難得的是,模型卡並沒有假裝這是個完成品。騰訊直接列出已知問題:模型處理複雜任務時會花費超乎必要的推理時間,且傾向過度自我驗證。團隊明確闡述其預覽版策略——「我們寧願早點發布、聽取哪裡會壞掉」——並以 Hy3 preview 的週期為證:早期社群回饋直接塑造了後來大幅改良的正式版。
這種發布哲學已成為中國開源生態的標誌:公開權重、歡迎批評、快速迭代。它也與閉源前沿實驗室的部署模式形成尖銳對比——後者最強的模型只能透過計量付費的 API 存取。
為什麼重要
Hy4 preview 的重要性有三。第一,能力密度:一個啟動參數僅 49B 的模型能與 GLM-5.3、Kimi K3 並駕齊驅,代表開源前沿正以迅猛步調縮小與閉源模型的差距。第二,上下文經濟學:開源權重套件中的百萬 token 上下文——搭配稀疏注意力與 FP8 權重讓服務部署可行——讓任何擁有硬體的人(而不只是擁有企業合約的人)都能解鎖長文件分析、整儲存庫程式碼理解與長時程代理工作流。第三,授權自由:Apache 2.0 無地域限制,商用、微調與蒸餾全部無需談判。
這次發布也延續了 2026 年的鮮明格局:當前最強的可下載開源模型——Hy4 preview、GLM-5.3、Kimi K3、Qwen 3.8-Max——全數來自中國實驗室,以寬鬆授權發布,而美國對手則將前沿權重緊握在手。無論各方的戰略考量為何,實際效應是:開源權重 AI 能力的重心已經位移,而 Hy4 preview 正是當下的最新證據。
想上手的開發者,門檻比參數量暗示的低得多:拉取 vllm/vllm-openai:hy4-preview 映像、載入 FP8 權重、設定張量並行 8,模型開箱即提供 OpenAI 相容 API。推理模式預設為 “high”,適合數學、編碼與推理等複雜任務的深度思考鏈,也可切換至 no_think 模式取得直接回應。
完整版(非 preview)的 Hy4 將隨團隊持續迭代預訓練與後訓練空間而推出。若 Hy3 的軌跡可資借鑑,正式版值得期待——但現在就開始動手打造,沒有理由再等。