騰訊開源 Hy4 Preview:770B MoE 旗艦、百萬 token 上下文,還親手把自己的推理吞吐提速 31.8%
騰訊混元新一代開源旗艦 Hy4 preview 擁有 770B 總參數、49B 激活參數與超過 1M token 的上下文視窗,並首度建立遞迴自我改進迴路,自行優化推論系統帶來 31.8% 吞吐提升。
騰訊混元團隊於 2026 年 8 月 28 日正式發布並開源新一代旗艦大語言模型 Hy4 preview:總參數達 7,700 億(770B),每 token 僅激活 490 億(49B),上下文視窗超過 100 萬 token。模型權重已上架 Hugging Face 與 ModelScope(BF16 與 FP8 雙版本),並透過騰訊的 WorkBuddy、CodeBuddy、元寶、ima 等產品提供全球使用,API 則可經由騰訊雲 TokenHub 與 OpenRouter 接取。
這次發布之所以重要,有三個原因。第一,它把開源權重的軍備競賽推向新量級——Hy4 preview 進入了先前由 DeepSeek、智譜、月之暗面等最大開源模型盤據的層級,騰訊宣稱它「位居開源模型第一梯隊」。第二,它的招牌評測不是公開排行榜,而是一場內部盲測人因研究,這種作法少見、且可以說更誠實。第三、也是最引人注目的:騰訊表示這個模型參與了自己的開發過程,建立起早期的遞迴自我改進(recursive self-improvement)迴路,並實際加速了它自己的推論系統。
架構:向 DeepSeek 看齊的稀疏注意力,規模直上 770B
Hy4 preview 是一個 78 層的 Mixture-of-Experts(MoE)Transformer。第一層使用稠密前饋網路,其餘 77 層每層配置 256 個路由專家(top-8 路由)加 1 個共享專家。770B 總參數中每 token 僅激活 49B,激活比率約 6.4%——在旗艦級總容量下仍能壓低推論成本的激進稀疏設計。
注意力模組最能看出 DeepSeek 的技術血緣。Hy4 preview 採用 Gated DeepSeek Sparse Attention(Gated DSA),搭配 IndexCache 機制做跨層稀疏索引重用,降低長上下文注意力的記憶體與運算負擔。殘差路徑則使用 identity Hyper-Connections(iHC) 擴展層間資訊流。模型原生內建 多 token 預測(MTP)層,額外增加 10B 總參數(激活 0.7B)用於投機解碼——vLLM 官方食譜已在 16×B200 或 8×B300 節點上,以 FLASHMLA_SPARSE 注意力後端與新的 hy_v4 工具呼叫/推理解析器提供 FP8 版本服務。
1M token(精確值 1,048,576)的上下文視窗,相較 7 月發布的 Hy3 preview(295B/21B、256K 視窗)是四倍躍升,讓 Hy4 preview 與最長視窗的前沿模型站在同一量級。
為生產力而生,由專家評判
騰訊把 Hy4 preview 定位為生產力模型而非聊天機器人,重點放在程式開發、辦公事務、資料分析、遊戲開發與科學研究。訓練資料由騰訊在軟體工程、遊戲、金融、安全等領域的專家共同打造,模型也與 WorkBuddy、CodeBuddy 團隊深度協同設計。
招牌評測反映了這種定位。在一場由 163 位專家盲測、涵蓋 203 項工程任務的內部評估中,Hy4 preview 平均得分 4 分制的 2.99 分,微幅領先 GLM-5.3(2.92)與 Kimi K3(2.94)——正是它直接對標的兩款中國開源旗艦。人類專家評審比自動化排行榜又慢又小眾,但更能抵抗污染與刷分,而這正是當前整個產業越來越在意的一點。
在具體能力上,騰訊強調模型對長上下程式開發任務的理解、規劃、除錯與驗證能力更強,前端生成品質提升,金融分析更深入,並支援從資訊處理到文件、試算表、簡報產製的完整工作流。在遊戲開發方面,據稱模型能從一句自然語言需求生成可玩的原型,再透過多輪互動持續打磨複雜專案。在科研方面,騰訊點名 AI 研發、分子動力學模擬、凝態物理與基礎數學等領域的進展。
遞迴自我改進迴路
整份發布中技術上最有趣的,是 Hy4 preview 在自身建構中扮演的角色。模型首度參與訓練方法、資料策略、評測框架與底層算子的自動化優化——提出方法、執行實驗、依結果迭代,產生的程式碼、日誌與回饋再注入下一輪探索。騰訊將此描述為早期的遞迴自我改進迴路。
這個迴路也延伸到推論端。Hy4 preview 自主分析了推論系統的瓶頸,並對算子融合與通訊優化進行多輪調校,讓端到端吞吐較基線提升 31.8%,且在不同上下文長度與並發水準下增益一致。一個能調校自己運行環境、而且真的有效的模型,對所有前沿實驗室都在追逐的「AI 加速 AI 研發」論述,是一個很有份量的數據點。
價格與可用性
Hy4 preview 在 WorkBuddy 與 CodeBuddy 上提供為期兩週的免費試用,兩平台上較舊的 Hy3 免費期則延長至 9 月 30 日。API 定價大幅低於多數閉源前沿模型:輸入每百萬 token 0.834 美元、輸出每百萬 token 2.501 美元、快取命中每百萬 token 僅 0.042 美元,可經騰訊雲 TokenHub 與 OpenRouter 使用。
「preview 先行」的發布策略是有意為之:混元先 early ship、透過正式版本蒐集真實回饋,再把經驗折進下一代。騰訊表示 Hy4 系列的下一批模型很快就會推出。
意義解讀
Hy4 preview 落地的這一週,中國每日 AI token 用量突破 500 兆,而阿里巴巴、智譜、月之暗面乃至如今的騰訊,開源權重模型的發布節奏已經是西方閉源實驗室望塵莫及的速度。三個觀察:
開源前沿持續壓縮差距。 一個 770B 參數、1M 上下文、附 FP8 權重、vLLM 第一天就支援、輸出單價低於 3 美元的開源模型,一年前根本無法想像。「最佳開源」與「最佳閉源」之間的差距,如今以月計而非以年計。
MoE 稀疏化已是標配而非例外。 49B 激活參數讓 Hy4 preview 以中階服務成本提供旗艦容量——與 DeepSeek、Qwen、GLM 押注同一架構路線。6.4% 的激活比率在此規模屬於最精瘦的一檔。
自我改進從口號變成可量測的產物。 模型驅動優化帶來 31.8% 吞吐提升,是一個具體、可檢驗的數字。若產業趨勢不變,「模型有沒有參與建造自己?」將成為發布說明中的標準問題——也將是能讓它發揮作用的實驗室手中真正的護城河。
對開發者而言,結論很簡單:FP8 權重今天就在 Hugging Face 上,vLLM 0.29.0+ 即可部署,而 CodeBuddy 兩週免費期是零成本試用這款騰訊押注能超越國內對手的編碼模型的最好時機。