← All posts / Tools

vLLM 0.28.0 釋出:Decode Context Parallel、DFlash2 投機解碼與磁碟層 KV 卸載全面到位

vLLM 最新版本集結 270 位貢獻者的 584 項提交:Kimi-K3 的 Decode Context Parallel、DeepSeek V4 端到端稀疏 MLA、DFlash2 投機解碼、磁碟層 KV 快取卸載,以及翻倍的批次預設值。

vLLM 0.28.0 釋出:Decode Context Parallel、DFlash2 投機解碼與磁碟層 KV 卸載全面到位

開源 AI 推論引擎界的沉默功臣剛送出了今年夏天最大的更新。vLLM v0.28.0 已於 2026 年 8 月 26 日發布,集結了 270 位貢獻者的 584 項提交——其中 76 位是首次參與。這個版本讀起來不像例行性的版本號推進,更像一場針對新一代開源前沿模型的協同效能作戰。

雖然本月的 AI頭條多半被模型發表與晶片地緣政治佔據,但像 vLLM 這樣的推論引擎,才是真正決定這些模型「跑起來要花多少錢」的那一層。0.28.0 版鎖定當前開源權重前沿的兩大模型家族——月之暗面 Kimi-K3 與 DeepSeek V4——用一整套最佳化同時推高吞吐量、記憶體效率與硬體覆蓋範圍。

Kimi-K3 迎來 Decode Context Parallel

本版最核心的工程項目,是 Kimi-K3 的 Decode Context Parallel(DCP)支援(#50484)。Context parallelism——把長序列的注意力運算切分到多張 GPU——在 prefill 階段早已是標準做法,但一次生成一個 token 的 decode 階段一直難以套用同樣的手法。如今把平行化解碼情境延伸到 Kimi-K3 這類混合注意力 MoE 模型,代表營運方可以把超長情境的服務分散到多張加速器上,不再被單卡 KV 快取記憶體卡住容量上限。

DCP 只是 Kimi-K3 全面優化的先鋒。這次更新加入融合 FlashKDA 解碼與 prefill 核心(#50654、#51311、#52458)、GEMM-RS 序列平行(#52079),以及合併式 all-gather 操作帶來的 1.5~3 倍核心級加速(#51070)。自適應投機 token 預算讓 DSpark 首 token 延遲(TTFT)改善約 60%(#51725),選配的共享專家分片則替每張 GPU 省下 約 17 GiB 記憶體(#50912)——這些空間可以直接換成更大的批次或更長的情境。Kimi-K3 也首度能在 AMD ROCm 上透過 V2 model runner 執行(#51653),鬆動了 Nvidia 對這個模型家族服務的壟斷。

DeepSeek V4 端到端稀疏 MLA

DeepSeek 的多頭潛在注意力(MLA)——V 系列經濟實惠長情境服務背後的 KV 快取壓縮技術——迎來重要里程碑:稀疏 MLA 現已端到端可用,涵蓋一般解碼、多 token 預測(MTP)與 DSpark 投機解碼(#51538)。過去營運方必須在稀疏注意力的吞吐優勢與投機解碼的延遲優勢之間二選一;0.28.0 讓 V4 部署不再需要做這個取捨。

DeepSeek 相關工作還包括 AMD Quark NVFP4 支援與模擬核心(#47972)、推理強度提示與映射(#50580)、稀疏 top-k 元資料核心優化(#52084、#51967)、縮小 eager CUDA graph 區域(#51430、#52401),以及 gfx11 與 gfx950 上的 ROCm 支援(#47017、#52212)——後者把 V4 服務帶到 AMD 的 MI350 級晶片上。

投機解碼:DFlash2 與信心調度

投機解碼——由輕量草稿模型提案 token、再由目標模型批次驗證——向前跨了兩大步。DFlash2 帶著局部捲積與新的候選選擇器登場(#52816),而 DSpark 信心調度驗證(#47808)讓驗證端可以根據實測信心度動態調整接受草稿 token 的積極程度,而非沿用固定排程。非同步排程也對草稿模型自動啟用(#48341),省掉一個大多數營運方根本不知道該調的參數。

KV 快取分層落地到磁碟

對記憶體受限的部署而言,KV 快取分層正式成熟:0.28.0 在 SimpleCPUOffloadConnector 之後加入磁碟卸載(#49644)、可透過 module_path 插入的外部第二層管理器(#51007)、部分第二層載入結果(#50321)、分層指標(#48798),以及與平行化無關的標準 CPU 佈局(#48414)。Mooncake 傳輸引擎則獲得儲存群組語意、租戶 ID 支援,Docker 映像也正式附上官方 wheel(#44956、#48069、#51067)。這些改動合起來,讓服務叢集可以把 RAM 與 NVMe 視為 GPU 記憶體背後的單一延遲分層池——超大規模雲端業者內部自建的架構,如今開源可用。

Model Runner V2、Rust 前端與新預設值

次世代 Model Runner V2 持續成熟,加入 E/P/D 分離部署(把 prefill、解碼與編碼器角色拆到專用實例)(#38390)、權重卸載(#51413)、多層 MTP KV 快取支援(#50062)、編碼器 CUDA graph(#49852)、無注意力模型支援(#52374),以及限制推理 token 上限的 thinking_token_budget(#46727)——這是 agent 開發者敲碗好幾個月的成本控制功能。

Rust 前端同樣成長:獨立渲染器(#50289)、透過 gRPC 的多模態影像推論(#50368)、明確的資料平行秩路由(#51178)、RL 生命週期控制(#51316),protobuf schema 也正式發布到 Buf(#51276),方便多語言整合。

三項預設值變更會在升級後立刻感受到:max_num_batched_tokens 從 8192 翻倍到 16384(#51726)、Mamba 架構模型預設開啟前綴快取(#50991)、Blackwell CUDA graph 擷取上限提高到 1024(#49390)。營運方應該重新跑一次基準測試,別假設舊調參表還適用。

更廣的模型與硬體覆蓋

新支援模型包括 Muse Glimmer(#51655)、BF16 搭配 MTP 的 Ling 3.0 Flash 及其 FP8 與混合 MXFP4 變體(#51045、#51265、#52114)、Dots3 NOTE 原生多模態(#51255)與 Interns2mobius(#51149)。Qwen3.8 登陸 AMD ROCm(#50068)、GLM-5.2 獲得擴充的 CuTe DSL skinny-GEMM MoE 支援(#49791),正確性修正則觸及 MiniMax-M3 NVFP4(#48929)與 Gemma 4 音訊批次(#50958)。

硬體支援橫跨 NVIDIA SM90/SM100/GB10、AMD GFX120x/gfx11/gfx950、Intel XPU(釋出管線新增 XPU wheel)、CPU(包括讓 DeepSeek V2/V3 能在 CPU 上執行的 MLA 後端 #49453,以及 s390x 與 Power 版本),還有基於 torch 2.12 / triton 3.7 的 ROCm Docker 映像。安全修正關閉了一個透過偽造取樣率繞過音訊解碼時長防護的阻斷服務漏洞(#49948),文件也明確警告 --api-key 並不會保護所有端點(#51999)。

留意的破壞性變更

升級者請注意:bitsandbytes 支援移轉為外部插件(#43529)、Transformers 升級到 5.15.0(#51668)、已棄用的 calculate_kv_scales 被移除(#49389)、override_attention_dtype 被移除(#48684)、KV 卸載分層指標更名(#52812),以及舊版 MoE 程式碼路徑刪除(#51078)。Docker 使用者的執行環境基底升級到 Ubuntu 24.04(#51058)。

為什麼重要

2026 年的開源權重大爆發——Kimi-K3、DeepSeek V4、Qwen3.8、GLM-5.2,以及騰訊剛開源的 770B 參數 Hy4——只有在推論軟體能榨出這些模型設計時預期的經濟效益時,對營運方才有意義。vLLM 0.28.0 給出了一個紮實而務實的答案:平行化解碼、讓投機更聰明、把 KV 快取沿記憶體階層往下倒,並扩展到每一家願意貢獻核心的加速器廠商。76 位首次貢獻者也說明,來自 AMD、Intel 與各模型實驗室的企業生力軍,如今選擇直接貢獻上游,而非維護自己的分支。

對自行托管前沿開源權重的團隊來說,0.28.0 不太像是可升可不升的選項,更像是這一季的基本門票。