微軟 Project Zenith 與 AMD 的兆級參數豪賭:Windows 為本地 AI 重新開機
在 IFA 2026,微軟將開發者最佳化版 Windows 正式命名為「Project Zenith」——開箱即寫程式、本地跑 30B+ 模型免計費——AMD 則發表 Ryzen AI Max Pro 400 與液冷 Threadripper Halo Station,劍指 1 兆參數的本地推論。兩者聯手,瞄準的是按 token 計費的雲端經濟。
多年來,Windows 對開發者一直有點不友善:檔案副檔名預設隱藏、長路徑支援殘缺、編譯時通知不斷閃現干擾注意力。在柏林 IFA 2026 上,微軟終於給它的解方起了名字——Project Zenith——並搭配 AMD 的新晶片,讓「跑在本地」成為不斷膨脹的雲端 AI 帳單的一個認真選項。
這項發表出現在一個微妙的時間點。AI 開發的經濟學已經成為真正的痛點:Agentic 工作流——多步驟、鏈式呼叫工具、需要不斷重試與長上下文的 AI 任務——每個 session 動輒消耗數百萬 token,而過去一場對話只需數千。結果是出現了一群想要把夠強的模型放在自己桌上、免計費、背後沒有 token 錶滴答作響的開發者。
Project Zenith 到底是什麼
Project Zenith 是一套預先組態好的 Windows 11 環境,專為新一類開發者機器打造:具備 64GB 以上統一記憶體的系統。微軟 Windows 平台與開發者事業 CVP Logan Iyer 的說法是:「Project Zenith 裝置出廠即內建為開發而組態的 Windows,以及開發者最先會用到的精選工具。在這些裝置上,開發者可以在本地跑 30B+ 參數模型、不限量——加速實驗,同時降低對計費雲端 token 的依賴。」
具體的變更簡直像一份蒐集了十年開發者抱怨的願望清單:
- 預裝工具:Visual Studio Code、GitHub Copilot、PowerToys、WinAppCLI、Windows Dev Skills 開箱即用
- 檔案總管恢復理智:顯示副檔名、顯示隱藏檔、標題列顯示完整路徑
- 關掉干擾:開始選單提示、帳戶通知、最近使用檔案建議、同步服務提示全部停用
- 強者預設值:啟用長路徑支援、PowerToys Command Palette 預設開啟
其中一些改動其實本來就該是每份 Windows 11 的預設值。但把它們打包成一個認證裝置類別,是微軟在宣示:開發者機器現在是一級硬體類別——而這個類別的定義需求是記憶體,因為記憶體正是本地 AI 的燃料。
底層晶片:Kraken Halo 與統一記憶體論證
第一台 Project Zenith 裝置由 AMD 在 IFA 舞台上揭曉:一台由 Ryzen AI Halo 晶片驅動的迷你主機。微軟承諾「未來幾個月」還會有更多 Project Zenith 裝置,包括採用不同晶片的版本。
讓這個類別有趣的技術故事是統一記憶體。傳統桌機把記憶體分成兩個池——CPU 用的系統 RAM 和獨立顯卡上的 VRAM——任何要交給 GPU 處理的模型都必須先複製進 VRAM。這個複製動作造成了硬天花板:超出 VRAM 容量的模型根本跑不動,不管系統 RAM 閒置多少。NVIDIA 的消費旗艦 RTX 5090 配備 32GB VRAM;就連企業級 PCIe 加速卡 H200 NVL 也只有 141GB HBM3E。一個 3,000 億參數的模型在 FP16 精度下需要約 600GB,FP4 也要約 150GB——超越任何單張獨立顯卡。
AMD 的答案是 Ryzen AI Max Pro 400 平台(代號 Kraken Halo)。它的 256-bit LPDDR5X-8533 介面打造出單一連貫記憶體池,由 Zen 5 CPU 核心、RDNA 3.5 繪圖引擎與 XDNA 2 NPU 共享。192GB 總量中最多可將 160GB 分配給 GPU 工作負載——足以容納一張任何價位的獨立顯卡都裝不下的 300B 參數 FP4 模型。記憶體匯流排峰值頻寬約 273GB/s,而 LLM 推論的瓶頸是頻寬而非算力,這個數字直接換算成每秒 token 數。
旗艦晶片 Ryzen AI Max+ PRO 495 結合 16 個 Zen 5 核心(最高 5.2GHz)、40 個 RDNA 3.5 運算單元與 55 TOPS 的 XDNA 2 NPU。聯想的 ThinkCentre X 精巧桌機與 HP 首次亮相、配備 190GB 統一記憶體的 ZBook「Sundance」筆電,是最早的商用量產系統。發表會上未公布價格;現有第一代 Ryzen AI Halo 主機售價 3,999 美元——比 NVIDIA 同級的 DGX Spark 便宜約 700 美元。
Threadripper Halo Station:桌上的兆級參數
IFA 更大的驚喜是首度公開的 Threadripper Halo Station。它不是單一 SoC,而是將 96 核心 Threadripper PRO CPU 與兩張 Instinct MI350P PCIe 加速器配對——硬體上還支援擴充到四張。每張 MI350P 配備 144GB HBM3E、頻寬 4TB/s,基礎配置共 288GB HBM3E,完整擴充後達 576GB——在積極量化下,足以把兆級參數模型整個放進加速器記憶體。這台液冷系統還支援最高 2TB 的傳統系統記憶體。
頻寬對比很殘酷:單張 MI350P 每秒搬移的資料量約是整個 Kraken Halo 平台的 14.6 倍。對於大到需要它的模型而言,這個差距決定了本地推論是玩具還是生產選項。
AMD 正在論證的經濟學
AMD 的 Jack Huynh 用明確的財務語言框架這場主題演講。AMD 宣稱 93% 的公司正在超支 AI 預算,元凶是 agentic 工作流;全產業每月處理的 token 量在一年內從約 0.7 千兆(quadrillion)跳到 1.7 千兆,並預測 2030 年將達每月 120 千兆——四年成長 70 倍。
示範用的算術是這樣的:以每天 1,500 萬輸出 token 計,雲端成本約為每個活躍使用者每天 300 歐元(約 349 美元)——一年近 10 萬歐元。Ryzen AI Halo 上的本地推論沒有 per-token 費用。AMD 還展示了一個 320B 參數的 GLM-5.3-Flash 模型在本地運行,宣稱它在某項(未公開的)基準測試上勝過 Claude Fable 5,而同等級雲端模型 1,000 萬輸出 token 約需 500 歐元。
但必須留意:這些比較來自 AMD 自己的簡報,基準測試套件與方法論並未完整揭露。可以獨立驗證的是架構本身——微軟的 Pavan Davuluri 在台上即時示範了 1,250 億參數的 Qwen 3.8 模型在 Kraken Halo 上運行,純 GPU、無雲端。兩個平台都執行 AMD 的開源 ROCm 堆疊,支援 PyTorch、vLLM、llama.cpp、Ollama、ComfyUI 與 LM Studio;SUSE 也確認其 AI Factory 與 Rancher 工具能把本地開發的工作負載擴展到企業基礎架構——解決了向來讓本地 AI 走到死胡同的「開發到生產」斷層。
為什麼重要
兩股力量正在匯流。第一,微軟把本地 AI 視為 Windows 的平台級需求,而非周邊功能——認證裝置、策展工具鏈、移除摩擦。第二,AMD 押注統一記憶體與 HBM 密度能把真正的推論工作負載從雲端拉回桌面,就像筆電當年把運算從大型主機上拉下來一樣。
兩家公司都沒有宣稱本地硬體能取代所有場景的前沿模型存取。誠實的框架是一個決策濾網:如果你的模型在你需要的精度下塞得進 160GB,Kraken Halo 級機器就是可行的免計費替代方案;如果你需要前沿尺度的模型,Threadripper Halo Station 的 576GB 天花板——等價格公布後——才是該評估的數字。
對開發者而言,結論更簡單。微軟今天推出的工具移除了「Windows 礙事」這個藉口,AMD 舞台上展示的硬體移除了「本地模型太小、不實用」這個藉口。「雲端 token」與「我的機器」之間的差距剛剛變窄了——而計費 token 時代距離它的天花板,可能比擁護者以為的更近。
Sources
- [1] https://www.theverge.com/news/990051/microsoft-project-zenith-windows-developers
- [2] https://www.techtimes.com/articles/326585/20260904/amd-launches-threadripper-halo-station-ifa-targets-trillion-parameter-local-ai.htm
- [3] https://www.techzine.eu/news/devops/144063/project-zenith-aims-to-make-windows-pcs-ready-for-coding-out-of-the-box/
- [4] https://www.amd.com/en/products/processors/desktops/ryzen/ryzen-ai-halo.html