← All posts / Tools

75GB 記憶體之後:微軟把 137B 參數的程式代理放上你的筆電

在 Windows 與 Surface 發表會上,微軟宣布 GitHub Copilot 將自動在雲端與本機之間調度任務——本機端是量化到 53GB、可塞進筆電的 137B 參數 MoE 程式模型 MAI Code 1.1 Flash,並以新的開源沙箱庫 Microsoft Execution Containers 加以隔離。

75GB 記憶體之後:微軟把 137B 參數的程式代理放上你的筆電

10 月 7 日,微軟在舊金山的 Windows 與 Surface 發表會上,為 PC 的下一章定調:本機 AI。Satya Nadella 與 NVIDIA 執行長黃仁勳同台展示「混合智慧」(hybrid intelligence),但對開發者而言最關鍵的宣布並不是哪台新筆電,而是一套計畫:把一個 1370 億參數的程式碼模型完全放到裝置上執行,並用一個新的開源沙箱庫把使用它的代理關進籠子。

10 月底之前,GitHub Copilot 將能自行判斷任務適合在本機推理還是呼叫雲端模型。這個承諾背後是兩項工程:深度最佳化的 MAI Code 1.1 Flash 本機版本,以及用於代理式編碼隔離的 Microsoft Execution Containers(MXC)。

模型:137B 總參數、6.8B 啟動參數、53GB 落地

MAI Code 1.1 Flash 是微軟 AI 的程式碼專用混合專家(MoE)模型,總參數 1370 億,但每個 token 只啟動 68 億。BFloat16 的雲端版本約 265GB;這次出貨的本機版本採用約每權重 3.3 位元的混合精度量化,並搭配 DFlash2 滑動視窗投機解碼(speculative decoding)來拉高解碼吞吐。

成果是一個 53GB 的足跡——縮小 80%——卻在代理式基準上繳出硬數字。在 Surface Laptop Ultra(搭載 NVIDIA RTX Spark、最高 128GB 統一記憶體與 1 petaflop AI 算力)上,微軟公布的數據是:

  • SWE-Bench Verified:本機 70.8%,雲端全精度 72.6%;而熱門的本機替代方案 Unsloth GPT-OSS-120B GGUF 只有 32.0%
  • Terminal-Bench 2.1:本機 66.29%,雲端 62.9%,GPT-OSS-120B 僅 23.6%
  • 吞吐:64k 上下文時 prompt 處理速度 923.5 tokens/秒,128k 時 769.8
  • 峰值記憶體:256k 上下文時 75.5GB——KV 快取與執行環境要與作業系統、你的應用程式共用統一記憶體池

這些數字的框架值得注意。微軟明講:程式碼的量化不是「優雅降級」問題——一個錯 token 就是一個語法錯誤、一次格式錯誤的工具呼叫、一份壞掉的 diff。所以評測量的是任務完成率,不是困惑度。以這個標準,量化模型不只撐住了——在 Terminal-Bench 上它甚至贏過 BFloat16 雲端版本,這更可能是評測設定與解碼策略的副作用,而非量化的魔法。

當然有個硬體但書,微軟也不掩飾:想要最佳效能,建議裝置配備 120GB 以上的記憶體。今天這實際上意味著 RTX Spark 架構的 Surface Laptop Ultra,以及新的 Surface RTX Spark Dev Box 與 Work Station。本機前沿編碼確實來了,但先落在價格堪比二手車的機器上。

沙箱:Microsoft Execution Containers

只有本機推理並不會讓連線階段變安全。代理的 shell 指令繼承執行者帳號的完整權限——把模型搬到裝置上,這件事一絲一毫都沒變。因此微軟把本機模型與 MXC 綁在一起:一個來自 Windows 團隊的開源庫,把宣告式政策翻譯成作業系統原生的控制。

它的設計刻意「無聊」,而這正是優點:

  • 在 Windows 上,GitHub Copilot 使用 MXC ProcessContainer 後端的 BaseContainer 層級
  • 在 macOS 上使用 Seatbelt——Apple 長年使用的沙箱
  • 在 Linux 上使用 bubblewrap

不需要額外的 VM 或容器映像檔;這些後端都是 OS 原生的程序邊界。啟用沙箱後,shell 指令以及(預設情況下的)本機 MCP 伺服器與語言伺服器都在邊界內執行。內建檔案工具由 Copilot 框架在程序內檢查;遠端 MCP 伺服器則不在本機沙箱內,而是對其連線政策做程序內檢查。Copilot CLI 裡一個 /sandbox 斜線指令隨時可調整設定。

這是整場發表中生命週期最長的一塊。MXC 開源、政策驅動、且跨平台選擇後端。當代理式編碼成為開發的預設模式,「我的代理被哪些 OS 原語隔離」會變成嚴肅的問題,而微軟剛剛交付了一份參考答案。

混合調度,不是離線模式

另一項 Copilot 功能是路由智慧。開發者有兩種模式:Auto 調度——Copilot 逐任務決定用本機還是雲端推理(並在切換時保留連線階段中有用的快取工作),以及明確選擇本機模型——透過 Windows ML 供應器或任何 OpenAI 相容的本機端點。

微軟對邊界很謹慎:本機推理不等於離線作業、模型選擇與工具執行互相獨立、而且無論哪個模型發起請求,沙箱政策一體適用。示範案例是一個每日自動化:讀取儲存庫、在無網路存取的沙箱工作副本中跑測試、寫出 HTML 分類儀表板——全程選用 MAI Code 1.1 Flash 在裝置上完成。

為什麼重要

三股潮流在此匯流。第一,邊緣推理棧的成熟速度已經讓「137B MoE 量化到 3.3 位元」成為可日常使用的程式模型,而非展示品。第二,代理安全終於獲得作業系統層級的對待,而不是靠提示詞祈禱——MXC 出現在旗艦消費性發表會上,與 Nadella 圍繞「為混合智慧打造 Windows」的論述並列,說明隔離正在從企業加購功能變成平台功能。第三是經濟學:MAI Code 1.1 Flash 本就以「四分之一成本」著稱,本機執行則把這份成本轉為固定的硬體投資。

但書在於硬體門檻。一個需要 120GB 以上記憶體才能發揮的模型,目前仍是高階機器的光環功能——與 Apple 本機 AI 的推法如出一轍,只是這次瞄準開發者。即便如此,方向再明確不過:「雲端代理」與「本機代理」的界線正在溶化為一次調度決策,而微軟押注兩端都握在自己手裡。

本機模型與沙箱化工具現正推送至 GitHub Copilot CLI、Copilot 應用程式與 VS Code,本機/雲端自動路由將於月底前上線。