每時脈 1,024 次 INT8 運算塞進著色器核心:Arm Mali G2-Ultra NX 是首款 AI 原生行動 GPU
Arm 的 CSS for Mobile 2 把神經網路加速器直接嵌入 Mali G2-Ultra NX 著色器核心——每時脈 1,024 次 INT8 MAC、七個世代以來最大規模的 ISA 改版,加上類 DLSS 的神經升頻技術帶來 4 倍效率,瞄準 2027 年旗艦機如 Samsung Galaxy S27 與 Xiaomi XRING O3。
當 AI 界整個上午都在爭論 GPT-6 Astra 是否真的宣告 AGI 時代來臨時,Arm 悄悄出貨了 AI 時代另一塊或許更具體的拼圖:9 月 8 日,該公司發表了 Arm CSS for Mobile 2——全新的高階智慧型手機 AI 原生運算平台,主打 Mali G2-Ultra NX,史上第一款把神經加速器直接建在著色器核心(shader core)內部的 Mali GPU。
這次的意義在於架構層面,而非漸進改良。過去二十年,智慧型手機一直是多個專用處理器的聯邦:CPU 負責邏輯、GPU 負責像素,而自 2017 年前後又多了獨立的 NPU 負責神經網路,各自擁有獨立的記憶體路徑與控制開銷。Arm 的賭注是:下一代行動 AI——從類 DLSS 的遊戲升頻到全天候運作的代理式助理——最好的執行位置,就是神經運算直接發生在繪圖管線內部,共用 GPU 的記憶體系統、一致性快取與控制結構。結果就是減少資料搬移(每一款行動 SoC 的傳統稅負),並縮短從模型到像素的路徑。
今天發表的內容實際上有什麼
這次發表包含了三件協同的智慧財產:
- Mali G2-Ultra NX GPU——首款 AI 原生 Mali,在著色器核心內嵌入專屬矩陣加速器、全新執行引擎,以及第三代硬體光線追蹤。
- Arm C2-Ultra 與 C2-Pro CPU——支援 SME2 的新 Armv9.3-A 核心;SME(Scalable Matrix Extension)把矩陣運算帶進 CPU 本身,Arm 宣稱 AI 模型效能比上一代提升最多 1.7 倍。
- CSS for Mobile 2 平台——把運算、記憶體、軟體與實作最佳化縫合成一個可授權整體的運算子系統,供晶圓夥伴採用。
Arm 給出的數字相當激進。根據 Arm 以與 Sumo Digital 共同開發的 Neural Dawn 展示所做的內部比較,G2-Ultra NX 上的神經渲染可帶來最高 4 倍的 FPS 與 4 倍的效能效率,並降低最多 70% 的外部記憶體流量。全新執行引擎——七個世代以來最大規模的 Mali ISA 改版——本身貢獻了最多 24% 的基準測試效能提升與 14% 的非 AI 遊戲效能提升;第三代光線追蹤則在主要 RT 基準上減少最多 13% 的 DRAM 流量。
Chips and Cheese 的獨立分析補上了 Arm 官方資料沒講的細節。每個著色器核心內的矩陣加速器可執行每時脈最多 1,024 次 INT8 MAC 或 512 次 INT16 MAC,而且它的時脈可以跑到周圍執行引擎的兩倍。暫存器檔增加了 25%,每個 warp 可存取的暫存器從 64 個倍增到 128 個,分配粒度也改善為以 16 個暫存器為單位。並非每個核心都需要神經單元——設計規範只要求至少 6 個「NX 核心」才能掛 Ultra 招牌——晶圓夥伴可以自行決定數量。Xiaomi 的 XRING O3(已於 8 月 24 日推出,搭載 G2-Ultra 等級 GPU)選擇只在一半的著色器核心配置矩陣加速器;Chips and Cheese 估計,神經單元會讓一個著色器核心的面積增加約 21%(約 1.88 mm² 對 1.55 mm²)。
這種彈性是雙面刃。正如 Chips and Cheese 指出,矩陣加速器只支援 INT8 與 INT16——沒有 FP8,也沒有 BF16。對遊戲升頻與幀率生成來說,這樣的量化精度已經足夠;但對想在裝置上跑通用 LLM 推論而言,這個遺漏是實實在在的限制。
Arm 版的 DLSS 答案——也是對 NPU 的避險
理解 Arm 在做什麼,最清楚的方式是看搭在新硬體上的三項神經技術:
- Neural Super Sampling(NSS,神經超取樣)——從低解析度渲染重建高解析度影像,直接對應 Nvidia 的 DLSS。
- Neural Frame Rate Upscaling(NFRU,神經幀率升頻)——利用動態、深度與已渲染幀資料生成中間幀,等同桌面上的幀生成技術。
- Neural Super Sampling and Denoising(NSSD,神經超取樣與降噪)——把升頻與降噪結合,處理需求苛刻的光追場景,角色等同桌面上的 DLSS Ray Reconstruction。
Videocardz 的定調正是如此:Arm 正在為行動 GPU 提出「類 DLSS 5、具備幀生成與光線重建的神經繪圖」。差別在商業模式。Nvidia 同時擁有 DLSS 的晶片與軟體堆疊;Arm 則是把 IP 授權給 Qualcomm、MediaTek、Samsung 與 Xiaomi,由各家自行打造晶片。要讓神經繪圖觸及 Arm 所稱的「數十億台裝置」(Mali GPU 累計出貨已超過 140 億顆),這項技術就不能住在專屬驅動程式裡,它必須以可攜式 IP 的形式出貨。
生態系佈局比硬體早了兩年。Arm 的 Neural Technology 計畫與開放開發套件,讓 Tencent Games(Magic Dawn 引擎、與 Arena Breakout Infinite 合作的 NSSD 展示)、Unity China(團結引擎)以及《燕雲十六聲》(Where Winds Meet)團隊提前取得技術,引擎層整合在晶片問世前就已完成。如今 Arm Neural Graphics Development Kit 提供 Vulkan ML 擴充、Unreal Engine 外掛、供自研引擎使用的 SDK,以及分析與模型最佳化工具。
策略上的解讀比「Arm 把 NPU 做進 GPU」更細膩。手機廠早已搭載擅長 CNN 時代視覺工作負載、且越來越能跑 transformer 推論的 NPU。NPU 不做的是繪圖。把矩陣運算放到像素所在之處,Arm 等於把 GPU 定位為神經繪圖的專屬歸宿——而搭載 SME2 的 C2-Ultra CPU 則處理受益於 CPU 端矩陣運算的代理式 AI 工作負載。如果 AI 運算需求的第四波(聊天機器人 → 推理 → 代理式編碼 → 電腦操作,正如分析師 Tae Kim 本週的框架)真的降臨手機,Arm 要的是 SoC 裡的每個引擎都具備矩陣能力,而不只是 NPU。
CPU 數字的但書
C2-Ultra CPU 的故事值得單獨打上問號。Arm 宣稱比 C1-Ultra 提升峰值效能 15%(平均 12%),但 Chips and Cheese 對註腳的分析顯示,這個比較建立在 FPGA 模擬的 C2-Ultra 平台擁有 8.5% 更高時脈與更大 L2 快取之上;在同等時脈下,平均提升縮水到約 3.2%,而 Arm 在文章刊出後確認的峰值 IPC 增益為 7%。至於宣稱的 38% 功耗降低,則把製程節點與實作改良一併計入。這些都不代表 C2-Ultra 是糟糕的核心——它是一個誠實的迭代世代,只是這一代真正的創新預算顯然花在 GPU 上。
什麼時候落地到你手上
CSS for Mobile 2 是現在就交付給夥伴的 IP,這意味著大約一年後才會有手機問世。Notebookcheck 的報導已經把這個架構放進 Samsung Galaxy S27 與 Vivo X500 Pro 的產品藍圖,屆時將與 Qualcomm 的 Oryon 核心 Snapdragon 8 Elite Gen 6 正面交鋒。Xiaomi 的 XRING O3 則提供了今日的預覽——搭載半數著色器核心含矩陣加速器的 G2-Ultra 等級 GPU。
給開發者的務實結論:如果你開發手機遊戲或繪圖引擎,Arm Neural Graphics Development Kit 現在就能取得,而最早整合的工作室——Tencent、Unity China、《燕雲十六聲》團隊——將推出第一批量產遊戲。對其他人而言,請注意這個模式:神經運算正在溶入 Arm 授權的每一個運算引擎。問題已經不再是你的手機有沒有 AI 加速器,而是有幾個、以及哪一個負責跑你在意的工作負載。
來源
Sources
- [1] https://newsroom.arm.com/blog/arm-mali-g2-ultra-nx-ai-native-mobile-graphics
- [2] https://chipsandcheese.com/p/arms-c2-ultra-g2-ultra-nx-and-css
- [3] https://www.androidauthority.com/arm-mali-g2-ultra-deep-dive-3706351/
- [4] https://videocardz.com/newz/arm-proposes-dlss-5-like-neural-graphics-for-mobile-gpus-with-frame-generation-and-ray-reconstruction