OpenAI 首款自研晶片「Jalapeño」首次公開測試即擊敗 Nvidia 能效表現
在 Hot Chips 2026 上,OpenAI 展示與 Broadcom 共同開發的推論專用 ASIC,以 700W 之力在每千瓦吞吐量上超越 Nvidia GB200/GB300 機架系統 1.5 至 1.9 倍。
在 Hot Chips 2026 大會上,OpenAI 帶來了一個幾乎沒人預期會從第一代晶片努力中聽到的宣言:其自研推論晶片——代號 Jalapeño——在日益定義 AI 資料中心經濟學的兩項指標上擊敗了 Nvidia 的旗艦機架系統:每瓦吞吐量與 token 延遲。
這批於 8 月 25 日發表、採用 SemiAnalysis 公開 InferenceX 基準測試套件完成的數據顯示,Jalapeño 在三個開放權重模型(GPT-OSS 120B、DeepSeek R1 670B、以及 Moonshot AI 的 1 兆參數 Kimi K2.5)上,於峰值吞吐量時達到比最佳商用系統(Nvidia GB200 與 GB300)多 1.5 至 1.9 倍的每瓦 AI 運算量,端對端延遲則低 1.7 至 3.6 倍。針對互動式、延遲敏感的工作負載,OpenAI 宣稱效能高出 2.1 至 4.1 倍;在 GB300 最快的前一個 time-between-tokens 設定點上,每千瓦吞吐量的領先幅度更拉大到 8.6 至 104.3 倍。
最醒目的對比在於:一顆 700W 的 ASIC,對上額定功率 1,200W 與 1,400W 的加速器——而且在能效上獲勝。OpenAI 將結果標準化至各加速器公布的封裝 TDP,並指出 Jalapeño 在測試中的實測持續功率保持在 550W 以下。
Jalapeño 到底是什麼
Jalapeño 是 OpenAI 的首款自研晶片,由 Broadcom 共同開發、採用台積電 3 奈米級 N3P 製程製造。它是一顆純推論加速器——可以執行 AI 模型但不能訓練模型——而且值得注意的是,它並非專門為 OpenAI 自家模型調校,而是一顆通用型 LLM 推論引擎。
每個封裝將運算裸晶與六個 HBM4 堆疊(共 216 GiB、15.4 TB/s 頻寬)配對。相較之下,GB300 在 1,400W 額定功率下配備 288GB 的 HBM3E:以每瓦額定功率計,OpenAI 的晶片塞進了約多 50% 的記憶體。根據 OpenAI 的 Hot Chips 簡報,其核心架構賭注在於:真正值得攻擸的瓶頸是充分發揮聚合 HBM 頻寬,而非一味增加頻寬。
執行速度與晶片本身一樣令人驚豔。設計工作於 2024 年中啟動,最終設計於 2025 年 11 月送交投片,整個週期約 16 個月——而從首份晶片設計到 tapeout 僅花了 9 個月。OpenAI 表示在開發過程中動用了自家 AI 模型:較舊的世代協助晶片設計,較新的世代加速程式設計與最佳化。據報導,第二代晶片已接近 tapeout,第三代的概念設計也已在進行中。
數字背後的但書
這些基準數據由 OpenAI 提供,但 SemiAnalysis 表示已在 OpenAI 實驗室現場驗證部分測試。在 GPT-OSS 上,Jalapeño 達到約每秒每使用者 1,400 tokens;在 DeepSeek R1 上,單一併發請求突破 700 tok/s。
不過仍有幾個重要的星號。Jalapeño 在未使用 multi-token prediction 或投機解碼的情況下達成這些結果——部分對比系統有用上這些最佳化技術,這意味著還有成長空間。若改用每加速器全域Utility功率做附錄比較(Jalapeño 1.18kW 對 GB300 的 2.55kW),差距會縮小;對上啟用 multi-token prediction 的 GB300 時,峰值能效領先也縮至約 1.5 倍。
最關鍵的是,Vera Rubin 並不在這次比較中——這個 Nvidia 平台預計為 OpenAI 在 2026 下半年部署的首個 GW 級系統供電。SemiAnalysis 認為更公平的對決對手是 Vera Rubin,因為兩者都用 HBM4 記憶體;即便如此,Jalapeño 仍在每兆瓦輸出 tokens 上略勝一籌(儘管 Nvidia 的晶片用上了 Jalapeño 尚未採用的 multi-token prediction)。在每 token 總持有成本上,兩者大致打平。此外,Rubin 系統已開始出貨給客戶,而據報導 Jalapeño 尚未超出工程樣品階段。
為什麼重要
SemiAnalysis 執行長 Dylan Patel 總結了這場產業震撼:「通常第一代晶片不具競爭力,但 OpenAI 擊敗了 Nvidia 的 Blackwell、甚至是 Rubin。」這家分析機構更進一步寫道:「鑑於 OpenAI 能如此快速地在自家晶片上導入新模型,CUDA 護城河可能已死」——直接挑戰了「Nvidia 軟體生態系鎖定效應能保護其免於客製晶片威脅」的假設。
策略脈絡同樣關鍵。Nvidia 仍與 OpenAI 的命運深度糾纏:8 月 17 日,Nvidia 才同意為 OpenAI 租用的俄亥俄州資料中心園區擔保高達 1,050 億美元的融資。「Nvidia 是非常好的合作夥伴,我們持續需要大量 Nvidia,」OpenAI 硬體副總裁 Richard Ho 向 Bloomberg 表示。財務長 Sarah Friar 則將 Jalapeño 定調為與 Nvidia、AMD、AWS、Cerebras、CoreWeave 等夥伴關係的互補,而非取代。
但 Nvidia 約 75% 的資料中心毛利率如今確實面臨壓力。若將 Jalapeño 擴展至 OpenAI 去年 10 月與 Broadcom 簽署的 10GW 部署協議,OpenAI 也將成為 HBM4 供給的重大新爭奪者——在這個市場中,三星、SK hynix 與 Micron 的產能已銷售一空至 2027 年,SK hynix 執行長更警告 2027 年將是供給吃緊最嚴重的一年。
OpenAI 計畫今年稍晚開始在自家資料中心部署 Jalapeño。對一個競相讓推論成本低到足以支撐以數十億計 token 消耗的代理式 AI 工作負載的產業而言,一顆以 700W 之力在每千瓦效能上超越 1,400W 旗艦的晶片,正是既有霸主再也無法斥為科幻的那種破壞式創新。
Sources
- [1] https://the-decoder.com/openais-first-custom-chip-jalapeno-reportedly-beats-nvidias-blackwell-and-rubin-in-inference-benchmarks/
- [2] https://www.tomshardware.com/tech-industry/semiconductors/openai-says-its-jalapeno-chip-beats-nvidias-gb300-in-first-published-benchmarks
- [3] https://aiweekly.co/alerts/openai-jalapeno-chip-beats-nvidia-rubin-on-perf-per-watt