OpenAI 首顆自研晶片 Jalapeño 首波測試出爐:每瓦效能擊敗 Nvidia Rubin
OpenAI 與 Broadcom 花費 16 個月打造的首顆自研推理晶片,在每瓦效能上以 1.5–1.9 倍領先目前最強的量產加速器,也讓 Nvidia 的 CUDA 護城河首度受到實質挑戰。
本週的 Hot Chips 2026 會議上,OpenAI 公布了首顆自研 AI 加速器 Jalapeño 的第一批獨立測試數據,結果震撼了整個矽晶圓產業。這顆與 Broadcom 共同開發、採用台積電 N3P 製程的 700 瓦推理晶片,在每瓦效能上比目前市面上最強的加速器——包括 Nvidia 最新世的 Vera Rubin 平台——多出 1.5 到 1.9 倍的 AI 工作量。對一家從未設計過晶片的公司來說,第一代產品就能有這種表現,在業界幾乎是沒有前例的。
關鍵數據
OpenAI 使用 SemiAnalysis 的公開 InferenceX 基準測試來驗證 Jalapeño,SemiAnalysis 並在其實驗室現場覆核了部分測試。測試涵蓋三個模型:GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T。結果如下:
- 在三個受測模型上,峰值吞吐量的每瓦 AI 工作量比最好的量產系統高出 1.5–1.9 倍
- 端對端延遲比最佳商用系統低 1.7–3.6 倍
- 互動式工作負載的效能高出 2.1–4.1 倍
- 在 GPT-OSS 120B 上達到約每秒 1,400 tokens(單一使用者),在 DeepSeek R1 單一併發請求下超過每秒 700 tokens
- 在相同解碼速度下,每千瓦的 token 吞吐量是最佳加速器的 54 到 104 倍(依模型而異)
硬體規格方面,B0 版本在 700 瓦的額定功率下提供 13.4 PFLOPs 的 MXFP4 運算能力——作為對比,Rubin 等級的對照硬體為 900–1,150 瓦——而實測持續功率維持在 550 瓦以下。每顆晶片搭配 216 GB 的 HBM4 記憶體與最高 15.4 TB/s 的頻寬,與 Nvidia Rubin 使用同世代的下一代記憶體。
最引人注目的是:Jalapeño 在沒有使用多重 token 預測(multi-token prediction)或投機解碼(speculative decoding)的情況下達到這些數字——而部分對照系統有用上這些最佳化技術。換句話說,這顆晶片還有成長空間。
九個月的晶片衝刺
幕後故事和測試數據一樣精彩。OpenAI 於 2024 年中與 Broadcom 展開設計,2025 年 11 月將最終設計送交投產,前後約 16 個月就在 Hot Chips 舞台上展示了一顆可運作、可測試的晶片——其中從第一版晶片設計到定案送廠,只花了約 9 個月。
OpenAI 表示,自家的 AI 模型在過程中幫了大忙:較舊世代的模型協助晶片設計本身,較新的模型則加速了程式開發與最佳化。這正是 Anthropic、Google 與 Nvidia 都曾暗示過的「AI 設計 AI 硬體」飛輪——只不過 OpenAI 把它變成了第一代量產晶片的實績。
SemiAnalysis 執行長 Dylan Patel 總結了業界的驚訝:「通常第一代晶片不具競爭力,但 OpenAI 打敗了 Nvidia 的 Blackwell,甚至 Rubin。」
為什麼每瓦效能才是關鍵指標
原始 FLOPs 早就不再是 AI 基礎設施的決勝指標。如今資料中心的瓶頸是電力供應與散熱,而不是資本預算——這正是為什麼近期產業最大的新聞(海上核動力駁船、渦輪葉片鑄造廠、吉瓦級園區合約)全都圍繞著電力打轉。一顆每瓦效能高出 1.5–1.9 倍的晶片,不只是降低營運成本;它實質上等於把同樣電力所能服務的 AI 流量乘上一個倍數。對一家據報已營運(並持續簽約)數吉瓦算力的公司來說,這個數學會快速複利放大。
正如 SemiAnalysis 自己指出的,更公平的比較對象是 Vera Rubin 而非 Blackwell,因為兩者都用 HBM4 記憶體。即便如此,Jalapeño 每百萬瓦產生的輸出 token 仍高於 Rubin——而且 Rubin 還用上了 Jalapeño 尚未採用的多重 token 預測技術。至於每 token 的總持有成本(TCO),兩個平台大致打平。
CUDA 護城河的疑問
最深遠的影響可能不在技術面,而在戰略面。SemiAnalysis 直白地寫道:「考量 OpenAI 能多快在自己的矽晶圓上跑起新模型,CUDA 護城河可能已經死了。」二十年來,Nvidia 的軟體生態系是客戶即使面對硬體規格相近的對手也不願轉換的核心原因。如果一家軟體公司能在數個月內建立出具競爭力的加速器,並把主要開放權重模型(DeepSeek、Kimi、GPT-OSS)移植上去,那這條護城河顯然比想像中淺得多。
值得留意的但書
這個故事仍有但書。Nvidia 與 AMD 已公布更大模型——DeepSeek V4 Pro 與 Kimi K3——的測試結果,而這些模型尚未在 Jalapeño 上受測。此外,Rubin 系統已開始大量出貨給客戶,Jalapeño 據報仍停留在工程樣品階段。Jalapeño 也僅限推理用途——它只能运行模型、無法訓練模型,OpenAI 的訓練艦隊在可預見的未來仍將依賴 Nvidia GPU、AMD 加速器以及持續擴大的合作與自研矽晶圓組合。
OpenAI 財務長 Sarah Friar 將這顆晶片定位為「互補而非取代」:資料中心、晶片、模型、開發者平台、產品與裝置整合為一個系統,與 Nvidia、AMD、AWS、Cerebras、CoreWeave 等既有夥伴並行。這說法相當外交辭令——Nvidia、AMD 與 AWS 都是 OpenAI 的投資者或算力夥伴,而彼此也都在打造相互競爭的 AI 晶片。但趨勢方向已經很明確:最大的 AI 買家們不再甘於依賴單一晶片供應商,而且他們現在有了證明——一個有決心的新進者可以在兩年內觸及前沿。
Hot Chips 2026 傳達給 Santa Clara 的訊息很清楚:每瓦效能是新的戰場,而 OpenAI 剛剛射出了第一發認真的砲火。
Sources
- [1] https://openai.com/index/jalapeno-first-results/
- [2] https://the-decoder.com/openais-first-custom-chip-jalapeno-reportedly-beats-nvidias-blackwell-and-rubin-in-inference-benchmarks/
- [3] https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia
- [4] https://www.tomshardware.com/tech-industry/artificial-intelligence/hot-chips-2026-openais-jalapeno-ai-asic-unpacked-accelerator-developed-using-ai-achieves-efficiency-and-throughput-gains-against-power-hungry-blackwell
- [5] https://aiweekly.co/alerts/openai-jalapeno-chip-beats-nvidia-rubin-on-perf-per-watt