← All posts / Models

OpenAI 自研晶片 Jalapeño 首批基準測試出爐:每瓦效率最高達 Blackwell 的 1.9 倍

在 Hot Chips 會議上,OpenAI 首顆自研推理 ASIC 在 SemiAnalysis 的 InferenceX 基準測試中擊敗 Nvidia Blackwell:每瓦工作量提升 1.5-1.9 倍,端對端延遲降低 1.7-3.6 倍。

OpenAI 自研晶片 Jalapeño 首批基準測試出爐:每瓦效率最高達 Blackwell 的 1.9 倍

在週二的 Hot Chips 會議上,OpenAI 終於為其首顆自研 AI 推理晶片 Jalapeño 交出具體數據。在 SemiAnalysis 的 InferenceX 基準測試中,這顆 ASIC 繳出比對照系統(Nvidia GB200/GB300 級 Blackwell 部署)每瓦多出 1.5 至 1.9 倍的工作量,以及降低 1.7 至 3.6 倍端對端延遲的成績。結果隨 OpenAI 詳細的工程部落格文章,以及由硬體負責人 Richard Ho 領銜的 Hot Chips 簡報一同發布。

對一家過去兩年不斷簽下史上最大規模算力合約的公司而言,這個訊息再明確不過:OpenAI 現在自己打造所能買到最有效率的推理矽晶片,而且是自己設計的。

基準測試到底說了什麼

亮眼的數字涵蓋三個差異極大的開放權重模型——GPT-OSS 120B、DeepSeek R1 與 Kimi K2.5 1T——從中型稠密模型到兆級參數的混合專家模型都有。在三個模型上,Jalapeño 同時改善了每千瓦吞吐量與每用戶 token 數,而這兩個指標向來是推理服務商必須彼此取捨的軸線。

「重點是,結果顯示出相較於現有技術水準非常、非常顯著的性能推進,」OpenAI 硬體負責人 Richard Ho 在媒體說明會上表示。「Jalapeño 能在每單位電力下服務更多 AI 工作量,同時更快回傳回應。」

這種雙贏比任何單一數字都重要。資料中心的經濟學如今越來越由電力而非晶片價格主導:併網排程、電網合約與散熱容量,才是 AI 擴建案的真正瓶頸。一顆在峰值吞吐下每瓦多出約 50% 至 90% 工作量的處理器,不只是省電費——它實質上等於讓同一個電力配額能承載的推理量翻倍。而以 token 間時間與端對端回應時間衡量的延遲面,正是讓代理式(agentic)工作負載感覺「即時」而非「卡頓」的關鍵。

數字背後的硬體

DCD 報導的 Hot Chips 細節補齊了規格表:每顆 Jalapeño 封裝 TDP 為 700W,HBM4 記憶體頻寬達 15.4 TB/s;一套 128 顆的部署可提供 1.7 exaflops 的 4-bit 算力與總計 27.5 TB 的 HBM4。SemiAnalysis 指出,15.4 TB/s 意味著其 HBM4 堆疊跑到了 10 Gbps 的腳位速度——略高於 Nvidia 在同級堆疊上達到的 9.6 Gbps,對受記憶體頻寬限制的解碼階段是一項實質優勢。

架構本身採 chiplet 設計:一顆大型運算裸晶,周圍環繞 HBM 記憶體 chiplet 與 I/O chiplet,由 OpenAI 與 Broadcom 合作、採台積電 3nm 製程打造。六月晶片首度亮相時,OpenAI 還強調了約 44 GB 的晶片上 SRAM,提供約 21 PB/s 的封裝內頻寬——這些暫存容量讓 Jalapeño 能把熱門模型狀態留在本地,不必在網路上來回搬運。

最後這一點正是設計哲學的核心。推理不是一種工作負載,而是至少三個階段——prefill、通訊與解碼——各自有不同的瓶頸。通用 GPU 必須在三者之間妥協;Jalapeño 則是依照 OpenAI 的說法,被設計來「最小化資料搬移與通訊延遲」:生成回應時使用的 KV cache 可以被明確放置並保持在本地,同時系統為每個推理階段啟動運算、記憶體與網路的正確組合。換句話說,OpenAI 把超大规模資料中心十多年來的調度智慧,直接燒進了矽晶片裡。

脈絡:OpenAI 為何要自研晶片

Jalapeño 於 2026 年 6 月首度公布,是與 Broadcom 的合作專案,據報導 OpenAI 自家的模型也參與輔助開發流程。它屬於更宏大的「豐沛智能的全端堆疊」策略:產品、模型、晶片與記憶體協同設計,作為跨世代的平台而非一次性產品。

策略邏輯不難理解。隨著聊天機器人、程式代理與自主工作流規模化,推理正成為 AI 算力的最大宗。擁有一顆推理最佳化的 ASIC,讓 OpenAI 在每 token 成本上取得籌碼、擺脫 GPU 分配週期的制約,並能讓未來模型繞著已知硬體目標共同設計——正是 Google 用 TPU 跑了十年的同一套飛輪。

競爭態勢同樣尖銳。Anthropic 正為 Claude 開發自研晶片,Meta 備於九月開始量產其新一代 AI 晶片,微軟與 Google 持續擴充自家加速器產品線。Nvidia 也没有停下腳步:被 Jalapeño 在每瓦效率上擊敗的 Blackwell 世代終將被取代,等到 Jalapeño 進入量產部署時,比較基準早已前移。Ho 對此直言不諱——也坦言 OpenAI 並未棄守 GPU 供應商,形容整體算力策略仍包含 Nvidia 這類「非常好的夥伴」。

部署時程

Jalapeño 將於 2026 年底以「極小量」部署,2027 年逐步放大至具規模的部署。OpenAI 未揭露具體數量。第二代與第三代晶片已在開發中,與跨世代平台的承諾一致。

這條時間線為基準測試的振奮潑了點冷水。對今日 Blackwell 系統的亮眼成績,必須撐過 Nvidia 下一世的反擊——以及 2027 年台積電製程經濟學的考驗。但方向已經很清楚:前沿 AI 公司純粹作為 Nvidia 客戶的時代正在結束。OpenAI 如今本身就是一家矽晶片供應商,而第一個客戶,就是它自己。

後續觀察

三件事將決定 Jalapeño 的帳面優勢能否成為結構性優勢:真實機群利用率能否貼近基準測試條件(InferenceX 結果反映的是受控組態);Nvidia Rubin 世代的反擊速度;以及 OpenAI 的全端共同設計迴路——模型為晶片塑形、晶片為模型塑形——是否真能跨世代複利。今天交出的第一個數據點,相當強勁。