← All posts / Models

OpenAI Ultrafast 模式:Cerebras 晶圓級晶片讓 GPT-5.6 Sol 每秒輸出 750 個 Token

OpenAI 推出 Ultrafast API 等級,由 Cerebras 晶圓級晶片驅動,旗下最強模型 GPT-5.6 Sol 每秒可輸出 750 個 token,速度最高達標準版的 14 倍。

OpenAI Ultrafast 模式:Cerebras 晶圓級晶片讓 GPT-5.6 Sol 每秒輸出 750 個 Token

2026 年 8 月 13 日,OpenAI 開放了全新 API 服務等級 Ultrafast 的限量預覽。這個等級將該公司最強的模型 GPT-5.6 Sol 部署在 Cerebras 的晶圓級(wafer-scale)硬體上運行,核心數字是:每秒最多輸出 750 個 token,速度最高達標準處理的 14 倍,而且 OpenAI 強調模型的基準智力毫無妥協。

作為對比,前沿級模型在標準 GPU 基礎設施上的輸出速度通常落在每秒 50 到 100 個 token 之間。在 750 tok/s 的速度下,過去需要串流好幾分鐘的技術報告,現在開發者連切換視窗的時間都還沒有,就已經生成完畢。OpenAI 將這樣的躍升定位為「數量級」的改變——它不只是讓既有工作流程變快,而是從根本上改變了產品可以圍繞模型延遲做出什麼設計。

Ultrafast 到底是什麼

首先要釐清:Ultrafast 是 OpenAI API 內的一個服務等級,不是新模型。智力仍然是 GPT-5.6 Sol,差別在於底層的推理服務架構。請求不再路由到 GPU,而是交給以晶圓級引擎(Wafer-Scale Engine,WSE)為核心的 Cerebras 系統——這顆晶片基本上是把一整片 300mm 矽晶圓做成單一處理器,容納約 4 兆個電晶體、90 萬個 AI 優化核心,以及最關鍵的 44 GB 片上 SRAM。

最後這個規格就是整個故事的核心。大型模型的快速推理,本質上是一個資料搬移問題。在 GPU 上,模型權重必須在片上記憶體與封裝外的 HBM 之間反覆穿梭,才能逐一生成每個 token,而記憶體頻寬就成了瓶頸。Cerebras 的做法是徹底消除這種搬移:權重常駐在晶圓上,token 不間斷地流經跨晶圓管線化的模型層。因為權重永遠不離開矽晶片,該公司主張這個速度優勢會隨模型規模自然延伸——等於是直接押注:當前沿模型持續長大,這個優勢依然成立。

此等級目前僅開放給一小群預覽客戶,會隨產能擴充逐步開放。OpenAI 表示,早期存取權已給予橫跨程式開發、電商、金融研究與互動式生產應用的公司,點名的早期用戶包括 Jane Street、Podium、Basis 與 Rogo。OpenAI 內部也將這個等級用於事件響應的日誌分析——在分秒必爭的場景裡。

基準測試數據——以及是誰做的

Cerebras 發布了幾項正面對決的比較,值得用適當的鹽份調味,因為該公司明言這些都是自家測量:

  • Humanity’s Last Exam(HLE):GPT-5.6 Sol 在 Ultrafast 模式下,以 11 小時 11 分鐘答完全部 2,500 道博士級題目。Claude Fable 5 則花了 78 小時 27 分鐘——超過三天的連續運算——才達到相近的結論,端到端慢了近 7 倍。(Sol Ultrafast 於 7 月 10 日測試,Fable 5 於 7 月 13 至 15 日測試,兩者皆在 xhigh 推理設定下分別透過 Codex 與 Claude Code 運行。)
  • GDP-Val:在這個衡量經濟價值知識工作的基準上,Ultrafast 相對標準處理帶來 5.6 倍的端到端加速且品質毫無減損,測試日期為 2026 年 7 月 31 日。
  • 跨廠商速度:對照 Artificial Analysis 公布的輸出速度,Ultrafast 模式下的 GPT-5.6 Sol 比 Claude Fable 5 快 11 倍,比 Opus 4.8 的 Fast 模式快 5 倍。

這些是廠商自測的數據,不是獨立結果——750 tok/s 與 14 倍這兩個數字來自 OpenAI 與 Cerebras 自己。但即使打個折扣,HLE 的結果尤其展現了質變:過去需要整個週末牆鐘時間的前沿推理工作,現在塞得進一個工作天。

為什麼速度會改變產品樣貌

有趣的問題不是 750 tok/s 算不算快,而是什麼東西因此變得可以做。有幾類應用立刻受惠:

站在關鍵路徑上的 Agent。 過去每一步要推理 30 到 60 秒的 agent 迴圈,塞不進互動式體驗或有時限的操作流程。在 14 倍的吞吐下,模型可以先花三秒思考再輸出,對使用者來說依然是即時的——推理深度不再需要耗損延遲預算。

即時事件響應。 當生產系統掛掉、SLA 分鐘不斷燒錢時,對數千行日誌做根因分析,正是「模型跑一小時完全無法接受」的工作負載。這也是 OpenAI 自己把停機排查列為第一方使用場景的原因。

盤中金融研究。 Jane Street 的 John Crepezzi 講得直接:「Cerebras 帶來的速度提升令人印象深刻。它讓模型有了不同的用法,也讓開發者能以更專注、更有效率的方式與模型協作。」市場不會等批次作業跑完。

語音與即時介面。 人類對話節奏約為每分鐘 150 字。任何假設輸出只有 60 tok/s 的延遲預算,都限制了語音產品每一輪能負擔多少推理。在 750 tok/s 下,模型可以在對話中途思考得更深,而互動感覺依然流暢。

100 億美元的背景

Ultrafast 並非憑空出現。OpenAI 今年稍早已向 Cerebras 采购了 100 億美元級別的低延遲算力,而這次上線把該產能放在旗艦模型後面,而不是較小或特化的模型。對 Cerebras 而言——這家多年來主張晶圓級架構才是推理正確形狀、而市場重心始終穩坐 GPU 供應商那邊的公司——拿下 OpenAI 最強模型的服務層,是它能拿到最強的生產環境實績背書。

這也象徵 NVIDIA 主導的服務堆疊出現了一道明顯裂痕。OpenAI 仍是 NVIDIA 最大的客戶之一,但 Ultrafast 證明它至少有一部分前沿推理已跑在非 GPU 矽晶片上。這究竟會維持為小眾低延遲等級,還是隨 Cerebras 產能擴張而成長,是目前的開放問題——OpenAI 刻意把擴大開放綁在產能上,而非宣布固定日期。

但書與未決問題

有三件事為這項發布降溫。第一,產能是近期約束:這是限量預覽,兩家公司都未承諾正式版時程。第二,定價未公布——OpenAI 尚未公布 Ultrafast 費率,而晶圓級服務不太可能便宜;對一般工作負載而言,經濟性可能仍偏向標準等級。第三,品質不減損的主張建立在廠商基準上——獨立驗證要等預覽客戶發布自己的數據。

更深層的問題是架構性的:Cerebras 的優勢建立在模型權重常駐片上 SRAM,這在前沿模型塞得進每晶圓 44 GB(搭配 FP8 壓縮等技術)時運作良好。如果模型規模的成長快過 SRAM 密度的提升,跨晶圓管線的做法將面對與所有人相同的記憶體牆物理限制。Cerebras 的反論是其架構隨模型規模平滑擴展——而 Ultrafast 首次讓這個主張在前沿尺度上變得可驗證。

後續觀察

  • 擴張速度。 OpenAI 以多快節奏放寬預覽,是判斷 Cerebras 能否規模化供應產能的最佳指標。
  • 獨立基準。 留意 Artificial Analysis 或預覽客戶驗證 750 tok/s 與品質保留數據。
  • 競爭對手的回應。 Groq、SambaNova 乃至 NVIDIA 自家的低延遲服務堆疊,都有動機應戰。推理速度正成為有別於原始智力的競爭軸線——而這可以說是此次發布最重要的訊號:前沿的競爭不再只是模型多聰明,還包括它能多快思考。