OpenAI Ultrafast 模式攜手 Cerebras:GPT-5.6 Sol 每秒 750 Token 的推論革命
OpenAI 推出 Ultrafast API 層級,以 Cerebras 晶片驅動 GPT-5.6 Sol,輸出速度可達每秒 750 token——為標準版的 14 倍——徹底打破速度與智慧的取捨困境。
OpenAI Ultrafast 模式攜手 Cerebras:GPT-5.6 Sol 每秒 750 Token 的推論革命
多年來,AI 開發者始終面對一個棘手的取捨:你可以選擇快速的模型,或是聰明的模型,但兩者很難兼得。越大的推理模型產出品質越高,代價卻是延遲——使用者要嘛等待數分鐘換取頂級結果,要嘛在短時間內接受較差的答案。2026 年 8 月 13 日,OpenAI 向這個取捨正式宣戰:Ultrafast 模式預覽版上線。這個全新的 API 服務層級讓旗艦模型 GPT-5.6 Sol 的輸出速度達到每秒 750 token——約為標準版的 14 倍——而且官方強調智慧水準毫無妥協。
這個速度背後的祕密,並不是一個新模型,而是Cerebras——以晶圓級加速器聞名的矽谷晶片公司。Cerebras 今年稍早與 OpenAI 簽下了百億美元級的合作協議,而 Ultrafast 預覽正是這筆交易迄今最具體的成果:GPT-5.6 Sol 的權重改由 Cerebras 硬體提供服務,而非傳統 GPU,一舉改寫了前沿模型的延遲經濟學。
每秒 750 token 到底是什麼概念?
「每秒 750 個輸出 token」這個數字聽起來抽象,換算一下就明白了。一段典型的文字段落約 100 個字,相當於 150 個 token 左右。在 Ultrafast 上,這段文字不到五分之一秒就能生成完畢。一份數千 token 的長篇分析報告——標準版推理模型需要串流一分鐘以上的那種——幾秒鐘就能完成。
Cerebras 進行了面對面的基準測試來量化這個差距。在 Humanity’s Last Exam(人類最後的考試)這個包含 2,500 道題目、設計上只有化學、經濟學、文學等領域博士級專家才能解答的基準測試中,Ultrafast 上的 GPT-5.6 Sol 只花了 11 小時 11 分鐘就完成所有題目。相比之下,Claude Fable 5 需要 78 小時 27 分鐘——超過三天的不間斷運算——才能得出相同的結論,Ultrafast 在相近準確度下的端到端速度快了近 7 倍。在衡量高經濟價值知識工作的 GDP-Val 基準上,Cerebras 量測到 5.6 倍的端到端加速,且品質毫無下降。
根據 Artificial Analysis 追蹤的輸出速度,Ultrafast 上的 GPT-5.6 Sol 比 Claude Fable 5 快 11 倍,比開啟 Fast 模式的 Opus 4.8 快 5 倍。用 Cerebras 的話說,這是全球最快的前沿模型。
為什麼這會改變產品設計
OpenAI 對 Ultrafast 的定位是「每秒完成更多有用的工作」——讓前沿智慧得以進駐每一秒都至關重要的工作流程。預覽公告描繪了幾個具體場景:
- 事故應變(Incident Response):工程師可以在停機事件仍在發生的當下,就讓模型分析 production 日誌、程式碼變更與事件報告,即時鎖定根因並準備修復方案。OpenAI 表示內部已經在這樣使用這個模型。
- 金融:模型能在市場條件仍在變動時就評估訊號、標記可疑交易,而不是在時機過去之後才交出分析。
- 客服與電商:複雜的多步驟詢問可以即時解決;商品問題、庫存查詢與個人化推薦都能在猶豫的買家放棄購物車之前完成。
- 研究:過去需要整夜批次執行的實驗,變成互動式的工作階段——測試想法、檢視結果、調整方向、再啟動下一輪,工作流程一氣呵成。
生產力論點也延伸到 Agent 工作流。OpenAI 研究員 Jeffrey Wang 的描述相當直白:以前他可能要等個幾分鐘任務才完成,「現在任務在我還來不及切換情境之前就做完了」。在每秒 750 token 的速度下,模型基本上跟得上一個人閱讀、思考與轉向的速度——自推理模型問世以來一直定義著人機協作體驗的「等待空窗」,正在被壓縮到消失。
速度成為定價槓桿
超越原始效能,Ultrafast 也揭露了 OpenAI 演進中的商業策略:將推論速度分層出售。該公司早已透過 API 提供「Fast Mode」,為 GPT-5.6 Sol 提供最高 2.5 倍的速度,價格約為兩倍。Ultrafast 在其上再添第三個更快、而且——雖然定價尚未公布——幾乎可以肯定更貴的層級。
這套邏輯與 AWS 等雲端業者長期以來對高效能服務等級收取溢價的做法如出一轍。如果延遲真的成為各行業的瓶頸——從事故應變、交易到客服的案例都顯示會如此——分層推論讓 OpenAI 能直接分食「更快的 AI 所創造的營收增益」。運算速度不再只是技術指標,而是像時脈、記憶體與網路吞吐量一樣,成為企業基礎設施預算中獨立計價的軸線。
可用性與但書
Ultrafast 以限量預覽的形式推出,初期僅透過 OpenAI API 提供 GPT-5.6 Sol,並只開放給獲選的客戶群。OpenAI 計畫隨 Cerebras 產能擴張逐步擴大存取範圍;有興趣的組織可透過公告頁面的表單登記取得更新。目前尚未公布定價與正式上線日期。
有兩點但書值得留意。其一,上述所有基準比較皆來自 Cerebras 與 OpenAI 自家——每秒 750 token 的數據在真實 production 負載下的獨立第三方驗證仍有待完成。其二,一個限量、未定價的預覽,更像是一份意圖宣言,而非正式出貨的產品;晶圓級服務能否以經濟規模支撐廣泛的 API 流量,仍是 Cerebras 商業模式的核心疑問。
即便如此,這次上線仍標誌著前沿模型格局的一次重要轉向。過去十年,產業競賽的主軸是智慧——更大的模型、更好的基準分數。Ultrafast 則主張,下一個競爭軸線是時間:誰能在關鍵時刻提供快到來得及行動的前沿推理。隨著 Cerebras 合作夥伴關係開端出可出貨的產品,OpenAI 在這場競賽中搶下了頭香——也向整個產業宣告:延遲,現在也是一條前線。
Sources
- [1] https://openai.com/index/previewing-ultrafast/
- [2] https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai
- [3] https://the-decoder.com/gpt-5-6-sol-goes-14x-faster-as-openai-launches-ultrafast-mode-powered-by-cerebras/
- [4] https://community.openai.com/t/ultrafast-mode-preview-gpt-5-6-sol-at-up-to-14x-the-speed-in-the-api/1390344