OpenAI 推出 Ultrafast 模式:GPT-5.6 Sol 搭載 Cerebras 達每秒 750 Token
OpenAI 預覽全新 Ultrafast API 服務層,搭載 Cerebras 晶圓級硬體,讓旗艦模型 GPT-5.6 Sol 以每秒 750 token 的速度生成——比標準模式快 14 倍。
2026 年 8 月 13 日,OpenAI 正式公開預覽 Ultrafast——全新的 API 服務層,讓其旗艦模型 GPT-5.6 Sol 以高達 每秒 750 個輸出 token 的速度運行,比標準模式快 14 倍。這項服務由 Cerebras Systems 的晶圓級推論硬體驅動,目前開放給經過篩選的 API 客戶預覽使用,專為時間敏感的生產級應用場景設計:即時語音助理、直播客服代理、互動式程式開發工具,以及任何需要次秒級回應延遲的產品。
此次發布標誌著 OpenAI 首次為其最強大的模型提供專屬速度層,也反映出公司對推論市場的策略轉變——不再僅僅關注每個 token 的原始智慧,而是關注將這份智慧傳遞給終端使用者的速度。
Ultrafast 的核心規格
公告的核心是一個簡單但震撼的數據:每秒 750 個輸出 token。作為對比,一般人閱讀速度大約是每秒 4 到 5 個 token。Ultrafast 的文字生成速度比人類閱讀速度快約 150 倍——一整頁文字(約 500 字)可以在不到一秒內生成完畢。
關鍵規格如下:
- 速度:比標準模式快最高 14 倍
- 吞吐量:每秒高達 750 個輸出 token
- 模型:GPT-5.6 Sol,OpenAI 的旗艦前沿模型
- 硬體:Cerebras 晶圓級引擎(Wafer Scale Engine, WSE)系統
- 智慧水準:零品質損失——Ultrafast 運行完整的 GPT-5.6 Sol 模型,沒有蒸餾或壓縮
- 可用性:預覽階段,開放給特定 API 客戶,預計後續擴大範圍
這不是一個更小、更快、更笨的模型。它就是 2026 年 7 月發布的同一個 GPT-5.6 Sol——在程式開發、知識工作與科學推理領域創下多項紀錄的前沿模型——只是在專門優化推論速度的硬體上運行。
Cerebras 合作夥伴關係:晶圓級運算的意義
Ultrafast 層由 Cerebras Systems(NASDAQ: CBRS) 驅動。這家晶片製造商將整個公司押注在一個激進的理念上:與其在一片矽晶圓上製造數十顆小晶片再切割開來,不如保持整片晶圓完整,作為一個巨大的單一處理器。結果就是 晶圓級引擎(WSE)——一個大約平板電腦大小的晶片,在單一裸晶上集成了比市面上任何 GPU 都更多的運算核心、記憶體與頻寬。
架構上的優勢既直接又深遠。在傳統 GPU 叢集中,大型語言模型的參數必須分散到多顆透過高速互連(如 NVIDIA 的 NVLink)連接的晶片上。每生成一個 token 都需要在晶片之間反覆傳輸資料,產生隨模型規模增長的延遲負擔。Cerebras 將模型的運算放在單一晶圓上,徹底消除了跨晶片通訊的瓶頸——每個核心都能在不跨越晶片邊界的情況下存取共享記憶體。
這就是為什麼 Cerebras 能在前沿模型上實現每秒 750 個 token。WSE 能夠在每個時脈週期中對其整個記憶體空間執行邏輯運算,意味著推論吞吐量沒有互連稅。同樣的模型在標準 GPU 基礎設施上大約每秒 50 到 55 個 token,而在 Cerebras 上突然快了 14 倍。
這項合作建立在 2026 年 6 月宣布的歷史性協議之上:OpenAI 承諾使用 750 百萬瓦的 Cerebras 運算容量——一份價值超過 200 億美元、為期多年的部署合約。當時許多分析師將此視為長期的基礎設施避險策略。如今隨著 Ultrafast 的推出,這些產能已被轉化為商業產品,直接在速度維度上與市場上所有推論服務提供商競爭。
速度層策略
Ultrafast 位於 OpenAI API 中兩個現有處理模式之上:Standard(基準)和 Fast(2026 年 7 月 30 日推出,提供 2.5 倍速度,收費為 2 倍)。完整的層級架構如下:
| 層級 | 相對標準模式速度 | 適用場景 |
|---|---|---|
| Standard | 1× | 批次處理、非時間敏感任務 |
| Fast | 最高 2.5× | 一般互動式應用 |
| Ultrafast | 最高 14× | 即時語音、直播代理、次秒級延遲 |
這個分層反映了 AI 推論市場的一個深層事實:速度正在成為競爭的主軸。多年來,競爭的核心是智慧——誰的模型在基準測試上得分最高、誰的推理最精確。但隨著前沿模型在能力上趨於收斂(GPT-5.6 Sol、Claude Opus 4.6、Gemini 3.1 和 DeepSeek V4 在大多數基準測試上的差距僅有幾個百分點),差異化正在轉向延遲、吞吐量和每次查詢成本。
OpenAI 尚未在新層級的預覽公告中完整說明定價細節,但根據 Fast 模式的先例——2 倍標準價格換取 2.5 倍速度——Ultrafast 預計將有顯著的溢價。社群的早期估算顯示,成本可能是標準定價的 18 到 40 倍,反映了以每秒 750 token 運行前沿模型的極端基礎設施需求。然而,對於建構即時產品的企業客戶而言,價格溢價是次要的——一個在 300 毫秒內回應的語音助理與一個需要 3 秒的助理,在產品品質上有本質上的差異。
為什麼每秒 750 Token 如此重要
要理解這個數字的重要性,考慮它所解鎖的應用場景:
即時語音 AI:語音助理需要端到端延遲低於 500 毫秒才能產生對話感。以每秒 750 token 的速度,GPT-5.6 Sol 可以在 300 毫秒內生成完整的口語長度回應(約 150–200 個 token,即 2–3 個句子),完全在自然對話流暢度的範圍內。這是 OpenAI 的 GPT-Live 語音產品(2026 年 7 月推出,搭載 SynthID 浮水印技術)的技術基礎。
多代理系統:現代 AI 應用越來越多涉及多次模型呼叫的串接——一個代理負責規劃、呼叫工具、反覆迭代結果,最後綜合出答案。在標準速度下,一個 5 步驟的代理管線可能需要 15 到 20 秒。在 Ultrafast 上,同樣的管線在 1 到 2 秒內完成,讓複雜的代理工作流程在即時介面中變得可行。
互動式程式開發:程式碼補全和自動重構等開發者工具需要近乎即時的回饋來維持心流狀態。以每秒 750 token 的速度,GPT-5.6 Sol 可以在開發者從鍵盤抬起手指的時間內生成一整個函式實作。
即時客服:客服代理需要解析使用者訊息、查詢知識庫、撰寫有用的回覆——如今這一切可以在不到一秒內完成,消除了 AI 客服聊天機器人常見的尷尬「正在輸入…」延遲。
競爭影響
Ultrafast 的推出對市場上所有推論服務提供商構成壓力。Anthropic 的 Claude 系列、Google 的 Gemini 家族,以及 DeepSeek V4 和 Qwen 3.8 等開放權重替代方案,都運行在 GPU 基礎設施上,其互連瓶頸將前沿模型的吞吐量限制在大約每秒 50 到 80 token。
Cerebras 本身也提供第三方推論服務——在其晶圓級硬體上運行 Meta、Mistral 等公司的模型——並曾展示較小模型超過每秒 2,000 token 的速度。但 OpenAI 的合作賦予了 Ultrafast 獨特的定位:OpenAI 最強大的模型與 Cerebras 最快的硬體的結合,以統一的 API 產品形式提供。
對 NVIDIA 而言,影響是微妙的。NVIDIA GPU 仍然是 AI 訓練的主導平台,Ultrafast 並未在模型開發領域取代它。但在推論——直接服務終端使用者、產生最多 API 營收的市場——Cerebras 已經展示了具體的、已出貨的優勢。如果 Ultrafast 在企業客戶中受到歡迎,其他模型提供商可能會尋求與 Cerebras、Groq 或其他專用推論硬體製造商的類似合作,逐步侵蝕 NVIDIA 對推論市場的掌控。
展望未來
Ultrafast 目前處於預覽階段,可透過 OpenAI 網站上的興趣表單申請。公司尚未宣布正式上市日期或詳細定價,但預覽的存在證實了 Cerebras 基礎設施已經投入運營並在處理真實流量。
更廣泛的訊號很明確:AI 推論市場正在進入一個新階段——延遲即是產品。前沿智慧不再是唯一的差異化因素,而是基本門檻。贏得 AI 部署下一階段的公司,將是那些以讓人類使用者感覺瞬間完成的速度,交付前沿級智慧的公司。透過 Ultrafast,OpenAI 和 Cerebras 在這場競賽中拔得頭籌。
對開發者而言,訊息很直接:如果你的應用有即時延遲需求——語音、代理、直播互動——現在有一個專門為你打造的服務層。在智慧與速度之間做選擇的時代正在結束。有了 Ultrafast,你兩者都能擁有。
Sources
- [1] https://openai.com/index/previewing-ultrafast/
- [2] https://techcrunch.com/2026/08/13/openai-introduces-ultrafast-a-new-mode-that-makes-gpt-5-6-sol-work-at-14x-the-speed/
- [3] https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai
- [4] https://alphasignal.ai/news/openai-s-gpt-5-6-sol-hits-750-tokens-per-second-on-cerebras-hardware
- [5] https://www.unite.ai/cerebras-runs-openais-gpt-5-6-sol-at-750-tokens-per-second-in-new-ultrafast-tier/
- [6] https://cryptobriefing.com/openai-ultrafast-mode-gpt-5-6-sol/