← All posts / Industry

ChatGPT、Claude 與 Grok 同時掛掉:一場罕見的多供應商 AI 大當機

9 月 3 日上午,ChatGPT、Codex、Claude 與 Grok 在幾乎同一時刻全面回報錯誤——這場橫跨多家獨立 AI 供應商的同時故障,暴露出全球 AI 依賴度有多麼集中。

ChatGPT、Claude 與 Grok 同時掛掉:一場罕見的多供應商 AI 大當機

2026 年 9 月 3 日太平洋時間上午 7 點 57 分左右,不尋常的事情發生了:ChatGPT 掛了。而且不只是 ChatGPT——Codex、Claude 與 Grok 也在幾乎同一時刻對大量用戶回傳錯誤。Anthropic 的狀態頁面從 13:26 UTC 開始回報 Fable/Mythos 5.1、Opus 5 與 Opus 4.8 全面出現錯誤率升高。幾分鐘內,當機追蹤網站爆量,各公司的 Slack 頻道塞滿了轉圈載入畫面的截圖,而一個安靜的疑問開始在網路上蔓延:三家名義上完全獨立的 AI 公司,怎麼會同時壞掉?

部分用戶的服務在大約半小時後開始恢復,但 Anthropic 的 Opus 4.8 與 Opus 5 直到 15:25 UTC 之後仍處於降級狀態——對部分客戶而言,這次事故已超過兩個小時。截至 15:22 UTC,OpenAI 的狀態頁面仍顯示「部分系統降級」(Partial System Degradation),距離第一批回報已過了數小時。

實際發生了什麼事

從狀態頁與當機回報拼湊出的時間線如下:

  • 7:57 a.m. PT / 14:57 UTC — 用戶開始同時回報 ChatGPT、Codex、Claude 與 Grok 故障。錯誤率是「暴增」而非「攀升」,暗示觸發點是突發的上游事件,而非漸進的容量耗盡。
  • 13:26 UTC — Anthropic 狀態頁記錄到 Fable/Mythos 5.1、Opus 5 與 Opus 4.8 的錯誤率升高窗口起點。(注意:這個時間戳早於用戶可見的暴增點,表示 Anthropic 的監控在劣化進行中就抓到了。)
  • ~15:25 UTC — 部分恢復。ChatGPT 與 Grok 對許多用戶恢復正常;Anthropic 的 Opus 4.8 與 Opus 5 仍維持錯誤率升高的降級狀態。
  • 15:22 UTC — OpenAI 狀態頁仍列出「部分系統降級」——事故尚未完全結束。

截至撰稿時,三家供應商都尚未發布根因分析。這本身就是故事的一部分:當你的產品已嵌入數百萬個工作流程時,「錯誤率升高」加上零解釋,就不只是 SLA 報表上的一行字,而是信任負債。

為什麼「同時故障」很重要

單一 AI 服務當機,到現在已經沒什麼新鮮感了。Claude 在 2026 年 6 月就發生過長達 7 小時 9 分鐘的當機——那已是 Anthropic 年內第四起重大事故。ChatGPT 在 2 月發生過全球性登入阻斷,8 月也有超過 22,000 筆回報的尖峰。Grok 的可靠性問題反覆出現、甚至延續多日,嚴重到 SpaceX 本週才在可靠性調查後空降自己的高階主管進駐 xAI 的資料中心。

讓 9 月 3 日不同的是相關性。這是三家不同的公司:不同的模型架構、不同的訓練管線、名義上各自獨立的基礎設施。當它們一起故障時,只有三種可能:

  1. 共用的上游依賴。 這是主流假說。三家供應商都跑在少得驚人的共同基礎層上:同樣的雲端區域、同樣的 CDN 與邊緣節點供應商、同樣的骨幹網路、同樣少數幾家 GPU 與網通設備廠。任何一個關鍵共用層的故障——DNS 事故、骨幹路由洩漏、雲區域控制平面故障——都會瞬間橫掃所有「競爭對手」。值得留意的是,OpenAI 2024 年 12 月的當機就被歸咎於上游供應商,此一模式早有前例。
  2. 共同的負載衝擊。 如果有一場大規模協調性流量事件同時打向所有供應商(病毒式prompt、協調式機器人攻擊、新模型上線吸走用戶去朝聖),三家可能同時飽和。時間點有一處可疑:9to5Mac 指出,這次當機正好落在 OpenAI 傳聞將發表下一個大模型的同一天。
  3. 純屬巧合。 有可能,但對三個高可靠度服務在同一個三十分鐘窗口內同時故障而言,統計上很牽強。當機分析的一般原則是:在證明無關之前,同時故障一律視為相關。

目前業界還不知道哪個解釋成立,而這種不確定性正是問題核心。AI 基礎設施沒有公開的「塔台」,沒有共用的事故揭露慣例,也沒有任何監管機構握有足以事後區分相關與因果的遙測數據。

更深的問題:集中化風險

這場當機揭開的不舒服真相是:全球的認知工作負載,如今有多大比例流向三家或四家公司。當 ChatGPT、Claude 與 Grok 一起降級時,備援選項薄得可憐——Gemini 有自己的可靠性紀錄,較小的供應商則沒有足夠的容量餘裕。

這正是 Moody’s 在 2026 年 8 月對銀行體系提出的系統性依賴警告,也解釋了為什麼 Anthropic 昨天才宣布讓企業客戶把 Claude 日誌跑在自己的雲端——那与其說是產品策略,不如說是保險。監管者也正在收網:歐盟 AI 法案的系統性風險條款、美國國會裡流傳的各版「AI 斷路器」法案,骨子裡都是同一件事——把「單點故障」思維強行塞進一個正以狂奔速度建造單點故障的產業。

對企業而言,營運面的結論樸素而不浪漫:

  • 多供應商路由已不再是選配。 如果你的產品只呼叫一個前沿模型,今天的當機你就全額吸收了。能在 OpenAI、Anthropic、Google 與開源權重備援之間自動切換的閘道器,是新的基本盤。
  • 釘死你的依賴。 共用的雲端區域與 CDN 層,意味著你「互為備援」的供應商共享命運的程度,可能遠高於行銷文案的暗示。向供應商要依賴地圖;大多數給不出來。
  • 把狀態頁當公關、別當遙測。 Anthropic 自己的事故時間戳落後於用戶可見的故障。針對你真實 prompt 的獨立監控與合成檢查,勝過不停重新整理狀態頁。

時間點的諷刺

開發者圈流傳著一個苦澀的笑話:OpenAI 傳聞發表下一個前沿模型的同一天,所有主要 AI 助手一起暫時失效。這兩件事是否相關——發表日的流量、內部基礎設施變更、還是純巧合——從外部無從得知。但它勾勒了這個產業的現狀:驚人的發表節奏、驚人的需求成長,以及一層拼命追趕的基礎設施。南韓晶片出口暴增三倍至 466.5 億美元、Broadcom 下季 AI 營收指引 217 億美元,都是同一條需求曲線在供給端的鏡像——而這條曲線今天同時壓垮了三個服務。

AI 可靠性工程的進度,沒有跟上 AI 採用的速度。今天是一次三十分鐘的提醒。下一次,可能不止三十分鐘。

資料來源