← All posts / Industry

從第一顆電子到最後一個 Token:Crusoe 與 Perplexity 簽下全模型生命週期合作

Crusoe 將以專屬 GB300 NVL72 叢集訓練 Perplexity 的前沿模型,並透過 Managed Inference 提供生產環境推論服務;同時 Crusoe 的 1,800 名員工將全面採用 Perplexity Enterprise Pro 與 Max。

從第一顆電子到最後一個 Token:Crusoe 與 Perplexity 簽下全模型生命週期合作

AI 雲端市場出現了一個新的指標性合約,重新定義了「全生命週期(full lifecycle)」的實際含義。2026 年 9 月 15 日,自詡為「AI 工廠」公司、也是最積極倡導垂直整合與能源優先基礎設施的 Crusoe,宣布與 Perplexity 建立多年期合作夥伴關係,一次涵蓋模型管線的兩端:Perplexity 的前沿模型將在 Crusoe 專屬的 NVIDIA GB300 NVL72 叢集上訓練,再透過 Crusoe 的 Managed Inference 服務上線服務。

這筆交易實際涵蓋什麼

根據這份發自舊金山的官方公告,協議分為兩個部分。第一是算力:Perplexity 的完整模型生命週期將運行在 Crusoe Cloud 上——訓練採用由 NVIDIA InfiniBand 串連的專屬 GB300 NVL72 叢集,生產環境推論則交給 Crusoe Managed Inference。值得一提的是,這項推論服務直到 2025 年 11 月才正式全面上市。

第二部分更不尋常:Crusoe 將為旗下約 1,800 名員工導入 Perplexity Enterprise Pro 與 Max,讓這家基礎設施公司的團隊使用 Perplexity 的網路與內部知識搜尋、多步研究、資料分析與前沿模型存取。換句話說,算力供應商同時變成了客戶——這種對稱關係,兩家公司都樂於大方宣傳。

「動作最快的 AI 公司需要能跟上整個模型生命週期、並隨他們成長而擴張的基礎設施,」Crusoe 共同創辦人兼執行長 Chase Lochmiller 表示。「Perplexity 正在打造人們尋找答案的未來,而 Crusoe 是實現這一切的關鍵夥伴——從第一顆電子到最後一個 token。」

「從第一顆電子到最後一個 token(from the first electron to the last token)」這句結語,在新聞稿裡承載了極大的分量。它濃縮了 Crusoe 的核心主張:同時掌握能源層(電力採購與電網策略)、資料中心層與雲端軟體層,才能端對端優化工作負載——這是在別人雲端上租用切片所做不到的。

底層硬體

協議中的訓練端採用 NVIDIA GB300 NVL72——這個機架級 Blackwell Ultra 平台,已是 2026 年頂級前沿訓練叢集的標準 building block。規格說明了一切:每個全液冷機架整合 72 顆 Blackwell Ultra GPU 與 36 顆 Arm 架構 Grace CPU,NVLink 頻寬達 130 TB/s,聚合 GPU 記憶體 20 TB(頻寬最高 576 TB/s),每系統配備 2,592 個 Arm Neoverse V2 CPU 核心。每顆 GPU 透過 ConnectX-8 SuperNIC 獲得 800 Gb/s 網路連線,接入 Quantum-X800 InfiniBand 或 Spectrum-X Ethernet 網路架構。

NVIDIA 宣稱,以 GB300 NVL72 建置的 AI 工廠,相較 Hopper 平台整體 AI 工廠產出最高可達 50 倍提升——這個數字來自每使用者回應速度(tokens per second per user)預估 10 倍改善,加上每百萬瓦吞吐量 5 倍改善,且 NVIDIA 自己也註明屬預估效能、可能變動。即使打折扣,這個平台仍是當前前沿後訓練(post-training)所需那種高密度、緊耦合訓練的最新技術。

NVIDIA HPC 與 AI 基礎設施解決方案資深總監 Dion Harris 將這筆交易視為該架構的驗證:「現代 AI 需要從研究到部署的統一運算架構。在 NVIDIA GB300 NVL72 與 NVIDIA InfiniBand 的驅動下,Crusoe Cloud 讓 Perplexity 能以 agentic AI 所要求的速度與效率,訓練、微調並在生產環境服務前沿模型。」

推論才是產品本體

對 Perplexity 而言,訓練端只是入場券;推論端才是生死存亡。「在 Perplexity 的規模上運行 AI,代表每一毫秒的延遲都會被使用者感受到,」Perplexity 共同創辦人兼執行長 Aravind Srinivas 說。「Crusoe 正是圍繞這個限制而建——它是次世代硬體支撐的高吞吐、低延遲推論。」

這不是行銷話術。一個即時服務數百萬使用者的搜尋答案產品,變現直接取決於回應速度——對 Perplexity 來說,延遲與吞吐不是理論 benchmark,而是產品本身。向一家引擎明確針對這些限制優化、且與訓練同平台的供應商採購推論,等於一次消除了一整類交接問題。

Crusoe 的 Managed Inference 服務由其自研推論引擎驅動,核心是 MemoryAlloy——一套叢集級 key-value 快取,讓 GPU 能從本地與遠端節點取得 prefix cache,消除重複的 prefill 運算。Crusoe 公布的 benchmark 顯示,在四節點部署的 Llama-3.3-70B 上,相較 vLLM 最高可達 9.9 倍的首 token 延遲(time-to-first-token)改善與 5 倍吞吐提升。服務提供三種型態:適合爆量或實驗流量的 serverless 推論、現已全面上市的自助部署,以及為專有模型打造的量身訂製專屬端點——Perplexity 的生產流量,大概率將由最後這一種承載。

為什麼這筆交易重要

三條更大的故事線在此交會。

Neocloud 的圈地戰向上移動。 Crusoe 是基礎設施層躍升最快的公司之一:2024 年 12 月以 28 億美元估值完成 6 億美元 D 輪,2025 年 10 月以超過 100 億美元估值完成 13.75 億美元 E 輪,2026 年中據報導又以 300 億美元估值籌得 30 億美元 F 輪——營收預估從 2024 年的 2.76 億美元,藉著為 OpenAI Stargate 計畫等客戶建置而逼近 10 億美元大關。像這樣把一家具名的消費級 AI 租戶同時錨定在訓練與服務兩端,正是 neocloud 把_raw 產能轉換為持久多年營收的方式。

訓練與服務之間的鴻溝正在閉合。 在 AI 熱潮的大半時間裡,前沿實驗室在一個平台訓練、在另一個平台(通常是超大型雲端業者)服務,默默承受中間的營運縫隙。Perplexity 把生命週期收攏到單一平台,是一場押注:統一優化(共享工具鏈、一致的網路架構、理解自家模型 prefix 模式的快取層)勝過各環節 best-of-breed 的拼裝。如果這個押注成立,預期會有更多實驗室跟進,超大型雲端業者的綁售優勢也將在邊際上被侵蝕。

算力換產品的交換正在成形。 Crusoe 讓自家員工全面採用 Perplexity Enterprise Pro 與 Max,呼應了基礎設施交易越來越常與相互產品採購綁定的模式。1,800 個座位規模不大,但它傳達了 AI 業者衡量夥伴關係的新方式——不只看金額,還看是否成為彼此內部工具鏈的一部分。

交易的財務條款未披露,而這個市場的多年期基礎設施協議,通常帶有直達九位數的承諾消費下限。已披露的是交易的形狀:單一平台、雙向的價值流動,以及一個非常明確的主張——AI 基礎設施競爭的未來,比的是生命週期覆蓋,而非單純的 GPU 庫存。

對一個仍在消化「推論已取代訓練、成為部署式 AI 最大成本中心」這件事的產業,Crusoe 與 Perplexity 給出了一個具體答案:掌握從第一顆電子到最後一個 token 的完整迴路。