← All posts / Tools

一個迴圈走天下:CoreWeave Forge 讓生產環境的運行直接餵養下一代模型

CoreWeave 全新開發層 Forge 把運行、觀測、篩選、改進與評估整合進單一開放環境,搭配編碼代理 ARIA,以及速度快 1.4 倍、成本降 40% 的無伺服器 RL 訓練。

一個迴圈走天下:CoreWeave Forge 讓生產環境的運行直接餵養下一代模型

當代 AI 產業最昂貴的浪費,不是 GPU 時數,而是訊號。每一天,上線運行的代理系統都產生數以百萬計的軌跡(traces),精確揭露系統在哪裡失敗;也是每一天,這些軌跡蒸發在沒有任何訓練管線會去讀的觀測儀表板裡。CoreWeave 認為它找到了阻止這種浪費的方法,而且圍繞這個想法打造了一整層產品。

2026 年 9 月 30 日,CoreWeave(Nasdaq: CRWV)在舊金山舉行的 Fully Connected 大會上發布 CoreWeave Forge——一個開發層(development layer),在單一互聯環境中運行完整的 AI 改進迴圈:運行、觀測、篩選、改進、評估,然後重來。其核心訴求簡單得近乎樸素:企業從 AI 生產運行中學到的東西,應該直接回流到工程師改進下一個版本的過程裡。MasterClass 與 Canva 已經在 Forge 上進行開發。

碎片化問題

2026 年的模型與代理開發,像是一場每次交棒都掉棒的接力賽。訓練運行住在一家的實驗追蹤器裡,評估住在另一家,代理軌跡住在第三家的觀測系統。它們天生互不相通,於是生產軌跡永遠餵不進下一次訓練,做完的實驗永遠啟發不了下一輪評估,每一次工具交接都在漏失訊號或燃燒工程師的時間。

Forge 就是 CoreWeave 的答案:把 Weights & Biases Models、來自 OpenPipe 的後訓練(post-training)專業能力,以及開源筆記本專案 marimo,與 CoreWeave 自家的服務整併成一個為持續改進而生的單一環境。這三塊拼圖都是 CoreWeave 在 2026 年稍早收購或吸收而來,而 Forge 正是這些收購從「資產組合」扣合成「連貫產品」的那一刻。

值得留意的是,CoreWeave 把「開放」喊得跟「整合」一樣響。Forge 對團隊已在使用 的模型、框架與其他雲端保持開放——這是對超大型雲端業者的一次直接出拳,後者的工具鏈總是悄悄假設你會永遠留在自家圍牆內。「這個市場裡,每一個平台決策都在權衡:為了一條互聯工具鏈,團隊願意放棄多少選擇權,」Futurum Group AI 平台業務副總裁 Nick Patience 說,「CoreWeave Forge 的立論前提,就是團隊根本不該做這種取捨。」

實際出貨的東西

Forge 隨多項全新與正式可用(GA)的能力一同推出,橫跨整個迴圈:

  • CoreWeave ARIA(GA)——編碼代理,自動分析大規模實驗資料與代理觀測資料,找出驅動變化的因素,並提出下一個值得跑的實驗,附上支撐證據。
  • Weights & Biases Models——可靠且高效地追蹤與比較數萬個實驗、數百萬項指標,以進階視覺化與自動化工作流加速模型開發。
  • CoreWeave Notebooks——以 marimo 為基礎的開發體驗,直接住在運行環境裡,原型可以一路直通訓練、評估與生產,「而不是死在重寫的路上」。
  • Agent Lens——針對生產代理的智慧觀測與持續改進工具,分析數千萬條軌跡並自動轉化為經過驗證的修復。CoreWeave 稱,對比通用前沿 LLM 的基準測試,它能多偵測 20% 的關鍵故障,修復成本僅為十分之一。
  • Sandboxes(GA)——每一次運行都有全新、隔離的環境,無論是代理工具呼叫、強化學習(RL)或模型評估,且已預先接上迴圈其餘部分。
  • Registry——每個模型檢查點(checkpoint)與代理組態都以開放、可攜的格式版本化,譜系清晰,下一次嘗試可以從團隊歷史上任何一點、在任何技術棧上開始。
  • Post-Training——無伺服器 RL、無伺服器監督式微調與模型蒸餾,讓改進深入到權重層級。CoreWeave 表示其無伺服器 RL 比自管環境訓練快 1.4 倍、成本低 40%。
  • Inference——提供最新開放權重模型的遊樂場與推論部署;Dedicated Inference 並新增預覽功能 RL Rollouts,可將檢查點熱載入(hot-load)線上部署,訓練迴圈不必重新部署即可持續運行。

RL Rollouts 這個細節值得停下來看。把檢查點熱交換進線上推論,是一種不性感卻悄悄改變團隊工作方式的基礎設施技巧:傳統「訓練—凍結—重新部署」的循環會扼殺迭代動能,而熱載入讓改進接近連續。搭配 Registry 的版本化譜系,團隊可以讓新微調的檢查點與線上版本對打 A/B 測試,不必另建平行基礎設施。

雲端公司為何要做開發工具

這背後的策略邏輯值得一說。CoreWeave 的主業是出租 AI 算力,而這門生意正被兩面夾擊——一邊是超大雲,另一邊是遍地開花的新創雲端(neoclouds)。裸 GPU 容量已不再是差異化所在,其上的軟體層日益關鍵。CoreWeave 一整年都在講這個故事:屢破紀錄的 MLPerf 推論與訓練成績,以及唯一連續三次獲得 SemiAnalysis ClusterMAX 最高 Platinum 評級的 AI 雲。

Forge 把這套邏輯從基礎設施延伸到工作流。如果改進迴圈住在 CoreWeave 上——實驗、軌跡、檢查點、評估,以及消費這一切 的後訓練任務都在同一個地方——那麼這些任務跑的算力就會無比黏著。在 Forge 裡把生產軌跡篩選成訓練資料的團隊,離開的成本會與日俱增;不是因為鎖死 的檔案格式(Registry 明確標榜開放與可攜),而是因為工作流本身會隨時間複利增值。

市場時機的論點也成立。「隨著愈來愈多人用 AI 建構,他們把模型放進自己的資料與工作流裡,」CoreWeave 產品與工程資深副總裁 Chen Goldberg 說,「模型能力與系統表現之間的落差,正是在這裡顯現。」前沿模型競賽搶佔頭條,但 2026 年 AI 支出的大宗,正流向 Forge 所瞄準的那一層:把開放權重與前沿模型調適到專有資料的團隊,而且苦苦掙扎於「版本 N+1 在真實運行條件下是否真的比版本 N 好」這個問題。

但書與未解之問

Forge 提供 Free、Pro 與 Enterprise 三個版本,Pro 有 30 天免費試用,讓團隊「不必走採購流程就能開始」。Free 版針對個人開發;之後的定價隨迴圈用量規模而變。

值得審視的是那些基準數據:Agent Lens 的「多偵測 20% 關鍵故障、修復成本十分之一」,以及無伺服器 RL 的「快 1.4 倍、省 40%」。這些都是 CoreWeave 自行挑選基線(分別是「通用前沿 LLM」與「自管環境」)的自陳數據,該公司尚未完整公布基準方法論。買家在把它們當成規劃依據前,應該先要求重現結果。

競爭對手的反應是接下來的看點。在被 CoreWeave 收購之前,Weights & Biases 是獨立的實驗追蹤標準;如今它的對手們——以及被 Agent Lens 直接搶生意的觀測廠商——面對的是一個由雲端競爭者擁有的昔日中立平台。可以預期「你的工具供應商不該同時是你的雲端供應商」這句推銷詞,很快就會出現在某家競爭對手的簡報裡。

無可爭辯的是方向。把模型開發與模型維運視為兩個獨立學科的時代正在結束,而下一階段 AI 基礎設施的贏家,將是能把「模型在生產中做了什麼」與「後繼者從中學到什麼」閉合成迴圈的公司。Forge 是迄今最完整的嘗試之一——它也宣告 CoreWeave 打算在軟體上一較高下,而不只是比誰的叢集更大。