← All posts / Industry

一年營收從 2,000 萬美元衝上 3.75 億:Snorkel AI 的 3.5 億美元融資,賭的是「資料就是新前線」

Snorkel AI 以 35 億美元估值完成 3.5 億美元 E 輪融資,年化營收從約 2,000 萬美元暴增至 3.75 億——證明在 RL 時代,稀缺資源不再只有算力,還有專家級資料與訓練環境。

一年營收從 2,000 萬美元衝上 3.75 億:Snorkel AI 的 3.5 億美元融資,賭的是「資料就是新前線」

在 AI 融資多到讓人麻木的這一年,Snorkel AI 的 E 輪融資有一個數字特別醒目:該公司表示,其年化營收本週突破 3.75 億美元,而一年前只有約 2,000 萬美元。這是十二個月內 18 倍的成長,也讓這家斯坦福孵化新創以 35 億美元估值完成 3.5 億美元融資——比起 2025 年 5 月 D 輪後的 13 億美元估值,接近三倍。

這輪於週二宣布的融資由 Insight Partners 與 S32 領投,Third Point、March、Blumberg、Allegis、Standard VC、Frontline,以及既有投資人 Addition、Lightspeed、Greylock、GV、P7、Wells Fargo、Walden Catalyst Ventures 與 Factory 跟投。Reuters 以獨家專訪 CEO Alex Ratner 的形式率先報導。

Snorkel 到底賣什麼

Snorkel 十年前誕生於斯坦福 Christopher Ré 實驗室的一個研究計畫,Ratner 在那裡完成博士學位。它的創業論點很簡單:AI 的進步將日益「以資料為中心」,因此資料開發應該被當成研究與技術問題來對待,而不是人力與群包問題。公司先將這個想法商業化為資料標註軟體,2025 年 9 月再轉型為直接向前線實驗室(frontier labs)、超大規模雲端業者、所謂的「neolabs」、垂直 AI 公司、企業與美國政府機構,販售成品專家資料集與強化學習環境。

市場定價的正是這次轉型。在強化學習時代,前線模型進步的瓶頸不再只是 GPU——而是夠難、連強模型都解不出來的專家級訓練任務與環境。Snorkel 在名為《Data 2.0 and the research era of AI data》的部落格文章中提出:產業已從「Data 1.0」(拚量:爬取、標註、重來)走向「Data 2.0」(拚課綱:少數極度複雜、精準打點的資料與環境,才能讓已是專家級的模型再往前挪)。

程式碼是最清楚的例子。幾年前,有用的程式資料意味著大量原始程式碼供預訓練、加上簡單題目供 SFT 與 RLHF。今天,一個前線級的程式碼資料集或 RL 環境,必須近似資深工程師要花數天到數週才解得掉的問題、在產品級產出上捕捉細微的目標與獎勵訊號、像校準過的課綱一樣針對特定模型錯誤模式、抵抗模型駭獎勵(reward hacking)的企圖,而且往往要通過數百項品質檢查才算可用。純靠人力時數,供應不了這種規模。

RSI 引擎,以及人類為何必須留在迴圈裡

整份公告在概念上最有趣的部分,是 Ratner 所稱的「資料的 RSI 引擎」——一個遞迴自我改進迴圈:專門化的 AI 模型加速人類專家的產出,而規模化的人類監督又回頭持續評估並改進這些模型。Snorkel 內部的 Agentic Data Platform 就是圍繞這個迴圈打造的。公司分享了具體數字:在建構程式 agent 環境時,它用數百個專門化 QC agent 搭配人類專家審查,聲稱讓品管效率提升超過 50%、審查準確率比「人類+現成 LLM」基線高出 15 個百分點以上;規模化的人類回饋再作為弱監督,目前比非專門化的前線模型基線準確率高出一倍。

堅持人類在迴圈(humans-in-the-loop)不只是行銷話術。Ratner 的論證有兩層。機制上,純合成資料與模型已經知道的東西高度相關——學不到它還不會的事——(蒸餾除外)在上面訓練等於邀請模式塌縮(mode collapse)。規範上,資料是我們衡量與對齊 AI 的方式;完全沒有人類參與的資料開發,「等同於徹底放棄人類監督與對齊」。

開放基準作為戰略

Snorkel 同時宣布擴大 Open Benchmarks Grants 計畫,資助開放、獨立的基準。它已支持 Terminal Bench、OSWorld 2.0 與 Agents’ Last Exam——正是如今前線實驗室激烈爭搶的那些排行榜。對「benchmaxxing」(刷榜)與古德哈特定律,該公司的答案不是更少基準,而是更多:一個由強健、獨立打造、公開與私有並存的基準構成的多元生態,且多數公開基準應以開放方式開發。

這讓 Snorkel 站上了評測公信力之爭的正中央。就在這個月,包括 OpenAI Astra 分數爭議在內的基準修改風波,讓「發布後改分數」的做法受到嚴格檢視。一家以打造基準級資料為業的廠商,顯然希望評測生態被信任,也顯然在獨立性上有不容砸掉的信譽籌碼。

為什麼重要

這輪融資是迄今最清楚的市場訊號:「資料與環境」已自成 AI 技術堆疊中的一層,而且有定價權。Snorkel 是 OpenAI 官方列名的合作夥伴,客戶名單讀起來像整個產業的組織圖——前線實驗室、超大規模雲端業者與美國政府。它的營收軌跡(一年內從約 2,000 萬美元到 3.75 億美元)顯示,前線實驗室花在專家資料上的錢,規模已經可比當年為聊天機器人做標註,但任務複雜度與單價都是專家級。

疑問當然存在。以約 3.75 億美元年化營收支撐 35 億美元估值,本營收比約 9.3 倍——對服務成分偏重的業務而言相當激進,只有在使用者長期續約、且 RSI 迴圈真如宣稱般複利疊加時才站得住腳。而合成資料是否必然導致模式塌縮,學界也尚未定論;若純合成管線持續進步,人類在迴圈的溢價就會縮水。但至少此刻,市場已經對「前線的稀缺性在哪」給出裁決:一部分就藏在教會模型「它還不會的事」的資料集與環境裡。