← All posts / Tools

每個 PR 都要過的撞擊測試:Raindrop 募得 5,000 萬美元,要讓 AI Agent 不再在線上出包

獲 CRV 領投、OpenAI 與 Anthropic 研究員個人參投的 Raindrop 推出 Simulations,在每次 agent 變更上線前,用真實生產流量重播測試。

每個 PR 都要過的撞擊測試:Raindrop 募得 5,000 萬美元,要讓 AI Agent 不再在線上出包

AI agent 悄悄出現了一種傳統軟體從未有過的失敗模式:它們會以極具說服力的方式做錯事,而且是大規模地做,直到有人碰巧發現為止。沒有 stack trace,沒有 500 錯誤。Agent 只是用滿滿的自信給出一個錯誤答案——幻覺出來的事實、誤用的工具、模型升級帶來的微妙行為漂移——然後繼續跑下去。2026 年 9 月 17 日,舊金山新創 Raindrop 宣布總募資達到 5,000 萬美元,並推出一款專為這個問題打造的產品,而這輪投資人的名單,簡直是「agent 可靠性」這個命題的重量級背書。

官方宣布了什麼

Raindrop 完成了由 CRV 領投的 A 輪募資,總募資額來到 5,000 萬美元。本輪的確切金額並未公開,但股東名單說明了一切:2025 年 12 月種子輪就進場的 Lightspeed Venture Partners 與 Y Combinator 繼續加碼,Figma Ventures 與 Vercel Ventures 也參與其中。最值得注意的是,OpenAI、Anthropic 與 Thinking Machines 的資深研究員以個人名義投資。當打造前沿模型的人用自己的錢投一家失敗偵測新創,這個訊號值得解讀。

與募資同時,Raindrop 推出了 Simulations,目前處於 research preview(早期存取正在擴大,官方承諾「未來一個月內」全面開放)。公司也確認了客戶名單,包括 Vercel、Framer、Clay,以及醫療與物流領域多家未具名的財富 100 大企業。

產品核心:看見你的變更將會改變什麼

Raindrop 現有的平台是 agent 的生產環境監控系統。它讀取線上 agent 的完整軌跡——每一次執行、每一次工具呼叫、每一個決策——然後標記出公司所謂的語意異常(semantic anomalies):幻覺答案、不當的工具使用、卡在迴圈裡的 agent,以及團隊升級底層模型後出現的行為變化。問題會在使用者抱怨之前就出現在 trace 裡,工程團隊能看到什麼變了、從何時開始、影響了哪些用戶。

Simulations 則把這套邏輯往上游延伸,推到變更上線之前。產品在每一個 pull request 上執行,回答一個傳統評測無法回答的問題:這個變更實際上會改變什麼?

機制講起來很簡單:Simulations 會把真實的生產流量與團隊現有的測試案例,重播到 agent harness 的提議變更上,然後對結果套用 Raindrop 的異常偵測。團隊一方面能用自己預期到的測試案例衡量效能,另一方面也能偵測到預期之外的行為變化——那些沒有人寫過測試的問題。

困難之處,正如公司自己解釋的,在於要做到 harness 無關(harness-agnostic)。你不能只是重播網路呼叫或舊 trace 裡快取的工具回應。如果開發者新增了一個全新工具,歷史 trace 裡根本沒有它的紀錄。如果團隊把整個 harness 遷移到新的執行環境,舊的重播就毫無用處。Raindrop 的答案是:真正模擬 agent 周圍的整個世界。團隊的心智模型是瑞士起司:每一個被記錄下來的工具呼叫,都是一個洞,讓你看見底層世界的真實狀態,而這些洞就成了重建合理測試環境的原料。

為什麼是現在:Agent 變長了,失敗也變貴了

兩個數字解釋了這一切有多急迫。METR 的研究顯示,自 2019 年以來,前沿 AI agent 能以 50% 可靠度自主完成任務的長度,大約每七個月翻一倍。而在今天的生產環境中,單一 agent 執行可以持續數天、涉及數千次工具呼叫。

「Agent 現在一跑就是幾個小時、呼叫數千個工具、處理真正的錢、真正的健康資料和真正的客戶,」Raindrop 執行長 Zubin Koticha 說。「當 agent 失敗時,它是以極具說服力的方式、大規模地做錯事,直到有人碰巧注意到。」

執行時間越長,單一錯誤決策的爆炸半徑就越大。一個在 4,000 步執行中第 40 步就開始迴圈、幻覺或誤用工具的 agent,不只是給出錯誤答案——它可能一路上已經在真實系統裡採取了真實行動。領投種子輪的 Lightspeed 合夥人 Bucky Moore 講得直接:隨 agent 部署進國防、醫療與金融服務,壞行為不再只是不便,而是責任。

還有一個 Raindrop 大方承認的情報戰角度。公司聲稱 Simulations 是前沿實驗室以外的一般公司,第一次能接觸到這些實驗室內部使用的訓練與測試流程。OpenAI 最近發表了部署模擬(deployment simulation)研究——用候選模型重新生成去識別化的生產對話回應,在發布前預測不當行為率。Anthropic 則打造合成宇宙(synthetic universes)來訓練與壓力測試它的 agent。Raindrop 等於是把這套方法論產品化,賣給所有人。

創辦團隊

Raindrop 由 Zubin Koticha(CEO)、Ben Hylak(CTO)與 Alexis Gauba(COO)共同創辦。Koticha 與 Gauba 先前共同創辦密碼學新創 Apache(安全計算、ZEXE),Hylak 則在 Apple 打造過自主智慧 agent,之後待過一家 ML 觀測公司。這家九人規模的舊金山團隊,帶著與問題高度對症的傷疤:在 Robinhood 打造詐欺 transformer 模型的工程師、開創 Pinterest 推薦系統的人、在 Square 做惡意異常偵測的人,以及來自 Segment、Semgrep 與 Socket.dev 的資安工程師。

這個背景直接反映在 Raindrop 對品類的定位上。「Agent 與傳統軟體有根本上的不同。它們能力強、自主、且非確定性,」CRV 普通合夥人 Reid Christian 說。「Raindrop 把 agent 失敗當成一個偵測問題來處理,就像一家資安公司那樣。」這是把入侵偵測的劇本套用到你自己的軟體上——假設失敗必然發生且難以察覺,然後建出抓住它的感測器網格。

客戶的說法也印證了這個定位。「如果我們遇到建置失敗或 agent 卡在迴圈裡這類問題,我們會在 Slack 上看到,」Vercel 的 AI 工程師 Bani Singh 說。

擁擠的賽道,獨特的賭注

嗅到機會的不只 Raindrop。groundcover 七月募了 1 億美元做 AI 時代的可觀測性;Scaled Cognition 六月從 Khosla Ventures 拿了 1 億美元做可靠 agent;Harvey 本月稍早收購了 Guardrails AI。各家 pitch 的差異在於介入點:設計時的護欄、執行時的監控,還是部署前的測試。

Raindrop 的賭注有兩層。第一,agent 可靠性終究是偵測問題而非設計問題——你無法用規格窮舉擺脫非確定性。第二,槓桿最高的介入點是 pull request:人類的手還在鍵盤上、壞變更回滾成本為零的那一刻。如果 agent 未來要一跑數天,整個產業最後一個便宜的檢查點就是 PR——而 Simulations 想成為在那裡執行的撞擊測試。

這個賭注尚未定局。Simulations 還在 research preview,是與財富 100 大夥伴手工打造出來的,全面開放還要一個月。但隨著 agent 任務視野每七個月翻一倍,「agent 做了件怪事」與「agent 釀成災難」之間的窗口正在快速關閉——而抓住它的市場,也隨之升溫。

Raindrop 表示正在全面徵才,重點放在 go-to-market 與 ML 工程。