← All posts / Tools

在 Agent 出錯之前先測它:Raindrop 募資總額達 5,000 萬美元,推出 Simulations

Raindrop 完成 CRV 領投的 A 輪融資,總資金達 5,000 萬美元。新產品 Simulations 在每個 pull request 上重播真實生產流量,用異常偵測在問題上線前攔截 agent 失效。

在 Agent 出錯之前先測它:Raindrop 募資總額達 5,000 萬美元,推出 Simulations

AI agent 已經悄悄跨過了一條線。它們不再是回答一個問題就停下來——而是可以連續運行數小時、串接數千次工具呼叫,並且經手真實的資金、真實的醫療數據、真實的客戶。當這類軟體失效時,它不會丟出 stack trace 當機給你看,而是有說服力地做錯事,而且大規模地做,直到有人碰巧發現為止。

「壞掉」與「默默地錯」之間的這道鴻溝,就是 Raindrop 的全部生意。這家位於舊金山的新創由 Zubin Koticha、Ben Hylak 與 Alexis Gauba 共同創辦,並在 2026 年 9 月 17 日宣布完成 CRV 領投的 A 輪融資,使總募資額達到 5,000 萬美元。與融資同時,公司還推出了一款名為 Simulations 的新產品——這個組合很能說明 AI 基礎設施市場的下一步走向。

Raindrop 究竟在做什麼

Raindrop 的核心產品是 AI agent 的生產環境監控。它讀取即時的 agent 流量——每一次運行、每一次工具呼叫、每一個決策——並標記出所謂的語義異常(semantic anomalies):幻覺答案、工具誤用,以及每當有人換上新模型或升級 harness 時悄悄出現的行為漂移。一旦出了問題,工程團隊能看到是什麼變了、從何時開始、影響了哪些用戶。

這與「agent 可靠性」賽道上多數公司是刻意不同的賭注。正如 CRV 普通合夥人 Reid Christian 所說:「Raindrop 把 agent 失效當成一個偵測問題來處理,就像一家資安公司那樣。」你不去證明 agent 永遠不會出錯,而是為它裝上儀器、持續監看、快速抓錯——這正是資安團隊面對無法完全驗證的軟體時學會的姿態。

這套做法吸引到了真正的客戶:Vercel、Framer 與 Clay 都是具名用戶,另外還有醫療與物流產業的財富百大企業。Vercel 的 AI 工程師 Bani Singh 說:「如果出現 build 失敗或 agent 卡在迴圈裡之類的問題,我們會直接在 Slack 上看到。」

Simulations:把檢查點搬到 pull request 上

監控是在問題進入生產環境之後才抓到它;本週以研究預覽版形式推出的 Simulations,則是試圖在問題上線之前就攔下來。其原理說起來很直接:把真實的生產流量與團隊現有的測試案例,重播到一個提議中的 agent harness 變更上,然後對結果跑 Raindrop 的異常偵測。它會在每個 pull request 上執行,讓工程師終於能回答公司愛問的那個問題——「我的變更會改變什麼?」

這個賣點直接打向傳統評測。傳統 eval 套件依賴事先寫好的測試案例,換句話說,它們抓到的多半是團隊早就預料到的失效。而真正讓公司在生產環境裡燒起來的,恰恰是沒人寫過測試的那些失效模式。透過重播即時流量而非精心策劃的基準測試,Simulations 的設計目標就是浮現那些意料之外的行為變化——那種只在真實用戶真正會發出的奇怪請求上才會出現的迴歸。

該公司表示,技術上最難的部分在於以「與 harness 無關」的方式做到這件事。你不能只是重播舊 trace 裡快取的工具回應。如果開發者新增了一個全新工具,歷史 trace 裡根本沒有它的紀錄;如果團隊把整個 harness 遷移到新的執行環境,錄下來的世界就對不上了。Raindrop 的答案是模擬 agent 周圍的環境,把每一次錄下的工具呼叫當成一扇小窗——「瑞士起司上的一個洞」——窺見底層世界在那一刻的真實狀態。

前沿實驗室的連結

有兩個細節讓這不只是一則「又一家可觀測性新創」的新聞。

第一是股東名冊。Lightspeed 與 Y Combinator(2025 年 12 月 1,500 萬美元種子輪的既有投資人)都參與了這輪 A 輪——而且 OpenAI、Anthropic 與 Thinking Machines 的首席研究員們也以個人身份投資。當打造前沿 agent 的人們把自有資金投進一家失效偵測公司,這本身就是一個訊號:他們有多擔心這件事。

第二是產品本身的血統。Raindrop 明確把 Simulations 定位為:一般公司頭一次能取得前沿實驗室內部使用的訓練與測試流程。OpenAI 最近發布了關於部署模擬(deployment simulation)的研究——用候選模型對去識別化的生產對話重新生成回應,在發布前預測不當行為的比率;Anthropic 則打造合成世界(synthetic universes)來訓練並壓力測試其 agent。Raindrop 押注這些技術可以產品化、開放給實驗室以外的所有人,而且在擴大早期 access 之前,它已經與財富百大合作夥伴一起手工打磨 Simulations 好一段時間。

為什麼是現在:METR 曲線

這個時機點建立在一條令人不安的趨勢上。Raindrop 引用 METR 的研究指出,agent 能獨立完成的任務長度大約每七個月翻一倍。單一次 agent 運行現在可以持續數天、涉及數千次工具呼叫。每一次翻倍,都讓手寫測試套件成比例地更無力,也讓 silent failure 的爆炸半徑成比例地更大。

資本市場也同意這是個值得重押的類別:groundcover 在七月為 AI 時代的可觀測性募了 1 億美元;Scaled Cognition 六月從 Khosla 拿了 1 億美元做可靠 agent;Harvey 則在本月收購了 Guardrails AI。各家說法的差異在於介入點——而 Raindrop 把籌碼押在兩個格子上:偵測而非設計,pull request 而非事故檢討。Lightspeed 合夥人 Bucky Moore 對終局的警告——不當的 agent 行為將在國防等高風險場景變成災難——正是支撐這筆支出的空頭論述。

Simulations 還在預覽階段,這個賭注尚未蓋棺論定。但方向很清楚:當 agent 承擔愈來愈長、愈來愈高風險、愈來愈少人監督的工作,整個產業的重心正從「把模型變得更聰明」轉向「讓部署變得可證明地撐得住」。Raindrop 的 5,000 萬美元,是押注第二個問題才是更大生意 的最新、也最可信的一注。