← All posts / Tools

24 小時內拿下 13% 付費團隊:Jev 成為 Vercel 閘道史上被採用最快的模型

TypeSafe 的 System One 決策模型上架一天就觸及 Vercel 近 13% 的付費團隊——是 GPT-5.6 系列的 2 倍、Fable 5.1 的 6 倍以上,Cloudflare、LangChain 與 Langfuse 火速跟進整合。

24 小時內拿下 13% 付費團隊:Jev 成為 Vercel 閘道史上被採用最快的模型

一位前 OpenAI 研究員低調推出了一個連一個字都不肯寫的模型,五天後,這個模型打破了採用紀錄。Vercel 在 9 月 18 日發布數據:TypeSafe AI 的「System One」決策模型 Jev,成為該公司 AI Gateway 史上被採用最快的模型——上架 24 小時內,已有近 13% 的付費團隊在呼叫它,是該平台上任何先前新模型上市表現的兩倍以上。

數字相當驚人。Jev 在上架頭 12 小時內就超越了所有對比模型,並在當天剩餘時間持續拉開差距,18 小時內觸及十分之一的團隊。相較之下,Gateway 上其他近期上市的新模型,一整天結束後採用率都停在 7% 以下。拿熟悉的名字來比:Jev 的首日滲透率約為 GPT-5.6 系列的 2 倍、Anthropic Fable 5.1 的 6 倍以上。

Jev 到底是什麼

Jev 於 9 月 15 日發表,它不是聊天機器人,也不是縮小版的 LLM。它是一個機率式決策模型:應用程式傳給它一塊程式狀態加上一組帶型別的問題,Jev 回傳結構化答案——最多 255 個選項中擇一的 Choice、有序量表上的 Score,或是回傳 yes-no 機率的 Noul——每個答案都附帶校正過的信心度。同一請求裡的所有問題是並行評估的,不是逐一 token 生成。

TypeSafe 用它稱為「校正決策強化學習」(Reinforcement Learning for Calibrated Decisions, RLCD)的方法訓練,讓宣稱的信心度貼合實際準確率:程式可以在信心度高於門檻時自動執行,低於門檻時轉交人類。Schema 匹配由構造保證——在四個工具之間做選擇的 agent,不可能憑空發明第五個。因為模型從不生成自由形式的字串,它無法以語言模型的方式產生幻覺。

定價是另一個頭條:每百萬輸入 token 收 0.042 美元,輸出 token 免费——用該公司的話說是「便宜到不值得計量」。相較之下,前沿 LLM 的輸入單價為每百萬 0.20 至 10 美元,輸出通常又比輸入貴好幾倍。端對端延遲落在 70–500ms,而前沿模型是 3 到 329 秒。

為什麼採用速度這麼快

Vercel 的官方部落格把原因歸給專業化:一個專為技術棧中單一位置——決策層——打造的模型,幾乎立刻就能在生產環境找到自己的位置。用途一目了然:替 agent 選擇下一個工具或子代理、決定工作流程要繼續、重試、詢問使用者還是停止、在執行動作前為急迫性或風險評分,以及在任何自主行為跑之前驗證模型輸出、把關護欄。

周邊生態系在幾天內就跟上了。Vercel 於 9 月 16 日將 Jev 加入 AI Gateway,並列出工具選擇、下一步行動抉擇、風險檢查與輸出驗證等目標用途。Cloudflare 在其 AI 文件中將它列為 typesafe/jev,可直接用普通的 REST POST 呼叫、沿用 Workers AI 的 token。LangChain 推出了 TypeSafeClassifier 整合,Langfuse 也發布了用它做評估評分的指南。

TypeSafe 自己的工作流評測——涵蓋資安警報、agent 審查、發票處理與客服——顯示 Jev 與 GPT-6 Astra 和 Claude Fable 5.1 平均答案的一致率為 67.8%,與 GPT-5.6 Terra、Claude Sonnet 5 打平,但每案例成本僅 0.0004 美元、耗時 0.4 秒。Sonnet 5 達到相同分數需要 78.1 秒,每案例成本是 294 倍。該公司宣稱的 193.6 倍速度與 444.6 倍成本高峰值,位於實際增益的較高端——這項但書由公司自己公布,並坦承參考標籤來自其他模型的答案而非地面真值(ground truth)。

獨立案例也往同一個方向堆疊。Every 的 Mike Taylor 對 37 份文件跑 21 項寫作檢查,0.7 秒內拿回 777 個判斷,花費約 25 美分。一位開發者把自家引擎擱置待人工審查的 9,081 組商品配對丟給 Jev,13 分鐘、32 美分清完整批佇列——這個階段他在 6 月時因前沿模型輸出定價太貴而整個放棄過。

名字背後的 Jevons 賭注

這個名字不是取錯的。TypeSafe 以經濟學家 William Stanley Jevons 為模型命名——Jevons 觀察到煤變便宜反而增加了煤的消耗。該公司預期智慧遵循同一條曲線:決策成本每下降一個數量級,就解鎖數量級成長的新用途。那個 32 美分的審查佇列,就是這個效應的縮影——在每百萬輸出 token 15 美元時不存在的的工作,在零元時誕生了。

DCVC 領投了 4,000 萬美元的種子輪,押注創辦人 Diogo Almeida——他在 OpenAI 參與打造了 ChatGPT 背後的指令遵循研究,之後與共同創辦人 Erik Gafni、Sasha Sheng 隱身兩年。買家輪廓很說明問題:像 1 月以 45 億美元估值募資 2.5 億美元的 Decagon 這類 agent 廠商,其客服 agent 的每一步路由、評分與升級,目前都是語言模型呼叫。把這些步驟搬到輸出免費的模型上,整個 agent 產業的毛利同時擴張——而擁有決策層的實驗室,就坐在所有人之下的位置。

值得保留的但書

一個問世五天、評測由廠商自跑的模型值得懷疑,而 TypeSafe 大致上也同意:它在自家宣告下方公布但書,承認工作流評測由自家能力團隊建構、並排演示的輸入對模型有利。比較中 LLM 的數字來自 OpenRouter,而 OpenRouter 可能將較難的查詢路由給較強的模型。輸出免費的定價能否長期維持,定義上就還無法證明——只有時間能檢驗。

競爭前沿也已經出現:Jev 發表後數天內,Laya 這類開放權重的「System 1」決策模型問世,宣稱 33ms 延遲、更高分數且完全不需 API 費用。如果決策與文字真的分化成不同的模型類別——這正是 Vercel 採用曲線現在檢驗的賭注——agent 技術棧的決策層,即將成為另一個競爭極度激烈的市場。

Vercel 自己的措辭很節制:下一個考驗是早期採用能否延續。但紀錄就是紀錄,而它是由一個徹底放棄了文字的模型創下的。