38 毫秒做出決策:Cloudflare 開源首款自研 AI 模型 Clef
Cloudflare 首批自行訓練的模型 Clef 與 Clef-flash 是與 Jev 相容的決策模型,具備視覺能力、64K 上下文視窗,中位數延遲最低僅 38.8 毫秒——以 Apache 2.0 授權開源,並同步推出 RL 微調服務。
多年來,Cloudflare 在邊緣節點出租 GPU、在 Workers AI 上代管別人的模型。2026 年 10 月 1 日,在生日週(Birthday Week)活動中,該公司跨過了一道從未跨過的門檻:發布了自己訓練的模型。Clef 與 Clef-flash 是「決策模型」(decision models)——一個快速崛起的 AI 類別,它不寫文章、不逐步推理、不串流輸出 token。你給它一個狀態和一組型別化問題,它就回傳可以直接行動的校準機率。兩者皆以 Apache 2.0 開放權重、已上架 Workers AI,而較小的那款回應中位數延遲只有 38.8 毫秒。
這次發布讓 Cloudflare 正面迎戰 Typesafe 的 Jev——自問世以來持續佔據產業目光的決策模型。Cloudflare 選擇在這個類別最關鍵的兩個軸線上開戰:延遲與開放性。
決策模型到底是什麼
這個類別背後的核心洞見是:代理人(agent)用 LLM 做的事,大部分不是生成,而是判斷。這張工單該不該升級?這個請求緊急嗎?該派給哪個團隊?今天,團隊為了這些判斷動用前沿模型、解析自由文字輸出、忍受不確定性,還得等推理 token 串流完畢。決策模型把合約反過來:它讀取輸入狀態加上最多 64 個型別化問題,為每個允許的答案回傳機率。沒有文字要解析,也沒有東西要等。
Clef 支援三種問題型別。noul 是是非題,回傳答案為「是」的機率。choice 從你定義的選項中挑一個,回傳選擇結果、每個選項的機率,以及信心值。score 依有序評分表打分,回傳機率加權分數。關鍵的是,Clef 遵循與 Jev 相同的 System One API,現有的 Jev 整合只要改掉 endpoint 和模型名稱就能換過來——一條刻意鋪得毫無摩擦的遷移路徑。
這個名字是 Cloudflare 的工程師幽默,背後卻有真正的邏輯:在音樂裡,譜號(clef)為其後的線與間賦予意義;決策模型之於代理人的後續行動,作用正如譜號。而「CF」自然是在向 Cloudflare 致意。
數字會說話
對上 Jev,延遲的對比相當直接。在 43 次基準測試中,Clef 的中位數為 209.3 毫秒——比 Jev 的 524.1 毫秒快 2.5 倍——而 9B 的 Clef-flash 中位數僅 38.8 毫秒,約快 13 倍。在 p95 尾端延遲上,三者分別為 238.6、122.4 與 536.0 毫秒。由於模型架在 Workers AI 上,推論跑在 Cloudflare 網路內、離使用者很近的 GPU 上,網路往返時間因此很短。這樣的組合,讓「把模型決策直接放進請求的熱路徑」變得可行——擋下請求、派送工單、或轉給真人,只在真正需要時才交給完整的 LLM。
在品質面,Cloudflare 宣稱拿下 Jev Decision Index 的領先地位:在 10 項決策基準中,Clef 系列模型在 7 項拿下最高分。BFCL(case exact)方面,Clef 得 98.47、Clef-flash 得 98.76,Jev 為 95.75。BANKING77 macro-F1 是 94.20 對 79.74。家電分類更是懸殊——Clef-flash 的 97.73 對 Jev 的 52.27。輸的地方也誠實列出:Jev 在 When2Call 準確率上仍領先(80.97 對 72.37),BRIGHT 檢索亦然;而 DiffusionGemma Jev 在 PhishNChips 釣魚偵測仍以 85.35 居冠。在 Typesafe 自家的工作流程評測中,Clef 在 4 個領域贏了 3 個——發票處理、客服、資安事件——Jev 則保住代理人軌跡可觀測性一項。
兩個結構性優勢進一步放大了這些分數。Clef 的上下文視窗為 64K token,是 Jev 32K 的兩倍,能裝進更多待分類的狀態。而且 Clef 有視覺編碼器,可連同文字一起傳入最多四張圖片——這是今天任何純文字決策模型(包括 Jev)都做不到的事。螢幕截圖、商品照片或 UI 狀態的視覺分類,從此變成一次呼叫就能完成的操作。
Cloudflare 自家的威脅情資團隊已經在接近量產的工作流程中運行這個模型:搭配 Browser Run,Clef 用 2.2 秒完成一個網域的抓取、渲染與分類,而同一條流程中的 gpt-oss-120b 要 4.7 秒——而且 Clef 回傳的是依機率排序的豐富類別標籤,不是兩個分類結果。
訓練方式
技術背景是這次發布更有意思的部分之一。Jev 推出當週,Cloudflare 就已公開展示如何在擴散語言模型上建立確定性機率輸出的實驗——這些工作建立在 Matt Mastracci 的獨立研究與上游 vLLM 貢獻之上。Clef 保留了概念,但換掉地基:凍結的 Qwen 骨幹,Clef 用 Qwen3.8-27B,Clef-flash 用 Qwen3.5-9B。
推論設計是速度的關鍵。Clef 對 Qwen 只跑 prefill 階段,然後平行評分所有有效的 schema 選項。決策步驟是非自回歸的——沒有逐 token 生成的中繼文字,因為答案直接透過兩階段注意力路由機制從骨幹內部表徵導出:每個有效選項提取與提示相關的上下文,各欄位參數在評分前與其他欄位、以及原始 payload 交叉注意力。訓練時凍結骨幹,將路由頭與 rank-256 低秩適配器(LoRA)聯合最佳化,對有效 schema 輸出使用標籤平滑交叉熵,搭配 Brier loss 來精煉機率校準,訓練資料是內部合成資料集,對欄位順序、提示與 schema 結構做排列組合。第二個最佳化目標——「校準決策強化學習」(RLCD)——對相鄰的有序選項給部分功勞、獎勵完全精準的紀錄輸出,並施加參考懲罰以防止分布漂移。
伴隨模型一同登場的,是一項 RL 微調服務:先由前進部署工程師(FDE)團隊提供客製微調,之後再發展為自助式平台,讓客戶在 Cloudflare 上擷取資料、微調並重新部署模型。該公司明言,它十五年以上的網路資料——機器人分類、客服派送、信任與安全標籤——正是它打算用來打造領域特化版本的護城河。代管定價在這個類別中相當有攻擊性:據報導約為 Clef 每百萬輸入 token 0.24 美元、Clef-flash 0.09 美元,並向企業承諾 Cloudflare 不會讀取、儲存或拿請求來訓練。
為什麼重要
決策模型這個類別,正在填補 AI 技術堆疊的中層:前沿 LLM 負責推理與生成,極小而校準良好的分類器負責中間數以百萬計的判斷呼叫。Cloudflare 為這幅圖像補上的是邊緣。來自實體靠近使用者的 GPU、38.8 毫秒中位數的決策,改變了「哪些判斷值得自動化」——過去對 LLM 往返延遲太敏感的防護欄檢查與路由呼叫,現在塞得進請求路徑裡。
而 Apache 2.0 的開源,改變了 Typesafe 面臨的競爭算式。Jev 的氣勢是真實的,但一個在多數基準上更快、開放到可自行架設、背靠全球最大邊緣 GPU 機群之一、還附帶微調服務的即插即用替代品,正是會重塑年輕市場的商品化壓力。對開發者來說,結論更簡單:在代理人裡加入快速、校準良好的判斷,成本又降了一截——降到約十分之一秒,以及每百萬 token 約一毛美金。