一天、一個 LoRA、90.1%:Bespoke Labs 開源了完整的 Jev 配方
Bespoke Labs 以 Apache 2.0 公開 Nimble-9B 的資料、模型與訓練程式碼——這個一天完成的 Qwen3.5-9B LoRA,在 Jev 自家的評測上僅落後閉源版 3 分;而真正值得學的是對比式資料篩選,不是規模。
當 TypeSafe AI 在 2026 年 9 月 15 日發布 Jev 時,它提出了一個新類別:「System One 模型」——不產生任何文字,只輸出帶型別的決策(選擇、布林值、評分量表),在單次前向傳播中直接對允許的答案 token 計分,快且便宜到可以塞進 agent 迴圈裡。但它沒有公開的是配方:沒有權重、沒有資料、沒有訓練程式碼。
五天後,開源社群替它補上了。Bespoke Labs 以 Apache 2.0 授權發布了 Bespoke-Nimble-9B——而且與多數開源複製品不同,這次發布的不只是一個 checkpoint,而是完整三件套:篩選過的訓練資料、LoRA adapter,以及產出它們的精確配方。README 對工程現實毫不掩飾:「我們一天就做出了 Nimble,請預期一些粗糙之處。」在專案自己的 324 題保留評測集上,這個模型與參考標籤的一致率為 90.12%,而透過 API 呼叫的 Jev 1.13.0 是 93.21%——差距 3.09 個百分點,用一個約 165 MiB 的 adapter 疊在 90 億參數的基底模型上完成。
Nimble 到底是什麼
Nimble 是 Qwen3.5-9B 的 LoRA(低秩適配)微調,不是從零訓練的模型。adapter 很小——約 165 MiB——基底 checkpoint 另外從 Hugging Face 下載。真正有趣的是推理機制:沿用研究員 Niels Rogge 在那篇爆紅文章中拆解 Jev 解碼方式的做法,Nimble 先把 context 與 schema 一次性寫入 KV-cache,然後直接讀取允許答案 token 的 logits。沒有解碼迴圈、沒有需要解析的生成 JSON、沒有思考鏈。候選 token 上的 softmax 就是輸出,還附帶每個答案的機率。
它的使用契約刻意收窄。schema 必須是平的——不能有巢狀欄位——每個欄位只能是列舉(1 到 26 個字串選項)或布林值。超過 2,048 token 的提示會被直接拒絕而不是截斷。它只接受文字輸入(即使基底模型有視覺能力),也不能寫解釋或從 context 擷取文字片段。換來的是到處都能跑:有 PyTorch 的 NVIDIA GPU,或透過 MLX 在 Apple Silicon 的 MacBook 上——ParallelScorer 會把共用 context 處理一次,然後並行評分所有欄位。另有部署在 Modal 上的託管版本與公開 API,想先試再下載的人都有路徑。
延遲方面,專案自己的數據是:H100 上每題中位數 106 毫秒;64 GB 記憶體的 M5 Pro MacBook 上中位數 444 毫秒——完全不需要伺服器。作為對照,同一張表列出 Jev API 的中位數為 246.7 毫秒,而透過 OpenRouter 以傳統方式生成文字的通用前沿模型,每題約 2.8 到 15 秒。
誠實框定的數字
在 324 題保留集——162 對對比樣本、來自六個來源家族——上的比較如下:
| 模型 | 一致率 |
|---|---|
| Gemma 3 270M IT | 28.70% |
| Qwen3.5-0.8B | 45.37% |
| Qwen3.5-4B | 61.42% |
| Qwen3.5-9B(基底) | 66.36% |
| Qwen3.8-27B(未微調) | 84.88% |
| Bespoke-Nimble-9B | 90.12% |
| Jev 1.13.0(API) | 93.21% |
這張表格有兩種解讀,都比頭條數字重要。第一,微調後的 9B 模型贏過未微調的 Qwen3.8-27B 達 5.25 個百分點——那是它三倍大的模型。針對性訓練戰勝了參數量三倍化。第二,Jev 剩下的領先只有 3.09 分,而 Jev 是一套從零打造、訓練管線未公開的系統。這個差距在評測分佈之外是否還站得住,正是 repo 本身無法回答的問題——保留集很窄,只來自六個來源家族,而且所有參考標籤都是合成的。作者對此罕見地坦白:「所有標籤都是合成的:由模型檢查,沒有人工審閱。」他們也另外提供了一份指南,把 Nimble 與 Jev 放在十三個公開、人工標註的基準子集上並行測試,從 VitaminC 開始。
對比式資料篩選:真正值得偷學的部分
這份配方的核心是一套 Bespoke 稱為對比式資料篩選(contrastive data curation)的技術,而它正是基底模型從 66% 跳到 90% 背後的機制。概念是:把訓練樣本做成只差在一個關鍵事實的最小配對——這個改動會翻轉正確答案,而其他一切(包括問題與政策)保持不變。在 repo 的標準範例中,退款只有在唯一授權簽名者具有核准權限時才成立。一個例子裡簽名者是 Mira(有權限):答案為 true。把名字換成 Noah:答案變 false。模型於是精確學到哪些證據應該改變決策,而且因為負樣本是刻意構造而非順手收集的,它被推向校準,而不只是準確。
管線有四個步驟,每一步都有實際約束。先根據 schema 檢查決策規則。再建構配對,最多改動八個字。然後用獨立的模型呼叫驗證兩個例子——關鍵是逐一刪除證據句,確認刪掉後關鍵事實就變得無從判斷,確保沒有其他文字洩漏答案。最後用程式把檢查過的規則套用到檢查過的事實上產生標籤,只有所有檢查通過且兩個標籤不同時才保留該配對。所有模型請求與回應都被保存,整個過程可以離線重播。
以前沿標準來看,這整套努力小到近乎可笑:2,676 個訓練樣本、涵蓋十個主題類別、一個 epoch 的 LoRA(rank 16、學習率 5e-5、有效批次大小 8)——在 L40S 上調參,最終訓練與評測在 H100 上完成。作者特別聲明他們沒有從 Jev 蒸餾;硬標籤由自家管線產生,保存的 Jev 機率僅作為未來軟目標蒸餾的可選實驗材料。
48 小時複製潮的脈絡
Nimble 是 Jev 發布後約 48 小時內出現的至少六個獨立開源實作之一——Latent.Space 的整理還包括 Laya(421M 參數、PPO 訓練,作者早在 2025 年 3 月就把同一核心概念發上了 arXiv)、Jevlike(約 40 KB 的純嵌入實作)、Kev-0.5B(為 MacBook 離線運行而建)、OpenJev 與 DiffusionGemmaJev。資源規模跨越四個數量級,但其中好幾個都宣稱在閉源原版自己的賽場上逼近或追平它。
值得追蹤的訊號不是任何單一分數——上文所有數字都是自行回報——而是複製速度。一家前沿實驗室聽起來很新穎的能力,在兩天內被拆解、重實作、並帶著完整來源公開,至少在 Jev 針對的窄輸出形態上是如此。瓶頸從來不是架構,而是知道這個技巧可行——一旦知道,一支有現成基底模型與資料篩選紀律的團隊,就能補上大部分差距。對開發者來說,實際結論很直接:在為閉源決策模型支付 API 溢價之前,先算算用開源基底加上針對你自己任務分佈的對比配對做一次 LoRA 的成本。經濟學可能讓你吃驚——就算補不上差距,閉源模型也還在原地,而且現在多了一個真正值得超越的基準線。
模型規格、分數與時程反映 2026 年 9 月 20 日為止的 repo 與報導內容;所有評測數字皆為專案自行回報,未經獨立驗證。