← All posts / Models

16,379 次探測之後:獨立審計撕下 Jev 的「前沿」標籤

一份針對 TypeSafe AI 決策模型 Jev 的黑箱審計,跑完 16,379 次基準測試請求與 3,331 次後續探測,結論是它根本不是前沿模型——而是一個約 40 至 90 億活躍參數的小型評分器,97.9% 的 ARC-Challenge 分數來自一場早已結束的競賽。

16,379 次探測之後:獨立審計撕下 Jev 的「前沿」標籤

Jev 是 TypeSafe AI 推出的「System One」決策模型,自 9 月 15 日上線以來,官方行銷話術始終強硬:一個不會產生幻覺的前沿級推理器,速度極快、價格極低,由 ChatGPT 的共同發明者打造。本週發布的一份獨立黑箱審計,對這個模型跑完了 16,379 次基準測試請求外加 3,331 次後續探測,結論直接擊中其中一個宣稱:以 2026 年底的任何標準衡量,Jev 都不是前沿模型。它是更小、更謙遜的東西——而審計者同時強調,它其實是一個真正實用的模型,只是行銷話術把這一點給遮住了。

審計做了什麼

Jev Research 團隊從頭到尾沒有接觸過權重、梯度或服務端內部實作。所有測量都透過公開 API 進行:答案、機率向量、token 計數、延遲響應頭,以及帳單用量。測試規模相當可觀——12,032 道 MMLU-Pro 題目、1,172 道 ARC-Challenge 題目、196 道 GPQA Diamond 題目、494 道 Humanity’s Last Exam 選擇題、可編碼的 MATH-500 子集,以及以兩種方式重新編碼的 167 個 ARC-AGI-2 網格題。

這個規模很重要。更早之前已有小型探測流出——最著名的是 Archer Hume 的《Jev’s Architecture Unmasked》,那是一份基於上萬次 API 呼叫、約 28 頁的分析,於 9 月下旬發布。新審計將自己定位為該工作的「簡短反方意見」,但在幾個方向上走得更遠:它探測了機率格點的結構、逐文字系統測量了分詞器行為,跑了六種語言的推理測試,而且——關鍵的一步——估算了模型尺寸。

逐條檢驗官方宣稱

「不會產生幻覺。」 技術上站得住腳、狹義上為真、以買家聽到的方式理解則是誤導。Jev 無法輸出自由文字——它只能從呼叫方提供的選項中挑選作答,所以根本沒有可以捏造的散文。但一份「符合合約格式」的答案並不等於正確答案。審計發現 Jev 經常答錯,而且每一個錯誤答案都以漂亮的格式送達。一個不會寫文章的模型,並沒有解決幻覺問題;它只是改變了幻覺的形狀。

「又快又便宜。」 兩者皆真——但原因在於架構,而非前沿經濟學。時間數據支持的主流解釋是:只做 prefill 的評分流程,沒有自回歸解碼。每道題目和每個選項都在單次前向傳播中完成評分,實測延遲下限為 73 毫秒,每 1,000 token 再加 6.1 毫秒,在 29k token 之前呈線性成長。這種任務形態天生就快、就便宜;速度是設計的產物,不是前沿工程實力的證明。

「前沿級效能。」 這一條完全站不住腳。在一次性作答的知識型選擇題上,Jev 落在 2025 年代小型指令模型的區間:MMLU-Pro 82.7%、GPQA Diamond 76.5%——剛好被 Qwen 3.5 9B(82.5/77.6)與未開思考模式的 Claude 3.7 Sonnet(80.7/76.8)夾在中間。凡是多步驟任務就斷崖式下跌:HLE 選擇題子集只有 21.9%,ARC-AGI-2 上完全解出的網格為零。97.9% 的 ARC-Challenge 頭條分數是真的,但它來自一個早在多年前就已飽和的基準——一場在 2026 年開始前就結束了的競賽。審計指出,Jev 看起來像前沿的地方,都是它在參加已經落幕的比賽。

「由 ChatGPT 共同發明者打造。」 Diogo Almeida 是 InstructGPT 八位主要作者之一,也是 ChatGPT 首次發布時致謝的 88 人之一。審計認為這值得肯定——但「我共同發明了 ChatGPT」這種說法,把數千人建立的成果劃到了一人名下。

Jev 到底多大?

尺寸估算是這份審計最搶眼的結果。單靠延遲斜率推不出尺寸——伺服器把所有人的 token 混在一起批次處理——但兩條獨立路徑收斂到同一個區間:從吞吐側看,在計算受限的批次 prefill 下,約每秒 165,207 token 的邊際 prefill 速率從上方約束了活躍參數量;從能力側看,其 2025 年代小模型的能力輪廓從兩側夾住了它。結論:大約 40 至 90 億活躍參數,且很可能經過量化。不是什麼前沿巨獸——就是一個小型 transformer,在語言模型頭通常所在的位置換上了一個機率讀出頭。

機率格點的鑑識報告

報告最深的一節解剖了 Jev 回傳的機率值,讀起來像一場鑑識會計作業。在 7,887 個公開向量中的 704,277 個數值裡——從 2 選項題目到 255 選項菜單——沒有任何一個值跳出 0.01 的網格。而且進位有結構:所有機率總和永遠是 0.99 或 1.00,絕不超過,任何選項數量下都是如此。若是對每個值獨立四捨五入,255 選項時總和應該會散射 ±0.04,因此進位之後必定還跑了一個有界修正,而且這個修正只會把機率拿走、不會加上去。有九個公開向量回傳的選擇並不是自己顯示表格中的 argmax——每個差距都恰好是一個量子——這與「決策以更高精度計算、顯示則另行處理」的解釋一致。

選項排序的影響比買家想像的大。在一個有 254 個候選接續句的平淡創意任務上,同一組選項的十一種排列產生了十個不同的贏家,排序一致性掉到 Spearman 0.26–0.44。審計者自己用的實務解法:對六種以上的循環旋轉做集成並取平均,可將排序一致性拉回 0.91–1.00,代價是整體分布被壓平。

沒人對得上號的分詞器指紋

有兩個發現值得更廣泛的注意。第一,Jev 的分詞器以拉丁文字為中心,罕見字元退回到位元組層級——西里爾、希臘、阿拉伯、希伯來、泰文、天城文、諺文、假名與常見 CJK 大約每個字元一個 token,罕見文字系統甚至每個 UTF-8 位元組約一個 token,使得數字密集或 CJK 密集的請求成本是同體積英文的數倍。不過在一場對照的六語言 XNLI 推理測試中,Jev 在全部六種語言上都贏過 Qwen3.5 9B——英語 87.5% 對 83.3%——所以懲罰是真實的,但並不致命。

第二,早期探測讓 Jev 描述自己時,它在 360 次中有 337 次自稱是 OpenAI 家族的模型——但審計者將此解讀為從網路文本學來的助理式先驗,而非血統證明。如果你在提示詞裡斷言一個虛構的出身,它會以 0.97 的信心接受。這個模型完全不知道自己是誰;它的自我敘事繼承自訓練資料,而不是自身經歷。

便宜到足以改寫你呼叫模型的方式

Pareto 分析是這份審計「反方意見中的溫情」所在之處。Jev 不是前沿——但由於省去了文字解碼的成本,它確實推進了性價比的前沿,「而且推得很遠」。跑完 12,032 道 MMLU-Pro 題目總共只花了 0.28 美元——每題約 0.000024 美元,比 vals.ai 實測的旗艦模型便宜四到五個數量級。同樣的題目量若按 Claude Fable 5.1 的實測單題成本計算,約需 1,900 美元以上。

這個價格點定義了審計者認為 Jev 真正占據的產品形態:從一百個意圖的菜單中做路由、按評分規則批改答案、判斷二十個改寫中哪個最接近使用者本意、為管線把關文件相關性。快速、形似確定性、廉價的結構化判斷——而不是對話,也不是研究。

TypeSafe 應該從中學到什麼

審計並沒有說 Jev 是騙局——它說的是行銷犯了範疇錯誤。這個模型靠「有用」贏得關注,而不是靠「前沿」。報告給開發者的實際建議包括:把選擇結果當作答案、把機率向量當作排序訊號(校準程度因資料集而異——MMLU-Pro 接近校準,HLE 嚴重過度自信);需要穩定時對重複呼叫取平均,因為相同請求的結果會漂移;將選項的表面形式標準化,因為一個前導空格就可能翻轉勝負;把多個問題打包進同一個請求——192 道題打包後實測約 153 毫秒,分開各送則每題約 280 毫秒。

在一個正在爭論「前沿」究竟意味著什麼的產業裡——而且是在白宮協定把前沿發展的自我監管制度化之後一週——一份用 16,379 次探測證明某個被重金行銷的「前沿」模型其實是一台做工良好的小型決策引擎的審計,是很有價值的修正。Jev 真正的對手不是 Claude 或 Gemini,而是你程式裡的 if 陳述式。