不寫一個字的模型:前 OpenAI 研究員的 TypeSafe 發表 Jev,一個拒絕輸出文字的決策引擎
TypeSafe AI 結束兩年低調研發,推出首個「System One Model」——Jev。它不生成任何文字,只輸出帶校正機率的型別化決策,延遲 70-500 毫秒,每百萬輸入 token 僅 0.042 美元。
每一家前沿實驗室都在競相讓模型寫出更好的文章、更好的程式碼、更好的推理鏈。Diogo Almeida 卻花了兩年時間低調打造一個拒絕寫任何東西的模型——2026 年 9 月 15 日,他的公司 TypeSafe AI 公開了成果:Jev,該公司所稱「System One Model」新模型類別的第一個成員。
Almeida 對這個落差並非局外人。他是 OpenAI 2022 年 InstructGPT 論文的共同作者——那項人類回饋訓練研究把 GPT-3 變成了聽話的指令執行者——他的名字也出現在初版 ChatGPT 的製作名單中。照他自己的說法,他當年幫助發明的技術,恰恰是聊天模型至今無法被放進軟體核心的原因:被訓練來產出「人類偏愛」回應的模型,仍然過度自信、前後不一致、偶爾脫軌——當聊天機器人沒關係,當函式呼叫就是不合格。
System One Model 到底是什麼
名稱致敬 Daniel Kahneman 的《快思慢想》。LLM 是「系統二」——緩慢、深思熟慮、鏈式推理;TypeSafe 的模型要做「系統一」——一層快速、直覺、軟體可以直接呼叫的判斷機制。介面設計刻意走向極端:開發者傳給 Jev一段非結構化狀態(文字、文件、程式狀態)加上一組型別化問題,Jev 回傳結構化的選擇、分數與機率分佈。沒有文章、沒有程式碼、沒有自由文字。TypeSafe 的形容是:「一個前沿智慧的函式呼叫:非結構化狀態輸入,型別化機率決策輸出。」
三項工程選擇讓這個技術堆疊與眾不同:
- 為結構化輸出最佳化的全新架構。 所有可能輸出的空間由 schema 事先定義,這代表模型不可能產生型別錯誤——TypeSafe 稱這在數學上受到保證,並挑戰任何人用一個反例來推翻它。
- 平行取樣器。 LLM 逐一生成 token,每個都以前一個為條件;Jev 則在單次查詢中對所有問題平行求值,這正是它速度的主要來源。在同一查詢中加入更多問題,回應時間幾乎不變。
- RLCD——校正決策強化學習(Reinforcement Learning for Calibrated Decisions)。 RLHF 最佳化人類偏好,RLVR 最佳化可驗證獎勵,而 RLCD 訓練模型給出經過校正的答案:每個輸出都附帶機率與信心分數,且信心越高、實際準確率越高。
數字會說話
如果這些數字在 TypeSafe 自家測試環境之外依然成立,將非常驚人:
- 延遲: 端對端 70-500 毫秒。TypeSafe 稱在決策型任務上比前沿模型快 40 至 200 倍(前沿 LLM 約需 3 至 329 秒)。
- 成本: 每百萬輸入 token 0.042 美元(前沿模型為 0.20 至 10 美元)。輸出 token 免費——「便宜到不值得計量」。
- 型別錯誤: 零。這來自 schema 強制約束,而非實測統計。
- 官網數據: 在一個內部工作流上最快 193.6 倍、最省 444.6 倍——公司自己承認這偏真實增益的高標。
為了展示速度,TypeSafe 讓 Jev 玩《毀滅戰士》——一個每秒發出約 10 次模型呼叫的機器人,讀取的是結構化的文字版遊戲狀態,每小時成本約 7 美元。另一個「維基競速」展示則要求模型在數千個連結中挑選路徑、從一個維基百科頁面走到另一個——在這種任務裡,幻覺出來的連結是致命傷,而 Jev 單次查詢最多支援 255 個選項的特性正好派上用場。
但星號要自己看——TypeSafe 也很清楚
「我們熱愛懷疑者,我們自己就是懷疑者,」發表文章這麼寫。值得肯定的是,公司預先回應了多數明顯的質疑。支撐最大膽宣稱的工作流評測是內部的,由 TypeSafe 自家能力團隊打造,參考答案取自 GPT-6 Astra 與 Claude Fable 5.1 的平均輸出,而非獨立的標準答案。這次發表沒有論文、沒有開放權重、也沒有第三方評測——RuntimeWire 的報導指出,技術架構僅「以高層次方式」描述。
「零幻覺」的宣稱同樣需要星號。Jev 保證的是輸出符合要求的 schema——不會出現捏造欄位、格式錯誤的工具呼叫或無效型別。它仍然可能選錯答案。校正後的信心欄位帶來的,是設定門檻的能力:信心高於 95% 就自主執行,低於就轉交人類。這比行銷話術暗示的承諾更窄,但對於毒害代理式系統的特定失敗模式——深埋在依賴鏈中的幻覺呼叫——這正是自動化所需要的保證。
存取同樣設有門檻:Jev 目前僅開放早期存取,開發者從候補名單逐步放出,並未開放自由註冊。
為什麼這不只是一間新創公司的事
策略賭注就藏在名字裡。Jev 取名自威廉·斯坦利·傑文斯(William Stanley Jevons),即「傑文斯悖論」的發現者——這個十九世紀的經濟學觀察指出,效率提升反而會增加總消耗量。Almeida 的賭注是:當「每單位決策的智慧成本」下降 10 到 100 倍,開發者會把模型呼叫塞進過去 LLM 經濟學完全不合理的地方——即時互動路徑、對 PB 級資料的 map-reduce、逐事件評分、替其他模型的輸出把關。這個模型不想當更好的助理;它想當一個便宜、可靠的軟體基本元件——一條「智慧 if 陳述式」。
TypeSafe 自己也把 LLM 的經典用途——聊天機器人、副駕駛、可驗證問題、展示 demo——明確排除在 Jev 的守備範圍之外。它的跑道是那片模糊地帶:分類、路由、評分、萃取、分支——數千個目前由脆弱的手寫規則、或昂費緩慢還偶爾出錯的「LLM 加 JSON 解析器」實作的小型判斷。
競爭背景同樣值得注意。本週 OpenRouter 的數據顯示,開發者支出重新倒向 OpenAI——因為程式設計師把 Claude Code 的控制框架接上 GPT-5.6 Sol,這證明開發者已把前沿模型視為 API 後面可互換的大宗商品。TypeSafe 押的是相反方向:下一層價值不在更好的通用模型,而在一個更窄、介面終於能被軟體信賴的模型。如果 Jev 的生產數據接近內部評測,每一家打造代理基礎設施的平台都得回答一個新問題:你的決策層為什麼是用字串做的?
與 Almeida 共同創業的還有兩位共同創辦人:前 Meta 與 FAIR 研究工程師 Sasha Sheng,以及曾創辦基因體 AI 新創 Ravel、待過 Invitae 與 Freenome 的 Erik Gafni。公司尚未揭露融資資訊。它的證明方式將與所有此類證明相同:不是發表日的評測分數,而是真實生產環境——一個 500 毫秒、半美分的決策,悄悄勝過一個 30 秒、兩美元的完整生成。
就目前而言,最誠實的總結來自 TypeSafe 自己:非凡的宣稱、部分的收據,以及一個剛剛開放的候補名單。