33 毫秒、開放權重、分數更高:Laya 回應了那家「重新發現」他研究成果的前沿實驗室
一位早在 2025 年 3 月就發表非自回歸決策模型的獨立研究者,以 Apache 2.0 開源 Laya——421M 參數、33 毫秒回應,在準確率、校準與延遲上全面超越 TypeSafe 的閉源 Jev。
2026 年下半年最熱門的新模型類別之一,不是聊天機器人,而是它的反面:小型、非自回歸的「System 1」決策模型——不生成任何文字、不可能幻覺,在前向傳播一次之內就回傳帶校準機率的型別化答案。掀起重視這波浪潮的前沿實驗室 TypeSafe AI(由 ChatGPT 共同發明人 Diogo Almeida 創立)在九月推出了 Jev 模型,以閉源 API 形式供應,每百萬輸入 token 收費 0.042 美元,沒有論文、沒有權重、也沒有訓練資料。
本週,開源社群給出了回應。Convai Innovations 以 Apache 2.0 授權釋出 Laya——一個 421M 參數的多語言 System 1 決策模型,而且這次發布背後還有一段故事。作者 Nandakishor M 早在 2025 年 3 月就把相同核心概念發表在 arXiv 上(arXiv:2503.23303),隨後在 2025 年 9 月又發表了以強化學習引導結構描述決策的完整框架(arXiv:2510.01237)——比一家資金雄厚的實驗室把這個概念當成全新突破推出,早了整整一年。他沒有停留在懊惱,而是從頭重建整個架構、修正所有限制,然後把一切公開。
Laya 到底做什麼
這個定位瞄準了當前 AI 系統的一個真實痛點:我們正在用生成式 LLM 處理「反射性」的簡單決策。當一張客服工單、一封電子郵件或一個 API 請求進來,你通常只需要幾個簡單答案——該派給哪個部門、緊急程度如何、使用者是否揚言解約。為此呼叫 8B 或 70B 的生成模型,意味著 500 到 2,000 毫秒的串流等待、真實的推理成本、輸出端還要一個脆弱的 JSON 解析器,而且模型給的「信心值」只是聽起來很篤定的文字 token,背後沒有任何數學校準。
Laya 接收一個狀態(文字、信件、工單或 JSON)加上型別化的問題,然後在一次前向傳播中回答所有問題。它只提供三個原語:
choice——選出一個選項,並回傳每個選項的機率score——將輸入放到你定義的有序量尺上,附帶分佈noul——針對一個是非命題回傳校準過的 P(true)
因為輸出空間嚴格限定為機率與數字,沒有東西需要解析、也沒有東西可以幻覺。壞掉的 JSON 在物理上不可能存在。
架構:編碼器,不是解碼器
骨幹是 ModernBERT-large——395M 參數、雙向注意力、完整微調——再加上從零訓練的決策頭:兩層 transformer、選項標記評分器,以及 act/escalate 頭,合計 421M 參數。每個答案選項都有自己的 [MASK] token;模型在這些標記位置收集隱藏狀態,再對每個問題的選項做 softmax。這帶來一個巧妙的結果:答案空間是在請求時才定義的,因此全新的結構描述完全不需要重新訓練。
這個 repo 實際上一次交付了三個檢查點。英文版 laya(421M、512 token 上下文)放在根目錄;laya-multilingual(322M 的 mmBERT-base、1024 token 上下文、支援 100+ 語言、速度快約兩倍)與 laya-typed-decisions(421M、1024 token)放在子資料夾。Router 類別會依輸入語言惰性載入並分派,可選的 preload 模式在混合語言流量下最高可帶來 4.8 倍的吞吐提升。
RLCD:獎勵誠實的強化學習
訓練方法 RLCD(Reinforcement Learning for Calibrated Decisions,校準決策強化學習)是整個模型最有趣的部分。天真的 RL 會摧毀校準:策略梯度會把勝出選項的機率推向 1.0、其餘推向 0.0,製造出一台「很有自信但經常出錯」的機器。RLCD 改用嚴格適當計分規則(strictly proper scoring rule)作為獎勵——log score 加上 spherical score,有序問題再減去 ranked probability score。在這類規則下,期望獎勵只有在回報誠實機率時才能最大化。探索階段對 logits 加入零均值高斯雜訊;更新採用帶組均基準的 REINFORCE(GRPO 風格)。整個訓練耗時 7,313 次更新、一個 epoch、約 1.96 小時。
另外還有一個 act/escalate 頭,讀取池化後的 [CLS] token 與分佈特徵,輸出 P(act) 與 P(escalate)——模型自己學會何時該交給人類。實務上,把自動化門檻設在信心值 ≥ 0.85,Laya 大約能自動路由一半的進站工單,精確度在 92% 以上,真正棘手的案例才升級給真人。
對上 Jev 的數字
在 Tesla T4 上,單一問題 32.8 到 39.5 毫秒回應;批次處理下可達每秒 103 到 332 題。與 Jev 1.13.0 的第三方公開數據(TypeSafe 的 API 未被直接測量)相比,路由後的 Laya 全面勝出:
- typed-decisions 準確率:0.766 對 0.727
- AG News:0.950 對 0.910
- DAIR Emotion:0.595 對 0.480——Jev 在 16% 的範例上給正確標籤零機率
- 校準(ECE):0.081 對 0.246——好 3 倍
- p50 延遲:約 33ms 對 236–276ms——快 6 到 7 倍
- 授權:Apache 2.0 對閉源 API;自行架構成本為零
誠實的那一部分
讓這次發布具有可信度的,是那份罕見直白的「限制」章節。在 typed-decisions 的零樣本測試上,基礎檢查點的分數低於多數類基準(0.362 對 0.461)——頭條的 0.766 屬於在該基準自身訓練集上微調過的檢查點。Laya 是一個等待特化的快速底座,不是零樣本決策引擎。有序的 score 問題是最弱的原語。模型出廠時過度自信,需要依問題型別重新擬合溫度(這一步把平均 ECE 從 0.466 降到 0.081)。多語言檢查點在 51 個測試語言中只有 23 個超過隨機的三倍——高棉語(Khmer)以 0.952 的信心跑出 0.000 的準確率,這種細節幾乎沒有任何實驗室願意公開。
正是這種透明度,加上 Apache 2.0 權重、PyPI 套件(pip install laya)、線上 demo、微調 notebook 與完整基準明細,構成了閉源替代品拒絕提供的一切。這一週的啟示是:當前沿實驗室重新發現你的研究並拿來收費時,最好的回覆就是權重、基準,和一份誠實的 README。