體積縮小九倍、智慧保留 98.2%:PrismML 的 Ternary Bonsai 2 把完整 27B 模型塞進 5.9 GB
這家 Caltech 新創公司以三值權重將 Qwen3.8 27B 壓縮到 5.9 GB,保留 98.2% 的基準平均分——而且在最考驗推理能力的項目上,領先傳統 2-bit 量化超過十二分。
過去十年大部分時候,想跑一個 270 億參數的模型,光權重就得預留約 54 GB 的高頻寬記憶體。今年三月才以 1,625 萬美元種子輪(Khosla Ventures 領投)走出隱身期的 Caltech 新創 PrismML,剛發布了迄今最有力的證據:這個取捨其實是可以不要的。9 月 18 日以 Apache 2.0 授權釋出的 Ternary Bonsai 2 27B,把一個完整 27B 級模型裝進 5.9 GB——約為 FP16 原版的九分之一——同時在十四項評測中保留 98.2% 的基準平均分。
這次釋出的到底是什麼
Bonsai 2 27B 是阿里巴巴 Qwen3.8 27B 的壓縮版本,後者是該尺寸級最強的開放權重模型。PrismML 的做法是把語言模型的權重限制在三值——−1、0、+1——再搭配 FP16 的分組縮放(group-wise scaling),換算下來每個權重僅 1.76 個有效位元。這條技術路線源自 BitNet 系列研究,但 PrismML 的差異化在於:低到位元數的表示法貫穿整個語言模型,而且該公司公開、逐項地量化究竟有多少能力存活下來。
headline 數字來自在 NVIDIA H100 上、以 EvalScope 加 vLLM 於「思考模式」下進行的評測——這種模式會行使模型的完整推理路徑。在涵蓋知識、數學、程式、指令遵循、工具呼叫與視覺的十四項基準中,FP16 的 Qwen3.8 27B 平均 86.32 分,Bonsai 2 27B 平均 84.78 分——也就是那個 98.2% 保留率。模型支援 262K token 的上下文視窗,接受文字與圖片輸入,可透過 CUDA 在 NVIDIA GPU 上執行,或透過 MLX 與自訂低位元核心跑在 Apple 矽晶片上。
能力都保留在哪裡
總平均分其實不是重點。真正關鍵的是分數的分布,因為傳統量化的劣化並不均勻——它是選擇性塌陷的,而且正好塌在最需要持續推理鏈的項目上。
PrismML 的模型卡把這個對比講得很白。用 IQ2_XXS(一種標準的 sub-4-bit 方法)量化的 Qwen3.8-27B,在 MMLU-Redux 上仍有看似健康的 88.93 分——這正是隨手測試看不出問題的原因。但在 AIME26 上它掉到 57.5,LiveCodeBench 掉到 56.4。Bonsai 2 27B 在同樣這兩項上分別拿下 95.83 和 90.07。以十四項總平均計,佔 9.4 GB 的 IQ2_XXS 只有 72.59 分——也就是說,5.9 GB 的三值模型以小三號的體積,贏它超過十二分。
按技能類別看,圖像一致:數學只從 97.06 微降到 96.57,程式能力甚至與 FP16 基準打平(89.07 對 89.42),指令遵循還略勝(81.25 對 82.66)。剩餘差距集中在知識與推理(85.55 對 79.86)以及視覺(71.36 對 66.19)。值得一提的是,上一代 Bonsai 的報告在第二個模型家族 Gemma-4-31B 上也呈現同樣的選擇性塌陷模式——這說明問題出在傳統低位元方法本身,而不是某一個基底模型。
吞吐與能耗
壓縮買到的不只是記憶體。PrismML 公布的數據包括:RTX 5090 上最高每秒 143 token、Apple M5 Max 上 46.8 tok/s;模型卡補充了一般筆電約 28 tok/s、服務場景的 RTX 5090 約 130 tok/s,連 72 W 的資料中心 L4 也有約 30 tok/s。在 RTX 4090 上,解碼每 token 僅耗 0.714 mWh——比以全精度跑一個 8B 模型省約 40% 的能源。
PrismML 用「智慧密度」來概括這件事:每 GB 儲存空間能換到多少可用能力。以此衡量,Bonsai 2 達到同一模型最緻密傳統量化版本的 2.3 倍以上密度,約為 FP16 的 9 倍。
誠實的但書
有兩個限制值得留意。第一,公司自己承認拆包三值權重需要算力: dense PTQ1_0 打包在 Ada 級及更小的加速器上較快,但在 Ampere、Hopper 與 Blackwell 上,batch-1 解碼反而較慢——因為那些晶片的記憶體頻寬本來就不是瓶頸。第二,社群的檢視已經開始發揮作用:Hacker News 上的討論串有人拿背詩之類的邊緣案例去對比傳統 GGUF 量化,Reddit 上也有人要求逐項分數——而模型卡現在確實提供了。98.2% 的平均不等於處處 98.2%;視覺與深度知識工作仍有看得見的折損。
策略背景也值得知道。PrismML 源自 Caltech 由執行長 Babak Hassibi 領導的研究,背後有 Khosla Ventures、Cerberus 的投資、Google 的算力補助,以及三星的持續支持。七月曾有報導指出 Apple 曾洽談收購這家公司,原因正是極限壓縮是讓前哨級模型跑上 iPhone 的鑰匙。無論收購是否成真,方向已經很清楚。
為什麼重要
過去一個月的前哨議題,被數千億美元等級的算力預算佔據。Bonsai 2 提醒我們:反向的槓桿——用少得多的資源做多得多的事——正在以同樣快的速度複利成長。如果一個 27B 模型現在能和你的照片一起塞進筆電,代理迴圈的經濟學就變了:本地模型可以處理敏感或高頻率的步驟,再選擇性升級到雲端;重視隱私的部署不再需要資料中心;而讓手機模型變小的同一套數學,也能讓資料中心的每張 GPU 服務更多使用者。
PrismML 向整個領域提出的問題值得認真對待:不再只是「模型有多強」,而是「在固定的記憶體、算力與電力預算內,能交付多少有用的智慧」。以這次釋出的證據看,這個答案前進的速度,比多數人以為的更快。
Sources
- [1] https://prismml.com/news/bonsai-2-27b
- [2] https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf
- [3] https://www.marktechpost.com/2026/09/18/prismml-releases-ternary-bonsai-2-27b-a-5-9-gb-apache-2-0-model-retaining-98-2-of-qwen3-8-27b-performance/
- [4] https://www.hpcwire.com/2026/04/03/prismml-emerges-from-stealth-with-1-bit-llm-family/
- [5] https://news.ycombinator.com/item?id=49746765