梯度提升樹最難熬的一週:Prior Labs 的 TabPFN-3.5 席捲所有表格資料排行榜
Prior Labs 發布 TabPFN-3.5,同時拿下 TabArena 與 BeyondArena 雙榜第一,在真實世界的雜亂資料上領先約 150 Elo,並推出快六倍的 Fast 版本。
當前沿實驗室還在為減速與兆美元融資爭論不休時,機器學習裡最不起眼的資料格式——試算表—— quietly 迎來了屬於自己的前沿時刻。2026 年 9 月 15 日,源自弗萊堡大學與牛津的 Prior Labs 發布了表格基礎模型(tabular foundation model)的最新版本 TabPFN-3.5,而且是一次漂亮的橫掃:TabArena 第一名、BeyondArena 第一名,外加一個四成員的模型家族,從快上六倍的低延遲版本,一路到像推理型 LLM 一樣在推論時投入運算資源的「Thinking」模式。
如果你不追蹤表格機器學習這個領域,值得先停下來理解它為什麼重要。結構化的行列資料——保險理賠、交易紀錄、感測器讀數、CRM 客戶資料——才是真正為產業付帳單的資料格式,而過去十年這塊地盤一直屬於梯度提升決策樹:XGBoost、LightGBM、CatBoost。每一場 Kaggle 競賽、每一個信用評分模型、每一個客戶流失模型,本質上都是在提升樹上做調參練習。TabPFN-3.5 是迄今最強的證據,證明基礎模型那套「預訓練一次、以 in-context 方式預測、不需要為每個資料集重新訓練」的打法,能夠攻下這塊地盤。
TabPFN 究竟是什麼
TabPFN 是一個在海量合成資料集空間上預訓練的 Transformer,承襲「prior-fitted network」研究傳統。推論時你把訓練表格和測試列餵給它,它直接 in-context 預測——不在你的資料上跑梯度下降、不做超參數搜尋、不玩特徵工程骰子。這個模型早已在數百萬個彎曲、含噪、異質的合成問題上「學會了學習」,你的資料集對它來說只是另一個 prompt。
這條譜系很短,但推進飛快。TabPFN-2.5 於 2025 年 11 月問世,資料格數較前代擴增 20 倍;2026 年 5 月的 TabPFN-3 首度把測試時運算擴充(test-time compute scaling)帶進表格預測,樣本上限提高到 5,000 列(舊版為 1,000 列)。TabPFN-3.5 是十個月內的第三次大改版,而且瞄準的正是前幾代最弱的地方:違反乾淨 IID 假設的資料。
3.5 版新在哪裡
技術報告的核心宣稱本身就是精確的數字:TabPFN-3.5 在 TabArena 與 BeyondArena 雙榜均排名第一。TabArena 是持續更新的 IID 基準——51 個精選資料集、超過 27 種方法同場競技,其中包含十個以上的表格基礎模型。BeyondArena 則走得更遠:142 個資料集,涵蓋高維度、分組(grouped)、時間性、高基數(high-cardinality)與富文字資料這些標準基準避而不談的類型。在 BeyondArena 上,TabPFN-3.5 領先前任總冠軍約 150 Elo;在非大型資料子集上,它於富文字、高基數與高維度資料領先最強舊基準最多約 250 Elo,在分組資料上則與最強基準持平。報導還引用了對經典機器學習 99% 的勝率,以及 0.17 秒完成 1,000 列預測的速度。
這次發布是一個家族,不是單一檢查點:
- TabPFN-3.5(基礎版)——橫掃排行榜的預設選擇。
- TabPFN-3.5-Plus——加強對富文字資料集的訊號萃取:商品描述、客戶評論、內部備註。它在 STRABLE(108 個充滿雜亂字串的表格資料集基準)上排名第二,僅次於下面這位手足。
- TabPFN-3.5-Thinking——精確度天花板,用算力換結果:比基礎版在 TabArena 再多 44 Elo、在 BeyondArena 再多約 20 Elo。Thinking 對時間性與分組資料的改進尤其明顯——也就是「用 A 店訓練、要預測 B 店業績,或用歷史紀錄預測下個月銷量」這種會弄壞大多數現成模型的情境。
- TabPFN-3.5-Fast(alpha)——第一個面向低延遲應用的版本,比基礎版快最多六倍,瞄準毫秒有差的正式服務環境。
貫穿全場的主軸是對「真實資料長在哪裡」的押注。報告直言:「多數機器學習假設資料列彼此獨立、特徵乾淨、而且資料量足以訓練一棵梯度提升樹。現實中,商業資料幾乎從不符合這些假設。」保險表格把理賠金額和審核員結論混在一起;交易連向商家與客戶;工業感測器收集數百項會隨廠區與季節漂移的量測值。而這些正是 3.5 宣稱——並且在兩個獨立競技場上展示——最大戰果的場域。
企業客戶早在排行榜橫掃之前就來了
讓這次發布不只是一件學術排行榜大事的,是 Prior Labs 已經攒下的客戶名單。保險獨角獸 Marshmallow 表示 TabPFN「在真實保險資料集上不需任何調參就勝過梯度提升」,而且特別點出預測信心區間——風控團隊對它的重視不亞於點估計。日立(Hitachi)將 TabPFN 用於鐵路的預測性維護;Creditplus Bank 用於車貸審批;TD 已在企業規模上探索金融預測;BostonGene 用它辨識免疫系統特徵;Exito 用於媒體採購預測;牛津癌症分析中心(Oxford Cancer Analytics)更與 Prior Labs 合作,推動肺癌液態切片與臨床決策支援。
通路也同步到位。3.5 家族可透過 Prior Labs 自家的 API 與 MCP 伺服器使用(MCP 現已預設採用 3.5-Plus)、登上 AWS SageMaker(Plus 與 Thinking),並進駐 SAP AI Core(Plus)——這個部署位置等於把基礎模型直接放進全球大多數雜亂表格實際居住的 ERP 帝國。Azure ML 的支援「即將推出」。2026 年 9 月 29 日前,所有 API 與 MCP 用戶享有 TabPFN-3.5 標準 token 費率五折。開源 pip 套件附上基礎模型與 Fast 檢查點,而 SAP 與 AWS 的上架也證明企業級包裝在發布當天就已就緒。
必須誠實說的限制
三個但書讓熱度留在合理範圍。第一,授權:TabPFN 權重採非商業授權(TabPFN-3 授權涵蓋 2.5、2.6 與 3 世代),所以這裡的「開放」是指開放程式碼與可供研究的檢查點,不是一個可以不跟 Prior Labs 打招呼就塞進任何商業產品的 CatBoost 替代品。第二,規模:in-context 的甜蜜點仍是數千列,不是數百萬列——對最大的資料集,Prior Labs 仍在與客戶合作推行 TabPFN-2.5 Scaling Mode,那和把模型直接指向資料倉儲是不同的工作流程。第三,這些是廠商自行提交的排行榜成績。兩個競技場的策展嚴謹、Elo 差距也大,但同規模的獨立重現結果才剛開始流傳。
更深一層的反方論點是:提升樹便宜、無聊、可解釋、可無限除錯,而且十年的 MLOps 工具鏈都以其為前提。表格基礎模型贏在零樣本準確率與「到第一個預測」的速度;樹贏在大規模下的單位經濟與組織慣性。真正有趣的階段,是這些取捨在同一個平台內正面相撞的時候——而 SAP 與 AWS 的上架,恰恰就是這個相撞的開始。
為什麼是這一週
表格預測是應用機器學習中以市值計最大的區隔市場,也是基礎模型革命中最被隔絕的一塊。TabPFN-3.5 的雙榜第一、快六倍的服務層級、以及追求極致精確度的 Thinking 模式,是「隔絕正在失效」迄今最強的訊號。對資料團隊來說,務實的解讀很簡單:這一季就把它拿來和你調好的梯度提升基準對跑一次——零樣本、免調參的設定,代表這場評估的成本是一天,不是一個衝刺。對整個產業來說,這是「為每個問題訓練一個模型」讓位給「prompt 一個早就學會學習的模型」的又一個領域。前沿實驗室正在爭論誰要減速;在試算表的世界裡,有人剛剛踩下了油門。
所有評測細節——協議、資料集、組態與執行環境——皆記錄於下方連結的技術報告中。
Sources
- [1] https://priorlabs.ai/technical-reports/tabpfn-3-5
- [2] https://priorlabs.ai/
- [3] https://github.com/PriorLabs/tabpfn
- [4] https://blog.buildfastwithai.com/ai-news-today-september-16-2026
- [5] https://community.sap.com/t5/technology-blog-posts-by-sap/prior-labs-tabpfn-3-5-plus-is-available-now-in-sap-ai-core/ba-p/14484661