幫自己蓋出自己的模型:NaiveAI 首發作品是沒有全域注意力層的 309B MoE
北京神秘新創走出匿蹤期:Naive-N0.5-Flash 是 MIT 授權的 3,090 億參數 MoE,原生百萬 token 上下文、全網路零全域注意力層,而且建造它的研發流程每週跑近千萬個沙箱、大量交給 AI 執行。
本站九天前才報導過那家估值 14 億美元的北京神秘 AI 新創,現在它終於推出了真正能下載的東西。2026 年 9 月 27 日,由清華大學電子工程系副教授代季峰(Jifeng Dai)二月創立的 NaiveAI 發布了 Naive-N0.5-Flash——一個開放權重、總參數 3,090 億的混合專家(MoE)模型,鎖定程式開發與 AI 研究用途。權重採 MIT 授權,上下文視窗原生支援一百萬 token,而它的架構做了一件幾乎沒有前沿模型敢做的事:整個網路裡一層全域注意力(full attention)都沒有。
這次發布把一個九個月的募資傳說變成了可檢驗的實體。在此之前,關於 NaiveAI 的一切都是間接消息——三輪合計約 4 億美元的融資、騰訊與 IDG 資本、HSG(原紅杉中國)等投資人,以及一個只有一句話的官網:「100x Intelligence for the pioneers」。現在有了 benchmark 對照表、Hugging Face 儲存庫、自研推論引擎,還有一篇研究文章,異常坦白地描述這家公司認為前沿模型應該怎麼蓋:AI 系統做工程,人類定方向。
模型本體:3,090 億總參數、155 億活化、只有局部與稀疏注意力
Naive-N0.5-Flash 採混合專家設計,總參數 3,090 億、每 token 活化 155 億,與小米 MiMo-V2-Flash、DeepSeek V3 系列屬同一量級。架構上的招牌是注意力堆疊:39 層滑動視窗注意力(SWA)搭配 9 層輕量級 DeepSeek 稀疏注意力(DSA),大致呈 5:1 布局,並全面採用 GQA4。網路中每一層都是局部或稀疏的——模型裡不存在任何一層全域注意力。
這個選擇是對長上下文經濟學的一次下注。全域注意力的計算成本隨序列長度平方成長,到了百萬 token 規模,它會成為服務一個模型最主要的開銷。讓整個網路維持局部與稀疏,Naive-N0.5-Flash 把百萬 token 上下文便宜到可以當成預設值,而不是企業版的加價選項。歷史上的代價是超長距離的檢索能力——這正是 DSA 這類稀疏注意力機制要找回的東西。NaiveAI 用 3.25 兆 token 訓練這個模型,並表示產出它的研發與工程流程「大幅由 AI 系統執行」,人類負責設定目標與評估標準。
數字:便宜、飛快、而且蓋法不一樣
API 定價看起來像標錯價:每百萬輸入 token 0.10 美元、輸出 0.40 美元、快取讀取 0.01 美元。以這個價位,它比多數開放權重對手便宜了一個數量級。自家推論系統 NaiveRT 是它敢開這種價的底氣:結合 mega-kernel 融合、用程式化依賴啟動(PDL)重疊 kernel 邊界、再加上搭配融合 DFlash 草稿模型的投機解碼,標準模式提供每人 50 token/s,Ultrafast 模式可達每人 2,000 token/s。在針對 RL 的配置下,NaiveRT 在 8 張 GPU 上衝出單一流 2,122 token/s 的峰值解碼速度,並把一次完整投機解碼回合從 SGLang 的 12.3 毫秒壓到 3.4 毫秒——降幅 72.4%。
Benchmark 章節密密麻麻對照了 GLM-5.3、Kimi-K3、Qwen-3.8-Max、DeepSeek-V4.1-Flash、Opus-5.5、GPT-5.6-Sol,橫跨 SWE-Bench Pro、DeepSWE v1.1、Terminal-Bench 2.1、ALE-CLI、MLE-bench-30 等測項。其中一項對照顯得像是放錯了類別,卻恰恰是最大的亮點:NanoGPT SpeedRun——參賽者比賽誰能用最低成本訓練出 GPT-2 級模型的競賽。一個能幫人類更快訓練小模型的模型,這種能力只有在你預期它終將被用在它自己身上時,才會去打造。
流程才是產品
這次發布最重要的部分不在 model card 裡,而在建造過程的描述。NaiveAI 說它「從第一天起就揚棄了以人為中心的研發」:AI 模型寫程式、跑實驗、監控進度、分析結果、反覆迭代;人類研究員設定方向、定義限制、做關鍵決策。支撐這套流程的基礎設施每週服務近一千萬個沙箱,尖峰時刻同時有十萬個在跑,全部由一個統一控制平面管理運算、環境、工具、權限與安全。
NaiveRT 的案例把這套流程量化了。這個推論引擎是六天內、經由 151 次有紀錄的最佳化試驗完成的——43 次全网路工程(採納 28 次)、45 次真實檢查點執行(採納 15 次)、63 次 W8A8 kernel 精修(採納 20 次)。151 次試驗中 63 次的成果被採納;71 次沒通過驗證或被回滾;17 次屬於探索性質。這篇文章對失敗的坦白程度在實驗室部落格裡少見:一條 MoE 融合路線做了七輪實作,每一輪數值上都正確,每一輪端到端都比 PDL 串接的基準更慢,最後由人類研究員砍掉整個方向。一層 DSA 從每個解碼步驟 29 次 kernel 執行,變成橫跨 148 個 CTA 的單一協作 mega-kernel。一項 QKV 權重預取的最佳化——在隔離微基準裡更慢、在完整模型裡每步快 21–23 微秒——被保留了下來。
最後這個細節是整份發布的低調論證。用端到端影響而非微基準分數來評斷候選最佳化,AI 系統避開了 kernel 工程的經典陷阱,而且是在人類無法持續的步調下跨越數百次試驗做到的。六天做出一個在目標工作負載上解碼延遲勝過 SGLang 3.6 倍的自研推論引擎,這個數字若經得起重現,就是對「AI 為中心的研發」最有力的背書;若經不起,就會被社群拆解。
由模型親手打造的世界模型
第二個案例更跳脫框架。一位 NaiveAI 研究員給 Naive-N0.5-Flash 出了一道公司自身專長以外的端到端研究題:做一個世界模型。人類定義目標、算力預算與評測協定;模型自己設計方法、訓練模型、跑評測、決定下一步。累計 400 小時、15 輪主要實驗之後,產出的 AutoWM 在公開的 WorldArena-1 Track 1 協定下拿到 77.43 分,高於當時排行榜最高公開分數 73.64。這個模型先重現了官方 FlowWAM 配方,發現傳統調整沒什麼用,於是轉而改寫題目本身:重寫字幕、把訓練集從 2,500 支片段擴增到 22,500 支。
由於 Naive-N0.5-Flash 本身也針對 AI 研究工作訓練——直接參與研究迴圈——NaiveAI 把這次發布定位為「開啟通往遞迴自我改進(RSI)的路」。這個詞承載了整份發布最重的分量,也是最值得盯的一個。遞迴自我改進是快速起飛情境的理論引擎:系統改進用來改進系統的系統。一個具備強大代理式程式能力、百萬 token 上下文、基礎設施每週跑千萬個任務、而且明確以參與自己後繼者開發為設計目標的 3,090 億開放權重模型,要嘛是史上被開源的最高效研究實驗室,要嘛是迄今以 MIT 授權釋出、最有趣的未對齊代理——而誠實的答案是:現在還沒有人知道是哪一個。
意義何在
三件事讓這次發布不只是又一次開放權重模型上架。第一,經濟學:155 億活化參數加上每百萬 token 0.10 美元的輸入價,讓前沿等級的程式能力落到任何一個有單節點和一份 Docker Compose 檔的團隊都負擔得起——NaiveRT 附帶一份,完整原始碼與 W8A8 檢查點將於 10 月 12 日前釋出。第二,架構:3,090 億規模、零全域注意力、原生百萬上下文,證明 DeepSeek 開拓的稀疏注意力路線正在成為長上下文服務的預設解。第三,流程:如果「AI 為中心的研發」這套宣稱經得起社群檢驗——開放權重加上開放推論引擎,意味著它可以被檢驗——那麼蓋出有競爭力模型的成本,對所有人而言都剛剛下降了一截,不只是對 NaiveAI。
九天前還是一句話官網加 14 億美元估值的公司,現在是 GLM、Kimi、Qwen、DeepSeek 的正面競爭者,而且它的方法學挑戰了所有這些實驗室的人力配置。代季峰最初的押注,是開放基座之上的中訓練與後訓練比預訓練軍備競賽更有發揮空間。Naive-N0.5-Flash 是這個押注第一次公開兌現的分期付款——而公司說,蓋它的,正是它本來就要幫忙創造的那些系統。