← All posts / Models

80 億參數開源擊敗閉源前沿:商湯 SenseNova-U1.5 視覺推理評測超越 Nano-Banana-Pro

商湯以 Apache 2.0 釋出的 8B 原生統一多模態模型 SenseNova-U1.5-8B-MoT,在 VBVR-Pro-Bench 視覺推理評測拿下 68.2%,超越專有模型 Nano-Banana-Pro 的 56.4%,並原生支援 4K 生成。

80 億參數開源擊敗閉源前沿:商湯 SenseNova-U1.5 視覺推理評測超越 Nano-Banana-Pro

過去兩年,圖像 AI 領域的潛規則很簡單:閉源模型畫得比較漂亮,開源模型比較便宜。這個默契剛被打破了。商湯(SenseTime)以 Apache 2.0 授權釋出的 SenseNova-U1.5——一個 80 億參數的原生統一多模態模型——不只在生成與編輯評測登上開源榜首,更在強調推理能力的視覺評測 VBVR-Pro-Bench 上拿下 68.2%,超越 Google 專有模型 Nano-Banana-Pro 的 56.4%。一個可以自己下載、自己跑的開源權重,就這樣在閉源前沿最擅長的賽道上把它比了下去。

SenseNova-U1.5 到底是什麼

「U」系列是商湯 SenseNova 對「統一多模態」難題的回應,而它最大膽的地方在於架構上的激進。市面上多數多模態系統本質上是拼裝車:視覺編碼器(通常是 CLIP 或 SigLIP 變體)先把影像消化成嵌入向量,另一個帶 VAE 的擴散解碼器負責生成像素,中間靠膠水程式碼來回搬運。SenseNova-U1.5 把這些全部丟掉——它是 無編碼器(encoder-free)、無 VAE(VAE-free) 的 Mixture-of-Transformers(MoT)架構,直接在與語言相同的 token 空間裡操作視覺 patch。

這樣做的回報是:理解與生成共享同一套表徵。當模型把文字排進海報時,用的是讀海報的那組權重。此架構建立在商湯先前 SenseNova-U1 論文(arXiv:2605.12500)提出的 NEO-unify 設計之上;U1.5 強化了 patchify 層、收紧了資料品質與分布、改善了任務表述,並升級了提示增強與後訓練流程。Hugging Face 上同步釋出兩個檢查點:RL 訓練的主模型,以及中間階段的 SFT 版本,方便研究者檢視整條訓練階梯。

關鍵數字

官方釋出的核心成績如下:

  • VBVR-Pro-Bench(推理密集視覺評測):68.2%——高於 Nano-Banana-Pro 的 56.4%
  • GenEval(組合式生成):0.92——開源模型最佳
  • CVTG-2K(圖內文字渲染):0.948
  • ImgEdit(指令式編輯):4.59
  • GEdit-Bench-EN:開源最高分
  • 單一 8B 級模型即支援原生 4K 生成

其中兩項特別值得注意。圖內文字渲染一直是擴散模型的長年痛處——過去 AI 生成圖片裡的招牌文字總像中風的人寫的。CVTG-2K 達到 0.948,且中英文皆然,意味著海報、資訊圖表、品牌素材這類文字密集設計,在開源權重這一級已經是「夠好」的問題。而 VBVR-Pro-Bench 的差距最有指標意義:它不是美感分數,而是衡量模型能否推理所見內容。在這裡以近 12 分之差擊敗閉源前沿產品,重新定義了「開源」在這個品類的含義。

正式版帶來的六項改進

商湯對此次正式版相對預覽版的變化交代得相當具體:

  1. 更高品質的生成——構圖、色彩和諧度、材質渲染與局部細節均提升
  2. 更好的文字渲染與資訊圖表——文字密集設計的資訊層級更清晰
  3. 更高效的原生 4K 生成——高解析度下維持整體結構一致性
  4. 更可靠的圖像編輯——局部編輯、插入與多參考替換時,主體身分與背景保存更穩
  5. 更強的複雜指令遵循——單次請求中物件數量、空間關係與多重約束的一致執行
  6. 更精確的視覺控制——透過邊界框、視覺標記與參考圖片實現區域級、物件級操控

同樣值得注意的是模型卡「持續改進」一節的誠實:它坦承部分提示詞會產生過飽和色彩(調低 cfg_scale 可緩解)、密集中英混排文字仍會出錯、嚴格受限的版面配置仍不精確、小臉小手等細節仍不穩定、大範圍多區域編輯仍會漂移。這種坦白在模型發布中相當少見,對評估是否能上線的人是實用資訊。

為什麼重要

開源前沿正從下方逼近。 Qwen、DeepSeek,到現在的商湯,整個 2026 年都在證明:開源權重可以在特定軸線上站上或貼近前沿,而不只是跟在後面。SenseNova-U1.5 是視覺創作領域至今最乾淨的範例:一個 8B、單節點就能微調的模型,在推理上贏過 Google 的專有產品。對新創公司而言,這消除了建立在別人限流 API 上的平台風險;對研究者而言,附帶 SFT 兄弟版本的 Apache 2.0 RL 檢查點是份大禮——你可以研究整條後訓練流程,而不只看終點。

效率是被忽略的暗線。 沒有 VAE、沒有獨立編碼器,意味著更少的組件、更少的記憶體、更短的路徑。模型卡明言原生 4K 的「生成效率提升」——而 8B 級統一模型直接輸出 4K,在一年半前聽起來是天方夜譚,當時 4K 意味著級聯放大器掛在數十億參數的擴散模型後面。

統一範式正在勝出。 SenseNova-U1.5 與 BAGEL、Qwen 統一模型等同期工作,標誌著這個領域正從管線式架構轉向「同一顆大腦又看又畫」的單一模型。VBVR-Pro-Bench 的結果暗示這不只是工程上的優雅——共享表徵可能真的有助於視覺推理。

動手試試

權重已在 Hugging Face(sensenova/SenseNova-U1.5-8B-MoT)與 ModelScope 上架,參考實作放在 SenseNova-U1 GitHub 儲存庫(Python 3.11、PyTorch 2.8、CUDA 12.8)。文生圖與編輯的推論腳本都有現成範例;SenseNova-Studio 提供免費的瀏覽器試玩,不需 GPU。BF16 權重分片後約 35GB,社群量化版本也已出現。

更大的啟示是:如果你的產品路線圖假設開源圖像模型會永遠落後一個世代,該重算一次了。差距不只縮小——在推理密集的視覺評測上,它已經反轉。