單一模型原生支援 RGBA,但先看授權:Qwen-Image-2.1 帶著 7B DiT 與但書登場
阿里巴巴 Qwen 團隊發布 Qwen-Image-2.1:7B 單流 DiT 架構,一個模型同時搞定文生圖與圖像編輯、原生透明通道輸出,但授權從 Apache 2.0 改為僅限研究的 Qwen Research License。
阿里巴巴的 Qwen 團隊再次悄悄改寫了開源圖像生成領域的格局。9 月 20 日,團隊將 Qwen-Image-2.1 推上 Hugging Face 與 ModelScope——這是一個統一的文生圖與圖像編輯模型,視覺生成組件僅 70 億參數、由 32 層單流 DiT(Diffusion Transformer)構成。這次發布在技術上令人印象深刻,但伴隨的授權變更,將實際決定誰能真正基於它來打造產品。
這次發布了什麼
基礎模型早在 9 月 14 日前後就已低調上傳至 Hugging Face,今天則是搭配一系列週邊檢查點的完整上線。核心賣點是:一個緊湊的模型同時支援生成、編輯,而且——很少見地——原生透明(RGBA)圖像生成,全部整合在單一架構內。
根據官方模型卡,這次發布有四大改進:
- 緊湊且高效。 採用混合粒度注意力(mixed-granularity attention)與前綴 KV 快取重用(prefix KV cache reuse)的輕量架構,以低運算成本交付強勁的圖像品質。這是明確的「效率」路線:不靠堆疊越來越大的 transformer,而是把 DiT 控制在 32 層、讓每一層都更便宜。
- 原生透明、生成編輯一體。 模型可以直接從文字生成普通或透明 RGBA 圖像、編輯既有透明圖層、從照片中摳出主體——不需要外掛摳圖模型或額外的 alpha 預測步驟。
- 多樣的編輯能力。 單次編輯請求最多支援 10 張參考圖,局部編輯可透過圈選、塗抹標註或獨立遮罩指定。人物與商品的身分保持(identity preservation)被明確點名為重點功能——官方展示中用六張人像參考圖合成團體照,就是招牌示範。
- 更真實的紋理與美感。 改進了排版文字渲染、人像打光與細節呈現。
在底層配置上,這條 pipeline 由 7B DiT 搭配 Qwen3-VL 8B 文字編碼器(負責理解提示詞的視覺語言模型)與 64 通道 RGBA VAE 組成,原生輸出 2048×2048、40 步取樣。開箱即支援七種長寬比,從 1:1(2048×2048)到 16:9(2752×1536)與 9:16 直式。
與基礎模型一同發布的,還有兩個 9B 的提示詞改寫檢查點——PE-T2I 與 PE-I2I,都在今天上線。它們位於生成器之前,把使用者提示詞改寫成模型更容易理解的形式,這是 Qwen 一貫用來在有限參數量下榨出更高保真度的手法。
但書:授權變了
社群最快注意到的,就是這一點。先前版本的 Qwen-Image 系列——包括下載量驚人的基礎版與 Edit 編輯版——都採用 Apache 2.0 完全開源授權。Qwen-Image-2.1 則改採 Qwen Research License Agreement,這是一份禁止商業使用的授權:允許研究用途,商業使用者需要另外簽訂協議。
這個轉變之所以重要,是因為 Qwen-Image 早已成為開源圖像生成的事實標準:它在 AI Arena 上同時拿下文生圖與圖像編輯第一名,其檢查點支撐著無數 ComfyUI 工作流、LoRA 微調與下游產品。2.1 版的研究限縮條款,讓商業業者面臨三選一:與阿里巴巴談判授權、繼續使用舊的 Apache 授權版本,或者遷移到 FLUX、SD3.5 等維持寬鬆授權的競爭對手。
值得一提的是,這個方向其實早有跡可循——六個月前社群就曾討論過 Qwen-Image-2.0 可能不再以 Apache 條款開源的跡象。2.1 的發布證實了戰略方向:阿里巴巴樂於把世界級模型送給研究者,但「商業上隨便用」的時代顯然正在畫下句點。
生態系反應極快
無論授權怎麼寫,工具生態系沒有等待。上線數小時內:
- Comfy-Org 發布了 ComfyUI(多數本機使用者依賴的節點式生成工具)的封裝版本。
- 多位維護者(leejet、AlperKTS、Abiray)推出了 GGUF 量化版本,把模型壓進消費級 GPU。
- FlagRelease 發布了針對五個中國晶片平台——NVIDIA、MetaX、海光(Hygon)、昇騰(Ascend)、摩爾線程(Moore Threads)——的 BF16 版本,生動展示了如今中國重大模型發布必然伴隨的國產加速器相容佈局。
- Hugging Face 上當天就出現了多個提供線上 demo 的社群 Space。
這個速度本身就是重點。即使在限制性授權之下,一個能靠單張 16GB 級 GPU 搭配 CPU offload(官方支援 enable_model_cpu_offload)舒適運行的 7B 模型,本週就會被數千名研究者拆解、微調、跑分。發布當天,模型樹上的微調與量化版本就已經開始累積。
為什麼重要
這次發布凸顯了開源權重圖像生成的兩條分歧路線。一邊是:把每參數的效能做到極致、原生支援 RGBA 這類多模態特性、把生成與編輯統一進單一檢查點——Qwen-Image-2.1 可以說是迄今公開發布過最強的緊湊型圖像模型。另一邊是:不斷收緊的授權,把「開源」變成「開放研究」,從寬鬆授權時代建立起來的生態系中回收商業價值。
對研究者與愛好者來說,這是一份大禮:最先進的 7B DiT,支援透明圖像生成、多參考圖編輯、遮罩式局部控制,而且遊戲筆電就能跑。對那些把產品路線圖建立在「Qwen-Image 會永遠維持 Apache 授權」假設上的公司來說,今天是一記警鐘:「開放」是有等級之分的——而且等級可能在版本之間毫無預警地改變。
技術報告與完整跑分將在未來幾週揭曉更多細節,但眼前的結論很簡單:最好的小型圖像模型變得更強了,而你能使用它的條件變得更窄了。這兩個事實都將形塑未來一年的圖像生成工具生態。