來源TechNode•最新收集於 44m
Qwen-Image-2.1 統一影像生成與編輯

#image-generation#image-editing#reference-imagesqwen-image-2.1alibabaqwenqwen-image-2.1
一個開源模型同時支援生成、編輯、透明背景與多圖參考。
30 秒速覽
有什麼變化
模型整合文字生圖與影像編輯功能。
為什麼重要
統一的開源工作流程可簡化目前需要串接多個生成與編輯模型的創意應用。參考圖片合成也可能提升產品、角色與行銷素材的一致性。
下一步行動
下載 Qwen-Image-2.1,並將透明輸出、遮罩編輯及 10 張圖片合成與目前的影像流程進行基準比較。
誰應關注:Creators & Designers
關鍵要點
- •模型整合文字生圖與影像編輯功能。
- •其視覺生成元件具備 70 億參數。
- •模型支援透明背景、局部編輯及最多 10 張參考圖片。
深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
增強重點摘要
- •模型採用輕量化 7.1B 參數架構與 32 層單流 Diffusion Transformer (DiT),自 Qwen-Image 1.0 的 20B MMDiT 設計顯著精簡,大幅降低推論資源消耗。
- •整合 Qwen3-VL-8B 視覺語言編碼器與客製化 16x RGBA 自動編碼器,原生支援 Alpha 透明通道生成與編輯,無需第三方去背工具即可分離主體。
- •原生支援最高 2048×2048 (2K) 解析度與 7 種長寬比輸出,針對中英文排版、海報及簡報字形呈現進行專門強化。
- •引入跨擴散步(Cross-Step)Prefix KV 快取技術,將文字與參考圖像編碼轉為一次性開銷,在 RTX 4090 上生成 1024×1024 影像僅需約 5 秒。
- •開源授權模式自先前的 Apache 2.0 轉向 Qwen Research License,未獲授權限制商業用途,同時首日即支援 ComfyUI 與 vLLM-Omni Serving 推論框架。
競品分析
Qwen-Image-2.1
- 核心架構 / 參數規模
- 7.1B 單流 DiT + Qwen3-VL-8B
- 原生透明度 (RGBA) / 影像編輯
- 支援原生 RGBA、局部筆刷/遮罩、最多 10 張參考圖統一工作流
- 基準測試評分 (GenAI Showdown)
- 7 / 15
- 授權條款
- Qwen Research License (限制商用)
Qwen-Image 1.0
- 核心架構 / 參數規模
- 20B MMDiT 架構
- 原生透明度 (RGBA) / 影像編輯
- 傳統文字生圖,缺乏原生統一編輯管線
- 基準測試評分 (GenAI Showdown)
- 4 / 15
- 授權條款
- Apache 2.0
Ideogram 4
- 核心架構 / 參數規模
- 閉源大型生成架構
- 原生透明度 (RGBA) / 影像編輯
- 強調排版與字體呈現,依賴特定編輯工具
- 基準測試評分 (GenAI Showdown)
- 8 / 15
- 授權條款
- 商業專有雲端 API
Krea 2
- 核心架構 / 參數規模
- 閉源即時生成架構
- 原生透明度 (RGBA) / 影像編輯
- 著重畫布即時渲染與風格參照
- 基準測試評分 (GenAI Showdown)
- 6 / 15
- 授權條款
- 商業專有雲端服務
| 模型 | 核心架構 / 參數規模 | 原生透明度 (RGBA) / 影像編輯 | 基準測試評分 (GenAI Showdown) | 授權條款 |
|---|---|---|---|---|
| Qwen-Image-2.1 | 7.1B 單流 DiT + Qwen3-VL-8B | 支援原生 RGBA、局部筆刷/遮罩、最多 10 張參考圖統一工作流 | 7 / 15 | Qwen Research License (限制商用) |
| Qwen-Image 1.0 | 20B MMDiT 架構 | 傳統文字生圖,缺乏原生統一編輯管線 | 4 / 15 | Apache 2.0 |
| Ideogram 4 | 閉源大型生成架構 | 強調排版與字體呈現,依賴特定編輯工具 | 8 / 15 | 商業專有雲端 API |
| Krea 2 | 閉源即時生成架構 | 著重畫布即時渲染與風格參照 | 6 / 15 | 商業專有雲端服務 |
技術深入
- 架構設計:由 7.1B 參數、32 層單流 Diffusion Transformer (DiT) 生成主幹,與 Qwen3-VL-8B 視覺語言編碼器協同組成
QwenImage21Pipeline。 - 自編碼器與透明度:採用客製化 16x RGBA 自動編碼器(VAE),支援原生 Alpha 通道解析,實現影像主體提取與多圖層局部編輯。
- 推論加速機制:導入跨步 Prefix KV Cache 技術,固定文字提示詞與參考圖像的注意力矩陣,使 1024×1024 影像在企業級 GPU 推論僅需約 4.5 秒、RTX 4090 約 5 秒。
- 生態整合:推論端無縫接入 vLLM-Omni,原生支援張量並行(Tensor Parallelism)、連續批處理(Continuous Batching)以及 FP8 權重降精量化;工作流端支援 ComfyUI (v0.37.0+)。
前景展望基於引用來源的 AI 分析
邊緣端與個人創作者的影像編輯工作流將高度標準化
7.1B 單流架構結合 5 秒級的消費級顯卡推論速度,使高品質局部編輯與原生透明圖層生成得以直接在本地端實現。
商業影像應用將面臨更嚴格的授權與合規成本審查
該模型由完全開放的 Apache 2.0 轉向研究導向授權,將促使企業在進行大規模商用部署時必須另外取得阿里巴巴的官方商業授權。
時間線
2024-09
阿里開源 Qwen-Image 1.0 (20B MMDiT 架構,採 Apache 2.0 授權)
2026-09
發布 Qwen-Image-2.1,統一 7.1B 單流架構、原生 RGBA 與多圖參照編輯功能
- 2024-09阿里開源 Qwen-Image 1.0 (20B MMDiT 架構,採 Apache 2.0 授權)
- 2026-09發布 Qwen-Image-2.1,統一 7.1B 單流架構、原生 RGBA 與多圖參照編輯功能
來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechNode ↗
每週電子報
每週一封,可隨時退訂。



