返回資訊
AI趨勢入門

Qwen-Image-2.1 開權重:視覺生成 7B、原生 RGBA,授權從 Apache 改成研究用

2026年9月21日
易賺Ai團隊
12 分鐘閱讀
#Qwen#開放權重#Hugging Face#文生圖#圖像生成
Qwen-Image-2.1 開權重:視覺生成 7B、原生 RGBA,授權從 Apache 改成研究用

同一個早上,Hugging Face 上出現三份檢查點,而不是一份。Qwen/Qwen-Image-2.1 是圖像模型本身:32 層單流 DiT,視覺生成部分 7B 參數,配 Qwen3-VL 8B 文字編碼器,以及 64 通道、16 倍空間壓縮的 RGBA 變分自編碼器。另外兩份是提示改寫器:Qwen-Image-2.1-PE-T2I 負責文生圖,Qwen-Image-2.1-PE-I2I 負責編修,都是微調過的 Qwen3.5-VL 9B,各約 18.8 GB。OrcaRouter 記下 I2I 那份上傳時間是 08:46 UTC。官方部落格、GitHub 新聞欄、模型卡與授權檔,都標在同一天。

The Decoder、Gate News 與模型卡對得上同一組功能宣告:文生圖與圖像編修收進同一個權重;原生輸出一般圖或透明 RGBA;最多十張參考圖;局部編修可用圓圈、手繪標註或另給遮罩。預設解析度 2048×2048,推論步數 40。授權檔寫的是 Qwen Research License Agreement,明文「僅限非商業用途」,商用必須另向廠商申請。較早的 Qwen-Image 線曾用過 Apache 2.0。這次放出的是開放權重,不等于能拿去賣。

獨立評測還沒出現。官方部落格引用的 Qwen-Image-Bench 對照圖,數字來自廠商自己。The Decoder 寫明第三方基準仍待跑。提早拿到權重的人,現在比的不是排行榜,是這三份檔案到底讓不讓你在自己的卡上把一張透明貼紙跑完。

7B 指的是哪一塊,下載體積為什麼接近 33 GB

「7B」很容易被讀成整包模型只有 70 億參數。模型卡寫的是視覺生成組件 7B、32 層單流 DiT。文字編碼器是另一塊 Qwen3-VL 8B;VAE 又是一塊。三件加起來大約 33 GB,其中文字編碼器約 17.5 GB,擴散 Transformer 本身大約 14 GB。主導下載體積的不是生圖的那 7B,是讀懂你那句提示詞的編碼器。

架構上,模型卡寫的是混合粒度注意力,以及前綴 KV 快取 重用:文字側用 token 級因果遮罩,圖像生成側用塊級雙向遮罩;檢查點帶 causal_condition: true 時,前綴快取會啟動。訓練目標是 流匹配,排程用 Euler discrete。這不是把舊的 U-Net 擴散模型 再縮一輪,而是單流 DiT 加上專門為透明通道設計的 VAE。

官方給了七種長寬比預設,而不是只鎖正方形:

比例寬 × 高
1:12048 × 2048
4:32400 × 1792
3:41792 × 2400
3:22528 × 1696
2:31696 × 2528
16:92752 × 1536
9:161536 × 2752

文生圖 範例用 QwenImage21Pipeline,提示詞直接寫霓虹招牌與雨夜反光;圖生圖 範例把背景改成日落海灘。透明圖有官方建議的提示格式,必須寫明這是帶 alpha 通道、背景透明的 RGBA 圖像。顯存不夠時,模型卡給的是標準後門:pipe.enable_model_cpu_offload()。The Decoder 寫它能在 RTX 3090 這類消費級卡上跑;那是「能力上做得到」,不是「40 步、2K、十張參考圖仍然輕鬆」。

透明圖層與十張參考圖,是這次真正能動手的功能

功能清單裡,最不像行銷套話的是 RGBA。多數開源生圖權重輸出三通道 RGB,要透明背景得再跑一輪去背。Qwen-Image-2.1 把透明當成原生模式:從文字生成透明圖、編修既有透明圖層、再從普通照片把主體取出來。官方展示的是貼紙、物件分離、在透明層上改字。對做素材的人來說,這比「畫質更強」具體:輸出可以直接進後製,不必先賭去背模型有沒有把頭髮切乾淨。

第二件是參考圖數量。模型卡寫最多十張。官方展示把六張單人肖像合成一張團體照,並宣稱能保人物與商品身份。局部編修不靠純文字硬猜座標,而靠圓圈、筆刷或獨立遮罩。虛擬試穿、房間佈置、把一組商品圖拼進同一場景,都落在這條能力上。Qwen 還說架構改動與 KV 快取重用,會讓多張參考圖時的 推理 比較快。

這些都是廠商宣告。唯一接近獨立的手感資料,來自一位走 Qwen Ambassador 提早試用、後來用正式權重在 ModelScope Studio 重跑的評測者。OrcaRouter 轉述:文生圖大約 10 到 15 秒,編修大約 18 到 23 秒;鏡頭位置預設與多角色分配表現不錯;多參考一致性大約從三張輸入開始變差,側馬尾在側面角度會塌成中分馬尾。那是一個人、一套介面、計時器沒被公開截圖。它能當故障模式預告,不能當基準分數。

真正決定畫面語言的,是 PE-I2I 那份系統提示

多數報導會停在 7B。比較少人打開的是提示增強檢查點。圖像模型看到的不是你打的那句提示詞,是改寫器重寫過的指令。I2I 那份的輸入形狀很硬:一定有一張輸入圖,所以它永遠是編修任務,不會從空白畫布文生圖。倉庫裡 prompt_rewrite/ 同時服務 T2I 與 edit,提供 transformers 路徑、vLLM 路徑、serve.shclient.py,以及共用的 pe_core.py

system_prompt.txt 把語言拆成兩件獨立的事。描述語言跟使用者指令走:中文指令就中文描述,英文指令就英文描述;日文、韓文、法文、泰文或其他語言的指令,描述改寫成英文。畫進畫面裡的文字是另一套優先序:使用者指定了精確字串或目標語言,就照做;沒指定就跟輸入圖裡既有文字的主導語言對齊,即使指令是另一種語言;圖裡沒有字、也沒點名語言,才用指令本身的語言,而且不要強行改成英文。倉庫還給了一個例子:圖面以泰文為主,英文指令沒點名語言,輸出文字必須仍是泰文。畫面文字必須單語,不能中英並陳;規格表或分鏡這類版型,靠排版與字體達成,不准靠把標籤翻成英文來假裝專業。

這段系統提示能被讀、被 diff、被覆蓋。閉源託管模型把同一層藏在服務端。對要做包裝、海報、多語素材的人,改寫器把泰文標籤「好心」翻成英文,跟模型畫錯一隻手,後果一樣:資產直接作廢。2.1 把這層決策公開了。它沒有把這層決策保證做對。

授權改成研究條款,是比參數數字更硬的產品決策

Qwen-Image 家族並不是第一次開權重。較早的線用過 Apache 2.0,商用相對乾淨。2.1 的授權檔日期與權重同一天,標題是 Qwen Research License Agreement,授權範圍寫成僅限非商業。要商用,得另向 Qwen 申請,條款與價格都還沒公開。也沒有公布 2.1 的託管端點價目。

同一年稍早,Qwen-Image-3.0 走的是相反方向:封閉託管、不放權重,主打「Real」。2.1 把較小的視覺生成組件公開,但把法律門檻從 Apache 收到研究許可。兩次發布隔了約四個月,賭注相反。開權重讓研究者能在自己的 GPU 上拆 VAE 與改寫器;研究授權讓法務不能把「Hugging Face 能下載」寫進可以上架的產品。

這跟站內寫過的 Qwen 語言權重不是同一條產品線。Qwen3.8-27B Apache 2.0 落地 解決的是單卡可商用的多模態對話;Qwen3.8-2.4T-A95B 開權重 解決的是 Max 級語言旗艦能不能自架。2.1 解決的是圖像生成能不能在消費級卡上跑完透明圖層。三件事都叫 Qwen,授權與模態都不一樣。把 27B 那份 Apache 習慣套到 2.1,會在第一張要賣的海報上踩線。

框架比評測先到,這是這次比較安靜的好消息

權重公開當天,推論路徑已經有人接上。Hugging Face Diffusers 合入 QwenImage21Pipeline,模型倉庫帶對應標籤。ComfyUI 提供原生文生圖與編修工作流模板,另有一份相容權重倉庫。vLLM-Omni 寫了逐步執行、前綴 KV 快取、CUDA Graph decode、FP8 量化與張量/Ulysses 平行。SGLang 的原生支援 pull request 在權重公開前三天就合入,涵蓋 DiT、RGBA VAE、Qwen3-VL 條件、多參考圖與 RGBA 輸入輸出,並在 H200、B200、RTX PRO 6000、RTX 5090、RTX 4090 上驗證過。LightX2V 提供加速,並經 ROCm 走到 AMD Radeon。

權重還沒公開就先合框架,代表服務路徑是對著檢查點測的,不是事後照模型卡補的。對一份文字編碼器比 DiT 還大的包,這差在一個下午能跑,還是一個週末在對版本。OrcaRouter 寫明他們路由層當下沒有把 2.1 收進去,並列的仍是 OpenAI 的 GPT-Image 家族、Google Imagen 4 與 Gemini 圖像預覽、xAI 的 Grok Imagine。換句話說:你可以在自己機器上評這份權重,但還沒有一條「失敗就自動切回閉源圖像 API」的現成備援,是你自己要接的。

ModelScope 在權重公開前三天發過 50 個早鳥名額,要求入選者在期限前公開樣本或評測。沒有發表會,沒有基準禁運,沒有媒體巡迴。The Decoder 能引的獨立數字因此幾乎是零。官方宣稱 7B 視覺生成在自家榜上勝過多數閉源模型——這句話現在只能標成「廠商自評,待複現」。

對只想今晚試試看的人,路徑很短:從 Hugging Face Hub 或 ModelScope 拉權重,用 Diffusers 或 ComfyUI 跑一張 RGBA 貼紙,記得授權是研究用。對要把這套接進商品圖管線的人,缺的不是範例程式,是三份還沒出現的文件:第三方基準、託管價目、以及一份寫明可以商用的授權。7B 讓消費級卡有機會加入評測;研究條款讓這次開權重停在實驗室門口,進不了商店後台。