隨著開源生成式 AI 模型的飛速演進,Qwen 團隊最新推出的 Qwen-Image-2.1 帶來了令人驚豔的突破。這款模型最大的亮點在於「小模強效、創改一體」,其視覺生成模組僅具備 7B 參數,卻將高品質的文字生成圖片(Text-to-Image)與基於指令的影像編輯(Image Edit)完美整合於同一套權重中。不僅原生支援高達 2K 解析度輸出與透明通道(Alpha 通道)生成,更藉由混合粒度注意力結構與靜態 KV 快取(KV Cache)機制大幅優化了推理效能,使得本地端消費級顯示卡也能輕鬆駕馭複雜的多圖參考編輯任務。
在 ComfyUI 的生態支援下,官方已迅速釋出原生工作流模板,讓創作者無需自行摸索複雜節點即可快速上手。Qwen-Image-2.1 的影像編輯節點支援多達 10 張的參考圖輸入,提示詞中只需以 <image1>、<image2> 的標籤語法即可精準對應角色主體與服飾特徵。本次實測在 RTX 5070 Ti 16GB VRAM 與 64GB RAM 的本地硬體環境下,首次加載生成僅需約 39 秒,後續單次算圖更縮短至 22 秒左右,直出 1280 x 960 px 的高畫質成果。接下來我們將透過兩張素材圖片「萌芽娘」原圖與「黑色系蘿莉塔洋裝」參考圖,示範如何一鍵為角色精準換裝!

▲ 本次透過 Qwen-Image-2.1 實現精準角色換裝的成果展示圖。左側為萌芽娘原圖參考,中間為目標黑色系蘿莉塔洋裝,右側則是最終生成效果,可見不僅完整保留了角色的髮型、神韻、姿態與背景溪流環境,同時將繁複的蕾絲花邊與黑色服飾完美替換。

▲ 開啟 ComfyUI 介面後,點擊左側選單欄位中的「Templates」模板庫,即可進入官方預設工作流清單。

▲ 在 Templates 視窗中切換至「Image」分類,於右上角搜尋欄位輸入「Qwen Image 2.1」,點選左側的「Qwen Image 2.1: Image Edit」影像編輯工作流模板。

▲ 載入工作流後,右側 Workflow Overview 面板會提示缺失的模型組件。點擊紅箭頭標示的「Download all (16.1 GB)」按鈕,系統便會自動下載並部署所需的 VAE、Text Encoder 與 Diffusion Model 權重。
對應的 safetensors 檔案放置於本地端 ComfyUI 的模型目錄中,實際儲存路徑如下:
- Diffusion Model:
C:\Users\User\ComfyUI-Shared\models\diffusion_models\qwen_image_2.1_int8_convrot.safetensors - Text Encoder:
C:\Users\User\ComfyUI-Shared\models\text_encoders\qwen3vl_8b_int8_convrot.safetensors - VAE:
C:\Users\User\ComfyUI-Shared\models\vae\qwen_image_2.1_vae_bf16.safetensors

▲ 檔案下載完畢後,可以在對應的資料夾中確認權重檔已完整儲存。模板預設採用 int8 量化版本的 Diffusion Model 與 Text Encoder,不僅大幅減少顯存負擔,也能維持與 bf16 相當的高水準品質。

▲ 在工作流左側的兩個 Load Image 節點分別載入萌芽娘原圖(image 1)與黑色蘿莉塔服裝(image 2)。提示詞設定要求保留 <image1> 的角色特徵與姿勢,並換上 <image2> 的服飾。設定完成後點擊「Run」按鈕即可開始執行生成運算。
📝 提示詞:Keeping the character and pose in <image1> unchanged. Put this cloth from <image2> on the character, while preserving the original facial features, hair, body shape, and pose.

▲ 最終生成的 1280 x 960 px 高畫質換裝成品。萌芽娘眨眼的俏皮神情、藍綠色長髮以及溪流岩石背景皆獲得高度保真,同時完美穿上了層次豐富的黑色蘿莉塔洋裝、蕾絲頸圈與黑絲襪,展現 Qwen-Image-2.1 強大的多圖參考與局部換衣能力。這張是第一次生成的成果,如果不滿意可以多生成幾張,選一張效果最好的。
《上一篇》PixAI 從零打造日系動態壁紙!一站生成到底的體驗分享
《下一篇》ComfyUI x Qwen-Image-2.1:7B 參數小而強大的圖片生成模型是否支援 NSFW?實測角色脫衣! 









留言區 / Comments
萌芽論壇