Alibaba、画像生成モデル「Qwen-Image-2.1」を公開 2K・透過出力に対応
QwenAlibaba画像生成オープンモデルComfyUI
Alibaba の Qwen チームが画像生成モデル「Qwen-Image-2.1」を公開しました。ネイティブ2K解像度、最大10枚の参照画像を使った編集、透過(RGBA)出力、マスクや丸囲みによる部分編集に対応。Diffusers や ComfyUI でも利用できますが、ライセンスは「Qwen Research License」です。
何が発表されたか
Alibaba の Qwen チームは2026年9月20日、画像生成モデル「Qwen-Image-2.1」を GitHub、Hugging Face、ModelScope で公開しました。
主な仕様
- 画像生成部は7Bパラメータ、32層の Single-Stream DiT
- ネイティブ2K解像度。アスペクト比は 1:1、4:3、3:4、3:2、2:3、16:9、9:16 に対応
- 既定の出力サイズは2048×2048、推論ステップは既定40
できること
- テキストからの画像生成
- 最大10枚の参照画像を使った画像編集
- 透過(RGBA)出力に対応し、生成と編集を1つのモデルで扱える
- 丸囲み、手描きの注釈、マスクによる部分編集
- 人物や商品の同一性を保った生成
- タイポグラフィ(文字表現)やポートレートの光の表現を改善
対応フレームワーク
- Diffusers(
QwenImage21Pipeline) - ComfyUI(ネイティブ対応、サンプルワークフローあり)
- vLLM-Omni、SGLang、LightX2V
開発者への影響
- EC・制作実務で使いやすい機能が揃った:透過出力や商品の同一性保持、部分編集は、商品画像の差し替えやバナー素材づくりと相性のよい機能です。
- 既存のワークフローに組み込みやすい:ComfyUI と Diffusers に最初から対応しているため、ローカル環境や自社パイプラインで試しやすくなっています。
- ライセンスの確認が必須:ライセンスは「Qwen Research License Agreement」です。案件や自社サービスでの商用利用を考える場合は、利用条件を事前に確認してください。
