QwenLMは、テキストからの画像生成と画像の編集を一つのモデルで行える「Qwen-Image-2.1」を公開しました。このモデルは、生成の品質と推論効率、そして多機能性を両立させている点が特徴です。
生成と編集を一つのモデルで実現
Qwen-Image-2.1は、テキストから通常の画像や背景が透明なRGBA画像を生成できるほか、写真から被写体を抽出したり、既存の画像を編集したりすることが可能です。画像編集においては、最大10枚の参照画像を使用できるほか、円やペイントによる指示、マスクを用いた局所的な編集にも対応しています。また、人物や製品のアイデンティティを維持した編集も可能です。
高品質な2K解像度と効率的なアーキテクチャ
本モデルは、ビジュアル生成コンポーネントに7B(70億)パラメータを採用しています。軽量なアーキテクチャにより、低い計算コストで高い画質を実現しています。解像度については2Kに対応しており、1:1や16:9など、多様なアスペクト比での生成が可能です。さらに、タイポグラフィやポートレートのライティング、細部の描写においても改善が図られています。
開発環境への迅速な対応
リリースと同時に、DiffusersやComfyUIといった主要なツールでのネイティブサポートが開始されています。また、vLLM-OmniやSGLangなどの推論エンジンも対応しており、高パフォーマンスな推論が可能です。なお、プロンプトを詳細に書き換えるための専用モデルも提供されており、より高品質な結果を得るための活用が推奨されています。
