Qwen Image 2.1: лучшая открытая модель генерации изображений
Что охватывает эта статья о Qwen Image 2.1
- Возможности Qwen Image 2.1 и почему эта модель переворачивает рынок открытых сетей для работы с изображениями.
- Сравнение с Flux, Imagen, GPT Image, Seedream и Stable Diffusion.
- Какое оборудование нужно, чтобы запустить модель с 7 триллионами параметров на собственном сервере.
- Ограничения: лицензирование, референс-изображения и особенности редактирования.
- Как попробовать Qwen Image 2.1 в ComfyUI или напрямую через Diffusers.
Qwen Image 2.1: почему эта модель имеет значение
Когда Alibaba выпускает новую модель, весь мир искусственного интеллекта рефлекторно закатывает глаза, а потом смотрит еще раз. И не зря. Qwen Image 2.1 открыта с 20 сентября 2026 года и попадает прямо в боль, где открытые модели до этого слабели: она объединяет генерирование и редактирование изображений в одной модели, чистит текст, создает родную прозрачность и обрабатывает одновременно 10 референс-изображений.
Примечательная деталь: визуальный компонент генерации содержит только 7 миллиардов параметров, распределённых на 32 однопотоковых DiT слоя. Для сравнения: многие конкурирующие модели требуют намного больше вычислительных ресурсов для сопоставимых результатов. Alibaba опирается на компактную архитектуру с Mixed-Granularity-Attention и Prefix-KV-Cache, что заметно ускоряет инференс.
В собственном бенчмарке Qwen, Qwen-Image-Bench, модель получила 60,28 балла, что выше среднего всех протестированных моделей (59,82). Она превосходит Google Nano Banana 2, ByteDance Seedream 5.0 и обе варианты Flux 2. Впереди только шесть закрытых моделей, во главе с OpenAI GPT Image 2.5 Sunburst с 67,01. Важно уточнить: это цифры самого Qwen, независимого подтверждения пока нет. Но даже самый критичный взгляд не меняет факт, что ни одна другая открытая модель для работы с изображениями сейчас не конкурирует в этом сегменте.
Qwen Image 2.1 вкратце: одна модель для всего
Раньше при локальной работе с изображениями была чёткая специализация: одна модель генерирует, другая редактирует, третья занимается inpainting, а для прозрачных PNG нужны специальные модели типа Qwen-Image-Layered. Qwen Image 2.1 упаковывает всё это в один checkpoint.
Конкретно это означает:
- Текст в изображение: классическая генерация с нативным выводом в 2K в разных соотношениях сторон.
- Родная прозрачность: модель создаёт RGBA-изображения, то есть PNG с настоящим альфа-каналом. Вы просите по промпту прозрачный объект и получаете не поддельную прозрачность в клеточку, а аккуратно выделённый слой.
- Редактирование с референсами: до 10 референс-изображений на задачу. Например, объедините фото товара с новым фоном или создайте групповое фото из шести портретов.
- Локальное редактирование: отмечаете области кругом, стрелкой или отдельной маской, и модель изменяет только эту часть. Идентичность людей и товаров при этом сохраняется, по крайней мере в большинстве случаев.
- Рендеринг текста: семейство Qwen Image всегда было сильным в выводе читаемого текста. Версия 2.1 улучшает типографику, включая немецкие умляуты и китайские иероглифы.
Последний пункт в реальной работе стоит золота. Кто пробовал создать с помощью Stable Diffusion миниатюру YouTube с читаемым заголовком, знает результат: творческий салат из букв. Qwen просто пишет текст правильно.
Сравнение: Qwen Image 2.1 против Flux, Imagen и GPT Image
Честное сравнение разделяет два мира: закрытые облачные модели и открытые веса. Qwen Image 2.1 не выиграет конкурс красоты против лучшей модели OpenAI, но это и не нужно: это лучшая модель, которую вы можете запустить на собственном оборудовании.
| Модель | Открытые веса | Сильные стороны | Слабые стороны | Локальное использование |
|---|---|---|---|---|
| Qwen Image 2.1 | Да | Рендеринг текста, редактирование, прозрачность, 10 референсов, быстрая | Нет коммерческого использования без лицензионного соглашения | Да, от 16 до 24 GB VRAM |
| Flux 2 Pro / Max | Частично (Flux.1) | Отличная эстетика, устоявшиеся ComfyUI-рабочие процессы | Pro-версии только через API, нет нативного редактирования | Flux.1 да, Flux 2 частично |
| Stable Diffusion 3.5 / SDXL | Да | Огромное сообщество, LoRA, ControlNet | Слабый текст, редактирование требует дополнительных моделей | Да, очень экономная |
| GPT Image 2.5 Sunburst | Нет | Лучший общий балл (67,01), сильная креативность | Только API, дорого, локальный запуск невозможен | Нет |
| Nano Banana 2 (Gemini) | Нет | Быстрая, хорошая креативность | Google контролирует, требует API | Нет |
| Seedream 5.0 (ByteDance) | Нет | Сильный фотореализм | Только API, мало локальных вариантов | Нет |
| Imagen 4.0 / Ultra | Нет | Высокое качество изображения | Требует API, уступает Qwen 2.1 | Нет |
Если резюмировать таблицу, получается простой вывод: кто хочет генерировать изображения локально и нужно больше, чем простая генерация текст-в-изображение, сейчас не обойти Qwen Image 2.1. Flux.1 имеет более сильное сообщество и больше LoRA, Stable Diffusion самую большую экосистему. Но ни одна из них не может сразу дать прозрачные слои, 10 референсов и чистый текст в одной модели.
Оборудование для Qwen Image 2.1: что нужно
7 миллиардов параметров звучит много, но в области ИИ для работы с изображениями это удивительно компактно. В точности BF16 нужно грубо 16-20 GB VRAM. С FP8-квантизацией, которую поддерживают и vLLM-Omni, и ComfyUI, модель крутится на RTX 5090 с 32 GB комфортно, а с 8-битными вариантами и на картах с 16-24 GB.
Первые тесты сообщества показывают: 40 шагов сэмплирования при 1024x1024 на RTX 5090 это дело секунд, а не минут. Для тех, у кого нет настольной видеокарты, есть стандартные варианты: аренда облачного GPU или использование хостированного демо на Hugging Face.
Интеграция, кстати, произошла изумительно быстро: ComfyUI, Diffusers (QwenImage21Pipeline), vLLM-Omni, SGLang и LightX2V все имели готовую поддержку в день релиза. Если у вас уже есть настройка ComfyUI, загружаете веса с Hugging Face и начинаете работать. Наш путь обучения локальному ИИ показывает основы, если ComfyUI для вас новое.
Редактирование изображений с референсами: где Qwen Image 2.1 сияет и где спотыкается
Главная фишка это работа с референс-изображениями. Вы даёте модели фотографии людей, товаров или сцен, и она составляет из них новое. Картинки для e-commerce, листы персонажей для раскадровок, фотографии товаров в новой обстановке: это именно задачи, для которых раньше требовались профессионалы Photoshop или дорогие API.
Независимые тесты, однако, показывают и слабые стороны. На референс-фотографиях модель склонна дословно вклеивать лицо из референса. Тело стоит боком с зонтиком, а лицо упёрто смотрит в камеру. Новые позы и необычные ракурсы камеры работают ненадёжно. Многостраничные проекты вроде книжек с картинками тоже не сильная сторона модели, здесь специализированные сервисы иногда лучше.
Будьте объективны: для 7B-checkpoint, запускающегося локально, уровень всё равно невероятно хороший. Год назад весь этот набор функций был исключительно привилегией облачных моделей.
Лицензия Qwen Image 2.1: главный подвох
Вот то, о чём восторженные отчёты предпочитают не говорить. Qwen Image 2.1 нельзя использовать в коммерческих целях без разрешения. Веса распространяются под лицензией для исследований: загружай, экспериментируй, исследуй, всё разрешено. Как только захочешь зарабатывать, нужно отдельное соглашение с Alibaba.
Это отличает модель от Flux.1 Dev или Stable Diffusion, где коммерческое использование возможно в зависимости от варианта лицензии. Для домашней лаборатории, обучающих проектов и личных экспериментов: без проблем. Для генератора изображений в SaaS-продукте: сначала прочитай лицензию, потом разрабатывай. Детали регулирует файл лицензии в репозитории Hugging Face.
Ключевые термины для Qwen Image 2.1
- Qwen Image 2.1 на Hugging Face, официальные веса и лицензия. Когда полезно: всегда первое место для скачивания.
- ComfyUI, узловой интерфейс для моделей изображений. Когда полезно: если хочешь строить воркфлоу визуально вместо написания кода.
- Diffusers, Python-библиотека с
QwenImage21Pipeline. Когда полезно: когда встраиваешь генерацию в собственные скрипты или агентов. - Qwen Image Bench, собственный бенчмарк Qwen с 18 моделями. Когда полезно: для контекста результатов, помня что производитель готовит тестовую среду.
- RGBA-генерация, изображения с настоящим альфа-каналом. Когда полезно: логотипы, стикеры, слои для композитинга.
- FP8-квантизация, веса в 8-битной форме с плавающей точкой. Когда полезно: уменьшает потребление VRAM вдвое с едва заметной потерей качества.
Типичные ошибки при работе с Qwen Image 2.1
Недостаточно VRAM в полной точности. BF16 требует 16-20 ГБ. На картах меньше сразу используй FP8, иначе первый запуск закончится Out-of-Memory вместо изображения.
Опорные фото без указания позы. Дай модели чёткие инструкции о позе и перспективе, иначе получишь просто вклеенное опорное лицо. Чем точнее промпт, тем лучше переопозиционирование.
Коммерческие планы без проверки лицензии. Лицензия для исследований щедра для экспериментов и жестока при зарабатывании. Если проект должен приносить доход, разбирайся с лицензией до первого сгенерированного товарного изображения.
Перенесение ожиданий из облачных бенчмарков. 60,28 балла получены в собственной оценке Qwen. На практике: для локальной работы модель несравненно хорош, против самых дорогих облачных моделей проигрывает в абсолютных показателях. Для 99 процентов домашних применений этого достаточно.
Дополнительные ссылки и информация по Qwen Image 2.1
Самое главное кратко:
- Qwen Image 2.1 объединяет генерацию, редактирование и прозрачность в одной 7B-модели.
- Работает локально от 16 ГБ VRAM с FP8, нативный вывод 2K.
- Самая сильная открытая модель для изображений по сравнению с Flux и Stable Diffusion, особенно для текста и редактирования с опорой.
- Коммерческое использование требует отдельной лицензионной сделки.
- Поддержка в день релиза в ComfyUI, Diffusers, vLLM-Omni и SGLang.
Связанные статьи на BotServ.de: Запуск моделей для изображений локально, ПК для генерации изображений и путь обучения для локального AI.
Если хочешь встроить воркфлоу в собственные скрипты, стоит изучить основы Python. На IRC-Coding.de есть более 500 статей по программированию, ботам и AI-темам, которые помогут при старте.
Часто задаваемые вопросы: Qwen Image 2.1
Qwen Image 2.1 бесплатна?
Веса модели бесплатны для загрузки и свободны для исследований и личного использования. Для коммерческого использования нужно отдельное лицензионное соглашение с Alibaba.
Могу ли я запустить Qwen Image 2.1 локально?
Да. С FP8-квантизацией модель работает на видеокартах с примерно 16-24 ГБ VRAM, например RTX 4090 или RTX 5090. ComfyUI и Diffusers поддерживают её со дня релиза.
Qwen Image 2.1 лучше Flux?
В собственном бенчмарке Qwen версия 2.1 опережает Flux 2 Pro и Flux 2 Max. Плюс функции, которых в Flux нет в стандартной поставке: прозрачные изображения, до 10 опорных изображений и намного лучший рендер текста. Зато Flux.1 имеет более большую экосистему LoRA и воркфлоу сообщества.
Qwen Image 2.1 действительно рендерит текст в изображениях?
Да, и это одна из главных сильных сторон. Семейство Qwen Image всегда было лидером в рендере разборчивого текста, включая немецкие умлауты и сложные иероглифы. Версия 2.1 улучшает типографику и качество шрифтов ещё больше.
Что означает встроенная прозрачность в Qwen Image 2.1?
Модель создаёт RGBA-изображения с настоящим альфа-каналом, не имитированную прозрачность. Можно генерировать вырезанные объекты, логотипы и стикеры прямо как прозрачный PNG.
Сколько опорных изображений поддерживает Qwen Image 2.1?
До 10 опорных изображений на задачу. Например, можно создавать групповые фото из отдельных портретов или товарные снимки в новых окружениях.
Какое разрешение достигает Qwen Image 2.1?
Нативно до 2K в различных соотношениях сторон. Для более высоких разрешений используй аптскейлеры в воркфлоу как и с другими моделями.
Нужна ли мне RTX 5090 для Qwen Image 2.1?
Нет. RTX 5090 удобна, но FP8-варианты работают и на картах с 16-24 ГБ. При меньшем VRAM есть опции выгрузки памяти в ComfyUI, тогда генерация просто займёт больше времени.
Qwen Image 2.1 хороша для немецких пользователей?
Да. Модель хорошо понимает немецкие промпты и правильно рендерит немецкий текст с умлаутами в изображения. Управление в ComfyUI в любом случае идёт через английские или смешанные промпты, оба варианта работают.
В чём отличие от Qwen Image Layered?
Qwen Image Layered была отдельной специальной моделью для прозрачных изображений. Версия 2.1 встраивает эту способность прямо в основную модель, отдельный чекпоинт больше не нужен.
Источники и дополнительная литература
- QwenLM/Qwen Image 2.1 на GitHub
- Qwen/Qwen Image 2.1 на Hugging Face
- Qwen Image Bench
- Alibaba Cloud Blog: релиз Qwen Image 2.1
- Технический отчёт Qwen Image


