Alibaba представила Qwen-Image 2.1: генерация прозрачных изображений и работа с 10 референсами
16

Alibaba представила Qwen-Image 2.1: генерация прозрачных изображений и работа с 10 референсами

Автор: admin

Alibaba выпустила веса модели Qwen-Image 2.1 — генератора изображений с 7 млрд параметров, поддерживающего нативное разрешение 2K, прозрачный фон (RGBA) и редактирование до 10 референсов за один запрос. Модель объединяет генерацию и редактирование в одном пайплайне, использует KV-кеш для ускорения и доступна для некоммерческого использования.

Команда Qwen из Alibaba опубликовала открытые веса новой генеративной модели Qwen-Image 2.1. Генеративный компонент построен на 32-слойном диффузионном трансформере (DiT) и содержит 7 млрд параметров, однако для обработки текста и исходных изображений дополнительно задействована визуально-языковая модель Qwen3-VL 8B. Модель работает в нативном разрешении 2K (рекомендованные размеры — от 2048×2048 до 2752×1536 пикселей) и по умолчанию выполняет генерацию за 40 шагов диффузии.

Ключевая особенность релиза — нативная поддержка формата RGBA. Qwen-Image 2.1 умеет генерировать объекты на прозрачном фоне, извлекать предметы из фотографий и редактировать существующие прозрачные слои без необходимости отдельного удаления фона или специализированных моделей. Это достигается за счёт автоэнкодера с 16-кратным пространственным сжатием и поддержкой альфа-канала.

Модель объединяет генерацию по тексту и редактирование изображений в едином пайплайне. За один запрос можно передать до десяти референсов: собирать групповые снимки из портретов, примерять одежду, переносить предметы между сценами. Локальные правки задаются маской, нарисованной областью или кругом вокруг объекта. Разработчики заявляют о сохранении внешности людей и деталей товаров при переносе между контекстами.

Для эффективной работы с множественными референсами внедрён KV-кеш: исходные картинки и инструкции обрабатываются один раз, а промежуточные ключи и значения сохраняются. Текст обрабатывается с причинной маской на уровне токенов, изображения — более крупными блоками. По данным Alibaba, это ускоряет инференс и снижает избыточные вычисления.

На собственном бенчмарке Qwen-Image-Bench новая модель, согласно внутренним тестам, превосходит большинство закрытых конкурентов по качеству текста, портретного освещения, мелких деталей и текстур. Однако независимых оценок пока нет, поэтому результаты следует воспринимать с осторожностью. Важное ограничение: веса распространяются под Qwen Research License, разрешающей использование только в некоммерческих исследовательских целях. Для коммерческого применения требуется отдельная лицензия Alibaba.

Веса модели доступны на Hugging Face и ModelScope. С первого дня релиза обеспечена поддержка в Diffusers, ComfyUI, а для серверного деплоя — интеграция с vLLM-Omni и SGLang. Qwen-Image 2.1 представляет интерес для локальных экспериментов благодаря компактности, прозрачности и мультиреференсной работе, однако коммерческим проектам перед внедрением необходимо внимательно изучить лицензионные условия.