Z-Image Turbo: что это, установка в ComfyUI, LoRA и промты
Содержание
- Что такое Z-Image Turbo и чем он отличается от SDXL и Flux
- Требования к ПК
- Установка в ComfyUI: файлы и workflow
- Промты: структура и примеры для вымышленных взрослых персонажей
- LoRA и дообученные версии
- Частые ошибки и их решения
- Как использовать скорость модели
- Кому подходит Z-Image Turbo
- Z-Image Turbo бесплатно и онлайн
- Ограничения и лицензия
- Частые вопросы
Z-Image Turbo — компактная и быстрая модель генерации изображений от команды Tongyi-MAI из Alibaba, вышедшая в ноябре 2025 года. При размере около 6 млрд параметров она генерирует фотореалистичные изображения за 8–9 шагов, хорошо понимает естественный язык и распространяется под свободной лицензией Apache 2.0. Поэтому Z-Image Turbo быстро стал одной из самых популярных моделей для локальной генерации в ComfyUI. В этом гайде — чем он отличается от SDXL и Flux, какое нужно железо, как установить модель в ComfyUI, как писать промты, какие есть LoRA и дообученные версии и какие у модели ограничения.
Коротко
- Z-Image Turbo — дистиллированная модель на 6 млрд параметров от Tongyi-MAI (Alibaba), лицензия Apache 2.0.
- Скорость: 8–9 шагов при CFG около 1; сильные стороны — фотореализм и понимание длинных описаний.
- Требования: по данным разработчиков, модель помещается в 16 ГБ видеопамяти; сторонние fp8- и GGUF-версии запускаются на 8 ГБ и меньше.
- Установка: модель — в diffusion_models, текстовый энкодер Qwen 3 4B — в text_encoders, VAE — в vae; готовый шаблон есть в ComfyUI.
- Есть LoRA и дообученные версии сообщества; в семействе также заявлены версии Base и Edit.
Что такое Z-Image Turbo и чем он отличается от SDXL и Flux
Z-Image — семейство моделей генерации изображений. Turbo — дистиллированная версия: её «научили» получать результат за малое число шагов, поэтому генерация занимает секунды. В семействе также заявлены базовая версия (Base) — для дообучения и максимального качества — и версия для редактирования изображений (Edit).
| Параметр | SDXL | Flux.1 Dev | Z-Image Turbo |
|---|---|---|---|
| Размер | около 3,5 млрд параметров | 12 млрд | 6 млрд |
| Шаги | 25–35 | 20–30 | 8–9 |
| Промты | Короткие фразы и теги | Естественный язык | Естественный язык |
| Лицензия | Открытая лицензия, у производных — свои условия | Некоммерческая | Apache 2.0 |
| Экосистема LoRA | Огромная | Большая | Растёт |
| Сильные стороны | Скорость, выбор моделей, аниме | Сложные сцены, текст, руки | Фотореализм, скорость, свободная лицензия |
Короче говоря, Z-Image Turbo занимает нишу между SDXL и Flux: понимает промт почти как Flux, работает быстрее SDXL и при этом распространяется под свободной лицензией. Подробнее о семействе Flux — в гайде Flux локально, а общий обзор моделей — в статье лучшие модели Stable Diffusion.
Требования к ПК
- Видеопамять. По данным разработчиков, модель в полной точности помещается в 16 ГБ. Сторонние fp8-версии требуют около 8 ГБ, квантованные GGUF-версии — около 6 ГБ; на слабых картах поможет выгрузка в оперативную память.
- Оперативная память. От 16 ГБ, комфортно — 32 ГБ, особенно если используется выгрузка.
- Диск. Модель, текстовый энкодер и VAE вместе занимают больше 15 ГБ в полной точности; держите их на SSD.
- Интерфейс. Актуальная версия ComfyUI, в которой модель поддерживается встроенными нодами.
Установка в ComfyUI: файлы и workflow
- Обновите ComfyUI до последней версии.
- Откройте шаблон. В меню Workflow → Browse Templates найдите шаблон Z-Image Turbo. Интерфейс покажет, каких файлов не хватает, и даст ссылки на официальные страницы.
- Скачайте три файла и разложите их по папкам:
- модель z_image_turbo_bf16.safetensors — в ComfyUI/models/diffusion_models;
- текстовый энкодер qwen_3_4b.safetensors — в ComfyUI/models/text_encoders;
- VAE ae.safetensors — в ComfyUI/models/vae.
- Проверьте ноды загрузки: в каждой должен быть выбран нужный файл.
- Настройки: около 9 шагов в шаблоне ComfyUI, CFG около 1, разрешение около мегапикселя — 1024×1024 или 832×1216 для вертикальных кадров.
- Нажмите Run.
Для fp8- или GGUF-версий замените файл модели на облегчённый; для GGUF понадобится пакет нод для загрузки таких файлов, который ставится через встроенный менеджер. Если вы впервые работаете с нодами, начните с гайда ComfyUI для начинающих.
Особенности настройки
- Больше шагов — не лучше. Модель дистиллирована под малое число шагов; 20–30 шагов, как у SDXL, не улучшат картинку.
- CFG около 1. Высокий CFG даёт пересвеченные и «пережжённые» изображения.
- Негативный промт при CFG 1 почти не действует — описывайте желаемое в позитивном промте.
- Разнообразие. Дистиллированные модели иногда дают похожие композиции на разных seed. Меняйте формулировку промта, чтобы получить больше вариантов.
Промты: структура и примеры для вымышленных взрослых персонажей
Z-Image Turbo понимает связные описания на английском. Хорошая структура — как описание кадра для фотографа:
- Тип изображения: photo, cinematic still, portrait, illustration.
- Кто в кадре: возраст (25+), внешность, одежда, выражение лица.
- Действие и поза.
- Место и фон.
- Свет, камера, настроение.
Примеры
A natural photo of a 34-year-old woman with long dark wavy hair and light freckles, wearing a white linen shirt, standing barefoot on a wooden pier at sunset, gentle wind in her hair, warm golden light, the sea in the background, shot on a 35mm lens, soft film grain.
A cinematic portrait of a 40-year-old woman detective in a long grey coat, standing under a streetlight on a rainy night street, neon reflections on wet asphalt, serious expression, shallow depth of field.
An editorial fashion photo of a 29-year-old woman with a platinum bob haircut, wearing a black velvet evening dress, sitting on a vintage armchair in a dimly lit art deco lounge, dramatic side lighting.
Советы: описывайте свет конкретно, указывайте фотографические детали для реализма и избегайте противоречий в описании. Если персонаж на картинке выглядит моложе, чем нужно, усильте возраст в тексте — «a woman in her late thirties», «mature face», — и уточните взрослый контекст.
LoRA и дообученные версии
Вокруг Z-Image Turbo быстро выросла экосистема сообщества: LoRA стилей и концептов и дообученные версии модели, в том числе от авторов известных реалистичных линеек вроде CyberRealistic. Что важно знать:
- LoRA для Z-Image совместимы только с Z-Image, не с SDXL или Flux.
- В ComfyUI LoRA подключается нодой LoraLoaderModelOnly между загрузкой модели и сэмплером.
- Стартовый вес — 0,6–1,0 по рекомендации автора.
- Для обучения собственных LoRA сообщество использует в том числе версию Base, которая лучше подходит для дообучения, чем дистиллированная Turbo.
- Не используйте LoRA и модели, обученные на внешности реальных людей.
Общие принципы подключения LoRA — в гайде LoRA для Stable Diffusion.
Частые ошибки и их решения
| Проблема | Причина | Решение |
|---|---|---|
| Ноды шаблона красные | Устаревший ComfyUI | Обновите ComfyUI до последней версии |
| Модель не видна в списке | Файл не в той папке | Модель — в diffusion_models, энкодер — в text_encoders, VAE — в vae |
| Пересвеченная картинка | Высокий CFG | Верните CFG около 1 |
| Картинка мутная или недорисованная | Слишком мало шагов или неподходящий сэмплер | Используйте значения из официального шаблона |
| Нехватка памяти | Полная версия модели на карте с малым объёмом памяти | Возьмите fp8 или GGUF, уменьшите разрешение |
| Все картинки похожи | Особенность дистиллированной модели | Меняйте формулировку, детали сцены и ракурс, а не только seed |
| Ошибка при подключении LoRA | LoRA от другой модели | Проверьте, что LoRA сделана для Z-Image |
Как использовать скорость модели
Главное преимущество Z-Image Turbo — скорость. Её удобно использовать как «быстрый черновик»: генерировать десятки вариантов композиции за несколько минут, выбирать лучший и дорабатывать его.
- Перебор идей. Генерируйте пачку по четыре картинки и меняйте детали промта — одежду, свет, место — чтобы быстро найти удачное направление.
- Серия с одним персонажем. Повторяйте одно и то же подробное описание внешности вымышленной героини и меняйте только сцену. Благодаря хорошему пониманию текста модель довольно стабильно удерживает черты.
- Второй проход. Удачную картинку можно увеличить апскейлером и прогнать через img2img с небольшой силой шумоподавления для дополнительной детализации.
- Первый кадр для видео. Быстро сгенерированный фотореалистичный кадр подходит как исходное изображение для видеомоделей в режиме image-to-video — только с вашими собственными сгенерированными персонажами.
Кому подходит Z-Image Turbo
Модель хорошо подходит тем, кому нужен фотореализм и естественные промты без тегов, у кого видеокарта от 8–16 ГБ и кто ценит скорость. Для аниме, комикса и стилизованных иллюстраций по-прежнему удобнее специализированные SDXL-модели на базе Pony и Illustrious. Для самых сложных сцен с текстом на картинке и множеством объектов стоит сравнить результат с Flux. Практичный вариант — держать Z-Image Turbo как основную модель для реалистичных кадров, а для других стилей подключать модели, которые в них сильнее.
Z-Image Turbo бесплатно и онлайн
Локальный запуск Z-Image Turbo полностью бесплатен: модель можно скачать с официальной страницы и использовать без ограничений по числу генераций. Платите вы только электричеством и временем, которое уходит на первую установку и настройку. Кроме того, после выхода модели демо-страницы появились на площадках вроде Hugging Face, а часть онлайн-генераторов добавила Z-Image в свой набор моделей. Онлайн-демо удобны, чтобы оценить модель до скачивания, но обычно имеют очереди, дневные лимиты и собственные правила контента площадки.
Советы по промтам на русском
Модель лучше всего понимает промты, написанные на английском языке. Если вам проще думать по-русски, сформулируйте сцену на русском, переведите её на английский связными предложениями и проверьте, что в переводе сохранились важные детали: возраст персонажа, одежда, свет, ракурс. Не смешивайте языки в одном промте — это заметно снижает точность результата.
Ещё один полезный приём — держать под рукой шаблон из пяти предложений: тип кадра, персонаж, действие, место, свет и камера. Заполняя его заново для каждой сцены, вы довольно быстро выработаете собственный узнаваемый стиль и будете получать предсказуемый и качественный результат буквально с первых попыток.
И последний совет: сохраняйте удачные результаты вместе с workflow. ComfyUI записывает весь граф и промт в метаданные PNG, поэтому любую понравившуюся картинку можно перетащить обратно в интерфейс и получить точные настройки, при которых она была создана, — включая seed, модель, LoRA и все параметры сэмплера.
Ограничения и лицензия
- Лицензия Apache 2.0 разрешает свободное использование, включая коммерческое, с сохранением уведомлений о лицензии. Это одна из самых свободных лицензий среди современных моделей.
- Стиль. Модель сильна в фотореализме; в аниме и стилизованной иллюстрации она уступает специализированным SDXL-моделям.
- Разнообразие композиций у дистиллированной версии ниже, чем у базовых моделей.
- Экосистема LoRA пока меньше, чем у SDXL и Flux.
- Правила. Свободная лицензия не отменяет закон: создание изображений реальных людей без согласия и любых изображений лиц младше 18 лет запрещено.
Фотореализм без установки: генератор онлайн Партнёрская ссылка · 18+
Частые вопросы
Что такое Z-Image Turbo?
Быстрая дистиллированная модель генерации изображений на 6 млрд параметров от Tongyi-MAI (Alibaba). Генерирует за 8–9 шагов, сильна в фотореализме и распространяется под лицензией Apache 2.0.
Как установить Z-Image Turbo в ComfyUI?
Обновите ComfyUI, откройте шаблон Z-Image Turbo, скачайте модель в diffusion_models, текстовый энкодер Qwen 3 4B в text_encoders и VAE в vae, затем запустите workflow.
Сколько видеопамяти нужно для Z-Image Turbo?
По данным разработчиков, полная версия помещается в 16 ГБ. Сторонние fp8-версии требуют около 8 ГБ, GGUF — около 6 ГБ.
Z-Image Turbo бесплатный?
Да. Модель распространяется под лицензией Apache 2.0 и бесплатно запускается локально.
Какие настройки ставить для Z-Image Turbo?
Около 8–9 шагов, CFG около 1, разрешение около мегапикселя. Большее число шагов и высокий CFG не улучшают результат.
Есть ли LoRA для Z-Image Turbo?
Да, сообщество публикует LoRA и дообученные версии. Они совместимы только с Z-Image, а для обучения своих LoRA чаще используют версию Base.
