Локальная генерация видео: Wan 2.2 и LTX в ComfyUI
Содержание
- Какие видеомодели можно запустить дома
- Требования: VRAM, RAM, время на клип
- Установка Wan 2.2 в ComfyUI
- Text-to-video: промт, длина, FPS
- Анимация своего сгенерированного кадра (не фото людей)
- LTX и HunyuanVideo: когда выбрать их
- Постобработка: апскейл, интерполяция, склейка
- Частые ошибки и как их исправить
- LoRA для видеомоделей
- Локально или в облаке: что выбрать
- GGUF и оптимизация под 8–12 ГБ
- Частые вопросы
Генерировать короткие видеоклипы можно не только в облачных сервисах, но и на домашнем компьютере. Открытые видеомодели — Wan 2.2 от Alibaba, LTX-2.3 от Lightricks, HunyuanVideo от Tencent — запускаются в ComfyUI и создают ролики по текстовому описанию или анимируют кадр, который вы сами сгенерировали. Это медленнее и требовательнее к железу, чем генерация картинок, но даёт полный контроль и отсутствие лимитов. В этой инструкции — какие модели можно запустить дома, сколько нужно видеопамяти, как установить Wan 2.2 в ComfyUI, как писать промт для text-to-video, как анимировать свой сгенерированный кадр, когда выбирать LTX или HunyuanVideo и как уместиться в 8–12 ГБ.
Коротко
- Wan 2.2 TI2V-5B — лучший старт: текст или картинка в видео, 720p, по документации ComfyUI запускается даже на 8 ГБ с выгрузкой в оперативную память (медленно).
- Wan 2.2 14B — выше качество, но нужны 16–24 ГБ или квантованные версии.
- LTX-2.3 — генерирует видео сразу со звуком, есть быстрая дистиллированная версия на 8 шагов; требует много памяти.
- Установка: обновлённый ComfyUI → шаблон видео → три файла модели по своим папкам → запуск.
- Анимируйте только собственные сгенерированные кадры вымышленных взрослых — никаких фотографий реальных людей.
Какие видеомодели можно запустить дома
| Модель | Разработчик | Режимы | Особенности | Лицензия |
|---|---|---|---|---|
| Wan 2.2 TI2V-5B | Alibaba | Текст → видео, картинка → видео | Лёгкая, 720p, 24 кадра в секунду | Apache 2.0 |
| Wan 2.2 A14B (T2V и I2V) | Alibaba | Отдельные модели для текста и картинки | Две «экспертные» модели: для ранних и поздних шагов; выше качество | Apache 2.0 |
| Wan 2.1 | Alibaba | Текст и картинка → видео | Предыдущее поколение, много готовых LoRA и workflow | Apache 2.0 |
| LTX-2.3 | Lightricks | Текст, картинка, аудио → видео со звуком | 22 млрд параметров, синхронный звук, дистиллированная версия на 8 шагов | Собственная community-лицензия |
| HunyuanVideo | Tencent | Текст и картинка → видео | Высокое качество движения, тяжёлая | Собственная лицензия |
Для первого знакомства почти всем подходит Wan 2.2 TI2V-5B: она самая доступная по железу и официально поддерживается в ComfyUI со встроенным шаблоном. Если у вас мощная видеокарта, переходите на 14B-версии или LTX-2.3.
Требования: VRAM, RAM, время на клип
Видео — это десятки кадров, которые модель генерирует одновременно, поэтому требования намного выше, чем у картинок. Ориентиры ниже взяты из документации ComfyUI, карточек моделей и отзывов пользователей; реальные цифры зависят от разрешения, длины клипа и версии модели.
| Модель | Видеопамять | Оперативная память | Комментарий |
|---|---|---|---|
| Wan 2.2 TI2V-5B | от 8 ГБ с выгрузкой, комфортно 12–16 ГБ | от 32 ГБ | На 8 ГБ работает, но медленно |
| Wan 2.2 A14B в fp8 | 16–24 ГБ | от 64 ГБ желательно | С GGUF-квантованием — меньше |
| LTX-2.3 fp8 | около 16 ГБ (по сторонним данным) | от 32–64 ГБ | Полная bf16-версия — около 32 ГБ |
| HunyuanVideo | от 16–24 ГБ | от 64 ГБ | Квантованные версии снижают порог |
Время на клип сильно зависит от карты: на мощной видеокарте короткий ролик в несколько секунд генерируется за минуты, на карте с 8 ГБ и выгрузкой — может занимать десятки минут. Поэтому начинайте с низкого разрешения и короткой длины, а качество повышайте, когда промт отработан. Подробнее о выборе видеокарты под ИИ — в статье видеокарта для Stable Diffusion.
Если видеокарты нет или она слабая, короткие ролики с вымышленными взрослыми персонажами можно сделать в облачных генераторах — без установки и ожидания.
Видео без видеокарты: открыть генератор Партнёрская ссылка · 18+
Установка Wan 2.2 в ComfyUI
Если ComfyUI у вас ещё не установлен, начните с гайда ComfyUI для начинающих. Дальше — пошагово для версии TI2V-5B.
- Обновите ComfyUI до последней версии: поддержка новых видеомоделей появляется в обновлениях. В версии Desktop это происходит автоматически, в Portable — скриптом обновления.
- Откройте шаблон. В меню Workflow → Browse Templates найдите раздел видео и выберите шаблон Wan 2.2 5B. Интерфейс покажет, каких файлов не хватает, и предложит ссылки на официальные страницы для загрузки.
- Скачайте три файла и положите их по папкам:
- модель wan2.2_ti2v_5B_fp16.safetensors — в ComfyUI/models/diffusion_models;
- текстовый энкодер umt5_xxl_fp8_e4m3fn_scaled.safetensors — в ComfyUI/models/text_encoders;
- VAE wan2.2_vae.safetensors — в ComfyUI/models/vae.
- Перезапустите ComfyUI или обновите список моделей и проверьте, что в нодах загрузки выбраны именно эти файлы.
- Задайте параметры в шаблоне: разрешение, число кадров, промт. Для первого запуска оставьте значения по умолчанию.
- Нажмите Run и дождитесь результата — готовый ролик появится в ноде сохранения видео и в папке output.
Для версий 14B процесс тот же, но файлов больше: две модели (для ранних и поздних шагов шумоподавления), отдельные шаблоны для text-to-video и image-to-video. Качайте модели только с официальных страниц — ссылки на них приведены в документации ComfyUI и в самих шаблонах.
Text-to-video: промт, длина, FPS
Как писать промт для видео
Видеомодели понимают естественный язык, поэтому пишите связное описание на английском. Хорошая структура: кто в кадре → как выглядит → что делает (движение) → где → камера → свет и стиль.
A 35-year-old woman with long auburn hair in a flowing emerald dress walks slowly along a seaside promenade at sunset, the wind gently moving her hair and dress, the camera tracks her from the side, warm golden light, soft film look, cinematic.
- Описывайте движение явно: walks slowly, turns her head, smiles, wind moves the curtains. Без глаголов модель может выдать почти статичную сцену.
- Одно главное действие на клип. За несколько секунд модель не успеет показать сюжет из пяти событий.
- Камера: static shot, slow dolly in, camera pans left, tracking shot.
- Возраст: указывайте его явно, как и в промтах для картинок.
Больше примеров для разных сцен — в статье промты для видео 18+.
Длина и частота кадров
- Wan 2.2 TI2V-5B генерирует 720p с частотой 24 кадра в секунду; стандартная длина клипа — около пяти секунд.
- Wan 2.1 и 14B-версии в шаблонах по умолчанию используют меньшую частоту и около 81 кадра.
- LTX-2.3 требует, чтобы ширина и высота делились на 32, а число кадров было вида 8n + 1 (например, 97 или 121).
- Длинные клипы резко увеличивают время и память. Для длинного ролика делайте несколько коротких и склеивайте их в видеоредакторе.
Анимация своего сгенерированного кадра (не фото людей)
Режим image-to-video берёт картинку как первый кадр и достраивает движение. Это самый надёжный способ получить красивый ролик: композицию, персонажа и свет вы подбираете на этапе генерации картинки, где всё быстрее и дешевле, а видеомодель только добавляет движение.
- Сгенерируйте кадр с вымышленным взрослым персонажем в своей модели изображений — в разрешении, близком к видео (например, 1280×704 или 704×1280).
- Откройте шаблон image-to-video для Wan 2.2 и загрузите кадр в ноду Load Image.
- В промте опишите только движение и камеру: «she slowly turns to the camera and smiles, hair moving in the wind, slow push in».
- Запустите генерацию и при необходимости поменяйте seed.
Только собственные сгенерированные кадры
Не загружайте в image-to-video фотографии реальных людей — ни свои, ни чужие, ни знаменитостей. Создание интимных или компрометирующих роликов с реальными людьми без согласия нарушает закон и правила всех площадок. Анимируйте только изображения вымышленных взрослых персонажей, которые вы сгенерировали сами. Изображения лиц младше 18 лет и персонажей, выглядящих юно, запрещены всегда.
Советы для image-to-video
- Готовьте кадр под видео. Соотношение сторон исходной картинки должно совпадать с видео: вертикальный кадр для вертикального ролика, горизонтальный — для горизонтального. Иначе модель обрежет или растянет изображение.
- Оставьте место для движения. Если персонаж будет поворачиваться или идти, в кадре должно быть пространство вокруг него. Слишком плотный крупный план ограничивает движение.
- Простой фон — стабильнее. Сложные фоны с множеством мелких деталей чаще «плывут» при движении камеры.
- Описывайте только изменения. Модель уже видит внешность и сцену на картинке, поэтому промт должен говорить, что происходит: движение, эмоция, камера. Повторять описание внешности не нужно, но возраст и взрослый облик персонажа должны быть очевидны уже на исходном кадре.
- Умеренное движение. Резкие повороты, бег и сложные жесты рук за несколько секунд дают больше артефактов, чем плавные движения.
Сколько места на диске нужно
Видеомодели занимают много места. Wan 2.2 TI2V-5B вместе с текстовым энкодером и VAE — это около 15–20 ГБ, версии 14B с двумя моделями — в разы больше, LTX-2.3 в полной версии тоже весит десятки гигабайт. Держите модели на быстром SSD: при выгрузке в оперативную память и подгрузке частей модели скорость диска напрямую влияет на время генерации. Если у вас уже установлены модели для картинок в другом интерфейсе, подключите их общими папками через extra_model_paths.yaml, а видеомодели храните отдельно в папках ComfyUI.
Рабочий процесс, который экономит время
- Придумайте сцену и сгенерируйте несколько вариантов первого кадра в модели изображений — это быстро.
- Выберите лучший кадр и запустите image-to-video в низком разрешении и с коротким клипом, чтобы проверить движение.
- Подберите промт движения и seed, пока результат не понравится.
- Только после этого генерируйте финальную версию в полном разрешении.
- Примените интерполяцию кадров и апскейл, соберите клипы в редакторе.
Такой подход позволяет не тратить впустую десятки, а на слабых картах и сотни минут на полноценный рендер ролика, который в итоге придётся переделывать из-за неудачной композиции, света или слишком резкого движения персонажа.
Сохраняйте удачные workflow вместе с параметрами: ComfyUI записывает весь граф в метаданные сохранённых файлов, поэтому любой удачный ролик можно воспроизвести или доработать позже. Ведите короткие заметки о том, какие настройки, модели и промты движения дали лучший результат на вашей видеокарте, — через пару недель это станет вашей личной шпаргалкой, которая сэкономит часы экспериментов и перегенераций.
LTX и HunyuanVideo: когда выбрать их
LTX-2.3
Главное отличие LTX-2.3 — видео генерируется сразу со звуком: окружающие звуки, музыка и речь синхронизированы с изображением в одной модели. Кроме полной версии есть дистиллированная, которая работает за 8 шагов при CFG 1, и отдельные модели-апскейлеры: пространственные — для повышения разрешения — и временной — для повышения частоты кадров. В ComfyUI LTX поддерживается встроенными нодами, а официальный пакет нод от Lightricks добавляет готовые workflow и загрузчики для экономии памяти. Выбирайте LTX, если вам нужен звук и есть видеокарта от 16 ГБ.
HunyuanVideo
Открытая видеомодель от Tencent, известная качеством движения и детализацией. Требования у неё высокие, но существуют квантованные версии и оптимизированные workflow. Выбирайте HunyuanVideo, если у вас мощная видеокарта и вы хотите сравнить стиль движения с Wan: у разных моделей заметно отличается пластика, работа камеры и то, как они передают ткань, волосы и свет. Как установить HunyuanVideo: процесс аналогичен Wan — обновлённый ComfyUI, официальный шаблон, файлы модели, энкодеров и VAE по своим папкам.
Что выбрать
- 8–12 ГБ видеопамяти — Wan 2.2 TI2V-5B или квантованные версии Wan.
- 16 ГБ — Wan 2.2 14B в квантованном виде или LTX-2.3 fp8.
- 24 ГБ и больше — любые модели, включая 14B в fp8 и HunyuanVideo.
Постобработка: апскейл, интерполяция, склейка
Сырой клип из видеомодели редко бывает финальным. Три шага, которые заметно улучшают результат:
- Интерполяция кадров. Если модель генерирует 16 кадров в секунду, движение может казаться дёрганым. Ноды интерполяции, например на основе RIFE или FILM, дорисовывают промежуточные кадры и повышают частоту до 24–32 кадров в секунду. У LTX-2.3 для этого есть собственный временной апскейлер.
- Апскейл. Увеличение разрешения видео — тяжёлая операция. Проще сгенерировать клип в умеренном разрешении, а затем увеличить его апскейлером для видео или покадрово с последующей сборкой. Для LTX-2.3 есть пространственные апскейлеры в латентном пространстве.
- Склейка и монтаж. Несколько коротких клипов собираются в видеоредакторе. Чтобы переходы были плавными, используйте последний кадр одного клипа как первый кадр следующего в режиме image-to-video.
Частые ошибки и как их исправить
| Проблема | Вероятная причина | Что сделать |
|---|---|---|
| Ошибка нехватки памяти | Слишком большое разрешение или длина, тяжёлая модель | Уменьшите разрешение и число кадров, возьмите fp8 или GGUF |
| Красные ноды в шаблоне | Устаревший ComfyUI или не установлен пакет нод | Обновите ComfyUI, установите недостающие ноды через менеджер |
| Модель не найдена | Файл лежит не в той папке | Проверьте diffusion_models, text_encoders и vae |
| Почти статичное видео | В промте нет движения | Опишите действие и движение камеры глаголами |
| Лицо «плывёт» и меняется | Слишком длинный клип или сложное движение | Короче клип, проще движение, используйте image-to-video |
| Мерцание и артефакты | Мало шагов, агрессивное квантование | Больше шагов, менее сжатая версия модели |
| Черный или серый кадр | Несовместимый VAE или энкодер | Используйте файлы из официального шаблона |
Если ошибка не видеомодели, а самого ComfyUI — не запускается, падает при старте, — ищите решение в разделе об ошибках гайда для начинающих.
LoRA для видеомоделей
Как и для картинок, для видеомоделей существуют LoRA: стили, типы движения камеры, эффекты, ускорение генерации. Они привязаны к конкретной модели: LoRA для Wan 2.1 не обязательно работает на Wan 2.2, LoRA для 14B не подходят к 5B, а LoRA для LTX — только к LTX. Подключаются они в ComfyUI нодой загрузки LoRA для модели между загрузчиком и сэмплером. Как и в случае с изображениями, не используйте LoRA, воспроизводящие внешность реальных людей.
Локально или в облаке: что выбрать
| Критерий | Локальная генерация | Облачный сервис |
|---|---|---|
| Железо | Видеокарта от 8–12 ГБ, много RAM | Любой компьютер или телефон |
| Скорость | Зависит от карты, часто медленно | Быстро, генерация на серверах |
| Лимиты | Нет | Кредиты, тарифы |
| Контроль | Полный: любые модели, LoRA, настройки | В рамках функций сервиса |
| Приватность | Файлы не покидают компьютер | Данные хранятся у сервиса |
| Порог входа | Нужно разобраться с ComfyUI | Промт и кнопка |
Общий обзор процесса создания ИИ-видео — от идеи и кадра до монтажа — есть в статье как создать ИИ-видео 18+. Там же описано, как спланировать сцену так, чтобы генерация получилась с первого раза.
GGUF и оптимизация под 8–12 ГБ
- GGUF-версии моделей. Квантованные файлы занимают меньше памяти ценой небольшой потери качества. Для их загрузки в ComfyUI нужен пакет нод для GGUF, который ставится через встроенный менеджер.
- fp8 вместо fp16. Модели и текстовые энкодеры в fp8 примерно вдвое легче.
- Меньше разрешение и кадров. Начинайте с 480p и 49–81 кадра, увеличивайте, когда промт отработан.
- Выгрузка в оперативную память. ComfyUI сам выгружает части модели в RAM, если видеопамяти не хватает. Это медленно, но работает; нужно много оперативной памяти и быстрый SSD.
- Тайловое декодирование VAE. Декодирование видео тоже требует памяти; ноды с тайловым режимом декодируют по частям.
- Закройте всё лишнее. Браузер с десятками вкладок и игры занимают видеопамять.
- Ускоряющие LoRA. Для Wan существуют LoRA, которые уменьшают число шагов; они экономят время ценой некоторой потери качества.
Если после всех оптимизаций генерация занимает слишком много времени, разумнее воспользоваться облачными сервисами: где попробовать ИИ-видео 18+ бесплатно, рассказано в статье бесплатные ИИ-видео 18+, а сравнение платных генераторов — в обзоре ИИ-видео 18+ генераторы.
Видео и персонажи онлайн: попробовать Promptchan Партнёрская ссылка · 18+
Частые вопросы
Как установить Wan 2.2 в ComfyUI?
Обновите ComfyUI, откройте шаблон Wan 2.2 5B в браузере шаблонов, скачайте модель, текстовый энкодер и VAE в папки diffusion_models, text_encoders и vae и запустите workflow.
Сколько видеопамяти нужно для Wan 2.2?
По документации ComfyUI версия TI2V-5B запускается на 8 ГБ с выгрузкой в оперативную память, но медленно. Комфортно — от 12–16 ГБ; для 14B-версий нужно 16–24 ГБ или квантованные файлы.
Чем Wan 2.2 отличается от Wan 2.1?
Wan 2.2 даёт лучшее качество и движение, включает лёгкую модель 5B для текста и картинки и 14B-версии с двумя экспертными моделями. У Wan 2.1 больше готовых LoRA и workflow.
Что такое LTX-2.3?
Открытая видеомодель от Lightricks, которая генерирует видео сразу со звуком. Есть полная и дистиллированная версия на 8 шагов, а также модели для повышения разрешения и частоты кадров.
Можно ли генерировать видео локально на 8 ГБ?
Да, с Wan 2.2 TI2V-5B, квантованными моделями, низким разрешением и выгрузкой в оперативную память. Генерация будет медленной.
Можно ли анимировать фотографию человека?
Нельзя, если это фото реального человека. Анимируйте только собственные сгенерированные кадры вымышленных взрослых персонажей.
Какой длины получаются ролики?
Обычно около пяти секунд за одну генерацию. Длинные ролики собирают из нескольких клипов в видеоредакторе.


