Как ускорить Stable Diffusion и ComfyUI: xformers, SageAttention, Triton, LCM и Lightning LoRA
Содержание
- От чего зависит скорость генерации
- Быстрые настройки без установки
- xformers: что это и как включить
- SageAttention и Triton на Windows
- TensorRT: когда оправдан
- LCM, Lightning и Turbo LoRA: меньше шагов
- fp8 и GGUF-версии моделей
- Ускорение видео: кэширование шагов
- Как измерить эффект у себя
- Если у вас AMD, Mac или слабая видеокарта
- Порядок действий: с чего начать
- Итог
- Частые вопросы
Генерация в Stable Diffusion или ComfyUI идёт медленно, видео на Wan считается полчаса, а новая модель FLUX едва помещается в видеопамять? Прежде чем покупать новую видеокарту, стоит выжать максимум из той, что есть. Существует целый набор программных способов ускорить генерацию: оптимизированное внимание (xformers, SageAttention), компиляторы (Triton, TensorRT), дистиллированные LoRA, которые сокращают число шагов (LCM, Lightning, Turbo, Hyper), и облегчённые форматы моделей (fp8, GGUF). В этом гайде разберём, от чего зависит скорость, какие настройки дают эффект без установки, как поставить xformers и SageAttention с Triton на Windows, когда оправдан TensorRT, как работают LoRA-ускорители и как честно измерить результат на своём компьютере.
Коротко
- Сначала бесплатные шаги: свежие драйверы, актуальная версия ComfyUI/Forge, правильное разрешение, меньше шагов, подходящий сэмплер.
- Оптимизированное внимание: в современном PyTorch уже есть встроенное быстрое внимание; xformers и SageAttention могут дать дополнительный прирост, особенно на видео и больших моделях.
- SageAttention на Windows требует Triton (triton-windows) и сборок, точно совпадающих с вашими версиями Python, PyTorch и CUDA.
- LCM, Lightning, Turbo, Hyper LoRA сокращают генерацию до 4–8 шагов ценой части качества и гибкости.
- fp8 и GGUF уменьшают расход видеопамяти; скорость растёт, если модель перестаёт «вылезать» в оперативную память.
- Меряйте у себя: один и тот же промт, сид и настройки — до и после каждого изменения.
От чего зависит скорость генерации
Время генерации одной картинки складывается из нескольких частей:
- Загрузка модели. Первый запуск после старта или смены модели всегда дольше: веса читаются с диска в память. Быстрый SSD заметно сокращает это время.
- Шаги сэмплера. Основная работа: модель много раз «очищает» изображение от шума. Время почти линейно растёт с числом шагов.
- Разрешение. Число пикселей растёт квадратично: картинка 2048×2048 требует примерно в четыре раза больше вычислений, чем 1024×1024, а для внимания — ещё больше.
- Размер модели. SD 1.5 легче SDXL, SDXL легче FLUX, а видеомодели вроде Wan тяжелее всех.
- Видеопамять. Если модель не помещается в VRAM, часть данных уходит в оперативную память, и скорость падает в разы. Это самая частая причина «внезапно медленной» генерации.
- Дополнительные модули. ControlNet, IP-Adapter, несколько LoRA, апскейл и ADetailer добавляют время.
- CFG. При CFG больше 1 модель на каждом шаге считает два прохода — с промтом и без. Поэтому ускорители, работающие при CFG 1, почти вдвое быстрее на шаг.
Железо, конечно, важнее всего — какую видеокарту выбрать и сколько памяти нужно, мы разобрали в гайде видеокарта для Stable Diffusion. Здесь — только программное ускорение на том, что уже есть.
Быстрые настройки без установки
- Обновите драйвер NVIDIA до актуальной версии. Для Windows проверьте в панели управления NVIDIA настройку отката системной памяти (CUDA Sysmem Fallback Policy): если модель чуть-чуть не помещается в VRAM, запрет отката покажет ошибку нехватки памяти вместо тихого многократного замедления — так легче понять, что именно происходит.
- Обновите ComfyUI или Forge. Разработчики постоянно добавляют оптимизации: новые версии часто заметно быстрее старых на той же модели.
- Генерируйте в родном разрешении модели. Для SD 1.5 — около 512–768 пикселей, для SDXL и FLUX — около 1024. Большее разрешение получайте апскейлом, а не генерацией: см. гайд апскейл в Stable Diffusion.
- Уменьшите число шагов. Многие модели дают почти тот же результат на 20–25 шагах, что и на 40–50. Проверьте на своей модели.
- Выберите эффективный сэмплер. Некоторые сэмплеры сходятся за меньшее число шагов. Сравните 2–3 варианта на одинаковом сиде.
- Используйте «быстрые» флаги. В ComfyUI есть флаг запуска —fast, который включает экспериментальные оптимизации на поддерживаемых видеокартах. Проверяйте качество после включения.
- Закройте лишнее. Браузер с десятками вкладок, игры, видеоплееры и другие программы тоже занимают видеопамять, которая могла бы пойти на генерацию.
- Не держите лишние модели в памяти. Большие workflow с несколькими чекпойнтами заставляют выгружать и загружать модели на каждом запуске.
xformers: что это и как включить
xformers — библиотека от Meta с оптимизированными реализациями механизма внимания (attention) для трансформеров. Внимание — одна из самых тяжёлых операций в диффузионных моделях, и xformers выполняет её быстрее и с меньшим расходом видеопамяти.
Нужен ли xformers в 2026 году? Уже не так обязателен, как раньше. В современных версиях PyTorch есть встроенное оптимизированное внимание (scaled dot product attention), которое по умолчанию используют ComfyUI и Forge, и разница с xformers на многих конфигурациях небольшая. Но на некоторых видеокартах и моделях xformers по-прежнему даёт выигрыш по памяти — проверяйте у себя.
- AUTOMATIC1111: добавьте —xformers в аргументы запуска (переменная COMMANDLINE_ARGS в webui-user.bat).
- Forge: использует собственные оптимизации памяти и внимания; отдельная установка xformers обычно не требуется.
- ComfyUI: если xformers установлен в окружение, ComfyUI может его использовать; для портативной версии установка идёт в встроенный Python (папка python_embeded).
Главное правило установки: версия xformers должна соответствовать вашей версии PyTorch и CUDA. Несовместимая версия либо не загрузится, либо «потянет» переустановку PyTorch и сломает окружение. Перед установкой сделайте копию папки или используйте отдельное окружение.
SageAttention и Triton на Windows
SageAttention — ещё более быстрая реализация внимания, использующая квантование (вычисления в пониженной точности) внутри attention. Особенно заметный эффект она даёт на видеомоделях (Wan, HunyuanVideo, LTX) и больших моделях изображений, где внимание занимает большую часть времени.
Triton — компилятор для GPU-ядер, на котором работают SageAttention и ряд других оптимизаций, включая torch.compile. Официально Triton выпускается для Linux; для Windows есть поддерживаемый сообществом пакет triton-windows.
Как поставить (общая схема)
- Узнайте свои версии: Python, PyTorch и CUDA в окружении ComfyUI. В портативной версии это встроенный Python в папке python_embeded.
- Установите triton-windows версии, совместимой с вашим PyTorch, через pip встроенного Python.
- Для портативной версии может понадобиться добавить в папку Python заголовочные файлы и библиотеки (include и libs) той же версии Python — без них Triton не сможет компилировать ядра.
- Установите SageAttention из готовой сборки (wheel) для Windows, точно соответствующей вашим версиям Python, PyTorch и CUDA. Сборки для Windows публикует сообщество на GitHub; сборка из исходников требует компилятора и долгой настройки.
- Включите SageAttention: в ComfyUI — флагом запуска —use-sage-attention или специальными узлами патча внимания в workflow.
- Проверьте: в консоли при запуске должно появиться сообщение об использовании SageAttention, а генерация — пройти без ошибок и чёрных картинок.
Типичные проблемы: чёрные или шумные изображения (несовместимая версия или неподдерживаемая видеокарта), ошибки компиляции Triton (не хватает include/libs или компилятора), падение при старте после обновления PyTorch (сборку SageAttention нужно обновить вместе с ним). Есть установочные скрипты от сообщества, которые подбирают совместимые версии автоматически, — но запускайте только скрипты из проверенных репозиториев и читайте, что они делают. Подробнее о типичных ошибках окружения — в гайде ошибки ComfyUI и Stable Diffusion.
Какие видеокарты: SageAttention рассчитана на современные видеокарты NVIDIA; на старых поколениях часть оптимизаций недоступна. AMD и Mac эту библиотеку не поддерживают — для них есть свои пути ускорения.
TensorRT: когда оправдан
TensorRT — библиотека NVIDIA, которая «компилирует» модель под конкретную видеокарту, оптимизируя вычисления. Для Stable Diffusion есть расширение для AUTOMATIC1111 и узлы для ComfyUI.
- Плюсы: заметный прирост скорости на поддерживаемых моделях и видеокартах NVIDIA RTX.
- Минусы: модель нужно конвертировать (это занимает время и место на диске), движок строится под определённые разрешения и размеры батча, поддержка LoRA и ControlNet ограничена и требует отдельной подготовки, после обновления драйверов или библиотек движок часто нужно пересобирать.
Когда стоит: если вы много генерируете одной моделью в фиксированных разрешениях — например, для сервиса или больших серий. Когда не стоит: если вы постоянно меняете модели, LoRA, разрешения и экспериментируете с workflow — затраты на конвертацию съедят выигрыш.
LCM, Lightning и Turbo LoRA: меньше шагов
Самый радикальный способ ускорить генерацию — сократить число шагов с 25–30 до 4–8. Для этого существуют «дистиллированные» модели и LoRA, обученные давать хороший результат за несколько шагов:
| Ускоритель | Для каких моделей | Типичные настройки |
|---|---|---|
| LCM LoRA | SD 1.5, SDXL | Сэмплер LCM, 4–8 шагов, CFG 1–2 |
| SDXL Lightning | SDXL | 2, 4 или 8 шагов в зависимости от версии LoRA, CFG около 1 |
| Hyper-SD | SD 1.5, SDXL, FLUX | Мало шагов, настройки по версии |
| Turbo-модели | SDXL Turbo и производные | 1–4 шага, CFG около 1 |
| DMD2 | SDXL | 4–8 шагов, CFG 1 |
| Ускоряющие LoRA для FLUX и видео | FLUX, Wan и другие | По рекомендации автора LoRA |
Как использовать: подключите LoRA-ускоритель как обычную LoRA, выставьте рекомендуемое число шагов, сэмплер и CFG (обычно 1–2). Высокий CFG с такими LoRA даёт пережжённые картинки.
Цена ускорения: меньше разнообразия, иногда хуже детали и следование сложному промту, негативный промт при CFG 1 почти не работает. Хорошая стратегия — быстрые черновики с ускорителем, а финальную версию понравившейся композиции — без него или с большим числом шагов.
Отдельный класс — модели, изначально быстрые: например, Z-Image Turbo рассчитан на малое число шагов без дополнительных LoRA.
fp8 и GGUF-версии моделей
Если модель не помещается в видеопамять, никакие оптимизации внимания не помогут — сначала нужно уменьшить саму модель.
- fp8 — веса в 8-битном формате вместо 16-битного. Модель занимает примерно вдвое меньше памяти, а качество для большинства задач почти не страдает. На новых видеокартах NVIDIA есть аппаратное ускорение вычислений в fp8.
- GGUF — формат квантованных моделей, пришедший из мира языковых моделей. Позволяет выбрать степень сжатия (Q8, Q6, Q5, Q4 и ниже): чем сильнее сжатие, тем меньше памяти и тем заметнее потери качества. В ComfyUI для этого используют узлы загрузки GGUF от сообщества.
- 4-битные форматы с отдельными движками — существуют проекты, которые хранят веса в 4 битах и используют специальные ядра для быстрого вычисления; они дают большой выигрыш по памяти и скорости для поддерживаемых моделей, но требуют отдельной установки.
Важно: квантование ускоряет генерацию прежде всего тогда, когда без него модель не помещалась в VRAM. Если модель и так целиком в памяти, выигрыш по скорости может быть небольшим или отсутствовать — зато освободится место под ControlNet, LoRA или большее разрешение. Подробнее о квантизации и форматах — в статье GGUF и квантизация.
Ускорение видео: кэширование шагов
Для видеомоделей (Wan, HunyuanVideo, LTX) есть ещё один класс оптимизаций — кэширование промежуточных результатов между шагами. Идея в том, что на соседних шагах модель считает очень похожие вещи, и часть вычислений можно пропустить. В ComfyUI такие методы доступны через узлы сообщества и встроенные функции кэширования. Они заметно сокращают время ценой небольшой потери деталей; порог кэширования нужно подбирать под свою модель. Вместе с SageAttention, fp8 и ускоряющими LoRA это позволяет генерировать видео на домашних видеокартах за разумное время — подробнее о локальном видео в гайде локальная генерация видео Wan.
Как измерить эффект у себя
Мы сознательно не приводим «таблицу ускорения в процентах»: результат сильно зависит от видеокарты, драйвера, версий библиотек, модели, разрешения и workflow. Чужие цифры почти никогда не совпадут с вашими. Вместо этого измерьте сами:
- Зафиксируйте тест. Одна модель, один промт, один сид, одно разрешение, одно число шагов и один сэмплер.
- Прогрейте. Первую генерацию после запуска не считайте — в ней загрузка модели и компиляция.
- Сделайте 3–5 прогонов и запишите время каждого (ComfyUI и Forge показывают время выполнения в консоли) — берите среднее.
- Меняйте одно за раз. Включили SageAttention — замерили. Поставили fp8 — замерили. Иначе не поймёте, что сработало.
- Сравнивайте картинки. Ускорение, которое портит качество, — не ускорение. Сохраняйте результаты рядом и смотрите на детали.
- Следите за VRAM. Диспетчер задач Windows или утилита nvidia-smi покажут, помещается ли модель в видеопамять.
Если у вас AMD, Mac или слабая видеокарта
- AMD на Windows и Linux. SageAttention, xformers и TensorRT рассчитаны на NVIDIA. Для AMD важнее всего правильный бэкенд (ROCm на Linux, актуальные сборки для Windows), свежие драйверы и облегчённые модели. Подробно — в гайде Stable Diffusion на AMD.
- Mac на Apple Silicon. Генерация идёт через Metal; ускоряют в основном меньшее разрешение, меньше шагов, LoRA-ускорители и лёгкие модели.
- 6–8 ГБ видеопамяти. Для вас главное — не выйти за пределы VRAM: fp8 или GGUF для больших моделей, режимы экономии памяти в интерфейсе, генерация в родном разрешении и апскейл отдельно. Турбо-модели и LoRA-ускорители дают самый заметный эффект именно на слабом железе, потому что сокращают число самых дорогих операций — шагов сэмплера.
Порядок действий: с чего начать
- Драйвер, обновление ComfyUI/Forge, родное разрешение, разумное число шагов.
- Если модель не помещается в VRAM — fp8 или GGUF.
- Для черновиков — LoRA-ускоритель на 4–8 шагов.
- Для видео и больших моделей — SageAttention с Triton и кэширование шагов.
- Для конвейерной генерации одной моделью в фиксированных размерах — TensorRT.
Если вы выбираете между интерфейсами, у Forge, ComfyUI и AUTOMATIC1111 разный набор встроенных оптимизаций — сравнение в статье ComfyUI, Forge и AUTOMATIC1111. А если ComfyUI для вас новый, начните с гайда ComfyUI для начинающих.
Итог
Ускорить Stable Diffusion и ComfyUI можно без новой видеокарты: начните с бесплатных шагов — драйвер, обновления, родное разрешение, меньше шагов. Если модель не помещается в видеопамять, переходите на fp8 или GGUF. Для быстрых черновиков используйте LCM, Lightning, Turbo или Hyper LoRA. Для видео и тяжёлых моделей ставьте SageAttention с Triton, строго подбирая версии под свой PyTorch и CUDA. TensorRT оставьте для конвейерной работы одной моделью. И всегда измеряйте эффект у себя — одним и тем же тестом до и после.
Частые вопросы
Как ускорить генерацию в Stable Diffusion?
Обновите драйвер и интерфейс, генерируйте в родном разрешении модели, уменьшите число шагов, используйте LoRA-ускорители вроде LCM или Lightning, а если модель не помещается в видеопамять — fp8 или GGUF-версии. Для видео и больших моделей помогает SageAttention.
Что такое xformers?
xformers — библиотека с оптимизированными реализациями механизма внимания, которая ускоряет генерацию и снижает расход видеопамяти. В современных версиях PyTorch есть встроенное быстрое внимание, поэтому xformers уже не обязателен, но на некоторых конфигурациях даёт выигрыш.
Как установить SageAttention в ComfyUI на Windows?
Установите triton-windows, совместимый с вашим PyTorch, при необходимости добавьте в папку встроенного Python файлы include и libs, затем поставьте сборку SageAttention для Windows, точно соответствующую версиям Python, PyTorch и CUDA, и запустите ComfyUI с флагом --use-sage-attention.
Что такое LCM LoRA и Lightning LoRA?
Это LoRA-ускорители, обученные давать хороший результат за 4–8 шагов вместо 25–30. Они используются с низким CFG (1–2) и подходящим сэмплером, но немного снижают разнообразие и точность следования сложным промтам.
Стоит ли использовать TensorRT для Stable Diffusion?
Если вы много генерируете одной моделью в фиксированных разрешениях — да, прирост заметный. Если часто меняете модели, LoRA и размеры, затраты на конвертацию и ограничения совместимости обычно не окупаются.
Ускоряет ли GGUF генерацию?
Главным образом тогда, когда без квантования модель не помещалась в видеопамять. Если модель и так целиком в VRAM, прирост скорости может быть небольшим, но освободится память под другие модули.
