Создание видео в воркфлоу
В прошлой статье мы разобрали простую схему создания видео с помощью Kling Motion Control. Теперь разберём создание воркфлоу.
Интерфейс воркфлоу
Начнём с основы, ComfyUI — это графический интерфейс для работы с open-source нейросетями. В отличие от закрытых сервисов вроде Midjourney или ChatGPT, где вы просто вводите запрос и ждёте результат, ComfyUI даёт полный контроль над каждым этапом генерации. Вся архитектура построена на нодах — это технические шаги или этапы в работе нейросети. Мы сами решаем, когда она должна посмотреть на картинку, когда прочитать промпт или применить маску. Это открывает больше возможностей для детализации процесса и результата.
Сам воркфлоу — это визуальный набор связанных блоков (нод) в формате JSON. Каждая нода выполняет конкретную функцию. Базовые принципы воркфлоу обычно создаёт опенсорс-сообщество, а инженеры дорабатывают их под задачи: убирают лишнее и собирают финальный пайплайн.
Основные модели при работе воркфлоу
Для генерации видео одной модели мало — в воркфлоу всегда сочетаются несколько. Давайте разберём основные.
Основная модель
Это модель для отрисовки. При работе с видео наш воркфлоу использует модель Wan2.2.
Модели CLIP и CLIP Vision
Первая переводит текстовый промпт на язык математики для нейросети. Вторая делает то же, но с референсной картинкой, объясняя нейронке, как выглядит персонаж.
Модель VAE
Нейросетям тяжело работать с объёмными файлами, поэтому VAE сжимает видео в специальное пространство для быстрого расчёта моделью, а потом распаковывает обратно в пиксели.
Модели LoRA
Они закрепляют постоянное лицо персонажа (помимо референс-фото) или улучшают пост-генерацию. Это модификаторы воркфлоу. Например, они делают текстуру кожи рук и пальцев реалистичнее.
Модели распознавания позы
Для точного копирования движений персонажа с референс-видео используются ноды распознавания позы. Модель сканирует референсное видео, строит скелет и передаёт его как жёсткое условие главной модели. Та «натягивает» сгенерированного персонажа строго на этот каркас.
Если просто дать модели референс-видео, она перерисует его целиком. Чтобы сохранить фон исходного видео, используется сегментация.
Специальный набор нод анализирует видео, рисует чёрную блочную маску поверх человека. Маска указывает модели генерировать новое изображение только внутри неё. Персонаж меняется, а фон остаётся нетронутым. Набор работает как с фото, так и с видео.
Также воркфлоу позволяет заменить только лицо, а не всего человека. Тогда маска строится только на лице. Это сохраняет оригинальное тело и одежду, подставляя внешность другого человека.
Как создать свой собственный воркфлоу?
После ознакомления с базовой теорией воркфлоу попробуем собрать свой с нуля. Будем делать это поэтапно.
Сначала установите ComfyUI локально на ПК или на удалённом сервере. Если у вас топовое железо и быстрый интернет, можно локально, но мы пойдём более простым и оптимальным путем.
Для установки ComfyUI используем RunPod — там уже есть готовый шаблон с моделями. Важный нюанс: RunPod — платный.
Выберите предустановленный сервис и в дополнительных настройках укажите CUDA 12.8 или 12.9. Далее разверните ComfyUI по ссылке и приступайте к работе.
Важно: при локальной установке ComfyUI модели загружаются вручную, что занимает время.
После установки шаблона откройте ComfyUI: увидите окно с набором готовых бесплатных воркфлоу. Закройте его, пока оно нам не нужно, — получите чистый холст.
Соберём базовый флоу: text to image. Механика проста: нейросеть Flux генерирует изображение по тексту. Никакой лишней логики, только базовая связка нод.
Первым делом добавляем модели. Двойной клик левой кнопкой мыши по пустому месту холста открывает поиск нод.
В поиске введите «load diffusion model», нажимаем, и у нас появляется первая нода. В первой строке выберите модель flux-2.
Следом добавляем CLIP: снова два раза нажимаем по холсту и пишем load clip. Как вы помните, без этой ноды модель просто не поймет ваш промпт. CLIP переводит текст на язык математики для нейросети.
Дальше добавьте CLIP: сделайте двойной клик по холсту и введите «load clip». Без неё модель не поймёт промпт — CLIP переводит текст в математический язык для нейросети.
Модели загружены, так что теперь добавляем сердце всей генерации: KSampler.
KSampler — нода, управляющая процессом диффузии. Здесь происходит вся «магия» генерации.
KSampler получает чистый шум (пустой латент) и шаг за шагом убирает лишнее, ориентируясь на промпт и модель. Латент — сжатое математическое представление изображения для работы нейросети.
Каждый шаг KSampler — одна итерация «очистки»: нейросеть сравнивает текущий латент с промптом и приближает его к финальному результату.
Чтобы добавить KSampler в наш воркфлоу, зажмите точку у MODEL и тяните вправо. ComfyUI предложит популярные ноды — выберите KSampler.
Чтобы KSampler заработал, добавьте две ноды: позитивный и негативный промпты. От CLIP тяните вправо и выберите CLIP Text Encode (Prompt). Повторите дважды: одну для позитивного, вторую для негативного. Соедините обе с KSampler.
Добавьте пустое латентное изображение. В нашем случае оно будет пустым — KSampler сам заполнит его с нуля. От latent_image тяните вниз, выберите Empty Latent Image.
Теперь KSampler может выдать нам тот самый латент — декодируйте его в картинку. От LATENT тяните вправо, выберите VAE Decode. Подключите загруженную VAE-модель к декодеру.
Чтобы вывести результат, от IMAGE тяните вправо и добавьте Preview Image. Растяните ноду — изображение будет лучше видно в интерфейсе воркфлоу.
Воркфлоу готов. Перед запуском настройте KSampler: ставим Steps — 10, CFG — 1.0. Это оптимальные параметры для Flux на старте.
Введите простой промпт: «Asian women» и нажмите Run в правом верхнем углу.
Через несколько секунд воркфлоу выдаст первое изображение.
Мы собрали самый простой text-to-image флоу. Но даже в базовой связке нод есть гибкие настройки — профессионалы используют их для максимального качества генераций.
Нюансы в работе воркфлоу
Обратите внимание, сколько шагов потребовалось для базового воркфлоу генерации изображений. Теперь посмотрим на тот воркфлоу, через который мы генерируем видеоконтент.
Создание такого сложного рабочего флоу занимает не часы, а дни. А вот генерация итогового видео — минуты или десятки минут. Также необходимо постоянное обслуживание текущего флоу, чтобы правильно подгружать модели, фиксить баги и выдавать классный результат.
В целях безопасности мы не можем выложить наш флоу в открытый доступ, но готовы поделиться им с ограниченным количеством людей. Поэтому мы уже разрабатываем для вас понятное решение с удобным интерфейсом.
Следите за обновлениями в нашем Telegram-канале.
А вот какой контент вам лучше создавать и как вообще развивать свои соцсети — расскажем в следующей статье.