Технологии синхронизации речи и движения губ быстро развиваются, и сегодня создать реалистичный липсинк можно даже с помощью бесплатного программного обеспечения. Одним из таких инструментов является Infinite Talk — open-source генератор синхронизации губ, который работает через ComfyUI. Вы сможете бесплатно генерировать креативы и вести аккаунты в соцсетях, подгоняя под вашего персонажа любой текст с точным совпадением движения губ.
Этот инструмент позволяет автоматически синхронизировать мимику лица на видео с аудиодорожкой. Infinite Talk поддерживает два основных формата работы:
- i2v (image-to-video) — анимация лица на основе статичного изображения.
- v2v (video-to-video) — изменение мимики на готовом видео.

В этом материале разберем именно v2v-режим, который используется для замены движения губ и мимики в уже существующих роликах.
Стоит отметить, что качество генерации пока уступает коммерческим решениям вроде HeyGen. Однако для бесплатного open-source проекта результат выглядит весьма достойно, особенно если правильно настроить воркфлоу.

Требования к железу
Infinite Talk работает на базе нейросетевых моделей и требует достаточно мощного оборудования. На данный момент система не поддерживает рендеринг в 4K. Оптимальное разрешение — 480p или 720p.
Для тестов подойдут видеокарты уровня NVIDIA GeForce RTX 4090 или NVIDIA GeForce RTX 5090.
Если планируется генерация большого количества видео, лучше использовать серверные GPU: NVIDIA H100, NVIDIA H200.
Многие пользователи запускают такие задачи на облачных сервисах, например Vast.ai, где можно арендовать мощные видеокарты на несколько часов.
Важно учитывать, что multi-GPU серверы не дают заметного прироста скорости при рендере одного видео. Они полезны только при параллельной генерации нескольких роликов.
Шаг 1. Подготовка окружения
Для начала необходимо развернуть сервер с установленным ComfyUI. В Vast AI достаточно выбрать шаблон с уже установленным ComfyUI. Желательно использовать проверенные template-образы со всеми зависимостями — это снизит вероятность ошибок.
При создании инстанса важно выделить достаточно места на диске. Оптимальный объем — 130–150 ГБ, поскольку модели занимают значительное пространство.
После запуска сервера необходимо подождать около минуты, пока система завершит кэширование и подготовит окружение. Затем можно перейти в Dashboard.
Шаг 2. Установка моделей
Следующий этап — загрузка моделей, необходимых для работы Infinite Talk. В панели управления нужно открыть Jupyter Terminal. По умолчанию пользователь оказывается в папке workspace.
Сами модели скачиваются с Hugging Face с помощью команды wget. После загрузки файлы необходимо распределить по папкам ComfyUI.
Основные директории:
- ComfyUI/models/diffusion_models/ — здесь размещаются ключевые модели: Wan2.1-I2V-14B, InfiniteTalk_Single и MelBandRoformer.
- ComfyUI/models/vae/ — сюда помещается VAE-модель Wan2_1_VAE.
- ComfyUI/models/text_encoders/ — здесь размещается текстовый энкодер umt5-xxl-enc.
- ComfyUI/models/clip_vision/ — в этой папке находится файл clip_vision_h.
- ComfyUI/models/loras/ — сюда загружается апскейлер lightx2v.
Корректное распределение файлов по директориям крайне важно — иначе ComfyUI просто не увидит нужные модели.
Шаг 3. Запуск генерации (Workflow)
После установки моделей необходимо загрузить готовый workflow-файл в формате JSON.
Для этого достаточно перетащить файл в интерфейс ComfyUI. После загрузки останется выполнить три простых действия:
1. Загрузить видео. В ноде choose video to upload необходимо добавить исходное видео без звуковой дорожки.
2. Загрузить аудио. В отдельную ноду добавляется звуковая дорожка, с которой будет синхронизироваться мимика.
3. Настроить промпты. В поле Positive Prompt указывается желаемый результат, а в Negative Prompt — то, чего нужно избежать.
После этого достаточно нажать кнопку Queue Prompt, чтобы запустить процесс генерации.
Тонкая настройка и решение проблем
При работе с Infinite Talk могут возникать различные технические нюансы. Самые распространенные проблемы:
- Ошибки из-за отсутствия нод. Если система сообщает о недостающих нодах, необходимо открыть Manager → Install Missing Nodes и установить все отсутствующие компоненты.
- Красные блоки в воркфлоу. Если нода выделена красным цветом, это означает, что она не видит модель. Нужно открыть выпадающий список внутри ноды и выбрать правильный файл.
- Баланс качества и скорости. Параметр Steps в ноде WanVideo Sampler отвечает за качество генерации. Чем больше шагов, тем выше качество, но тем дольше идет рендер.
- Настройка мимики. За четкость движения губ отвечает параметр CFG. Оптимальный диапазон — 2.0–2.5. Более высокие значения делают мимику неестественной.
- Детализация изображения. В нодах wanVideo decode и encode есть параметры tile_x, tile_y, tile_stride_x и tile_stride_y. Увеличение этих значений повышает детализацию, но увеличивает время рендера. Важное правило: значение tile_stride должно быть ровно в два раза меньше tile.
- Синхронизация кадров. Перед запуском генерации нужно убедиться, что FPS исходного видео совпадает с FPS финального рендера в ноде Video Combine.
Итог
Infinite Talk — мощный инструмент для генерации липсинка, который позволяет синхронизировать речь и мимику на видео без использования коммерческих сервисов. Благодаря интеграции с ComfyUI и наличию API весь процесс можно автоматизировать — например, создать Telegram-бота для генерации видео по запросу.
При правильной настройке и достаточной вычислительной мощности Infinite Talk может стать удобным инструментом для создания ИИ-контента, тестирования новых форматов и экспериментов с нейросетевой генерацией видео.






