Ещё в 2023-м AI едва справлялся с короткими анимированными картинками, то в 2025-м пользователи Wan 2.5 создают полноценные ролики со звуком, речью и движениями — буквально за пару минут. По данным платформы, ежедневно через неё проходит свыше полумиллиона промтов, а более 60% готовых видео сразу публикуются в соцсетях без ручного монтажа.
Если вы используете Wan для создания клипов, важно понимать, как формулировать промты так, чтобы нейросеть не додумывала лишнего и выдавала видео, готовое к публикации. Ниже — подробное руководство о структуре, нюансах и практических приёмах.

Зачем нужны правильные промты
Нейросети опираются на ваш запрос как на ТЗ. Чем точнее промт, тем меньше сюрпризов на выходе: меньше лишних объектов в кадре и выше совпадение с референсами. В Wan 2.1, 2.2 и особенно 2.5 качество результата напрямую связано с тем, насколько структурировано вы описали сцену, действие, камеру и звук.
Базовые принципы: что должно быть в хорошем запросе
- Главный объект и цель сцены. Начало промта — кто/что в фокусе, потом уже второстепенные детали.
- Контекст и пространство. Где находимся, какое время суток, погода, атмосфера.
- Действие + камера. Что происходит и как это увидеть: ракурс, движение.
- Стиль и ограничения. Референсы, цвет или темп.
- Аудио. Музыка, амбиент, фразы, язык реплик (актуально для Wan 2.5).
- Технические параметры. Длительность, соотношение сторон, ориентир по разрешению.

Разница между версиями в Wan
| Версия | Ее особенности | На что делать упор в промте |
| Wan 2.1 | Базовая стабильность, адекватные простые сцены | Чёткая сцена и один главный объект, избегайте перегруза стилем |
| Wan 2.2 | Лучшая динамика, более уверенная камера, гибкость | Явно прописывать движения и темп, добавлять негативные уточнения |
| Wan 2.5 | Улучшенное понимание языка, плавность, встроенное аудио/липсинк | Описывать звук, фиксировать идентичность в I2V |
Универсальная структура промта для нейросети Wan
Кратко опишите цель ролика в одном предложении — зачем создаётся клип. Далее — блоками:
- Scene: место, время, свет, атмосфера.
- Character/Subject: кто в кадре, внешний вид, костюм, возраст, настроение.
- Action + Camera: действие + крупность/ракурс/трекинг/панорама.
- Style: жанр, референсы, палитра, фактура.
- Audio: музыка, амбиент, реплики, нужна ли синхронизация губ.
- Duration & Format: длина, ориентир по разрешению.
- Negatives: «без текста на экране», «без шумной толпы», «без карикатурных лиц» и т. п.
Такую структуру для Wan удобно хранить как шаблон и заполнять промт отдельно под каждую задачу.
Универсальная подборка промтов для генерации по описанию и по изображению в Wan
1. Минимальный T2V — мотивация
Молодая женщина бежит по парку на рассвете, камера плавно приближается спереди, мягкий золотой свет и лёгкий туман, реалистичный стиль, звучит спокойная электронная музыка.
2. I2V — оживление портрета
Сохрани выражение лица и стиль одежды с исходного изображения, человек слегка поворачивает голову и улыбается, лёгкий параллакс, мягкий офисный фон и тихий эмбиент, без текста и искажений.
3. T2V — демонстрация продукта
Серебристая кофемашина на белой кухне наливает кофе в чашку, медленный переход от сопла к поверхности напитка, пар и блики солнца, реалистичная детализация, без рук и надписей, слышен звук кофемолки.
4. T2V — городской закат
Молодой мужчина идёт по мосту на фоне вечернего города, камера слегка дрейфует сбоку, оранжево-фиолетовое небо отражается в реке, стиль кинематографичный, тихая фоновая музыка, без текста и посторонних людей.
5. I2V — аватар для видеообращения
Сохрани внешность и одежду исходного фото, персонаж слегка наклоняет голову и говорит короткую фразу на русском, средний план, освещение нейтральное, звук чистый без эха, без лишних элементов.
Фото мужчины мы сгенерировали по нашему гайду для Шедеврума
6. T2V — рекламная сцена с автомобилем
Красный электрокар едет по горной дороге на рассвете, камера следует за машиной сверху и сбоку, отражения на кузове, лёгкий туман, кинематографичный стиль, динамичная оркестровая музыка, без логотипов.
7. T2V — фуд-видео
На деревянном столе сервируют салат, плавный переход, зелень и пар, мягкий утренний свет, стиль реалистичный, слышны тихие звуки готовки, без текста и рук в кадре.
8. I2V — цифровой персонаж
Сохрани черты лица из исходного изображения, персонаж моргает и немного двигает рукой, лёгкий ветер колышет волосы, мягкий свет, лёгкий эмбиент, без текста и резких движений.
9. T2V — пейзаж и атмосфера
Заснеженный лес в утреннем свете, камера медленно движется вперёд по тропинке, падает мягкий снег, стиль реалистичный, без людей и животных, фоновая музыка спокойная, без текста и надписей.
10. T2V — технологичный клип
Крупный план материнской платы, камера движется по поверхности микросхем, вспыхивают голубые диоды, холодная цветовая палитра, фоновая электронная музыка, без текста, без логотипов, стиль футуристичный.
Резюме
Хороший промт — это компактное ТЗ: цель, сцена, действие, камера, стиль, звук, техника и запреты. В версии Wan 2.1 стоит начинать с простых сюжетов и минималистичного визуального ряда. В 2.2 уже можно управлять камерой и добавлять негативные уточнения, чтобы убрать всё лишнее из кадра. А в Wan 2.5 не забывайте про аудио: добавляйте фоновые звуки, короткие реплики и следите за липсинком, особенно в режиме I2V. Здесь важно бережно сохранять идентичность персонажа и избегать чрезмерной динамики.
