Wan 3.0 Prime берут за две вещи: ролик длиной до 30 секунд за одну генерацию и звук, который рождается вместе с картинкой. Секунда готового видео стоит 10.2 нейрона на 480p, 21 — на 720p и 42 — на 1080p; выше 1080p модель не идёт. Тридцать секунд в 1080p — это 1260 нейронов, пять секунд в 480p — 51. Модель доступна на уровне STANDARD, то есть с тарифа Старт. По цене на сопоставимых разрешениях Wan дороже соседней Gemini Omni Flash 1.1, так что берут его именно ради длины и звука, а не ради экономии.
Что именно умеет Wan 3.0 Prime
Это генератор видео, который собирает изображение и звуковую дорожку в один проход: на выходе ролик, который уже звучит. Плюс длина — 30 секунд за одну генерацию. Этого хватает на пре-ролл, разбор продукта или сцену с репликой, а не только на короткую перебивку.
- text-to-video — ролик из текстового описания. Базовый режим для сторис, заставок, фонов и рекламных вставок.
- image-to-video — оживление готового кадра. Удобно, когда есть утверждённый визуал: снятое фото товара, ключевой кадр из брендбука, отрисованный макет.
- reference-to-video — генерация с опорой на референсы. Сюда можно подать и звук — тогда модель ориентируется на заданную дорожку, а не придумывает свою с нуля.
Чем Wan отличается от Gemini Omni Flash 1.1?
Это две разные рабочие лошадки, и путать их дорого. Gemini Omni Flash 1.1 — про короткие ролики и низкую цену секунды: 3–10 секунд, по умолчанию 8, четыре эндпоинта, включая правку уже готового ролика по описанию, запрос до 20000 символов и поддержка 4K. Wan 3.0 Prime — про длину и звук: 2–30 секунд, по умолчанию 5, три эндпоинта, потолок 1080p, запрос до 5000 символов.
| Параметр | Wan 3.0 Prime | Gemini Omni Flash 1.1 |
|---|---|---|
| Длительность | 2–30 сек, по умолчанию 5 | 3–10 сек, по умолчанию 8 |
| Звук в генерации | Да, вместе с видео | Нет |
| Максимальное разрешение | 1080p | 4K |
| Эндпоинты | text-to-video, image-to-video, reference-to-video | text-to-video, image-to-video, reference-to-video, edit |
| Правка готового ролика по описанию | Нет | Да |
| Длина запроса | до 5000 символов | до 20000 символов |
| Уровень доступа | STANDARD (с тарифа Старт) | STANDARD (с тарифа Старт) |
Сколько стоит секунда
Цена у обеих моделей ступенчатая: чем выше разрешение, тем дороже каждая секунда. Фиксированной цены за ролик нет ни у той, ни у другой, поэтому считать надо не «сколько стоит ролик вообще», а «сколько стоит секунда на том разрешении, которое реально нужно площадке».
| Разрешение | Wan 3.0 Prime | Gemini Omni Flash 1.1 |
|---|---|---|
| 360p | — | 4.5 |
| 480p | 10.2 | — |
| 720p | 21 | 15 |
| 1080p | 42 | 22.5 |
| 4K | не поддерживается | 45 |
| Длина | 480p | 720p | 1080p |
|---|---|---|---|
| 5 секунд (по умолчанию) | 51 | 105 | 210 |
| 10 секунд | 102 | 210 | 420 |
| 30 секунд (максимум) | 306 | 630 | 1260 |
Вывод прямой: на сопоставимых разрешениях Wan дороже. Десять секунд в 720p — 210 нейронов против 150 у Gemini, в 1080p — 420 против 225. Поэтому Wan не стоит ставить моделью по умолчанию: он оправдан там, где нужны его собственные преимущества — длина сверх 10 секунд и звук в той же генерации. Всё, что укладывается в 10 секунд, дешевле делать на Gemini. Отдельный случай — ролик, поверх которого всё равно ляжет закадровый голос или трек из библиотеки: сгенерированный звук там просто выбрасывается, и платить за него незачем.
Когда длина решает
Десять секунд — это ровно один смысловой ход: показали объект, повернули камеру, закончили. Как только в ролике появляется второй ход — «было плохо, стало хорошо», «шаг первый, шаг второй», «вопрос и ответ» — десяти секунд не хватает физически. Здесь и начинается территория Wan.
- Пре-ролл и рекламная вставка на 15–30 секунд: завязка, демонстрация, финальный кадр с логотипом.
- Мини-разбор продукта: три состояния интерфейса или три ракурса товара в одном непрерывном движении камеры.
- Сцена с репликой: персонаж что-то произносит, и звук идёт из той же генерации, без отдельной озвучки и подгонки таймингов.
- Атмосферный фон для лендинга или экрана ожидания, где склейка каждые восемь секунд бросается в глаза.
- Сторис-серия из одной длинной генерации, которую потом режут на части, а не сшивают из разных.
- А вот перебивка, зацикленный фон, анимация логотипа и короткий хук для рилса живут в 3–8 секундах — под них Wan брать незачем.
Что не так со склейкой длинного ролика из коротких?
По публичным обзорам и гайдам практиков, главная беда сшитых роликов — дрейф: между отдельными генерациями уезжает лицо персонажа, меняется оттенок света, чуть иначе ложится фактура фона. На стыке это заметно даже неподготовленному зрителю. Плюс каждая склейка требует ручной работы в монтаже и подгонки звука. Одна тридцатисекундная генерация снимает и то, и другое: вы платите больше за секунду, но меньше — временем дизайнера.
Звук: главный аргумент модели
Wan 3.0 Prime генерирует звук вместе с видео и принимает звук в референсе. Это меняет маршрут работы: обычно видео и дорожку собирают в разных инструментах, а потом сводят и подгоняют по таймингу. Здесь звук приходит вместе с картинкой и уже совпадает с тем, что происходит в кадре.
- Звук в референсе — способ задать нужный характер дорожки, а не полагаться на догадку модели.
- Если нужна именно музыка как отдельный продукт — под неё есть свои инструменты, см. генерацию музыки нейросетью.
- Если ролик уже снят и нужны только эффекты или озвучка поверх — это отдельная задача, разобранная в гайде по звуковым эффектам.
Как управлять звуком в промпте?
Описывайте звук так же явно, как картинку: отдельно музыка (жанр и настроение), отдельно эффекты (что звучит и в какой момент), отдельно реплики (кто говорит и какими словами). Если о звуке в запросе не сказано ничего, модель выбирает его сама — и результат может не совпасть с вашим замыслом. Так же явно стоит писать, чего быть не должно: тишина в кадре тоже задаётся словами.
Промпты для трёх режимов
text-to-video: рекламная вставка на 15 секунд со звуком
Вертикальный ролик 9:16, 15 секунд, одна непрерывная сцена.
[0–5с] Керамическая кружка стоит на деревянной столешнице у окна, утренний свет сбоку. Камера — медленный push-in на кружку.
[5–10с] В кружку льётся кофе, поднимается пар. Камера продолжает движение вперёд, фокус на струе.
[10–15с] Рука в кадре берёт кружку и уносит из кадра, остаётся пустая столешница и световое пятно.
Стиль: тёплые оттенки, мягкие тени, естественное освещение, неглубокая резкость.
Звук: тихий эмбиент без мелодии; эффекты — журчание наливаемого кофе, лёгкий стук керамики о дерево, приглушённый уличный шум за окном. Речи нет.image-to-video: оживление снятого кадра товара
Возьми загруженный кадр как первый кадр ролика. 8 секунд, 16:9.
Объект на фото остаётся неизменным: та же форма, тот же цвет, та же этикетка.
Движение: камера делает плавный облёт объекта слева направо примерно на 40 градусов, объект остаётся в центре кадра.
Освещение и фон сохраняются из исходного кадра, без смены цвета и без появления новых предметов.
Звук: только ровный тихий эмбиент студии. Без музыки, без голоса.reference-to-video: сцена с персонажем и заданным звуком
Референсы: изображение 1 — внешность персонажа, изображение 2 — интерьер локации, аудио 1 — характер фоновой дорожки.
Сцена 12 секунд, 16:9.
[0–6с] Персонаж с изображения 1 входит в помещение с изображения 2, оглядывается. Камера — статичный средний план.
[6–12с] Персонаж садится за стол и произносит: «Давайте начнём». Камера медленно приближается до поясного плана.
Внешность персонажа и интерьер должны совпадать с референсами и не меняться по ходу ролика.
Звук: фон в характере аудио 1, эффекты — шаги, скрип стула; одна реплика голосом персонажа.Общий принцип у всех трёх: сначала субъект, место и действие, потом камера, потом стиль, потом звук. Разметка по времени на пять-десять шагов даёт модели понятную структуру вместо абзаца из сорока прилагательных, а движение камеры лучше называть явно — иначе его выберут за вас.
Как не сжечь нейроны на перегенерациях
- Черновики — на 480p. Секунда стоит 10.2 нейрона вместо 42, а композицию, ритм и звук вы проверите ровно так же.
- Держите черновую длину минимальной. Пять секунд на 480p — 51 нейрон; тридцать секунд в 1080p — 1260. Проверять идею на максимуме — самый дорогой способ ошибиться.
- Финал — один раз и сразу в нужном разрешении. 1080p для сайта и YouTube, 720p для сторис и мессенджеров: на тридцати секундах это 1260 против 630 нейронов.
- Разложите ролик на смысловые шаги и пропишите их с таймингами. Одна сцена, растянутая на 30 секунд без внутренней структуры, чаще всего выходит вялой — и переделывать её дорого.
- Проверьте, точно ли нужен звук из генерации. Если поверх всё равно ляжет закадровый голос, ролик дешевле сделать на Gemini Omni Flash 1.1.
- Мелкие предметы описывайте вместе с их положением к финалу сцены: чем длиннее ролик, тем выше шанс, что не названная явно деталь изменится или уйдёт из кадра.
Рабочая связка двух моделей
На практике удобнее не выбирать одну модель навсегда, а держать обе и распределять задачи. Короткое, многовариантное и требующее правок — на Gemini Omni Flash 1.1: там дешевле секунда, шире запрос и есть правка готового ролика по описанию. Длинное и звучащее — на Wan 3.0 Prime. Обе доступны с тарифа Старт, так что переключение между ними ничего дополнительно не стоит.
| Задача | Модель | Почему |
|---|---|---|
| Перебивка, луп, анимация логотипа | Gemini Omni Flash 1.1 | 3–10 секунд хватает, 360p — 4.5 нейрона за секунду |
| Ролик в 4K для большого экрана | Gemini Omni Flash 1.1 | Wan выше 1080p не идёт |
| Правка уже готового ролика по описанию | Gemini Omni Flash 1.1 | Отдельный эндпоинт edit, у Wan его нет |
| Короткий ролик в 720p или 1080p | Gemini Omni Flash 1.1 | 15 и 22.5 нейрона за секунду против 21 и 42 у Wan |
| Пре-ролл 15–30 секунд | Wan 3.0 Prime | Одна генерация вместо склейки из трёх |
| Сцена с репликой и эффектами | Wan 3.0 Prime | Звук приходит вместе с картинкой |
| Длинный сюжет с опорой на референсы и звук | Wan 3.0 Prime | reference-to-video принимает звук в референсе |
Частые вопросы
Сколько стоит 30-секундный ролик на Wan 3.0 Prime?
306 нейронов в 480p, 630 в 720p и 1260 в 1080p — считается по секундам: 10.2, 21 и 42 нейрона соответственно. Тридцать секунд — максимум модели, минимум — две секунды.
Wan дешевле, чем Gemini Omni Flash 1.1?
Нет. На сопоставимых разрешениях Wan дороже: 720p — 21 нейрон за секунду против 15, 1080p — 42 против 22.5. Цена ступенчатая у обеих моделей и растёт вместе с разрешением, фиксированной ставки за ролик нет ни у одной. Wan берут не ради экономии, а ради длины до 30 секунд и звука в той же генерации.
Может ли Wan 3.0 Prime выдать 4K?
Нет, потолок — 1080p. Если нужен 4K, это задача для Gemini Omni Flash 1.1: там 4K стоит 45 нейронов за секунду, а максимальная длина ролика — 10 секунд.
Нужно ли отдельно озвучивать ролик после генерации?
Wan 3.0 Prime генерирует звук вместе с видео, поэтому отдельная озвучка не обязательна. Если нужна конкретная дорожка — её можно подать в референсе. Отдельный этап озвучки остаётся нужен, когда поверх ролика идёт закадровый голос диктора или готовый музыкальный трек.
На каком тарифе доступна модель?
Wan 3.0 Prime и Gemini Omni Flash 1.1 относятся к уровню STANDARD — они открываются с тарифа Старт и выше. Обе живут в МедиаЛаб, условия по тарифам — на странице тарифов, начать работу можно в личном кабинете.


