Wan 3.0 Prime берут за две вещи: ролик длиной до 30 секунд за одну генерацию и звук, который рождается вместе с картинкой. Секунда готового видео стоит 10.2 нейрона на 480p, 21 — на 720p и 42 — на 1080p; выше 1080p модель не идёт. Тридцать секунд в 1080p — это 1260 нейронов, пять секунд в 480p — 51. Модель доступна на уровне STANDARD, то есть с тарифа Старт. По цене на сопоставимых разрешениях Wan дороже соседней Gemini Omni Flash 1.1, так что берут его именно ради длины и звука, а не ради экономии.

Что именно умеет Wan 3.0 Prime

Это генератор видео, который собирает изображение и звуковую дорожку в один проход: на выходе ролик, который уже звучит. Плюс длина — 30 секунд за одну генерацию. Этого хватает на пре-ролл, разбор продукта или сцену с репликой, а не только на короткую перебивку.

  • text-to-video — ролик из текстового описания. Базовый режим для сторис, заставок, фонов и рекламных вставок.
  • image-to-video — оживление готового кадра. Удобно, когда есть утверждённый визуал: снятое фото товара, ключевой кадр из брендбука, отрисованный макет.
  • reference-to-video — генерация с опорой на референсы. Сюда можно подать и звук — тогда модель ориентируется на заданную дорожку, а не придумывает свою с нуля.

Чем Wan отличается от Gemini Omni Flash 1.1?

Это две разные рабочие лошадки, и путать их дорого. Gemini Omni Flash 1.1 — про короткие ролики и низкую цену секунды: 3–10 секунд, по умолчанию 8, четыре эндпоинта, включая правку уже готового ролика по описанию, запрос до 20000 символов и поддержка 4K. Wan 3.0 Prime — про длину и звук: 2–30 секунд, по умолчанию 5, три эндпоинта, потолок 1080p, запрос до 5000 символов.

ПараметрWan 3.0 PrimeGemini Omni Flash 1.1
Длительность2–30 сек, по умолчанию 53–10 сек, по умолчанию 8
Звук в генерацииДа, вместе с видеоНет
Максимальное разрешение1080p4K
Эндпоинтыtext-to-video, image-to-video, reference-to-videotext-to-video, image-to-video, reference-to-video, edit
Правка готового ролика по описаниюНетДа
Длина запросадо 5000 символовдо 20000 символов
Уровень доступаSTANDARD (с тарифа Старт)STANDARD (с тарифа Старт)
Wan 3.0 Prime и Gemini Omni Flash 1.1: что где

Сколько стоит секунда

Цена у обеих моделей ступенчатая: чем выше разрешение, тем дороже каждая секунда. Фиксированной цены за ролик нет ни у той, ни у другой, поэтому считать надо не «сколько стоит ролик вообще», а «сколько стоит секунда на том разрешении, которое реально нужно площадке».

РазрешениеWan 3.0 PrimeGemini Omni Flash 1.1
360p4.5
480p10.2
720p2115
1080p4222.5
4Kне поддерживается45
Цена за секунду готового видео, нейронов (проверено 28.08.2026)
Длина480p720p1080p
5 секунд (по умолчанию)51105210
10 секунд102210420
30 секунд (максимум)3066301260
Стоимость ролика на Wan 3.0 Prime, нейронов

Вывод прямой: на сопоставимых разрешениях Wan дороже. Десять секунд в 720p — 210 нейронов против 150 у Gemini, в 1080p — 420 против 225. Поэтому Wan не стоит ставить моделью по умолчанию: он оправдан там, где нужны его собственные преимущества — длина сверх 10 секунд и звук в той же генерации. Всё, что укладывается в 10 секунд, дешевле делать на Gemini. Отдельный случай — ролик, поверх которого всё равно ляжет закадровый голос или трек из библиотеки: сгенерированный звук там просто выбрасывается, и платить за него незачем.

Когда длина решает

Десять секунд — это ровно один смысловой ход: показали объект, повернули камеру, закончили. Как только в ролике появляется второй ход — «было плохо, стало хорошо», «шаг первый, шаг второй», «вопрос и ответ» — десяти секунд не хватает физически. Здесь и начинается территория Wan.

  • Пре-ролл и рекламная вставка на 15–30 секунд: завязка, демонстрация, финальный кадр с логотипом.
  • Мини-разбор продукта: три состояния интерфейса или три ракурса товара в одном непрерывном движении камеры.
  • Сцена с репликой: персонаж что-то произносит, и звук идёт из той же генерации, без отдельной озвучки и подгонки таймингов.
  • Атмосферный фон для лендинга или экрана ожидания, где склейка каждые восемь секунд бросается в глаза.
  • Сторис-серия из одной длинной генерации, которую потом режут на части, а не сшивают из разных.
  • А вот перебивка, зацикленный фон, анимация логотипа и короткий хук для рилса живут в 3–8 секундах — под них Wan брать незачем.

Что не так со склейкой длинного ролика из коротких?

По публичным обзорам и гайдам практиков, главная беда сшитых роликов — дрейф: между отдельными генерациями уезжает лицо персонажа, меняется оттенок света, чуть иначе ложится фактура фона. На стыке это заметно даже неподготовленному зрителю. Плюс каждая склейка требует ручной работы в монтаже и подгонки звука. Одна тридцатисекундная генерация снимает и то, и другое: вы платите больше за секунду, но меньше — временем дизайнера.

Звук: главный аргумент модели

Wan 3.0 Prime генерирует звук вместе с видео и принимает звук в референсе. Это меняет маршрут работы: обычно видео и дорожку собирают в разных инструментах, а потом сводят и подгоняют по таймингу. Здесь звук приходит вместе с картинкой и уже совпадает с тем, что происходит в кадре.

  • Звук в референсе — способ задать нужный характер дорожки, а не полагаться на догадку модели.
  • Если нужна именно музыка как отдельный продукт — под неё есть свои инструменты, см. генерацию музыки нейросетью.
  • Если ролик уже снят и нужны только эффекты или озвучка поверх — это отдельная задача, разобранная в гайде по звуковым эффектам.

Как управлять звуком в промпте?

Описывайте звук так же явно, как картинку: отдельно музыка (жанр и настроение), отдельно эффекты (что звучит и в какой момент), отдельно реплики (кто говорит и какими словами). Если о звуке в запросе не сказано ничего, модель выбирает его сама — и результат может не совпасть с вашим замыслом. Так же явно стоит писать, чего быть не должно: тишина в кадре тоже задаётся словами.

Промпты для трёх режимов

text-to-video: рекламная вставка на 15 секунд со звуком

Вертикальный ролик 9:16, 15 секунд, одна непрерывная сцена.
[0–5с] Керамическая кружка стоит на деревянной столешнице у окна, утренний свет сбоку. Камера — медленный push-in на кружку.
[5–10с] В кружку льётся кофе, поднимается пар. Камера продолжает движение вперёд, фокус на струе.
[10–15с] Рука в кадре берёт кружку и уносит из кадра, остаётся пустая столешница и световое пятно.
Стиль: тёплые оттенки, мягкие тени, естественное освещение, неглубокая резкость.
Звук: тихий эмбиент без мелодии; эффекты — журчание наливаемого кофе, лёгкий стук керамики о дерево, приглушённый уличный шум за окном. Речи нет.

image-to-video: оживление снятого кадра товара

Возьми загруженный кадр как первый кадр ролика. 8 секунд, 16:9.
Объект на фото остаётся неизменным: та же форма, тот же цвет, та же этикетка.
Движение: камера делает плавный облёт объекта слева направо примерно на 40 градусов, объект остаётся в центре кадра.
Освещение и фон сохраняются из исходного кадра, без смены цвета и без появления новых предметов.
Звук: только ровный тихий эмбиент студии. Без музыки, без голоса.

reference-to-video: сцена с персонажем и заданным звуком

Референсы: изображение 1 — внешность персонажа, изображение 2 — интерьер локации, аудио 1 — характер фоновой дорожки.
Сцена 12 секунд, 16:9.
[0–6с] Персонаж с изображения 1 входит в помещение с изображения 2, оглядывается. Камера — статичный средний план.
[6–12с] Персонаж садится за стол и произносит: «Давайте начнём». Камера медленно приближается до поясного плана.
Внешность персонажа и интерьер должны совпадать с референсами и не меняться по ходу ролика.
Звук: фон в характере аудио 1, эффекты — шаги, скрип стула; одна реплика голосом персонажа.

Общий принцип у всех трёх: сначала субъект, место и действие, потом камера, потом стиль, потом звук. Разметка по времени на пять-десять шагов даёт модели понятную структуру вместо абзаца из сорока прилагательных, а движение камеры лучше называть явно — иначе его выберут за вас.

Как не сжечь нейроны на перегенерациях

  1. Черновики — на 480p. Секунда стоит 10.2 нейрона вместо 42, а композицию, ритм и звук вы проверите ровно так же.
  2. Держите черновую длину минимальной. Пять секунд на 480p — 51 нейрон; тридцать секунд в 1080p — 1260. Проверять идею на максимуме — самый дорогой способ ошибиться.
  3. Финал — один раз и сразу в нужном разрешении. 1080p для сайта и YouTube, 720p для сторис и мессенджеров: на тридцати секундах это 1260 против 630 нейронов.
  4. Разложите ролик на смысловые шаги и пропишите их с таймингами. Одна сцена, растянутая на 30 секунд без внутренней структуры, чаще всего выходит вялой — и переделывать её дорого.
  5. Проверьте, точно ли нужен звук из генерации. Если поверх всё равно ляжет закадровый голос, ролик дешевле сделать на Gemini Omni Flash 1.1.
  6. Мелкие предметы описывайте вместе с их положением к финалу сцены: чем длиннее ролик, тем выше шанс, что не названная явно деталь изменится или уйдёт из кадра.

Рабочая связка двух моделей

На практике удобнее не выбирать одну модель навсегда, а держать обе и распределять задачи. Короткое, многовариантное и требующее правок — на Gemini Omni Flash 1.1: там дешевле секунда, шире запрос и есть правка готового ролика по описанию. Длинное и звучащее — на Wan 3.0 Prime. Обе доступны с тарифа Старт, так что переключение между ними ничего дополнительно не стоит.

ЗадачаМодельПочему
Перебивка, луп, анимация логотипаGemini Omni Flash 1.13–10 секунд хватает, 360p — 4.5 нейрона за секунду
Ролик в 4K для большого экранаGemini Omni Flash 1.1Wan выше 1080p не идёт
Правка уже готового ролика по описаниюGemini Omni Flash 1.1Отдельный эндпоинт edit, у Wan его нет
Короткий ролик в 720p или 1080pGemini Omni Flash 1.115 и 22.5 нейрона за секунду против 21 и 42 у Wan
Пре-ролл 15–30 секундWan 3.0 PrimeОдна генерация вместо склейки из трёх
Сцена с репликой и эффектамиWan 3.0 PrimeЗвук приходит вместе с картинкой
Длинный сюжет с опорой на референсы и звукWan 3.0 Primereference-to-video принимает звук в референсе
Что чем делать

Частые вопросы

Сколько стоит 30-секундный ролик на Wan 3.0 Prime?

306 нейронов в 480p, 630 в 720p и 1260 в 1080p — считается по секундам: 10.2, 21 и 42 нейрона соответственно. Тридцать секунд — максимум модели, минимум — две секунды.

Wan дешевле, чем Gemini Omni Flash 1.1?

Нет. На сопоставимых разрешениях Wan дороже: 720p — 21 нейрон за секунду против 15, 1080p — 42 против 22.5. Цена ступенчатая у обеих моделей и растёт вместе с разрешением, фиксированной ставки за ролик нет ни у одной. Wan берут не ради экономии, а ради длины до 30 секунд и звука в той же генерации.

Может ли Wan 3.0 Prime выдать 4K?

Нет, потолок — 1080p. Если нужен 4K, это задача для Gemini Omni Flash 1.1: там 4K стоит 45 нейронов за секунду, а максимальная длина ролика — 10 секунд.

Нужно ли отдельно озвучивать ролик после генерации?

Wan 3.0 Prime генерирует звук вместе с видео, поэтому отдельная озвучка не обязательна. Если нужна конкретная дорожка — её можно подать в референсе. Отдельный этап озвучки остаётся нужен, когда поверх ролика идёт закадровый голос диктора или готовый музыкальный трек.

На каком тарифе доступна модель?

Wan 3.0 Prime и Gemini Omni Flash 1.1 относятся к уровню STANDARD — они открываются с тарифа Старт и выше. Обе живут в МедиаЛаб, условия по тарифам — на странице тарифов, начать работу можно в личном кабинете.