Reference-to-video — это генерация ролика, в котором манеру задают ваши образцы, а сюжет вы описываете текстом. Вы загружаете картинки, видео, а у одной из моделей и звук — как эталон света, цвета, ритма и характера движения камеры, — и модель снимает по этому эталону новую сцену. В каталоге СуперИнтеллекта режим есть у двух моделей, обе добавлены 28 августа 2026 года и обе относятся к уровню STANDARD: alibaba/wan-3.0-prime/reference-to-video (от 2 до 30 секунд, со звуком, от 10.2 нейрона за секунду) и google/gemini-omni-flash/v1.1/reference-to-video (от 3 до 10 секунд, от 4.5 нейрона за секунду).

Зачем нужен образец стиля

Попробуйте описать словами свет в ролике, который вам понравился. «Тёплый», «мягкий», «как в рекламе парфюма» — и вы уже слышите, что это не инструкция, а настроение. То же с ритмом монтажа и характером движения камеры: «плавная проходка» у каждого своя. Текст хорошо говорит, что происходит в кадре, и почти беспомощен, когда нужно передать, как это выглядит.

Референс закрывает именно это. Вы показываете образец — модель забирает палитру, фактуру, темп, зернистость, манеру съёмки. Что происходит в новом ролике, вы по-прежнему пишете текстом. Картинка отвечает за «как», промпт — за «что».

Чем это отличается от «оживить фото»?

Это главная путаница, из-за которой режим разочаровывает. Image-to-video берёт ваш кадр и приводит его в движение: тот же человек, тот же фон, та же композиция, просто теперь она дышит. Reference-to-video ваш кадр в результат не переносит — он берёт из него манеру и снимает по ней другую сцену. Если вы загрузили фото продукта и ждали, что оно поедет в кадре, а получили новый ролик «в духе» этого фото, дело не в модели: выбран не тот режим. Отсюда и практический вывод — серию роликов, узнаваемых как одна работа, собирают именно референсом.

РежимЧто подаёте на входЧто получаетеКогда это ваш выбор
Текст → видеоТолько описаниеСцену с нуля, стиль на усмотрение моделиИдея есть, визуальных заготовок нет
Фото → видеоОдин конкретный кадрТот же кадр в движенииНужно оживить готовую картинку, продукт, портрет
Референс → видеоОбразцы стиля (картинки, видео, звук) плюс описание сюжетаНовую сцену в манере образцовНужна серия роликов в одном узнаваемом стиле
Три режима генерации видео: что выбрать под задачу

Две модели: длина, звук и цена

Обе модели появились в каталоге 28 августа 2026 года и обе относятся к уровню STANDARD. Цена ступенчатая: ставка считается за секунду готового ролика и зависит от разрешения — умножаете ставку на длительность и получаете стоимость генерации.

РазрешениеНейронов за секундуРолик 5 секундРолик 10 секунд (максимум)
360p4.522.545
720p1575150
1080p22.5112.5225
4K45225450
google/gemini-omni-flash/v1.1/reference-to-video — цена за секунду
РазрешениеНейронов за секундуРолик 6 секундРолик 30 секунд (максимум)
480p10.261.2306
720p21126630
1080p422521260
alibaba/wan-3.0-prime/reference-to-video — цена за секунду

Сравнение простое: на каждом сопоставимом разрешении Gemini Omni Flash обходится дешевле. Восемь секунд в 720p — это 120 нейронов у Gemini против 168 у Wan; в 1080p — 180 против 336. Плюс у Gemini есть 360p по 4.5 нейрона за секунду для черновиков и 4K, которого у Wan в этом режиме нет.

Wan 3.0 Prime выбирают не ради цены, а ради двух вещей. Первая — длина: до 30 секунд против 10, а это разница между сценой и роликом целиком. Вторая — звук: Wan объединяет референсные изображения, видео и аудио в один результат и сам генерирует звуковую дорожку. Нужен готовый ролик с атмосферой, а не немой материал под последующее озвучание — берите его.

Как собрать референс, который сработает

Сколько образцов загружать?

Рабочий ориентир из практики и публичных обзоров режима — три-пять образцов. С одним модель нередко цепляется за конкретную композицию вместо манеры; с десятком разнородных картинок стиль усредняется и теряет ваше лицо. Важнее количества — согласованность: если в наборе два тёплых закатных кадра и один холодный студийный, вы фактически просите модель выбрать сторону. Посмотрите на подборку как на один мудборд — если она не выглядит цельной для вас, для модели тем более.

  • Кадры из вашей прошлой съёмки — самый надёжный источник: права уже ваши.
  • Фрагмент видео, если важен темп монтажа и характер движения камеры, а не только цвет.
  • Аудио как референс — только у Wan 3.0 Prime; так задают атмосферу и характер звука.
  • Фирменная палитра и типовые планы бренда — то, по чему вас узнают без логотипа.
  • Не смешивайте в одном наборе разный свет, разную оптику и разную цветокоррекцию.

Что писать в промпте, если стиль уже задан картинкой?

Сюжет, действие и движение камеры. Описывать заново то, что уже видно на референсе, — частая ошибка: текст начинает спорить с образцом. Держитесь формулы «объект плюс одно действие плюс движение камеры плюс ограничения». Одно ключевое действие на ролик: «встал, взял, подошёл, открыл» за пять секунд превращается в кашу, лучше разбить на два дубля.

Продуктовая карточка в стиле прошлой съёмки (Gemini, 5 с, 720p — 75 нейронов)

Референсы: 4 кадра осенней съёмки бренда.
Промпт: Флакон стоит на деревянной поверхности, камера медленно
объезжает его слева направо. Форма, логотип и цвет упаковки
остаются без изменений. Свет, палитра и фактура — как в референсах.

Атмосферная заставка со звуком (Wan, 12 с, 720p — 252 нейрона)

Референсы: 3 кадра + аудиофрагмент с шумом улицы.
Промпт: Утренняя улица, редкие прохожие проходят мимо витрины,
камера медленно едет вдоль стекла. 12 секунд. Звук — уличная
атмосфера в характере референсного аудио, без речи.

Перенос манеры на новый сюжет (Gemini, 8 с, 1080p — 180 нейронов)

Референсы: 5 кадров ночной съёмки с неоном.
Промпт: Курьер на велосипеде проезжает перекрёсток, камера
следует за ним сбоку. Ночь, отражения на мокром асфальте.
Палитра, контраст и зернистость — строго по референсам.

Черновик перед финальным дублем (Gemini, 5 с, 360p — 22.5 нейрона)

Референсы: те же 4 кадра, что пойдут в финал.
Промпт: Общий план кухни, руки раскладывают продукты на столе,
камера сверху, без движения. 5 секунд, 360p.
Цель прохода — проверить, считался ли стиль.

Стиль не считался: что делать по шагам

Результат вышел «вообще не тем» — обычно это разбирается за две-три итерации и почти никогда сменой модели. Идите по порядку, меняя за раз что-то одно, и держите набор референсов неизменным на всю серию: стоит подменить один кадр между роликами — и стиль поплывёт.

  1. Проверьте режим. Ждали движения именно вашего кадра — вам нужен image-to-video, а не референс.
  2. Уберите из набора выбивающийся образец: один чужеродный кадр тянет стиль на себя сильнее, чем кажется.
  3. Сократите текст. Если промпт описывает свет и цвет, он конкурирует с картинками — оставьте действие и камеру.
  4. Сошлитесь на образцы явно: «палитра, контраст и характер света — по референсам».
  5. Упростите действие до одного движения: сложная хореография расшатывает и анатомию, и стилевую стабильность.
  6. Пробы гоняйте на минимальном разрешении: 360p у Gemini стоит 4.5 нейрона за секунду — пять таких проб дешевле одного финала в 1080p.

Права на референсы: берите своё

Этот вопрос приятнее закрыть заранее, чем разбирать потом. Референс — чужое произведение, если снимали не вы: то, что файл открылся в интерфейсе, ничего не говорит о правах на его использование в вашей кампании. Музыка, сток, шрифты и чужие материалы приходят со своими лицензиями, и ИИ-этап их не отменяет. Хорошая новость в том, что лучший источник у вас и так под рукой.

  • Собственный архив — прошлые съёмки, фирменные материалы, кадры, снятые на телефон специально под задачу.
  • Сток с лицензией, которая прямо допускает коммерческое использование и переработку.
  • Чужая реклама из ленты выглядит соблазнительно, но для коммерческого проекта это вопрос лицензии — лучше не рисковать.
  • Реальные люди в кадре требуют согласия отдельно от прав на сам файл.
  • Сомневаетесь в происхождении материала — быстрее снять три своих кадра на телефон, чем выяснять это задним числом.

Серия роликов в одном стиле: порядок работы

  1. Соберите 3–5 согласованных образцов и зафиксируйте набор на всю серию.
  2. Прогоните первый черновик на 360p у Gemini Omni Flash — проверяете только стиль, не сюжет.
  3. Когда стиль считался, распишите сюжеты остальных роликов: по одному действию на ролик.
  4. Генерируйте серию с одним и тем же набором референсов, меняя только текст сюжета.
  5. Финальные дубли — на нужном разрешении: 720p для соцсетей, 1080p и выше под размещение.
  6. Нужен ролик длиннее 10 секунд или со звуком — переносите тот же набор в Wan 3.0 Prime.

Дальше остаётся собрать это в регулярный контент-план — как именно, разбираем в материалах Нейросети для SMM и Как сделать видео прямо в чате.


Частые вопросы

Можно ли подать референсом видео, а не картинку?

Да, у alibaba/wan-3.0-prime/reference-to-video: эта модель объединяет референсные изображения, видео и звук в один результат. Темп монтажа и характер движения камеры можно показать фрагментом, а не описывать словами. Она же генерирует звук к готовому ролику.

Сколько стоит ролик на 10 секунд?

Зависит от модели и разрешения. У Gemini Omni Flash 10 секунд — максимум: 45 нейронов в 360p, 150 в 720p, 225 в 1080p, 450 в 4K. У Wan 3.0 Prime те же 10 секунд — 102 нейрона в 480p, 210 в 720p и 420 в 1080p. Ставка всегда за секунду и умножается на длительность.

Референс заменяет промпт или дополняет его?

Дополняет. Референс отвечает за стиль — свет, палитру, фактуру, темп. Промпт нужен, чтобы описать, что происходит в кадре: объект, одно действие, движение камеры. Без текста модель получит эталон манеры, но не получит сюжета и придумает его сама.

На каком тарифе доступен режим по референсу?

Обе модели относятся к уровню STANDARD. Какие уровни моделей входят в ваш тариф, удобнее сверить на странице тарифов, а весь каталог — в разделе нейросети. Устанавливать ничего не нужно: референсы загружаются прямо в браузере, начать можно в личном кабинете или сразу в чате.