Reference-to-video — это генерация ролика, в котором манеру задают ваши образцы, а сюжет вы описываете текстом. Вы загружаете картинки, видео, а у одной из моделей и звук — как эталон света, цвета, ритма и характера движения камеры, — и модель снимает по этому эталону новую сцену. В каталоге СуперИнтеллекта режим есть у двух моделей, обе добавлены 28 августа 2026 года и обе относятся к уровню STANDARD: alibaba/wan-3.0-prime/reference-to-video (от 2 до 30 секунд, со звуком, от 10.2 нейрона за секунду) и google/gemini-omni-flash/v1.1/reference-to-video (от 3 до 10 секунд, от 4.5 нейрона за секунду).
Зачем нужен образец стиля
Попробуйте описать словами свет в ролике, который вам понравился. «Тёплый», «мягкий», «как в рекламе парфюма» — и вы уже слышите, что это не инструкция, а настроение. То же с ритмом монтажа и характером движения камеры: «плавная проходка» у каждого своя. Текст хорошо говорит, что происходит в кадре, и почти беспомощен, когда нужно передать, как это выглядит.
Референс закрывает именно это. Вы показываете образец — модель забирает палитру, фактуру, темп, зернистость, манеру съёмки. Что происходит в новом ролике, вы по-прежнему пишете текстом. Картинка отвечает за «как», промпт — за «что».
Чем это отличается от «оживить фото»?
Это главная путаница, из-за которой режим разочаровывает. Image-to-video берёт ваш кадр и приводит его в движение: тот же человек, тот же фон, та же композиция, просто теперь она дышит. Reference-to-video ваш кадр в результат не переносит — он берёт из него манеру и снимает по ней другую сцену. Если вы загрузили фото продукта и ждали, что оно поедет в кадре, а получили новый ролик «в духе» этого фото, дело не в модели: выбран не тот режим. Отсюда и практический вывод — серию роликов, узнаваемых как одна работа, собирают именно референсом.
| Режим | Что подаёте на вход | Что получаете | Когда это ваш выбор |
|---|---|---|---|
| Текст → видео | Только описание | Сцену с нуля, стиль на усмотрение модели | Идея есть, визуальных заготовок нет |
| Фото → видео | Один конкретный кадр | Тот же кадр в движении | Нужно оживить готовую картинку, продукт, портрет |
| Референс → видео | Образцы стиля (картинки, видео, звук) плюс описание сюжета | Новую сцену в манере образцов | Нужна серия роликов в одном узнаваемом стиле |
Две модели: длина, звук и цена
Обе модели появились в каталоге 28 августа 2026 года и обе относятся к уровню STANDARD. Цена ступенчатая: ставка считается за секунду готового ролика и зависит от разрешения — умножаете ставку на длительность и получаете стоимость генерации.
| Разрешение | Нейронов за секунду | Ролик 5 секунд | Ролик 10 секунд (максимум) |
|---|---|---|---|
| 360p | 4.5 | 22.5 | 45 |
| 720p | 15 | 75 | 150 |
| 1080p | 22.5 | 112.5 | 225 |
| 4K | 45 | 225 | 450 |
| Разрешение | Нейронов за секунду | Ролик 6 секунд | Ролик 30 секунд (максимум) |
|---|---|---|---|
| 480p | 10.2 | 61.2 | 306 |
| 720p | 21 | 126 | 630 |
| 1080p | 42 | 252 | 1260 |
Сравнение простое: на каждом сопоставимом разрешении Gemini Omni Flash обходится дешевле. Восемь секунд в 720p — это 120 нейронов у Gemini против 168 у Wan; в 1080p — 180 против 336. Плюс у Gemini есть 360p по 4.5 нейрона за секунду для черновиков и 4K, которого у Wan в этом режиме нет.
Wan 3.0 Prime выбирают не ради цены, а ради двух вещей. Первая — длина: до 30 секунд против 10, а это разница между сценой и роликом целиком. Вторая — звук: Wan объединяет референсные изображения, видео и аудио в один результат и сам генерирует звуковую дорожку. Нужен готовый ролик с атмосферой, а не немой материал под последующее озвучание — берите его.
Как собрать референс, который сработает
Сколько образцов загружать?
Рабочий ориентир из практики и публичных обзоров режима — три-пять образцов. С одним модель нередко цепляется за конкретную композицию вместо манеры; с десятком разнородных картинок стиль усредняется и теряет ваше лицо. Важнее количества — согласованность: если в наборе два тёплых закатных кадра и один холодный студийный, вы фактически просите модель выбрать сторону. Посмотрите на подборку как на один мудборд — если она не выглядит цельной для вас, для модели тем более.
- Кадры из вашей прошлой съёмки — самый надёжный источник: права уже ваши.
- Фрагмент видео, если важен темп монтажа и характер движения камеры, а не только цвет.
- Аудио как референс — только у Wan 3.0 Prime; так задают атмосферу и характер звука.
- Фирменная палитра и типовые планы бренда — то, по чему вас узнают без логотипа.
- Не смешивайте в одном наборе разный свет, разную оптику и разную цветокоррекцию.
Что писать в промпте, если стиль уже задан картинкой?
Сюжет, действие и движение камеры. Описывать заново то, что уже видно на референсе, — частая ошибка: текст начинает спорить с образцом. Держитесь формулы «объект плюс одно действие плюс движение камеры плюс ограничения». Одно ключевое действие на ролик: «встал, взял, подошёл, открыл» за пять секунд превращается в кашу, лучше разбить на два дубля.
Продуктовая карточка в стиле прошлой съёмки (Gemini, 5 с, 720p — 75 нейронов)
Референсы: 4 кадра осенней съёмки бренда.
Промпт: Флакон стоит на деревянной поверхности, камера медленно
объезжает его слева направо. Форма, логотип и цвет упаковки
остаются без изменений. Свет, палитра и фактура — как в референсах.Атмосферная заставка со звуком (Wan, 12 с, 720p — 252 нейрона)
Референсы: 3 кадра + аудиофрагмент с шумом улицы.
Промпт: Утренняя улица, редкие прохожие проходят мимо витрины,
камера медленно едет вдоль стекла. 12 секунд. Звук — уличная
атмосфера в характере референсного аудио, без речи.Перенос манеры на новый сюжет (Gemini, 8 с, 1080p — 180 нейронов)
Референсы: 5 кадров ночной съёмки с неоном.
Промпт: Курьер на велосипеде проезжает перекрёсток, камера
следует за ним сбоку. Ночь, отражения на мокром асфальте.
Палитра, контраст и зернистость — строго по референсам.Черновик перед финальным дублем (Gemini, 5 с, 360p — 22.5 нейрона)
Референсы: те же 4 кадра, что пойдут в финал.
Промпт: Общий план кухни, руки раскладывают продукты на столе,
камера сверху, без движения. 5 секунд, 360p.
Цель прохода — проверить, считался ли стиль.Стиль не считался: что делать по шагам
Результат вышел «вообще не тем» — обычно это разбирается за две-три итерации и почти никогда сменой модели. Идите по порядку, меняя за раз что-то одно, и держите набор референсов неизменным на всю серию: стоит подменить один кадр между роликами — и стиль поплывёт.
- Проверьте режим. Ждали движения именно вашего кадра — вам нужен image-to-video, а не референс.
- Уберите из набора выбивающийся образец: один чужеродный кадр тянет стиль на себя сильнее, чем кажется.
- Сократите текст. Если промпт описывает свет и цвет, он конкурирует с картинками — оставьте действие и камеру.
- Сошлитесь на образцы явно: «палитра, контраст и характер света — по референсам».
- Упростите действие до одного движения: сложная хореография расшатывает и анатомию, и стилевую стабильность.
- Пробы гоняйте на минимальном разрешении: 360p у Gemini стоит 4.5 нейрона за секунду — пять таких проб дешевле одного финала в 1080p.
Права на референсы: берите своё
Этот вопрос приятнее закрыть заранее, чем разбирать потом. Референс — чужое произведение, если снимали не вы: то, что файл открылся в интерфейсе, ничего не говорит о правах на его использование в вашей кампании. Музыка, сток, шрифты и чужие материалы приходят со своими лицензиями, и ИИ-этап их не отменяет. Хорошая новость в том, что лучший источник у вас и так под рукой.
- Собственный архив — прошлые съёмки, фирменные материалы, кадры, снятые на телефон специально под задачу.
- Сток с лицензией, которая прямо допускает коммерческое использование и переработку.
- Чужая реклама из ленты выглядит соблазнительно, но для коммерческого проекта это вопрос лицензии — лучше не рисковать.
- Реальные люди в кадре требуют согласия отдельно от прав на сам файл.
- Сомневаетесь в происхождении материала — быстрее снять три своих кадра на телефон, чем выяснять это задним числом.
Серия роликов в одном стиле: порядок работы
- Соберите 3–5 согласованных образцов и зафиксируйте набор на всю серию.
- Прогоните первый черновик на 360p у Gemini Omni Flash — проверяете только стиль, не сюжет.
- Когда стиль считался, распишите сюжеты остальных роликов: по одному действию на ролик.
- Генерируйте серию с одним и тем же набором референсов, меняя только текст сюжета.
- Финальные дубли — на нужном разрешении: 720p для соцсетей, 1080p и выше под размещение.
- Нужен ролик длиннее 10 секунд или со звуком — переносите тот же набор в Wan 3.0 Prime.
Дальше остаётся собрать это в регулярный контент-план — как именно, разбираем в материалах Нейросети для SMM и Как сделать видео прямо в чате.
Частые вопросы
Можно ли подать референсом видео, а не картинку?
Да, у alibaba/wan-3.0-prime/reference-to-video: эта модель объединяет референсные изображения, видео и звук в один результат. Темп монтажа и характер движения камеры можно показать фрагментом, а не описывать словами. Она же генерирует звук к готовому ролику.
Сколько стоит ролик на 10 секунд?
Зависит от модели и разрешения. У Gemini Omni Flash 10 секунд — максимум: 45 нейронов в 360p, 150 в 720p, 225 в 1080p, 450 в 4K. У Wan 3.0 Prime те же 10 секунд — 102 нейрона в 480p, 210 в 720p и 420 в 1080p. Ставка всегда за секунду и умножается на длительность.
Референс заменяет промпт или дополняет его?
Дополняет. Референс отвечает за стиль — свет, палитру, фактуру, темп. Промпт нужен, чтобы описать, что происходит в кадре: объект, одно действие, движение камеры. Без текста модель получит эталон манеры, но не получит сюжета и придумает его сама.
На каком тарифе доступен режим по референсу?
Обе модели относятся к уровню STANDARD. Какие уровни моделей входят в ваш тариф, удобнее сверить на странице тарифов, а весь каталог — в разделе нейросети. Устанавливать ничего не нужно: референсы загружаются прямо в браузере, начать можно в личном кабинете или сразу в чате.





