Gemini Omni Flash 1.1 — это четыре разных инструмента под одним именем: генерация видео из текста, оживление картинки, сборка ролика по референсам и правка уже готового видео по словесному описанию. Цена считается за секунду готового ролика и зависит от разрешения: 4.5 нейрона в 360p, 15 в 720p, 22.5 в 1080p и 45 в 4K. Длительность — от 3 до 10 секунд, по умолчанию 8. Промпт можно писать длинный, до 20000 символов. Модель доступна на уровне STANDARD — с тарифа Старт и выше.

Сколько стоит секунда и почему разрешение решает всё

Главное, что стоит понять до первой генерации: вы платите не за «ролик», а за секунду в конкретном разрешении. Разница между крайними ступенями — десятикратная, и именно она задаёт нормальный рабочий процесс: сначала дёшево перебираем идеи, потом дорого отрисовываем одну победившую.

РазрешениеЗа секундуРолик 5 секундРолик 8 секунд (по умолчанию)
360p4.5 нейрона22.5 нейрона36 нейронов
720p15 нейронов75 нейронов120 нейронов
1080p22.5 нейрона112.5 нейрона180 нейронов
4K45 нейронов225 нейронов360 нейронов
Gemini Omni Flash 1.1: цена ролика по разрешениям

Посчитайте по-другому: за один восьмисекундный ролик в 4K вы могли бы сделать десять таких же черновиков в 360p. Десять попыток — это уже не «повезёт или нет», это нормальный перебор: три композиции, три варианта движения камеры, пара версий финального кадра. И только после этого — чистовик.

Почему черновик стоит делать в 360p?

В 360p не видно фактуры кожи и мелкого текста — зато видно всё, из-за чего ролики обычно и переделывают: не туда поехала камера, герой сделал лишнее движение, композиция разваливается, фон живёт своей жизнью. Эти дефекты не лечатся разрешением. Смысл черновика — поймать их за 36 нейронов, а не за 360.

  1. Соберите промпт и прогоните 3–5 вариантов в 360p, меняя по одному параметру за раз — сначала движение камеры, потом свет, потом действие героя: так видно, какая именно правка сработала.
  2. Выберите один вариант, который «читается»: понятно, что происходит, куда смотрит зритель, где заканчивается кадр.
  3. Повторите тот же промпт в 720p — проверьте, не разъезжаются ли руки, лицо и текст на упаковке в нормальном разрешении.
  4. Финал делайте в 1080p для соцсетей или в 4K, если ролик пойдёт на сайт, на экран в офлайне или в монтаж с реальными съёмками.

Четыре режима: что каждый из них умеет

Режимы — это не «настройки качества», а принципиально разные способы задать модели опору. Чем больше опоры вы даёте, тем меньше модель додумывает, а додумывает она в первую очередь то, что вы не описали.

text-to-video: когда есть только идея?

Чистая генерация по описанию. Максимальная свобода и максимальный разброс результатов: у модели нет ни одного визуального ориентира, кроме ваших слов. Частая ошибка — писать промпт как подпись к фотографии: получается красивый кадр, в котором ничего не происходит. Описывайте движение во времени, а не красоту картинки. Лимит в 20000 символов нужен не под сценарий, а под точность: в такой объём помещаются субъект, действие, камера, свет, окружение и подробный блок запретов.

text-to-video: рекламный кадр с продуктом

Стеклянный флакон сыворотки стоит на мокром камне у кромки воды, утро.
Действие: одна капля скатывается по стенке флакона вниз, круги на воде расходятся.
Камера: медленный наезд спереди, без резких движений, статичный горизонт.
Свет: мягкий рассеянный, тёплый, тени длинные, бликов на этикетке нет.
Стиль: реалистичная съёмка, неглубокая резкость, фон размыт.
Ограничения: форма флакона, цвет и надписи не меняются; в кадре нет людей и рук;
камера не облетает объект; посторонние предметы не появляются.

image-to-video: когда кадр уже нарисован?

Вы даёте готовое изображение и описываете, что в нём должно ожить. Самый предсказуемый режим для маркетинга: композиция, цвет и продукт уже утверждены, модели остаётся добавить движение. Практическое правило — просить одно главное движение. Чем проще пластика, тем чище результат; чем больше событий вы просите одновременно, тем чаще появляются артефакты на руках, лицах и границах объектов.

image-to-video: оживить утверждённый визуал

Оживи изображение, сохранив кадр и композицию без изменений.
Главное движение: девушка на фото медленно моргает и чуть заметно улыбается.
Второй план: пар над чашкой поднимается, штора у окна слегка колышется.
Камера: почти неподвижна, едва заметный наезд.
Ограничения: черты лица, причёска, одежда и фон остаются прежними;
руки не перемещаются; поворота головы нет; свет не меняется.

reference-to-video: когда нужен один и тот же герой в серии?

Режим для тех, кто делает не ролик, а серию. Вы отдаёте референсы — лицо героя, упаковку, фирменный стиль, — и модель опирается на них при генерации. Так собирают линейку из пяти-восьми клипов, где продукт и персонаж узнаются от кадра к кадру. Референсы лучше подбирать однотипные: один ракурс, один свет, один фон — разнобой в исходниках модель усредняет, и герой начинает «плавать» от клипа к клипу.

reference-to-video: серия роликов с одним героем

Используй референсы: лицо и одежда героя — с первого изображения,
упаковка продукта — со второго, цветовая гамма и стиль — с третьего.
Сцена: герой заходит в кадр слева, ставит упаковку на стол, смотрит в камеру.
Камера: неподвижная, средний план, уровень глаз.
Свет: студийный, ровный, как на референсе.
Ограничения: внешность героя и дизайн упаковки строго с референсов;
логотип не перерисовывать; фон однотонный, без лишних предметов.

edit: чем правка отличается от новой генерации?

Это редкий режим. У большинства видеомоделей правка означает полную перегенерацию: вы переписываете промпт, запускаете заново и получаете другой ролик целиком — другое лицо, другой свет, другую динамику. Здесь на вход идёт уже готовое видео, а словами описывается только то, что нужно изменить. Выгода не столько в деньгах, сколько во времени согласований: замечание «сделайте фон посветлее» перестаёт быть перезапуском продакшена и становится одной репликой, а значит, правки заказчика можно отрабатывать прямо на созвоне. Вносить их лучше по одной, а после двух-трёх шагов фиксировать результат и начинать новую цепочку.

edit: точечная правка готового ролика

Возьми готовый ролик и внеси одно изменение.
Что изменить: замени фон на светлую скандинавскую кухню.
Что сохранить без изменений: героя, его лицо, одежду, движение и тайминг,
положение камеры и продукт в кадре.

(следующим шагом, отдельной правкой)
Что изменить: сделай свет тёплым, как на закате.
Что сохранить: всё остальное, включая новый фон.
РежимЧто вы даёте на входПод какую задачу
text-to-videoТолько текстТесты идей, сторис и вертикалки с нуля, фоновые видео, концепты для питча
image-to-videoКартинку и описание движенияОживить утверждённый визуал, макет, обложку, фото продукта
reference-to-videoРеференсы и описание сценыСерия роликов с одним героем и одной упаковкой, узнаваемый фирменный стиль
editГотовое видео и описание правкиЗамечания заказчика, версии одного ролика под разные площадки и сегменты
Какой режим под какую задачу

Gemini Omni Flash 1.1 или Wan 3.0 Prime

На платформе доступны обе модели, обе на уровне STANDARD. Выбор простой: Wan берут за две вещи, которых у Gemini нет, — длину до 30 секунд и звук, который генерируется вместе с видео. Gemini берут, когда нужны много попыток, правки и высокое разрешение: на сопоставимых ступенях он дешевле и умеет 4K.

ПараметрGemini Omni Flash 1.1Wan 3.0 Prime
Самое дешёвое разрешение360p — 4.5 нейрона за секунду480p — 10.2 нейрона за секунду
720p15 нейронов за секунду21 нейрон за секунду
1080p22.5 нейрона за секунду42 нейрона за секунду
4K45 нейронов за секундуНе поддерживается
Длительность3–10 секунд, по умолчанию 82–30 секунд, по умолчанию 5
ЗвукНетГенерирует звук и принимает звук в референсе
Режимыtext-to-video, image-to-video, reference-to-video, edittext-to-video, image-to-video, reference-to-video
Длина запросаДо 20000 символовДо 5000 символов
Что где дешевле и что где длиннее
  • Берите Gemini, если нужно много вариантов, точечные правки готового ролика или финал в 4K: на 1080p он почти вдвое дешевле — 22.5 против 42.
  • Берите Wan, если ролик должен быть длиннее десяти секунд или сразу со звуком — например, атмосферный проход по интерьеру или сцена с шумом улицы.
  • Комбинация тоже работает: перебор идей и правки на Gemini, финальный длинный дубль со звуком на Wan.
  • Подробный разбор пары есть в отдельном материале: Wan 3.0 Prime против Gemini Omni Flash.

Как писать промпт, чтобы не жечь нейроны впустую

Ролики чаще переделывают не из-за модели, а из-за пробелов в описании. Что не описано — модель придумывает сама, отсюда и плывущий фон, и внезапный поворот головы, и лишние предметы в кадре. Полминуты на блок ограничений экономят целую генерацию.

  1. Опишите одно главное действие. Не «идёт, говорит, поворачивается и берёт чашку», а одно движение — остальное вторым планом.
  2. Задайте камеру явно. Без этого модель выберет усреднённый вариант, обычно самый скучный: «медленный наезд», «статичный средний план», «проход слева направо».
  3. Опишите свет словами, а не настроением: «мягкий рассеянный», «жёсткий контровой», «ровный студийный».
  4. Добавьте блок ограничений — что не должно меняться. Это самый недооценённый абзац промпта: лицо, логотип, фон, положение рук.
  5. Сложную сцену разбейте на два-три коротких ролика вместо одного перегруженного: в 3–10 секунд длинный сценарий всё равно не поместится.

И отдельно: у любой видеомодели есть фильтры на узнаваемых людей и чувствительные сюжеты. Если генерация не проходит, дело обычно не в формулировке промпта — что именно блокируется и как действовать, разобрано в материале про модерацию в нейросетях.


Частые вопросы

Сколько стоит восьмисекундный ролик в 1080p?

180 нейронов: 22.5 нейрона за секунду умножаем на 8. Тот же ролик в 720p обойдётся в 120 нейронов, в 4K — в 360, а черновая версия в 360p — в 36 нейронов.

Можно ли сделать ролик длиннее 10 секунд?

У Gemini Omni Flash 1.1 — нет, диапазон 3–10 секунд, по умолчанию 8. Если нужен один непрерывный дубль до 30 секунд, это Wan 3.0 Prime. Альтернатива — собрать несколько коротких клипов в монтаже, используя reference-to-video, чтобы герой и продукт не «плавали» между сценами.

Есть ли у Gemini Omni Flash 1.1 звук?

Нет, модель работает с видеорядом. Если звук нужен сразу вместе с картинкой — это Wan 3.0 Prime: он генерирует аудио и принимает звук в референсе. Второй путь — озвучить готовый ролик отдельно, об этом есть материал про звуковые эффекты и озвучку.

На каком тарифе доступна модель и где её запустить?

Обе видеомодели — уровень STANDARD, то есть с тарифа Старт и выше. Сравнить, что входит в каждый план, можно на странице тарифов, а запустить генерацию — в MediaLab.