Gemini Omni Flash 1.1 — это четыре разных инструмента под одним именем: генерация видео из текста, оживление картинки, сборка ролика по референсам и правка уже готового видео по словесному описанию. Цена считается за секунду готового ролика и зависит от разрешения: 4.5 нейрона в 360p, 15 в 720p, 22.5 в 1080p и 45 в 4K. Длительность — от 3 до 10 секунд, по умолчанию 8. Промпт можно писать длинный, до 20000 символов. Модель доступна на уровне STANDARD — с тарифа Старт и выше.
Сколько стоит секунда и почему разрешение решает всё
Главное, что стоит понять до первой генерации: вы платите не за «ролик», а за секунду в конкретном разрешении. Разница между крайними ступенями — десятикратная, и именно она задаёт нормальный рабочий процесс: сначала дёшево перебираем идеи, потом дорого отрисовываем одну победившую.
| Разрешение | За секунду | Ролик 5 секунд | Ролик 8 секунд (по умолчанию) |
|---|---|---|---|
| 360p | 4.5 нейрона | 22.5 нейрона | 36 нейронов |
| 720p | 15 нейронов | 75 нейронов | 120 нейронов |
| 1080p | 22.5 нейрона | 112.5 нейрона | 180 нейронов |
| 4K | 45 нейронов | 225 нейронов | 360 нейронов |
Посчитайте по-другому: за один восьмисекундный ролик в 4K вы могли бы сделать десять таких же черновиков в 360p. Десять попыток — это уже не «повезёт или нет», это нормальный перебор: три композиции, три варианта движения камеры, пара версий финального кадра. И только после этого — чистовик.
Почему черновик стоит делать в 360p?
В 360p не видно фактуры кожи и мелкого текста — зато видно всё, из-за чего ролики обычно и переделывают: не туда поехала камера, герой сделал лишнее движение, композиция разваливается, фон живёт своей жизнью. Эти дефекты не лечатся разрешением. Смысл черновика — поймать их за 36 нейронов, а не за 360.
- Соберите промпт и прогоните 3–5 вариантов в 360p, меняя по одному параметру за раз — сначала движение камеры, потом свет, потом действие героя: так видно, какая именно правка сработала.
- Выберите один вариант, который «читается»: понятно, что происходит, куда смотрит зритель, где заканчивается кадр.
- Повторите тот же промпт в 720p — проверьте, не разъезжаются ли руки, лицо и текст на упаковке в нормальном разрешении.
- Финал делайте в 1080p для соцсетей или в 4K, если ролик пойдёт на сайт, на экран в офлайне или в монтаж с реальными съёмками.
Четыре режима: что каждый из них умеет
Режимы — это не «настройки качества», а принципиально разные способы задать модели опору. Чем больше опоры вы даёте, тем меньше модель додумывает, а додумывает она в первую очередь то, что вы не описали.
text-to-video: когда есть только идея?
Чистая генерация по описанию. Максимальная свобода и максимальный разброс результатов: у модели нет ни одного визуального ориентира, кроме ваших слов. Частая ошибка — писать промпт как подпись к фотографии: получается красивый кадр, в котором ничего не происходит. Описывайте движение во времени, а не красоту картинки. Лимит в 20000 символов нужен не под сценарий, а под точность: в такой объём помещаются субъект, действие, камера, свет, окружение и подробный блок запретов.
text-to-video: рекламный кадр с продуктом
Стеклянный флакон сыворотки стоит на мокром камне у кромки воды, утро.
Действие: одна капля скатывается по стенке флакона вниз, круги на воде расходятся.
Камера: медленный наезд спереди, без резких движений, статичный горизонт.
Свет: мягкий рассеянный, тёплый, тени длинные, бликов на этикетке нет.
Стиль: реалистичная съёмка, неглубокая резкость, фон размыт.
Ограничения: форма флакона, цвет и надписи не меняются; в кадре нет людей и рук;
камера не облетает объект; посторонние предметы не появляются.image-to-video: когда кадр уже нарисован?
Вы даёте готовое изображение и описываете, что в нём должно ожить. Самый предсказуемый режим для маркетинга: композиция, цвет и продукт уже утверждены, модели остаётся добавить движение. Практическое правило — просить одно главное движение. Чем проще пластика, тем чище результат; чем больше событий вы просите одновременно, тем чаще появляются артефакты на руках, лицах и границах объектов.
image-to-video: оживить утверждённый визуал
Оживи изображение, сохранив кадр и композицию без изменений.
Главное движение: девушка на фото медленно моргает и чуть заметно улыбается.
Второй план: пар над чашкой поднимается, штора у окна слегка колышется.
Камера: почти неподвижна, едва заметный наезд.
Ограничения: черты лица, причёска, одежда и фон остаются прежними;
руки не перемещаются; поворота головы нет; свет не меняется.reference-to-video: когда нужен один и тот же герой в серии?
Режим для тех, кто делает не ролик, а серию. Вы отдаёте референсы — лицо героя, упаковку, фирменный стиль, — и модель опирается на них при генерации. Так собирают линейку из пяти-восьми клипов, где продукт и персонаж узнаются от кадра к кадру. Референсы лучше подбирать однотипные: один ракурс, один свет, один фон — разнобой в исходниках модель усредняет, и герой начинает «плавать» от клипа к клипу.
reference-to-video: серия роликов с одним героем
Используй референсы: лицо и одежда героя — с первого изображения,
упаковка продукта — со второго, цветовая гамма и стиль — с третьего.
Сцена: герой заходит в кадр слева, ставит упаковку на стол, смотрит в камеру.
Камера: неподвижная, средний план, уровень глаз.
Свет: студийный, ровный, как на референсе.
Ограничения: внешность героя и дизайн упаковки строго с референсов;
логотип не перерисовывать; фон однотонный, без лишних предметов.edit: чем правка отличается от новой генерации?
Это редкий режим. У большинства видеомоделей правка означает полную перегенерацию: вы переписываете промпт, запускаете заново и получаете другой ролик целиком — другое лицо, другой свет, другую динамику. Здесь на вход идёт уже готовое видео, а словами описывается только то, что нужно изменить. Выгода не столько в деньгах, сколько во времени согласований: замечание «сделайте фон посветлее» перестаёт быть перезапуском продакшена и становится одной репликой, а значит, правки заказчика можно отрабатывать прямо на созвоне. Вносить их лучше по одной, а после двух-трёх шагов фиксировать результат и начинать новую цепочку.
edit: точечная правка готового ролика
Возьми готовый ролик и внеси одно изменение.
Что изменить: замени фон на светлую скандинавскую кухню.
Что сохранить без изменений: героя, его лицо, одежду, движение и тайминг,
положение камеры и продукт в кадре.
(следующим шагом, отдельной правкой)
Что изменить: сделай свет тёплым, как на закате.
Что сохранить: всё остальное, включая новый фон.| Режим | Что вы даёте на вход | Под какую задачу |
|---|---|---|
| text-to-video | Только текст | Тесты идей, сторис и вертикалки с нуля, фоновые видео, концепты для питча |
| image-to-video | Картинку и описание движения | Оживить утверждённый визуал, макет, обложку, фото продукта |
| reference-to-video | Референсы и описание сцены | Серия роликов с одним героем и одной упаковкой, узнаваемый фирменный стиль |
| edit | Готовое видео и описание правки | Замечания заказчика, версии одного ролика под разные площадки и сегменты |
Gemini Omni Flash 1.1 или Wan 3.0 Prime
На платформе доступны обе модели, обе на уровне STANDARD. Выбор простой: Wan берут за две вещи, которых у Gemini нет, — длину до 30 секунд и звук, который генерируется вместе с видео. Gemini берут, когда нужны много попыток, правки и высокое разрешение: на сопоставимых ступенях он дешевле и умеет 4K.
| Параметр | Gemini Omni Flash 1.1 | Wan 3.0 Prime |
|---|---|---|
| Самое дешёвое разрешение | 360p — 4.5 нейрона за секунду | 480p — 10.2 нейрона за секунду |
| 720p | 15 нейронов за секунду | 21 нейрон за секунду |
| 1080p | 22.5 нейрона за секунду | 42 нейрона за секунду |
| 4K | 45 нейронов за секунду | Не поддерживается |
| Длительность | 3–10 секунд, по умолчанию 8 | 2–30 секунд, по умолчанию 5 |
| Звук | Нет | Генерирует звук и принимает звук в референсе |
| Режимы | text-to-video, image-to-video, reference-to-video, edit | text-to-video, image-to-video, reference-to-video |
| Длина запроса | До 20000 символов | До 5000 символов |
- Берите Gemini, если нужно много вариантов, точечные правки готового ролика или финал в 4K: на 1080p он почти вдвое дешевле — 22.5 против 42.
- Берите Wan, если ролик должен быть длиннее десяти секунд или сразу со звуком — например, атмосферный проход по интерьеру или сцена с шумом улицы.
- Комбинация тоже работает: перебор идей и правки на Gemini, финальный длинный дубль со звуком на Wan.
- Подробный разбор пары есть в отдельном материале: Wan 3.0 Prime против Gemini Omni Flash.
Как писать промпт, чтобы не жечь нейроны впустую
Ролики чаще переделывают не из-за модели, а из-за пробелов в описании. Что не описано — модель придумывает сама, отсюда и плывущий фон, и внезапный поворот головы, и лишние предметы в кадре. Полминуты на блок ограничений экономят целую генерацию.
- Опишите одно главное действие. Не «идёт, говорит, поворачивается и берёт чашку», а одно движение — остальное вторым планом.
- Задайте камеру явно. Без этого модель выберет усреднённый вариант, обычно самый скучный: «медленный наезд», «статичный средний план», «проход слева направо».
- Опишите свет словами, а не настроением: «мягкий рассеянный», «жёсткий контровой», «ровный студийный».
- Добавьте блок ограничений — что не должно меняться. Это самый недооценённый абзац промпта: лицо, логотип, фон, положение рук.
- Сложную сцену разбейте на два-три коротких ролика вместо одного перегруженного: в 3–10 секунд длинный сценарий всё равно не поместится.
И отдельно: у любой видеомодели есть фильтры на узнаваемых людей и чувствительные сюжеты. Если генерация не проходит, дело обычно не в формулировке промпта — что именно блокируется и как действовать, разобрано в материале про модерацию в нейросетях.
Частые вопросы
Сколько стоит восьмисекундный ролик в 1080p?
180 нейронов: 22.5 нейрона за секунду умножаем на 8. Тот же ролик в 720p обойдётся в 120 нейронов, в 4K — в 360, а черновая версия в 360p — в 36 нейронов.
Можно ли сделать ролик длиннее 10 секунд?
У Gemini Omni Flash 1.1 — нет, диапазон 3–10 секунд, по умолчанию 8. Если нужен один непрерывный дубль до 30 секунд, это Wan 3.0 Prime. Альтернатива — собрать несколько коротких клипов в монтаже, используя reference-to-video, чтобы герой и продукт не «плавали» между сценами.
Есть ли у Gemini Omni Flash 1.1 звук?
Нет, модель работает с видеорядом. Если звук нужен сразу вместе с картинкой — это Wan 3.0 Prime: он генерирует аудио и принимает звук в референсе. Второй путь — озвучить готовый ролик отдельно, об этом есть материал про звуковые эффекты и озвучку.
На каком тарифе доступна модель и где её запустить?
Обе видеомодели — уровень STANDARD, то есть с тарифа Старт и выше. Сравнить, что входит в каждый план, можно на странице тарифов, а запустить генерацию — в MediaLab.
Куда дальше: Wan 3.0 Prime против Gemini Omni Flash · Лучшие нейросети 2026 · MediaLab · Каталог нейросетей · Начать работу


