Новые нейросети для видео и картинок появились в МедиаЛабе СуперИнтеллекта 26 сентября 2026 года: всего больше 30 моделей и режимов, включая 3D, озвучку текста и музыку. Среди новинок — MiniMax H3 Max, который снимает ролики в стиле VHS-кассеты, мультфильма 70-х и 16-битного пиксель-арта, видео со звуком Wan 3.0 и LTX 2.3, музыка Lyria 3.5 от Google DeepMind, 3D-модели Meshy 7.1 и примерка одежды от Bria. Все они работают в России без VPN и зарубежной карты и доступны с тарифа СТАРТ.

МедиаЛаб — раздел СуперИнтеллекта, где нейросети создают картинки, видео, звук и 3D; режимы одной модели собраны в группу с переключателем качества. Новые модели для текста и кода — в подборке новых нейросетей сентября.

Какие новые нейросети появились в МедиаЛабе в сентябре 2026 года?

Новинки закрывают пять задач: видео, картинки, 3D, звук с музыкой и съёмку для интернет-магазинов.

ЗадачаМодельЧто делает
ВидеоMiniMax H3 Max в стиляхРолики в пяти стилях: от VHS до 16-битного пиксель-арта
ВидеоMiniMax H3 Max: «По референсам», «Продлить видео», ЛипсинкРолик по образцам, продолжение готового видео, говорящее фото
ВидеоWan 3.0Видео со звуком из текста, картинки или референсов
ВидеоLTX 2.3 (Fast и Pro)Видео со звуком до 2160p и до 50 кадров в секунду
ВидеоID-V2VПеренос внешности и стиля с картинки на готовый ролик
КартинкиMeta Muse ImageГенерация и точечная правка по инструкции
КартинкиSeedream 5: качество Flash и «Разложить на слои»Генерация, правка и разбор картинки на слои
КартинкиKrea 2 Turbo, Recraft V4.1 FlashБыстрые черновики и массовые варианты
3DMeshy 7.13D-модель из текста, фото или нескольких ракурсов
МузыкаLyria 3.5Трек любого жанра и текст песни
ЗвукGemini 3.8 Flash TTS и Flash Lite TTSОзвучка текста 30 голосами
Музыка и видеоPixVerse VibeMVКлип под ваш трек
МагазинBria Virtual Try-On, Bria Product HoldingПримерка одежды, товар в руках человека
МагазинBria Increase ResolutionУвеличение картинки в 2 или 4 раза
Новые модели МедиаЛаба, сентябрь 2026: что для какой задачи

Какие новые нейросети делают видео?

Для видео появились MiniMax H3 Max в пяти стилях, новые режимы H3 Max и Липсинк, Wan 3.0, LTX 2.3 и ID-V2V для переноса образа.

MiniMax H3 Max в стилях: VHS, мультфильм 70-х и 16 бит

Эта версия H3 Max сразу снимает ролик в одном из пяти стилей: VHS-кассета с потёртостями, ретро-мультфильм 70-х, low-poly 3D (угловатая графика из крупных граней), рисованная анимация и 16-битный пиксель-арт. Ролик длиной до 15 секунд получается из текста или от стартового кадра. Стиль выбирается в панели, поэтому в промпте — текстовом описании задачи — пишите только, что происходит в кадре.

Пример промпта для стиля VHS

Семья распаковывает подарки у новогодней ёлки, дети смеются, в кадр заглядывает собака. Съёмка с рук, камера слегка покачивается, тёплый свет гирлянд.

Кому пригодится: SMM-специалистам для ностальгических рилсов, брендам — для ретро-рекламы, музыкантам — для визуала к треку.

H3 Max: «По референсам», «Продлить видео» и Липсинк

У основной модели MiniMax H3 Max появились два режима. «По референсам» собирает ролик по вашим образцам (референсам), а не только по текстовому описанию. «Продлить видео» продолжает уже готовый ролик.

Отдельной моделью вышел H3 Max Липсинк (lip-sync — синхронизация губ со звуком). Он оживляет фотографию и подгоняет движение губ под вашу аудиозапись длиной от 5 секунд, выход — до 2K.

Кому пригодится: экспертам, блогерам и студиям дубляжа — для говорящих аватаров и озвученных персонажей. Эксперт записывает голос, а говорит в ролике его портрет — без камеры и студии.

Wan 3.0: видео со звуком из текста, картинки и референсов

Wan 3.0 от Alibaba делает видео сразу со звуком тремя способами: из текста, из изображения (можно задать первый и последний кадр) и по референсам — до 10 картинок, до 5 роликов и аудиофрагментов. Модель умеет сама расширить короткий промпт, а в режиме рассуждений сначала продумывает ролик и только потом генерирует его. Стоит она в пять раз дешевле Wan 3.0 Prime, а по качеству близка к ней.

Кому пригодится: SMM-специалистам и рекламщикам, которые считают бюджет. Первый и последний кадр удобны для сюжетов «до и после»: пустая комната в начале, готовый интерьер в конце.

LTX 2.3: видео до 2160p и до 50 кадров в секунду

LTX 2.3 от Lightricks делает видео со звуком из текста или от стартового кадра, можно задать и последний. Длина ролика — 6–10 секунд, разрешение — от 1080p до 2160p, то есть от Full HD до 4K, частота — до 50 кадров в секунду. Вариантов качества два: Fast — быстрее и дешевле, Pro — максимальное.

Кому пригодится: тем, кто делает рекламу в высоком разрешении: сцену удобно подобрать на Fast, а чистовой вариант снять на Pro.

ID-V2V: новый образ на готовом видео

ID-V2V переносит образ на видео: движение и кадрирование берутся из вашего исходного ролика, а внешность и стиль — из картинки, которую вы даёте как первый кадр. Режим Relight ещё и переосвещает сцену под новый кадр.

Кому пригодится: блогерам и студиям: движение снимается один раз, а персонажа, костюм или стилистику можно менять без пересъёмки.

Какие новые нейросети рисуют и редактируют картинки?

Для картинок появились Meta Muse Image для точных правок, Seedream 5 с качеством Flash и режимом «Разложить на слои», Krea 2 Turbo и Recraft V4.1 Flash для быстрых черновиков.

Meta Muse Image: правит только то, что попросили

Muse Image от Meta точно следует инструкциям и даёт высокую детализацию при цене как у бюджетных моделей. Она генерирует картинку из текста и редактирует изображения по референсам — от 1 до 10 штук, — меняя только то, о чём вы попросили. Пропорции кадра — любые, например «16:9».

Кому пригодится: дизайнерам и маркетологам для точечных правок — заменить фон, перекрасить упаковку, убрать лишний предмет — так, чтобы остальная картинка осталась прежней.

Seedream 5: качество Flash и «Разложить на слои»

У Seedream 5 от ByteDance появилось качество Flash — и для генерации из текста, и для правки картинок. Второе нововведение — режим «Разложить на слои»: он делит готовое изображение на отдельные слои, чтобы фон и объекты можно было дорабатывать по отдельности.

Кому пригодится: дизайнерам, которые собирают макеты из сгенерированных картинок и дорабатывают их по частям.

Krea 2 Turbo и Recraft V4.1 Flash: картинки за секунды

Krea 2 Turbo генерирует изображения из текста за секунды: фотореализм и иллюстрации, несколько картинок за один запрос. Есть режим ускорения и авторасширение промпта — модель сама дописывает короткое описание до подробного.

Recraft V4.1 Flash — самая быстрая и дешёвая модель Recraft. Она делает фотографии, иллюстрации и графику с фирменным дизайнерским вкусом Recraft в стандартных размерах кадра.

Кому пригодится: дизайнерам и маркетологам на этапе поиска идеи: набросать десяток вариантов обложки или баннера, а лучший довести в модели посильнее.

Как сделать 3D-модель из фото или текста?

Проще всего — в Meshy 7.1: модель строит 3D-объект по текстовому описанию, по одному фото или по нескольким снимкам предмета с разных сторон.

Геометрия — до 4K, с текстурами и PBR-картами: они описывают материал поверхности — металл, дерево, ткань, — чтобы объект правильно отражал свет. Ретопология под квады перестраивает сетку модели в аккуратные четырёхугольники, удобные для анимации. Для человекоподобных персонажей есть авто-риггинг — «скелет» с базовыми анимациями ходьбы и бега — и выбор позы. На выходе — файлы GLB или FBX.

Кому пригодится: разработчикам игр, создателям AR-витрин (с дополненной реальностью) и тем, кто печатает на 3D-принтере. Сфотографируйте сувенир с нескольких сторон — и получите модель для игры, AR или печати.

Какой нейросетью написать музыку и озвучить текст?

Для музыки в МедиаЛабе появилась Lyria 3.5 от Google DeepMind, для озвучки — Gemini 3.8 Flash TTS и её облегчённая версия, а для клипа под готовый трек — PixVerse VibeMV. TTS (text-to-speech) — синтез речи: нейросеть читает текст вслух выбранным голосом.

Lyria 3.5: трек и текст песни по описанию

Lyria 3.5 — новейшая модель Google DeepMind для генерации музыки. Она пишет трек любого жанра и настроения по текстовому описанию, а картинку можно приложить как визуальное вдохновение. В ответе — сам трек и текст песни.

Кому пригодится: авторам роликов, презентаций и подкастов — для фоновой музыки и джинглов, а ещё всем, кому нужна песня-поздравление. Приложите фото с корпоратива и попросите «бодрый поп-рок про нашу команду».

Gemini 3.8 Flash TTS и Flash Lite TTS: озвучка 30 голосами

Gemini 3.8 Flash TTS — преемник Gemini 3.1 Flash TTS для выразительного синтеза речи. В нём 30 голосов, поддержка русского и больше 80 языков и отдельное поле для указаний по подаче: тон, темп, эмоция. Вокальные события — смех, вздох — ставятся метками прямо в тексте. Диалог на два голоса в форме пока не поддерживается.

Пример озвучки с указаниями и метками

Указания по подаче: тепло, неторопливо, с улыбкой в голосе.

Текст: Ровно год назад мы открыли первую кофейню. <laugh> Честно, сами не верили, что дойдём до этого дня. <sigh> Спасибо, что вы с нами!

Gemini 3.8 Flash Lite TTS — быстрая и экономичная версия: те же 30 голосов и указания по подаче, но ниже цена и задержка. Её стоит брать для длинных текстов, где скорость и стоимость важнее максимальной выразительности.

Какую выбрать: Flash TTS — для рекламы и подкастов, где важна интонация; Flash Lite TTS — для аудиоверсий статей и курсов.

PixVerse VibeMV: клип под ваш трек

PixVerse VibeMV делает музыкальный клип по вашему треку в mp3 или wav длиной от 10 секунд до 6 минут. Можно выбрать визуальный стиль и жанр, приложить референс персонажа и вывести текст песни субтитрами.

Кому пригодится: музыкантам без бюджета на съёмку — и всем, кто уже сделал трек в Lyria 3.5.

Какие нейросети помогут интернет-магазину?

Для карточек товаров и рекламы без фотосъёмки в МедиаЛабе появились три модели Bria: примерка одежды, товар в руках человека и увеличение разрешения.

Bria Virtual Try-On: примерка одежды на фото

Virtual Try-On (FIBO Edit 1.5) примеряет одежду: вы даёте фото человека и 1–3 фото вещей или аксессуаров, а получаете этого человека в выбранной одежде — с той же позой и тем же освещением. Bria называет модель коммерчески безопасной, то есть рассчитанной на использование в рекламе и продажах.

Кому пригодится: магазинам одежды и продавцам на маркетплейсах: одна съёмка модели — десятки образов из каталога.

Bria Product Holding: товар в руках без съёмки

Product Holding (FIBO Edit 1.5) создаёт фото, где человек держит ваш товар. Нужны фото человека и 1–3 фото продукта — например, упаковка и второй ракурс.

Кому пригодится: продавцам косметики, напитков и гаджетов — для карточек товаров и рекламы, где товар в руках покупателя, без студийной съёмки.

Bria Increase Resolution: картинка в 2 или 4 раза крупнее

Increase Resolution увеличивает изображение в 2 или 4 раза и сохраняет прозрачность и цвет. Выручает, когда есть только маленький снимок товара, а нужен крупный баннер или печать.

Как попробовать новые модели МедиаЛаба?

Попробовать новинки можно в МедиаЛабе на тарифе СТАРТ или выше: на бесплатном тарифе их нет.

  1. Зарегистрируйтесь в СуперИнтеллекте — это бесплатно: my.suin.ai/auth/register.
  2. Подключите тариф СТАРТ или выше. Оплата — в рублях, без зарубежной карты.
  3. Откройте МедиаЛаб и выберите тип задачи: видео, картинки, 3D или звук.
  4. Найдите модель по названию и выберите режим. Качество, например Fast или Pro у LTX 2.3, переключается в панели; если приложить стартовый кадр, ролик пойдёт от него.
  5. Опишите, что нужно получить, и запустите генерацию.

Частые вопросы

Можно ли пользоваться новыми моделями МедиаЛаба бесплатно?

Нет, все новинки из обзора открываются с тарифа СТАРТ. Регистрация бесплатная, а на бесплатном тарифе доступен чат — например, СуперИнтеллект, который сам подбирает нейросеть под вопрос.

Какая нейросеть делает видео со звуком?

Из новинок сентября — Wan 3.0 и LTX 2.3: обе генерируют ролик сразу со звуком. Если звук уже есть — ваш голос или готовый трек, — подойдут H3 Max Липсинк (говорящее фото) и PixVerse VibeMV (клип под музыку).

Можно ли озвучить диалог двумя голосами?

Пока нет: форма Gemini 3.8 Flash TTS в МедиаЛабе принимает один голос. Диалог можно озвучить по репликам разными голосами и склеить в аудиоредакторе.

Чем МедиаЛаб отличается от разбора видео в чате?

МедиаЛаб создаёт новые ролики, а чат разбирает готовые: пересказывает видео с таймкодами и отвечает на вопросы о ролике или ссылке на YouTube. Как это устроено — в статье «Чат смотрит видео и слушает аудио».