Новые нейросети для видео и картинок появились в МедиаЛабе СуперИнтеллекта 26 сентября 2026 года: всего больше 30 моделей и режимов, включая 3D, озвучку текста и музыку. Среди новинок — MiniMax H3 Max, который снимает ролики в стиле VHS-кассеты, мультфильма 70-х и 16-битного пиксель-арта, видео со звуком Wan 3.0 и LTX 2.3, музыка Lyria 3.5 от Google DeepMind, 3D-модели Meshy 7.1 и примерка одежды от Bria. Все они работают в России без VPN и зарубежной карты и доступны с тарифа СТАРТ.
МедиаЛаб — раздел СуперИнтеллекта, где нейросети создают картинки, видео, звук и 3D; режимы одной модели собраны в группу с переключателем качества. Новые модели для текста и кода — в подборке новых нейросетей сентября.
Какие новые нейросети появились в МедиаЛабе в сентябре 2026 года?
Новинки закрывают пять задач: видео, картинки, 3D, звук с музыкой и съёмку для интернет-магазинов.
| Задача | Модель | Что делает |
|---|---|---|
| Видео | MiniMax H3 Max в стилях | Ролики в пяти стилях: от VHS до 16-битного пиксель-арта |
| Видео | MiniMax H3 Max: «По референсам», «Продлить видео», Липсинк | Ролик по образцам, продолжение готового видео, говорящее фото |
| Видео | Wan 3.0 | Видео со звуком из текста, картинки или референсов |
| Видео | LTX 2.3 (Fast и Pro) | Видео со звуком до 2160p и до 50 кадров в секунду |
| Видео | ID-V2V | Перенос внешности и стиля с картинки на готовый ролик |
| Картинки | Meta Muse Image | Генерация и точечная правка по инструкции |
| Картинки | Seedream 5: качество Flash и «Разложить на слои» | Генерация, правка и разбор картинки на слои |
| Картинки | Krea 2 Turbo, Recraft V4.1 Flash | Быстрые черновики и массовые варианты |
| 3D | Meshy 7.1 | 3D-модель из текста, фото или нескольких ракурсов |
| Музыка | Lyria 3.5 | Трек любого жанра и текст песни |
| Звук | Gemini 3.8 Flash TTS и Flash Lite TTS | Озвучка текста 30 голосами |
| Музыка и видео | PixVerse VibeMV | Клип под ваш трек |
| Магазин | Bria Virtual Try-On, Bria Product Holding | Примерка одежды, товар в руках человека |
| Магазин | Bria Increase Resolution | Увеличение картинки в 2 или 4 раза |
Какие новые нейросети делают видео?
Для видео появились MiniMax H3 Max в пяти стилях, новые режимы H3 Max и Липсинк, Wan 3.0, LTX 2.3 и ID-V2V для переноса образа.
MiniMax H3 Max в стилях: VHS, мультфильм 70-х и 16 бит
Эта версия H3 Max сразу снимает ролик в одном из пяти стилей: VHS-кассета с потёртостями, ретро-мультфильм 70-х, low-poly 3D (угловатая графика из крупных граней), рисованная анимация и 16-битный пиксель-арт. Ролик длиной до 15 секунд получается из текста или от стартового кадра. Стиль выбирается в панели, поэтому в промпте — текстовом описании задачи — пишите только, что происходит в кадре.
Пример промпта для стиля VHS
Семья распаковывает подарки у новогодней ёлки, дети смеются, в кадр заглядывает собака. Съёмка с рук, камера слегка покачивается, тёплый свет гирлянд.Кому пригодится: SMM-специалистам для ностальгических рилсов, брендам — для ретро-рекламы, музыкантам — для визуала к треку.
H3 Max: «По референсам», «Продлить видео» и Липсинк
У основной модели MiniMax H3 Max появились два режима. «По референсам» собирает ролик по вашим образцам (референсам), а не только по текстовому описанию. «Продлить видео» продолжает уже готовый ролик.
Отдельной моделью вышел H3 Max Липсинк (lip-sync — синхронизация губ со звуком). Он оживляет фотографию и подгоняет движение губ под вашу аудиозапись длиной от 5 секунд, выход — до 2K.
Кому пригодится: экспертам, блогерам и студиям дубляжа — для говорящих аватаров и озвученных персонажей. Эксперт записывает голос, а говорит в ролике его портрет — без камеры и студии.
Wan 3.0: видео со звуком из текста, картинки и референсов
Wan 3.0 от Alibaba делает видео сразу со звуком тремя способами: из текста, из изображения (можно задать первый и последний кадр) и по референсам — до 10 картинок, до 5 роликов и аудиофрагментов. Модель умеет сама расширить короткий промпт, а в режиме рассуждений сначала продумывает ролик и только потом генерирует его. Стоит она в пять раз дешевле Wan 3.0 Prime, а по качеству близка к ней.
Кому пригодится: SMM-специалистам и рекламщикам, которые считают бюджет. Первый и последний кадр удобны для сюжетов «до и после»: пустая комната в начале, готовый интерьер в конце.
LTX 2.3: видео до 2160p и до 50 кадров в секунду
LTX 2.3 от Lightricks делает видео со звуком из текста или от стартового кадра, можно задать и последний. Длина ролика — 6–10 секунд, разрешение — от 1080p до 2160p, то есть от Full HD до 4K, частота — до 50 кадров в секунду. Вариантов качества два: Fast — быстрее и дешевле, Pro — максимальное.
Кому пригодится: тем, кто делает рекламу в высоком разрешении: сцену удобно подобрать на Fast, а чистовой вариант снять на Pro.
ID-V2V: новый образ на готовом видео
ID-V2V переносит образ на видео: движение и кадрирование берутся из вашего исходного ролика, а внешность и стиль — из картинки, которую вы даёте как первый кадр. Режим Relight ещё и переосвещает сцену под новый кадр.
Кому пригодится: блогерам и студиям: движение снимается один раз, а персонажа, костюм или стилистику можно менять без пересъёмки.
Какие новые нейросети рисуют и редактируют картинки?
Для картинок появились Meta Muse Image для точных правок, Seedream 5 с качеством Flash и режимом «Разложить на слои», Krea 2 Turbo и Recraft V4.1 Flash для быстрых черновиков.
Meta Muse Image: правит только то, что попросили
Muse Image от Meta точно следует инструкциям и даёт высокую детализацию при цене как у бюджетных моделей. Она генерирует картинку из текста и редактирует изображения по референсам — от 1 до 10 штук, — меняя только то, о чём вы попросили. Пропорции кадра — любые, например «16:9».
Кому пригодится: дизайнерам и маркетологам для точечных правок — заменить фон, перекрасить упаковку, убрать лишний предмет — так, чтобы остальная картинка осталась прежней.
Seedream 5: качество Flash и «Разложить на слои»
У Seedream 5 от ByteDance появилось качество Flash — и для генерации из текста, и для правки картинок. Второе нововведение — режим «Разложить на слои»: он делит готовое изображение на отдельные слои, чтобы фон и объекты можно было дорабатывать по отдельности.
Кому пригодится: дизайнерам, которые собирают макеты из сгенерированных картинок и дорабатывают их по частям.
Krea 2 Turbo и Recraft V4.1 Flash: картинки за секунды
Krea 2 Turbo генерирует изображения из текста за секунды: фотореализм и иллюстрации, несколько картинок за один запрос. Есть режим ускорения и авторасширение промпта — модель сама дописывает короткое описание до подробного.
Recraft V4.1 Flash — самая быстрая и дешёвая модель Recraft. Она делает фотографии, иллюстрации и графику с фирменным дизайнерским вкусом Recraft в стандартных размерах кадра.
Кому пригодится: дизайнерам и маркетологам на этапе поиска идеи: набросать десяток вариантов обложки или баннера, а лучший довести в модели посильнее.
Как сделать 3D-модель из фото или текста?
Проще всего — в Meshy 7.1: модель строит 3D-объект по текстовому описанию, по одному фото или по нескольким снимкам предмета с разных сторон.
Геометрия — до 4K, с текстурами и PBR-картами: они описывают материал поверхности — металл, дерево, ткань, — чтобы объект правильно отражал свет. Ретопология под квады перестраивает сетку модели в аккуратные четырёхугольники, удобные для анимации. Для человекоподобных персонажей есть авто-риггинг — «скелет» с базовыми анимациями ходьбы и бега — и выбор позы. На выходе — файлы GLB или FBX.
Кому пригодится: разработчикам игр, создателям AR-витрин (с дополненной реальностью) и тем, кто печатает на 3D-принтере. Сфотографируйте сувенир с нескольких сторон — и получите модель для игры, AR или печати.
Какой нейросетью написать музыку и озвучить текст?
Для музыки в МедиаЛабе появилась Lyria 3.5 от Google DeepMind, для озвучки — Gemini 3.8 Flash TTS и её облегчённая версия, а для клипа под готовый трек — PixVerse VibeMV. TTS (text-to-speech) — синтез речи: нейросеть читает текст вслух выбранным голосом.
Lyria 3.5: трек и текст песни по описанию
Lyria 3.5 — новейшая модель Google DeepMind для генерации музыки. Она пишет трек любого жанра и настроения по текстовому описанию, а картинку можно приложить как визуальное вдохновение. В ответе — сам трек и текст песни.
Кому пригодится: авторам роликов, презентаций и подкастов — для фоновой музыки и джинглов, а ещё всем, кому нужна песня-поздравление. Приложите фото с корпоратива и попросите «бодрый поп-рок про нашу команду».
Gemini 3.8 Flash TTS и Flash Lite TTS: озвучка 30 голосами
Gemini 3.8 Flash TTS — преемник Gemini 3.1 Flash TTS для выразительного синтеза речи. В нём 30 голосов, поддержка русского и больше 80 языков и отдельное поле для указаний по подаче: тон, темп, эмоция. Вокальные события — смех, вздох — ставятся метками прямо в тексте. Диалог на два голоса в форме пока не поддерживается.
Пример озвучки с указаниями и метками
Указания по подаче: тепло, неторопливо, с улыбкой в голосе.
Текст: Ровно год назад мы открыли первую кофейню. <laugh> Честно, сами не верили, что дойдём до этого дня. <sigh> Спасибо, что вы с нами!Gemini 3.8 Flash Lite TTS — быстрая и экономичная версия: те же 30 голосов и указания по подаче, но ниже цена и задержка. Её стоит брать для длинных текстов, где скорость и стоимость важнее максимальной выразительности.
Какую выбрать: Flash TTS — для рекламы и подкастов, где важна интонация; Flash Lite TTS — для аудиоверсий статей и курсов.
PixVerse VibeMV: клип под ваш трек
PixVerse VibeMV делает музыкальный клип по вашему треку в mp3 или wav длиной от 10 секунд до 6 минут. Можно выбрать визуальный стиль и жанр, приложить референс персонажа и вывести текст песни субтитрами.
Кому пригодится: музыкантам без бюджета на съёмку — и всем, кто уже сделал трек в Lyria 3.5.
Какие нейросети помогут интернет-магазину?
Для карточек товаров и рекламы без фотосъёмки в МедиаЛабе появились три модели Bria: примерка одежды, товар в руках человека и увеличение разрешения.
Bria Virtual Try-On: примерка одежды на фото
Virtual Try-On (FIBO Edit 1.5) примеряет одежду: вы даёте фото человека и 1–3 фото вещей или аксессуаров, а получаете этого человека в выбранной одежде — с той же позой и тем же освещением. Bria называет модель коммерчески безопасной, то есть рассчитанной на использование в рекламе и продажах.
Кому пригодится: магазинам одежды и продавцам на маркетплейсах: одна съёмка модели — десятки образов из каталога.
Bria Product Holding: товар в руках без съёмки
Product Holding (FIBO Edit 1.5) создаёт фото, где человек держит ваш товар. Нужны фото человека и 1–3 фото продукта — например, упаковка и второй ракурс.
Кому пригодится: продавцам косметики, напитков и гаджетов — для карточек товаров и рекламы, где товар в руках покупателя, без студийной съёмки.
Bria Increase Resolution: картинка в 2 или 4 раза крупнее
Increase Resolution увеличивает изображение в 2 или 4 раза и сохраняет прозрачность и цвет. Выручает, когда есть только маленький снимок товара, а нужен крупный баннер или печать.
Как попробовать новые модели МедиаЛаба?
Попробовать новинки можно в МедиаЛабе на тарифе СТАРТ или выше: на бесплатном тарифе их нет.
- Зарегистрируйтесь в СуперИнтеллекте — это бесплатно: my.suin.ai/auth/register.
- Подключите тариф СТАРТ или выше. Оплата — в рублях, без зарубежной карты.
- Откройте МедиаЛаб и выберите тип задачи: видео, картинки, 3D или звук.
- Найдите модель по названию и выберите режим. Качество, например Fast или Pro у LTX 2.3, переключается в панели; если приложить стартовый кадр, ролик пойдёт от него.
- Опишите, что нужно получить, и запустите генерацию.
Частые вопросы
Можно ли пользоваться новыми моделями МедиаЛаба бесплатно?
Нет, все новинки из обзора открываются с тарифа СТАРТ. Регистрация бесплатная, а на бесплатном тарифе доступен чат — например, СуперИнтеллект, который сам подбирает нейросеть под вопрос.
Какая нейросеть делает видео со звуком?
Из новинок сентября — Wan 3.0 и LTX 2.3: обе генерируют ролик сразу со звуком. Если звук уже есть — ваш голос или готовый трек, — подойдут H3 Max Липсинк (говорящее фото) и PixVerse VibeMV (клип под музыку).
Можно ли озвучить диалог двумя голосами?
Пока нет: форма Gemini 3.8 Flash TTS в МедиаЛабе принимает один голос. Диалог можно озвучить по репликам разными голосами и склеить в аудиоредакторе.
Чем МедиаЛаб отличается от разбора видео в чате?
МедиаЛаб создаёт новые ролики, а чат разбирает готовые: пересказывает видео с таймкодами и отвечает на вопросы о ролике или ссылке на YouTube. Как это устроено — в статье «Чат смотрит видео и слушает аудио».



