Песня с вокалом — музыка, аранжировка и спетый по вашему тексту вокал — стоит 30 нейронов за трек. Столько стоит одна генерация и в fal-ai/minimax-music/v2.6, и в minimax/music-3. Фоновая музыка считается иначе, посекундно: 0.04 нейрона за секунду у fal-ai/ace-step/prompt-to-audio (минута — примерно 2.4 нейрона) и 0.5 нейрона за секунду у sonilo/v1.1/text-to-music. Разница в цене здесь не про качество, а про задачу: песню слушают целиком, подложку под видео почти не замечают.

Песня и фоновый трек — это разные задачи

Подборки «нейросетей для музыки» обычно сваливают всё в одну кучу, а на практике вы решаете один из двух вопросов. Либо нужна вещь, которую будут слушать саму по себе: с текстом, голосом и развитием от куплета к припеву. Либо нужна звуковая подложка, чья работа — не мешать голосу диктора и не перетягивать внимание. Описываются они по-разному, считаются по-разному и требуют разного числа дублей.

Чем песня с вокалом отличается от фоновой музыки?

Задачей, единицей оплаты и тем, что вы пишете в описании. Песня — самостоятельный контент с текстом и голосом, и стоит она фиксированно за трек целиком. Фон — материал, который живёт под монтажом, титрами и озвучкой, и считается за секунды, так что вы платите ровно за нужный хронометраж. Отсюда четыре практических различия.

  • Единица оплаты. Песня — 30 нейронов за трек независимо от того, вышло две минуты или четыре. Фон — цена за секунду, и короткий кусок стоит копейки.
  • Что вы пишете в описании. Для песни нужны текст, роль вокала и разметка по секциям. Для фона хватит списка ключевых слов: жанр, темп, инструменты, настроение.
  • Цена ошибки и число дублей. Неудачную подложку на 15 секунд проще перегенерировать, чем песню, в которой не понравился один припев, — под песню разумно сразу закладывать несколько кандидатов.
  • Роль в проекте. Песня — это контент сам по себе. Фон — расходный материал, который подстраивается под всё остальное.
Что нужноМодельЦена
Песня целиком: музыка, аранжировка и живой вокал по вашему текстуfal-ai/minimax-music/v2.630 нейронов за трек
Песня, где важно строго удержать жанр и структуру куплет-припевminimax/music-330 нейронов за трек
Трек по описанию: жанр, темп, инструменты, при желании текст песниfal-ai/ace-step/prompt-to-audio0.04 нейрона за секунду (минута ≈ 2.4)
Фоновая музыка нужной длины под видео, рилс или подкастsonilo/v1.1/text-to-music0.5 нейрона за секунду
Звуковые эффекты по описанию: шаги, дверь, дождь, интерфейсный кликsonilo/v1.1/text-to-sound-effects0.36 нейрона за секунду
Что нужно → какая модель → цена

Сколько это стоит на конкретных задачах

ЗадачаЧто берёмВо что обходится
Один трек-кандидат с вокаломminimax-music/v2.6 или music-330 нейронов
Четыре варианта одной песни на выборлюбая из двух песенных моделей120 нейронов
Один текст, прогнанный через обе песенные моделиv2.6 плюс music-360 нейронов
Подложка 30 секунд под рилсace-step/prompt-to-audio1.2 нейрона
Подложка 30 секунд под рилсsonilo/v1.1/text-to-music15 нейронов
Минута фоновой музыкиace-step/prompt-to-audio2.4 нейрона
Три коротких эффекта по 3 секундыsonilo/v1.1/text-to-sound-effects3.24 нейрона
Прикидка бюджета

Как описать песню, чтобы попасть с первого-второго раза

Оценки в описании не работают: «красивая песня про любовь» модели не говорит ничего. Работает техническое задание — что играет, в каком темпе, кто поёт и как трек устроен по частям. Складывается оно из семи слагаемых.

  1. Жанр — один основной, максимум с одним уточнением. «Мелодичный поп с живой гитарой» лучше, чем смесь пяти стилей.
  2. Темп — числом, в BPM. Не знаете точного — возьмите ориентир от трека, который вам нравится, и правьте от него.
  3. Настроение — двумя-тремя словами: тёплое и ностальгическое, тревожное и собранное, лёгкое и ироничное.
  4. Вокал — пол, регистр, манера подачи, наличие бэк-вокала.
  5. Инструменты — конкретные названия, а не прилагательные: акустическая гитара, электропиано, щётки по малому барабану.
  6. Язык — прямым указанием: «текст на русском».
  7. Структура — разметка по секциям тегами вида [verse] и [chorus], каждый тег отдельной строкой.

Пример 1. Поп-песня на русском для клипа или рилса

Жанр: мелодичный поп с живой гитарой и лёгкой электроникой, 104 BPM.
Настроение: тёплое, ностальгическое, светлая грусть без надрыва.
Вокал: женский, средний регистр, мягкая подача, в припеве добавить бэк-вокал.
Инструменты: акустическая гитара, тёплые синтезаторные подкладки, мягкая бочка, щётки по малому барабану.
Язык: русский, простые слова.
Структура: [intro] [verse] [chorus] [verse] [chorus] [bridge] [chorus] [outro]

Пример 2. Джингл-открывашка для подкаста, 20–30 секунд

Жанр: инди-фолк, живые инструменты, 88 BPM.
Настроение: доверительное, домашнее, чуть ироничное.
Вокал: мужской баритон, почти разговорная подача, без вибрато.
Инструменты: банджо, контрабас, хлопки вместо барабанов, одна губная гармошка на проигрыше.
Язык: русский, короткие строки.
Структура: [intro] [verse] [chorus] [outro], без второго куплета.
Задача: короткая заставка, последние секунды — затухание под голос ведущего.

Как описывать вокал

Вокал сильнее всего решает, будете вы переслушивать трек или нет. Описывайте его не одним словом «женский», а четырьмя слоями: кто поёт, как поёт, что с обработкой и какую роль голос играет в треке. Плюс такого описания в том, что после первого прослушивания видно, какая именно строка не сработала, — и вы правите её одну, а не переписываете всё заново.

СлойКак формулироватьЧто это меняет
Голосженский альт, мужской баритон, высокий тенор, детский хорТембр и регистр — основа узнаваемости трека
Подачашёпотом, надрывно, спокойно и ровно, речитативом, с придыханиемЭмоция куплета и контраст с припевом
Обработкадвойной дубль, бэк-вокал в терцию, лёгкий реверб, сухой вокал крупным планомНасколько голос звучит студийно или «живьём»
Роль в трекевокал только в припеве, куплеты речитативом, финал — хоромГде трек прибавляет, а где отступает
Четыре слоя описания вокала

Как задать структуру куплет-припев?

Секционными тегами — это самый недооценённый инструмент. По документации MiniMax к Music 3, модель понимает теги [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro], и каждый тег нужно ставить отдельной строкой: структуру задают именно они, а не смысл слов. Там же разработчик честно оговаривает, что теги и описание дают управление, а не гарантию — темп, тональность и структура могут отойти от запрошенных. Поэтому текст лучше отдавать сразу размеченным, повторяющийся припев вставлять тем же тегом ещё раз, а для чисто инструментальных кусков брать отдельные теги вроде [Instrumental] и [Solo].

Пример 3. Размеченный текст песни

[intro]

[verse]
Утро в окне, пустая кухня,
Чайник шумит, как будто спорит.
Я собираю этот город
По остывающим часам.

[pre-chorus]
Ещё минута — и поедем,
Ещё минута — и пора.

[chorus]
Мы ещё здесь, мы ещё дышим,
Мы ещё помним, как начать.
Пусть будет громче, пусть будет выше,
Пусть этот день нельзя догнать.

[bridge]
Тихо. Только гитара.

[chorus]

[outro]

Фон и звуковые эффекты: другая логика описания

Для фоновой музыки многословное описание скорее мешает. Здесь работает короткий список тегов: жанр, темп, два-три конкретных инструмента, характер продакшена — примерно так и устроен приём у моделей вроде ace-step, где описание собирается из тегов стиля, темпа и инструментов. Слишком длинный список начинает спорить сам с собой. И отдельно просите ровную динамику, если под музыку ляжет голос. Эффекты описываются ещё конкретнее: не жанр, а источник звука, материал и акустика помещения.

Пример 4. Подложка под подкаст или обучающее видео

lo-fi hip-hop, спокойный, 80 BPM, электропиано, приглушённые барабаны, тёплый бас, лёгкий винтажный шум, без вокала, ровная громкость без резких пиков, зацикливаемый характер

Пример 5. Звуковой эффект

Двери старого грузового лифта закрываются: металлический лязг, короткий скрип направляющих, глухое эхо в бетонной шахте. Длительность 3 секунды, без музыки.

Пять ошибок, из-за которых трек не получается

  1. Жанровый перегруз. Пять стилей в одной строке дают не гибрид, а кашу: модель мечется между ними и не выбирает ни один.
  2. Противоречивые параметры. «Агрессивно и умиротворённо» или «техно на 70 BPM» — просьба, которую нельзя исполнить целиком.
  3. Оценки вместо параметров. «Мощно», «цепляюще», «как у крутых артистов» — это про впечатление, а не про звук. Разложите на инструменты, темп и подачу.
  4. Текст без разметки. Без секционных тегов песня легко выходит сплошным полотном, где непонятно, где припев.
  5. Не указан язык. Напишите прямо «текст на русском» — иначе фонетика может уехать не туда.

Права и коммерческое использование

Главное, что стоит понимать: «royalty-free» и «разрешено коммерческое использование» — не синонимы. Первое про то, как платят, второе про то, что можно делать. Перед тем как ставить сгенерированный трек в рекламу, монетизируемое видео или клиентский проект, спокойно откройте условия конкретной модели и сверьте их со своей задачей. Это пять минут чтения, которые снимают почти все последующие вопросы.

  • Разрешена ли коммерция явно — или условия говорят только про личное использование.
  • Покрывают ли они монетизируемый контент: YouTube, платные размещения, рекламные кабинеты.
  • Можно ли использовать результат в работе для третьих лиц — то есть в клиентских проектах агентства.
  • Что делать, если трек зацепят автоматические системы определения контента на площадке.
  • Не имитирует ли трек конкретного узнаваемого исполнителя — это отдельный риск, независимо от лицензии.

Как выбрать между инструментами

Специализированные музыкальные сервисы дают глубину внутри одной задачи: у Suno, по описанию самого сервиса, есть Custom-режим, где можно вставить собственный текст и разметить его тегами секций. Если музыка — ваше основное занятие и вы живёте в одном интерфейсе, отдельный музыкальный сервис логичен. Музыкальные модели в общей платформе закрывают другой сценарий: музыка здесь — один шаг в цепочке, где до неё был сценарий, а после будут видео и монтаж. Текст песни пишется в чате, трек генерируется в MediaLab, видео и озвучка собираются рядом и из одного баланса нейронов. Весь каталог — в разделе нейросети.

Между двумя песенными моделями выбор недорогой: они стоят одинаково и обе поют ваш текст. minimax/music-3 — третье поколение движка MiniMax, оно точнее держит заданный жанр и структуру куплет-припев, и его стоит брать, когда рамки жёсткие. fal-ai/minimax-music/v2.6 решает ту же задачу песни целиком. За 60 нейронов можно прогнать один текст через обе и оставить ту, что ближе к вашему звучанию.


Частые вопросы

Можно ли отдать модели свой готовый текст песни?

Да, это основной сценарий: fal-ai/minimax-music/v2.6 и minimax/music-3 поют именно ваш текст, а не сочиняют слова за вас. Разметьте его тегами секций, каждый тег отдельной строкой, и добавьте отдельным блоком описание жанра, темпа и вокала. Цена от этого не меняется — 30 нейронов за трек.

Сколько генераций закладывать на одну песню?

Считайте по числу дублей, которые хотите послушать: три генерации — 90 нейронов, четыре — 120. Если после четвёртой попытки результат всё ещё мимо, дело почти всегда не в модели, а в описании: чаще всего там жанровый перегруз, противоречивые параметры или текст без разметки.

Почему вокал коверкает отдельные русские слова?

Дикция — та часть, которую модели не обещают: разработчик MiniMax прямо предупреждает, что описание и теги дают управление, а не точное совпадение с запросом. Править дешевле не генерацию, а строку: заменить спотыкающееся слово на более короткое, разбить длинную строку на две и не ставить редкие термины в ударную позицию.

Что дешевле для 30-секундной подложки под рилс?

Посекундная модель. У fal-ai/ace-step/prompt-to-audio 30 секунд обойдутся в 1.2 нейрона, у sonilo/v1.1/text-to-music — в 15 нейронов. Песенные модели для такой задачи избыточны: вы заплатите 30 нейронов за трек целиком, а в монтаж возьмёте полминуты.