Песня с вокалом — музыка, аранжировка и спетый по вашему тексту вокал — стоит 30 нейронов за трек. Столько стоит одна генерация и в fal-ai/minimax-music/v2.6, и в minimax/music-3. Фоновая музыка считается иначе, посекундно: 0.04 нейрона за секунду у fal-ai/ace-step/prompt-to-audio (минута — примерно 2.4 нейрона) и 0.5 нейрона за секунду у sonilo/v1.1/text-to-music. Разница в цене здесь не про качество, а про задачу: песню слушают целиком, подложку под видео почти не замечают.
Песня и фоновый трек — это разные задачи
Подборки «нейросетей для музыки» обычно сваливают всё в одну кучу, а на практике вы решаете один из двух вопросов. Либо нужна вещь, которую будут слушать саму по себе: с текстом, голосом и развитием от куплета к припеву. Либо нужна звуковая подложка, чья работа — не мешать голосу диктора и не перетягивать внимание. Описываются они по-разному, считаются по-разному и требуют разного числа дублей.
Чем песня с вокалом отличается от фоновой музыки?
Задачей, единицей оплаты и тем, что вы пишете в описании. Песня — самостоятельный контент с текстом и голосом, и стоит она фиксированно за трек целиком. Фон — материал, который живёт под монтажом, титрами и озвучкой, и считается за секунды, так что вы платите ровно за нужный хронометраж. Отсюда четыре практических различия.
- Единица оплаты. Песня — 30 нейронов за трек независимо от того, вышло две минуты или четыре. Фон — цена за секунду, и короткий кусок стоит копейки.
- Что вы пишете в описании. Для песни нужны текст, роль вокала и разметка по секциям. Для фона хватит списка ключевых слов: жанр, темп, инструменты, настроение.
- Цена ошибки и число дублей. Неудачную подложку на 15 секунд проще перегенерировать, чем песню, в которой не понравился один припев, — под песню разумно сразу закладывать несколько кандидатов.
- Роль в проекте. Песня — это контент сам по себе. Фон — расходный материал, который подстраивается под всё остальное.
| Что нужно | Модель | Цена |
|---|---|---|
| Песня целиком: музыка, аранжировка и живой вокал по вашему тексту | fal-ai/minimax-music/v2.6 | 30 нейронов за трек |
| Песня, где важно строго удержать жанр и структуру куплет-припев | minimax/music-3 | 30 нейронов за трек |
| Трек по описанию: жанр, темп, инструменты, при желании текст песни | fal-ai/ace-step/prompt-to-audio | 0.04 нейрона за секунду (минута ≈ 2.4) |
| Фоновая музыка нужной длины под видео, рилс или подкаст | sonilo/v1.1/text-to-music | 0.5 нейрона за секунду |
| Звуковые эффекты по описанию: шаги, дверь, дождь, интерфейсный клик | sonilo/v1.1/text-to-sound-effects | 0.36 нейрона за секунду |
Сколько это стоит на конкретных задачах
| Задача | Что берём | Во что обходится |
|---|---|---|
| Один трек-кандидат с вокалом | minimax-music/v2.6 или music-3 | 30 нейронов |
| Четыре варианта одной песни на выбор | любая из двух песенных моделей | 120 нейронов |
| Один текст, прогнанный через обе песенные модели | v2.6 плюс music-3 | 60 нейронов |
| Подложка 30 секунд под рилс | ace-step/prompt-to-audio | 1.2 нейрона |
| Подложка 30 секунд под рилс | sonilo/v1.1/text-to-music | 15 нейронов |
| Минута фоновой музыки | ace-step/prompt-to-audio | 2.4 нейрона |
| Три коротких эффекта по 3 секунды | sonilo/v1.1/text-to-sound-effects | 3.24 нейрона |
Как описать песню, чтобы попасть с первого-второго раза
Оценки в описании не работают: «красивая песня про любовь» модели не говорит ничего. Работает техническое задание — что играет, в каком темпе, кто поёт и как трек устроен по частям. Складывается оно из семи слагаемых.
- Жанр — один основной, максимум с одним уточнением. «Мелодичный поп с живой гитарой» лучше, чем смесь пяти стилей.
- Темп — числом, в BPM. Не знаете точного — возьмите ориентир от трека, который вам нравится, и правьте от него.
- Настроение — двумя-тремя словами: тёплое и ностальгическое, тревожное и собранное, лёгкое и ироничное.
- Вокал — пол, регистр, манера подачи, наличие бэк-вокала.
- Инструменты — конкретные названия, а не прилагательные: акустическая гитара, электропиано, щётки по малому барабану.
- Язык — прямым указанием: «текст на русском».
- Структура — разметка по секциям тегами вида [verse] и [chorus], каждый тег отдельной строкой.
Пример 1. Поп-песня на русском для клипа или рилса
Жанр: мелодичный поп с живой гитарой и лёгкой электроникой, 104 BPM.
Настроение: тёплое, ностальгическое, светлая грусть без надрыва.
Вокал: женский, средний регистр, мягкая подача, в припеве добавить бэк-вокал.
Инструменты: акустическая гитара, тёплые синтезаторные подкладки, мягкая бочка, щётки по малому барабану.
Язык: русский, простые слова.
Структура: [intro] [verse] [chorus] [verse] [chorus] [bridge] [chorus] [outro]Пример 2. Джингл-открывашка для подкаста, 20–30 секунд
Жанр: инди-фолк, живые инструменты, 88 BPM.
Настроение: доверительное, домашнее, чуть ироничное.
Вокал: мужской баритон, почти разговорная подача, без вибрато.
Инструменты: банджо, контрабас, хлопки вместо барабанов, одна губная гармошка на проигрыше.
Язык: русский, короткие строки.
Структура: [intro] [verse] [chorus] [outro], без второго куплета.
Задача: короткая заставка, последние секунды — затухание под голос ведущего.Как описывать вокал
Вокал сильнее всего решает, будете вы переслушивать трек или нет. Описывайте его не одним словом «женский», а четырьмя слоями: кто поёт, как поёт, что с обработкой и какую роль голос играет в треке. Плюс такого описания в том, что после первого прослушивания видно, какая именно строка не сработала, — и вы правите её одну, а не переписываете всё заново.
| Слой | Как формулировать | Что это меняет |
|---|---|---|
| Голос | женский альт, мужской баритон, высокий тенор, детский хор | Тембр и регистр — основа узнаваемости трека |
| Подача | шёпотом, надрывно, спокойно и ровно, речитативом, с придыханием | Эмоция куплета и контраст с припевом |
| Обработка | двойной дубль, бэк-вокал в терцию, лёгкий реверб, сухой вокал крупным планом | Насколько голос звучит студийно или «живьём» |
| Роль в треке | вокал только в припеве, куплеты речитативом, финал — хором | Где трек прибавляет, а где отступает |
Как задать структуру куплет-припев?
Секционными тегами — это самый недооценённый инструмент. По документации MiniMax к Music 3, модель понимает теги [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro], и каждый тег нужно ставить отдельной строкой: структуру задают именно они, а не смысл слов. Там же разработчик честно оговаривает, что теги и описание дают управление, а не гарантию — темп, тональность и структура могут отойти от запрошенных. Поэтому текст лучше отдавать сразу размеченным, повторяющийся припев вставлять тем же тегом ещё раз, а для чисто инструментальных кусков брать отдельные теги вроде [Instrumental] и [Solo].
Пример 3. Размеченный текст песни
[intro]
[verse]
Утро в окне, пустая кухня,
Чайник шумит, как будто спорит.
Я собираю этот город
По остывающим часам.
[pre-chorus]
Ещё минута — и поедем,
Ещё минута — и пора.
[chorus]
Мы ещё здесь, мы ещё дышим,
Мы ещё помним, как начать.
Пусть будет громче, пусть будет выше,
Пусть этот день нельзя догнать.
[bridge]
Тихо. Только гитара.
[chorus]
[outro]Фон и звуковые эффекты: другая логика описания
Для фоновой музыки многословное описание скорее мешает. Здесь работает короткий список тегов: жанр, темп, два-три конкретных инструмента, характер продакшена — примерно так и устроен приём у моделей вроде ace-step, где описание собирается из тегов стиля, темпа и инструментов. Слишком длинный список начинает спорить сам с собой. И отдельно просите ровную динамику, если под музыку ляжет голос. Эффекты описываются ещё конкретнее: не жанр, а источник звука, материал и акустика помещения.
Пример 4. Подложка под подкаст или обучающее видео
lo-fi hip-hop, спокойный, 80 BPM, электропиано, приглушённые барабаны, тёплый бас, лёгкий винтажный шум, без вокала, ровная громкость без резких пиков, зацикливаемый характерПример 5. Звуковой эффект
Двери старого грузового лифта закрываются: металлический лязг, короткий скрип направляющих, глухое эхо в бетонной шахте. Длительность 3 секунды, без музыки.Пять ошибок, из-за которых трек не получается
- Жанровый перегруз. Пять стилей в одной строке дают не гибрид, а кашу: модель мечется между ними и не выбирает ни один.
- Противоречивые параметры. «Агрессивно и умиротворённо» или «техно на 70 BPM» — просьба, которую нельзя исполнить целиком.
- Оценки вместо параметров. «Мощно», «цепляюще», «как у крутых артистов» — это про впечатление, а не про звук. Разложите на инструменты, темп и подачу.
- Текст без разметки. Без секционных тегов песня легко выходит сплошным полотном, где непонятно, где припев.
- Не указан язык. Напишите прямо «текст на русском» — иначе фонетика может уехать не туда.
Права и коммерческое использование
Главное, что стоит понимать: «royalty-free» и «разрешено коммерческое использование» — не синонимы. Первое про то, как платят, второе про то, что можно делать. Перед тем как ставить сгенерированный трек в рекламу, монетизируемое видео или клиентский проект, спокойно откройте условия конкретной модели и сверьте их со своей задачей. Это пять минут чтения, которые снимают почти все последующие вопросы.
- Разрешена ли коммерция явно — или условия говорят только про личное использование.
- Покрывают ли они монетизируемый контент: YouTube, платные размещения, рекламные кабинеты.
- Можно ли использовать результат в работе для третьих лиц — то есть в клиентских проектах агентства.
- Что делать, если трек зацепят автоматические системы определения контента на площадке.
- Не имитирует ли трек конкретного узнаваемого исполнителя — это отдельный риск, независимо от лицензии.
Как выбрать между инструментами
Специализированные музыкальные сервисы дают глубину внутри одной задачи: у Suno, по описанию самого сервиса, есть Custom-режим, где можно вставить собственный текст и разметить его тегами секций. Если музыка — ваше основное занятие и вы живёте в одном интерфейсе, отдельный музыкальный сервис логичен. Музыкальные модели в общей платформе закрывают другой сценарий: музыка здесь — один шаг в цепочке, где до неё был сценарий, а после будут видео и монтаж. Текст песни пишется в чате, трек генерируется в MediaLab, видео и озвучка собираются рядом и из одного баланса нейронов. Весь каталог — в разделе нейросети.
Между двумя песенными моделями выбор недорогой: они стоят одинаково и обе поют ваш текст. minimax/music-3 — третье поколение движка MiniMax, оно точнее держит заданный жанр и структуру куплет-припев, и его стоит брать, когда рамки жёсткие. fal-ai/minimax-music/v2.6 решает ту же задачу песни целиком. За 60 нейронов можно прогнать один текст через обе и оставить ту, что ближе к вашему звучанию.
Частые вопросы
Можно ли отдать модели свой готовый текст песни?
Да, это основной сценарий: fal-ai/minimax-music/v2.6 и minimax/music-3 поют именно ваш текст, а не сочиняют слова за вас. Разметьте его тегами секций, каждый тег отдельной строкой, и добавьте отдельным блоком описание жанра, темпа и вокала. Цена от этого не меняется — 30 нейронов за трек.
Сколько генераций закладывать на одну песню?
Считайте по числу дублей, которые хотите послушать: три генерации — 90 нейронов, четыре — 120. Если после четвёртой попытки результат всё ещё мимо, дело почти всегда не в модели, а в описании: чаще всего там жанровый перегруз, противоречивые параметры или текст без разметки.
Почему вокал коверкает отдельные русские слова?
Дикция — та часть, которую модели не обещают: разработчик MiniMax прямо предупреждает, что описание и теги дают управление, а не точное совпадение с запросом. Править дешевле не генерацию, а строку: заменить спотыкающееся слово на более короткое, разбить длинную строку на две и не ставить редкие термины в ударную позицию.
Что дешевле для 30-секундной подложки под рилс?
Посекундная модель. У fal-ai/ace-step/prompt-to-audio 30 секунд обойдутся в 1.2 нейрона, у sonilo/v1.1/text-to-music — в 15 нейронов. Песенные модели для такой задачи избыточны: вы заплатите 30 нейронов за трек целиком, а в монтаж возьмёте полминуты.




