Хороший промпт для музыки — это семь слоёв в одной фразе: жанр, темп в BPM, два-три инструмента, настроение со сценой, структура, прямая пометка про вокал и характер записи. Эти слои закрывают ровно то, что модель иначе додумает за вас. На платформе СуперИнтеллект песня целиком с вокалом стоит 30 нейронов за трек, фоновая музыка нужной длины — 0.5 нейрона за секунду, а самый экономный инструментал обходится в 0.04 нейрона за секунду: минута ≈ 2.4 нейрона. Ниже — 16 готовых промптов под конкретные рабочие задачи, каждый с моделью и ценой.

Из чего состоит промпт для музыки

  • Жанр и поджанр. Не «электронная музыка», а «фьючер-хаус» или «даунтемпо». Поджанр сразу задаёт ритмику и набор тембров.
  • Темп. Число в BPM, хотя бы примерное: «около 90 BPM». Без него темп выбирает модель.
  • Инструменты. Два-три, с характером: «приглушённое пианино Rhodes», «пилообразный синт-лид». Один инструмент звучит пусто, семь смешиваются в кашу.
  • Настроение плюс сцена. «Меланхолично» — слабо. «Меланхолично, как разговор на прощание» — у модели появляется система координат для мелодии и гармонии.
  • Структура. Куда идёт трек: где нарастание, где кульминация, где тишина, чем заканчивается.
  • Вокал. Либо «инструментал, без вокала», либо тип голоса, язык и подача. Промолчать — значит отдать решение модели.
  • Референс по звучанию. Не имена артистов, а характер записи: «тёплая ламповая запись», «сухо и близко», «широкое пространство с длинным ревербом».
СлойЧто решаетПример формулировки
ЖанрРитмику и набор тембровЛоу-фай хип-хоп, босанова, синтвейв
ТемпЭнергию и монтажный шаг82 BPM, около 126 BPM
ИнструментыУзнаваемость звучанияЭлектропиано и щётки по малому барабану
Настроение + сценаМелодию и гармониюУютное утро в кофейне
СтруктураРазвитие и финалТихое начало, три ступени нарастания, резкий финал
ВокалНаличие и характер голосаИнструментал, без вокала / женский вокал с хрипотцой
Референс по звучаниюОбработку и пространствоТёплая запись на ленту, без резких верхов
Каркас промпта: что писать в каждом слоте

Промпт в несколько строк удобнее и слишком короткого, и очень длинного: в первом случае модель дополняет описание сама, во втором размывается акцент. Жанр и темп ставьте в начало. Чаще всего мешают три вещи. Первая — противоречия вроде «расслабляющий агрессивный трек»: модель мечется между двумя направлениями и не попадает никуда. Вторая — пропущенный темп. Третья — забытая пометка про вокал, из-за которой под закадровым голосом внезапно поёт кто-то ещё. И правило итерации: не переписывайте промпт целиком, меняйте по одному параметру за раз — так видно, что именно повлияло.

ЗадачаМодельЦенаПример расчёта
Песня целиком: музыка, аранжировка, вокалfal-ai/minimax-music/v2.630 нейронов за трек30 нейронов за генерацию
Песня со строгой структурой куплет-припевminimax/music-330 нейронов за трек30 нейронов за генерацию
Длинный инструментал, черновики, перебор вариантовfal-ai/ace-step/prompt-to-audio0.04 нейрона за секундуМинута ≈ 2.4 нейрона
Фоновая музыка точной длиныsonilo/v1.1/text-to-music0.5 нейрона за секунду30 секунд = 15 нейронов
Звуковые эффекты и атмосферыsonilo/v1.1/text-to-sound-effects0.36 нейрона за секунду5 секунд = 1.8 нейрона
Задача → модель → цена (все пять моделей — уровень STANDARD)

Промпты для рилс и коротких видео

Уютная подложка под вертикальное видео, 15 секунд — sonilo/v1.1/text-to-music, ≈ 7.5 нейрона

Инструментальный лоу-фай хип-хоп луп, 82 BPM. Приглушённое пианино Rhodes, мягкий пыльный брейк, лёгкий виниловый шум, тёплый бас без напора. Настроение — уютное утро в кофейне. Хук в первые две секунды, ровная громкость, без нарастаний и пауз, начало и конец сшиваются в петлю. Без вокала.

Динамичный трек под быстрый монтаж, 30 секунд — fal-ai/ace-step/prompt-to-audio, ≈ 1.2 нейрона

Энергичный фьючер-хаус, 126 BPM. Плотная бочка на четыре доли, яркий пилообразный синт-лид, короткие вокальные чопы без слов, звонкие хлопки. Настроение — уверенный старт дня. Начинается сразу с бита, без вступления. Акцент-удар каждые четыре такта под смену кадра, в середине пауза на полтакта. Инструментал.

Нейтральный фон под говорящую голову, 45 секунд — sonilo/v1.1/text-to-music, ≈ 22.5 нейрона

Спокойный амбиент-фон под речь, 80 BPM. Мягкое электропиано и тихие струнные подушки, лёгкая шейкер-перкуссия, без ударных с резкой атакой. Настроение — сосредоточенное и нейтральное. Ровная громкость от начала до конца, без нарастаний и кульминаций, средние частоты приглушены, чтобы не спорить с голосом. Инструментал.

Логика выбора здесь простая. Когда нужна ровно та длина, что стоит на таймлайне, берите sonilo/v1.1/text-to-music по 0.5 нейрона за секунду и не режьте потом хвост. Когда вы перебираете идеи и вам нужно десять черновиков подряд — fal-ai/ace-step/prompt-to-audio по 0.04 нейрона за секунду: десять тридцатисекундных вариантов обойдутся примерно в 12 нейронов. Для рилс важны два слова: «луп» и «хук в первые две секунды» — без них трек начинается с раскачки.

Промпты для подкастов и роликов с голосом

Заставка делового подкаста, 20 секунд — sonilo/v1.1/text-to-music, ≈ 10 нейронов

Заставка для делового подкаста, 20 секунд, 104 BPM. Уверенный пружинистый бас, ритмичная акустическая гитара, лёгкие щётки по малому барабану, одна яркая нота маримбы как звуковой логотип. Настроение — собранное и дружелюбное. Структура: два такта нарастания, восемь тактов основной темы, финальный аккорд с затуханием. Инструментал.

Фон под закадровый голос, 2 минуты — fal-ai/ace-step/prompt-to-audio, ≈ 4.8 нейрона

Фон под закадровый голос в документальном ролике, 72 BPM. Арпеджио на пианино, длинные струнные, редкие удары низкого барабана. Настроение — сдержанное уважение и лёгкая надежда. Развитие очень медленное: первая минута почти без движения, дальше добавляются струнные. Без резких переходов, без соло, без вокала.

Отбивка между рубриками, 6 секунд — sonilo/v1.1/text-to-music, ≈ 3 нейрона

Короткая отбивка между рубриками, 6 секунд, 120 BPM. Восходящий пассаж маримбы, один мягкий удар по тарелке, тёплый синтезаторный аккорд в конце. Настроение — приветливое, без пафоса. Структура: подъём, акцент, короткое затухание. Заканчивается ровно на сильной доле. Инструментал.

Под речь работает отдельное правило: музыка не должна жить в том же частотном диапазоне, что голос. Фраза «средние частоты приглушены, чтобы не спорить с голосом» снимает часть последующей работы эквалайзером. И ещё: под длинную начитку просите «развитие очень медленное» — иначе кульминация может прийтись ровно на важный тезис. Для сорокаминутного подкаста дешевле собрать двухминутный луп на fal-ai/ace-step/prompt-to-audio и зациклить его на монтаже.

Промпты для бренда и рекламы

Джингл бренда, 15 секунд — sonilo/v1.1/text-to-music, ≈ 7.5 нейрона

Джингл для бренда, 15 секунд, 118 BPM. Яркое пиццикато струнных, звонкий глокеншпиль, лёгкий поп-бит с хлопками. Настроение — свежее и приветливое. Структура: четыре такта простой мелодии из пяти нот, повтор той же мелодии на октаву выше, финальный аккорд. Мелодия простая, легко запоминающаяся. Инструментал.

Музыка для корпоративного ролика, 90 секунд — fal-ai/ace-step/prompt-to-audio, ≈ 3.6 нейрона

Музыка для корпоративного ролика, 110 BPM. Светлая акустическая гитара, тёплое пианино, мягкая перкуссия, ненавязчивый бас. Настроение — спокойная уверенность команды, которая делает свою работу. Структура: сдержанное начало, вход ударных на тридцатой секунде, лёгкая кульминация ближе к концу, спокойный выход. Инструментал.

Для джингла ключевые строки — «мелодия из пяти нот» и «повтор на октаву выше». Бренду нужна короткая узнаваемая фраза, которую можно повторять годами, поэтому её форму лучше задать явно — числом нот и характером повтора. Если с первого раза мелодия вышла слишком витиеватой, поменяйте только одно: «мелодия из трёх нот». Пятнадцать секунд стоят 7.5 нейрона, так что шесть подходов до нужного варианта — это 45 нейронов.

Промпты под конкретные жанры

Синтвейв, 3 минуты — fal-ai/ace-step/prompt-to-audio, ≈ 7.2 нейрона

Синтвейв, 100 BPM. Пульсирующий аналоговый бас-арпеджиатор, широкий хоровой пэд, электронный малый барабан с длинным ревербом, соло на синтезаторе в духе восьмидесятых. Настроение — ночная дорога, неон, лёгкая ностальгия. Структура: вступление на пэде, вход бита, основная тема, соло, спад. Инструментал.

Кинематографичный трейлерный фрагмент, 40 секунд — sonilo/v1.1/text-to-music, ≈ 20 нейронов

Кинематографичный трейлерный фрагмент, 40 секунд, 90 BPM. Низкие струнные стаккато, ударные тайко, металлические удары, хор без слов на кульминации. Настроение — растущая угроза, которая срывается в решимость. Структура: тихое начало, три ступени нарастания, пауза на две секунды, мощный финальный удар. Инструментал.

Босанова для фонового зала, 4 минуты — fal-ai/ace-step/prompt-to-audio, ≈ 9.6 нейрона

Босанова, 96 BPM. Нейлоновая гитара с мягким свингом, контрабас, щётки по малому барабану, редкая приглушённая труба. Настроение — вечер на веранде, неспешный разговор. Развитие ровное, без кульминаций, партии повторяются с небольшими вариациями. Звучание тёплое, как запись на ленту. Инструментал.

Жанровые треки — как раз случай, где удобно начинать с fal-ai/ace-step/prompt-to-audio: минута за 2.4 нейрона позволяет спокойно сравнить пять трактовок одного жанра и только потом переносить победивший промпт на модель подороже. И не пропускайте пометки о характере записи — «тёплое звучание, как на ленту», «длинный реверб»: обработка и пространство слышны в результате сразу.

Песня с вокалом по своему тексту

Поп-баллада с вашим текстом — fal-ai/minimax-music/v2.6, 30 нейронов за трек

Поп-баллада, 76 BPM, женский вокал с лёгкой хрипотцой, спокойная подача, русский язык. Пианино, струнные, мягкая бочка со второго куплета. Настроение — тихая благодарность человеку, который был рядом в трудный год.
Структура: куплет — припев — куплет — припев — бридж — финальный припев.
Текст:
[вставьте свой текст, размечая строки по частям: куплет, припев, бридж]

Инди-рок со строгой структурой — minimax/music-3, 30 нейронов за трек

Инди-рок, 128 BPM, мужской вокал среднего тембра, чуть небрежная подача, русский язык. Звенящая электрогитара, плотный бас, живые барабаны.
Структура строго: интро 4 такта — куплет 16 тактов — припев 8 — куплет 16 — припев 8 — гитарный бридж 8 без вокала — припев 8 — кода 4.
Припев громче и плотнее куплета.
Текст: [ваш текст]

Обе модели стоят одинаково — 30 нейронов за трек — но ведут себя по-разному. fal-ai/minimax-music/v2.6 отдаёт песню целиком: музыку, аранжировку и вокал, и подходит, когда точная форма не критична. minimax/music-3 точнее держит жанр и структуру куплет-припев, поэтому берите её, когда у вас готовый текст с фиксированным числом строк и припев должен встать туда, куда задумано. Размечайте текст по частям прямо в промпте. Подробный разбор — в гайде Песня с вокалом нейросетью.

Игры, интерфейсы и атмосфера

Звук подтверждения в приложении, 3 секунды — sonilo/v1.1/text-to-sound-effects, ≈ 1.08 нейрона

Короткий звук подтверждения для мобильного приложения: мягкий синтетический клик, за ним чистый колокольчик, восходящая интонация из двух нот, тёплый тембр без металлического призвука. Быстрая атака, короткий хвост, без реверберации и без фонового шума.

Атмосфера помещения, 10 секунд — sonilo/v1.1/text-to-sound-effects, ≈ 3.6 нейрона

Атмосфера полупустого читального зала: приглушённый гул вентиляции, редкий шелест страниц, далёкие шаги по паркету, едва слышный скрип стула. Пространство большое, с лёгким естественным эхом. Без музыки, без разборчивой речи, без резких событий — ровный фон, пригодный для зацикливания.

Луп для главного меню игры, 2 минуты — fal-ai/ace-step/prompt-to-audio, ≈ 4.8 нейрона

Луп для главного меню игры, 84 BPM. Медленное арпеджио на челесте, низкий гудящий пэд, редкий удар в глубоком барабане, шум ветра на фоне. Настроение — ожидание перед долгим путешествием. Ровная динамика без кульминаций, тема повторяется каждые восемь тактов, конец переходит в начало без слышимого шва. Инструментал.

Для звуковых эффектов работает другая грамматика, чем для музыки: вместо жанра и темпа — материал, размер помещения и форма огибающей. «Быстрая атака, короткий хвост» и «без реверберации» дают чистый интерфейсный звук, а «большое пространство с естественным эхом» — комнатную атмосферу. На 0.36 нейрона за секунду набор из двадцати трёхсекундных элементов обойдётся в ≈ 21.6 нейрона. Отдельный разбор — в гайде Звуковые эффекты и озвучка нейросетью.

Частые вопросы

Почему модель выдаёт совсем не то, что я описал?

Начните с трёх проверок. В промпте может быть противоречие — «расслабляющий агрессивный трек», и модель разрывается пополам. Может быть не указан темп, а слово «медленно» в лоу-фае и в оркестровой музыке означает разные вещи. Или забыта пометка «инструментал» — тогда голос появляется просто потому, что так принято в жанре. Пройдите эти три пункта до того, как переписывать промпт целиком.

Сколько стоит перебрать десять вариантов трека?

Зависит от модели. На fal-ai/ace-step/prompt-to-audio десять черновиков по 30 секунд — это около 12 нейронов, поэтому черновой перебор логично делать именно там. На sonilo/v1.1/text-to-music те же десять тридцатисекундных вариантов стоят 150 нейронов. Песня с вокалом — 30 нейронов за трек, десять попыток — 300. Рабочая схема: ищем звучание на дешёвой модели, финальную версию делаем на той, что нужна по задаче.

Как получить трек ровно нужной длины?

Через посекундные модели. sonilo/v1.1/text-to-music тарифицируется по 0.5 нейрона за секунду, поэтому вы заказываете столько, сколько стоит на таймлайне: 15 секунд — 7.5 нейрона, 45 секунд — 22.5. Для длинных фонов дешевле сгенерировать двухминутный луп на fal-ai/ace-step/prompt-to-audio и зациклить его при монтаже, добавив в промпт строку про бесшовный переход конца в начало.

На каком уровне доступны музыкальные модели?

Все пять музыкальных моделей относятся к уровню доступа STANDARD: fal-ai/minimax-music/v2.6, minimax/music-3, fal-ai/ace-step/prompt-to-audio, sonilo/v1.1/text-to-music и sonilo/v1.1/text-to-sound-effects — они добавлены 20 августа 2026 года. Списание идёт нейронами по расценкам из таблицы выше. Актуальные условия смотрите на странице тарифов, а начать генерацию можно в MediaLab на my.suin.ai.