Голос теперь не выбирают из списка — его описывают словами. Seed Audio 1.0 (0,62 нейрона за секунду) собирает голос по фразе вроде «усталый мужской голос, немного хриплый, говорит медленно», а sonilo/v1.1/text-to-sound-effects (0,36 нейрона за секунду) делает звуковые эффекты по такому же текстовому описанию: шаги по гравию, скрип двери, дождь по крыше, гул толпы. Минута озвучки обходится примерно в 37 нейронов, десятисекундный эффект — примерно в 4. Обе модели появились в каталоге 20 августа 2026 года, уровень доступа — STANDARD.

Две модели — две разные задачи

МодельЧто делаетЦенаУровень
bytedance/seed-audio-1.0Речь и голосовые сцены по текстовому описанию голоса0,62 нейрона / секундаSTANDARD
sonilo/v1.1/text-to-sound-effectsЗвуковые эффекты и атмосферу по описанию0,36 нейрона / секундаSTANDARD
Что выбрать под задачу

Разделение простое: всё, что кто-то произносит вслух, — это Seed Audio. Всё, что происходит вокруг говорящего, — Sonilo. В большинстве реальных проектов нужны обе: голос ведущего и гул зала, реплика героя и скрип половицы под ним.

Голос задаётся описанием — и это меняет всю работу

Привычный сценарий выглядит так: вы открываете список из сотни голосов, слушаете превью и берёте наименее неподходящий. Seed Audio 1.0 работает иначе — вы описываете голос словами, и модель собирает его под ваш текст. Возраст, тембр, темп, состояние, манера — это части описания, а не фильтры в каталоге. Поэтому результат зависит не от везения с пресетом, а от того, насколько точно вы сформулировали, кого и как хотите услышать.

Чем описание удобнее готового банка голосов?

Разница чувствуется с первой же сцены: описание правится так же свободно, как текст реплики, — и стоит эта правка ровно столько же, сколько новая генерация той же длины.

  • Голос подгоняется под сцену, а не сцена под голос: «сорок лет, устал, говорит тише обычного» — это состояние, которого в списке пресетов просто нет.
  • Один персонаж может звучать по-разному в разных сценах — достаточно поменять пару слов в описании, сохранив основу.
  • Правки формулируются человеческим языком: «то же самое, но медленнее и без бодрости в конце фразы».
  • Не нужно искать похожий голос среди чужих пресетов — вы описываете тот, что слышите у себя в голове.

Формула описания голоса

  1. Кто говорит: пол, примерный возраст, роль — «женский голос, 30–35 лет, рассказчик аудиокниги».
  2. Как звучит: тембр и текстура — тёплый, низкий, звонкий, чуть хриплый, с придыханием.
  3. В каком состоянии: устал, воодушевлён, сдерживает злость, говорит по секрету.
  4. Как подаёт: темп, паузы, интонация в конце фразы, дикция.
  5. Где записан: тихая комната, близкий микрофон, студия, улица — это добавляет ощущение реальной записи.
  6. Сам текст реплики — коротко, так, как говорят вслух, а не так, как пишут.

Диктор для промо-ролика

Мужской голос, 35–40 лет, тёплый низкий тембр, уверенная дикторская подача.
Говорит спокойно, средний темп, короткая пауза перед цифрами, без пафоса —
как закадровый голос в документальном фильме. Студийная запись, близкий микрофон.

Реплика: «Пять лет назад этой технологии не существовало.
Сегодня она помещается в кармане.»

Усталый герой, короткая реплика

Усталый мужской голос, около пятидесяти, немного хриплый, чуть севший к вечеру.
Говорит медленно, с тяжёлым выдохом перед фразой, будто после долгой смены.
Тихая комната, микрофон близко, слышно дыхание.

Реплика: «Ладно. Ещё один заход — и по домам.»

Аудиокнига: рассказчик и прямая речь

Рассказчик — женский голос, 30–35 лет, ровная аудиокнижная подача, чистая
артикуляция, тёплый средний тембр. Темп спокойный, эмоция сдержанная:
рассказчик знает финал и не спешит.

Прямая речь героини внутри абзаца — тот же голос, но напуганный: почти шёпот,
быстрый темп, обрывистые фразы.

Текст: Она досчитала до трёх и толкнула дверь. «Здесь никого. Слышишь? Никого.»

Диалог двух ведущих подкаста

Формат: студийный подкаст, лёгкая комнатная акустика, без музыки.

Ведущая А — женский голос, около 28, живой и любопытный, чуть ироничный,
быстрый темп, фразы налезают одна на другую.
Ведущий Б — мужской голос, около 45, спокойный, низкий, говорит с паузами,
не повышает тон.

А: «Ты правда думаешь, что это сработает?»
Б: «Я не думаю. Я проверил.»
Что задаёмСлабое описаниеРабочее описание
Возраст и пол«мужской голос»«мужской голос, 35–40 лет»
Тембр«приятный»«тёплый низкий, с лёгкой хрипотцой»
Эмоция«грустно»«сдерживает усталость, говорит тише обычного»
Темп«нормально»«медленно, длинные паузы между фразами»
Манера«красиво читает»«дикторская подача, без пафоса, как в документальном фильме»
Записьне указано«тихая комната, близкий микрофон, слышно дыхание»
Словарь описаний: слабо и сильно

Сколько деталей достаточно?

Односложный запрос вроде «мужской голос, прочитай текст» модель отработает ровно и безлико — ей просто не за что зацепиться. Обратный перегиб мешает не меньше: гирлянда из семи прилагательных подряд («бодрый, тёплый, дружелюбный, живой, естественный, энергичный, лёгкий») усредняет результат. Рабочая середина — два-три точных определения на каждый слой: кто говорит, как звучит, в каком состоянии. И если после генерации хочется что-то поправить, меняйте один слой за раз: так слышно, что именно сработало, а переписанное целиком описание даёт совершенно другой голос.

Звуковые эффекты: то же описание, только про мир вокруг

Sonilo закрывает то, чего обычно не хватает после монтажа: конкретный звук под конкретный кадр. Не «шаги вообще» из стоковой библиотеки, а восемь шагов тяжёлых ботинок по мокрому гравию — ровно столько, сколько нужно вашей сцене. Десять секунд эффекта стоят около 4 нейронов, так что перебрать три варианта дешевле и быстрее, чем полчаса охотиться по звуковым библиотекам ради двух секунд скрипа.

Из чего состоит рабочее описание эффекта?

Эффект описывается слоями, как и голос. Чем конкретнее материал и действие, тем меньше шансов получить абстрактный шум вместо нужного звука — и тем точнее совпадёт длительность, если написать её прямо в описании.

СлойЧто писатьПример
МатериалИз чего сделан источник звукамокрый гравий, сухое дерево, железная крыша
ДействиеЧто именно происходитвосемь шагов, дверь открывается на две трети
ХарактерСила, темп, текстураразмеренно, тяжело, ровно, без пиков
ПространствоГде это слышно и откудапустой подъезд, эхо двора, слушатель внутри помещения
ЧистотаЧего быть не должнобез музыки, без голосов, без ветра
Пять слоёв описания звука

Шаги по гравию

Шаги взрослого человека по мокрому гравию, тяжёлые ботинки, размеренный темп,
восемь шагов, близкая запись, лёгкое эхо двора.
Без музыки, без голосов, без посторонних звуков.

Скрип старой двери

Медленный скрип старой деревянной двери, сухие несмазанные петли.
Дверь открывается на две трети и останавливается, в конце — глухой удар о косяк.
Пустой холодный подъезд, естественная реверберация, ничего лишнего.

Дождь по крыше

Дождь по железной крыше мансарды, средней силы, ровный, без порывов ветра.
Слушатель находится внутри помещения. Редкие крупные капли по подоконнику,
дальний глухой раскат грома ближе к концу. Ровный фон, без нарастания.

Гул толпы на вокзале

Гул толпы в помещении вокзала, несколько десятков человек, неразборчивая речь,
редкий смех, шаги по кафелю. Вдалеке объявление по громкой связи —
без разборчивых слов. Ровный фон без пиков, пригоден для зацикливания.

Сколько это стоит

ЗадачаДлительностьМодельПримерно нейронов
Короткая реплика героя10 секSeed Audio 1.06
Закадровый текст для Reels30 секSeed Audio 1.019
Минута озвучки ролика60 секSeed Audio 1.037
Глава аудиокниги10 минSeed Audio 1.0≈ 372
Одиночный эффект (дверь, щелчок)5 секSonilo2
Эффект под сцену (шаги, дождь)10 секSonilo4
Фоновая атмосфера под эпизод60 секSonilo22
Стоимость типовых задач в нейронах

Как собрать сцену целиком

  1. Разложите сцену на слои: реплики отдельно, эффекты отдельно, фон отдельно. Полноценный микс одним запросом не собирают — собирают дорожками.
  2. Сначала голос: он задаёт ритм и длительность всей сцены. Под него потом подгоняется остальное.
  3. Затем точечные эффекты — шаги, дверь, стакан на столе. Каждый отдельным коротким запросом, чтобы можно было переставить его по таймлайну.
  4. Последним — фоновая атмосфера на всю длину эпизода: дождь, улица, гул помещения. Её проще один раз сгенерировать длинной.
  5. Сведите в монтажной программе: фон тише голоса, точечные эффекты — по кадрам. Именно на этом шаге сцена начинает звучать как запись, а не как набор файлов.
  6. Прослушайте целиком до самого хвоста: длинные вдохи в начале и лишние полсекунды в конце подрезаются за десять секунд, а слышны сразу.

Ошибки, из-за которых результат звучит дёшево

ОшибкаЧто слышноЧто делать
«Мужской голос, прочитай текст»Ровный безликий дикторДобавить возраст, тембр, состояние и темп
Семь прилагательных подрядГолос без характера, всё усредненоОставить два-три точных определения
Реплика написана как в документеРечь звучит зачитаннойПереписать так, как это говорят вслух
«Шаги»Случайные шаги не по вашей сценеУказать материал, обувь, темп и количество
Одна генерация и сразу в монтажОбрывы, лишние паузы, не тот тонСделать 2–3 варианта и выбрать лучший
Эффект и голос одним запросомСлои невозможно свести и подвинутьГенерировать дорожками и сводить самому
Весь материал одним кускомПроблемы с длиной и стыкамиРезать на фрагменты по сценам и абзацам
Что идёт не так и что делать

Частые вопросы

Как проверить, как модель звучит на вашем языке?

Дёшево и за минуту: сгенерируйте одну фразу на десять секунд — это около 6 нейронов — и послушайте, как звучат имена собственные, цифры и окончания слов. По короткому тесту сразу понятно, годится ли голос под ваш текст и не стоит ли переписать реплику проще. Ту же проверку удобно делать при смене описания: сравнивайте варианты на одной и той же фразе, тогда разница слышна честно.

Можно ли получить один и тот же голос в нескольких роликах?

Держите описание голоса как отдельный текстовый пресет и вставляйте его без изменений во все запросы серии — меняйте только реплику. Даже перестановка слов может слегка сдвинуть тембр, поэтому формулировку лучше не переписывать от ролика к ролику. Удобно завести файл с описаниями всех персонажей проекта и копировать оттуда.

Какой длины делать одну генерацию?

Режьте материал по сценам и абзацам, а не пытайтесь озвучить главу одним куском. Короткие фрагменты проще перегенерировать, если не понравилась одна фраза, и проще двигать по таймлайну. Платите вы за секунды звука, поэтому дробление ничего не удорожает: та же минута озвучки стоит около 37 нейронов, собрана она из одного куска или из шести.

Что выбрать, если в сцене есть и речь, и фон?

Для речи — Seed Audio 1.0, для шумов и атмосферы — Sonilo. Музыку эти две модели не делают, зато разделение дорожек даёт главное: любой слой можно перегенерировать отдельно, не трогая остальные, и свести громкости под себя. Если задача проще — прочитать вслух готовый текст без режиссуры, — загляните в гайд по озвучке текста в чате, там разобраны более простые сценарии.