Голос теперь не выбирают из списка — его описывают словами. Seed Audio 1.0 (0,62 нейрона за секунду) собирает голос по фразе вроде «усталый мужской голос, немного хриплый, говорит медленно», а sonilo/v1.1/text-to-sound-effects (0,36 нейрона за секунду) делает звуковые эффекты по такому же текстовому описанию: шаги по гравию, скрип двери, дождь по крыше, гул толпы. Минута озвучки обходится примерно в 37 нейронов, десятисекундный эффект — примерно в 4. Обе модели появились в каталоге 20 августа 2026 года, уровень доступа — STANDARD.
Две модели — две разные задачи
| Модель | Что делает | Цена | Уровень |
|---|---|---|---|
| bytedance/seed-audio-1.0 | Речь и голосовые сцены по текстовому описанию голоса | 0,62 нейрона / секунда | STANDARD |
| sonilo/v1.1/text-to-sound-effects | Звуковые эффекты и атмосферу по описанию | 0,36 нейрона / секунда | STANDARD |
Разделение простое: всё, что кто-то произносит вслух, — это Seed Audio. Всё, что происходит вокруг говорящего, — Sonilo. В большинстве реальных проектов нужны обе: голос ведущего и гул зала, реплика героя и скрип половицы под ним.
Голос задаётся описанием — и это меняет всю работу
Привычный сценарий выглядит так: вы открываете список из сотни голосов, слушаете превью и берёте наименее неподходящий. Seed Audio 1.0 работает иначе — вы описываете голос словами, и модель собирает его под ваш текст. Возраст, тембр, темп, состояние, манера — это части описания, а не фильтры в каталоге. Поэтому результат зависит не от везения с пресетом, а от того, насколько точно вы сформулировали, кого и как хотите услышать.
Чем описание удобнее готового банка голосов?
Разница чувствуется с первой же сцены: описание правится так же свободно, как текст реплики, — и стоит эта правка ровно столько же, сколько новая генерация той же длины.
- Голос подгоняется под сцену, а не сцена под голос: «сорок лет, устал, говорит тише обычного» — это состояние, которого в списке пресетов просто нет.
- Один персонаж может звучать по-разному в разных сценах — достаточно поменять пару слов в описании, сохранив основу.
- Правки формулируются человеческим языком: «то же самое, но медленнее и без бодрости в конце фразы».
- Не нужно искать похожий голос среди чужих пресетов — вы описываете тот, что слышите у себя в голове.
Формула описания голоса
- Кто говорит: пол, примерный возраст, роль — «женский голос, 30–35 лет, рассказчик аудиокниги».
- Как звучит: тембр и текстура — тёплый, низкий, звонкий, чуть хриплый, с придыханием.
- В каком состоянии: устал, воодушевлён, сдерживает злость, говорит по секрету.
- Как подаёт: темп, паузы, интонация в конце фразы, дикция.
- Где записан: тихая комната, близкий микрофон, студия, улица — это добавляет ощущение реальной записи.
- Сам текст реплики — коротко, так, как говорят вслух, а не так, как пишут.
Диктор для промо-ролика
Мужской голос, 35–40 лет, тёплый низкий тембр, уверенная дикторская подача.
Говорит спокойно, средний темп, короткая пауза перед цифрами, без пафоса —
как закадровый голос в документальном фильме. Студийная запись, близкий микрофон.
Реплика: «Пять лет назад этой технологии не существовало.
Сегодня она помещается в кармане.»Усталый герой, короткая реплика
Усталый мужской голос, около пятидесяти, немного хриплый, чуть севший к вечеру.
Говорит медленно, с тяжёлым выдохом перед фразой, будто после долгой смены.
Тихая комната, микрофон близко, слышно дыхание.
Реплика: «Ладно. Ещё один заход — и по домам.»Аудиокнига: рассказчик и прямая речь
Рассказчик — женский голос, 30–35 лет, ровная аудиокнижная подача, чистая
артикуляция, тёплый средний тембр. Темп спокойный, эмоция сдержанная:
рассказчик знает финал и не спешит.
Прямая речь героини внутри абзаца — тот же голос, но напуганный: почти шёпот,
быстрый темп, обрывистые фразы.
Текст: Она досчитала до трёх и толкнула дверь. «Здесь никого. Слышишь? Никого.»Диалог двух ведущих подкаста
Формат: студийный подкаст, лёгкая комнатная акустика, без музыки.
Ведущая А — женский голос, около 28, живой и любопытный, чуть ироничный,
быстрый темп, фразы налезают одна на другую.
Ведущий Б — мужской голос, около 45, спокойный, низкий, говорит с паузами,
не повышает тон.
А: «Ты правда думаешь, что это сработает?»
Б: «Я не думаю. Я проверил.»| Что задаём | Слабое описание | Рабочее описание |
|---|---|---|
| Возраст и пол | «мужской голос» | «мужской голос, 35–40 лет» |
| Тембр | «приятный» | «тёплый низкий, с лёгкой хрипотцой» |
| Эмоция | «грустно» | «сдерживает усталость, говорит тише обычного» |
| Темп | «нормально» | «медленно, длинные паузы между фразами» |
| Манера | «красиво читает» | «дикторская подача, без пафоса, как в документальном фильме» |
| Запись | не указано | «тихая комната, близкий микрофон, слышно дыхание» |
Сколько деталей достаточно?
Односложный запрос вроде «мужской голос, прочитай текст» модель отработает ровно и безлико — ей просто не за что зацепиться. Обратный перегиб мешает не меньше: гирлянда из семи прилагательных подряд («бодрый, тёплый, дружелюбный, живой, естественный, энергичный, лёгкий») усредняет результат. Рабочая середина — два-три точных определения на каждый слой: кто говорит, как звучит, в каком состоянии. И если после генерации хочется что-то поправить, меняйте один слой за раз: так слышно, что именно сработало, а переписанное целиком описание даёт совершенно другой голос.
Звуковые эффекты: то же описание, только про мир вокруг
Sonilo закрывает то, чего обычно не хватает после монтажа: конкретный звук под конкретный кадр. Не «шаги вообще» из стоковой библиотеки, а восемь шагов тяжёлых ботинок по мокрому гравию — ровно столько, сколько нужно вашей сцене. Десять секунд эффекта стоят около 4 нейронов, так что перебрать три варианта дешевле и быстрее, чем полчаса охотиться по звуковым библиотекам ради двух секунд скрипа.
Из чего состоит рабочее описание эффекта?
Эффект описывается слоями, как и голос. Чем конкретнее материал и действие, тем меньше шансов получить абстрактный шум вместо нужного звука — и тем точнее совпадёт длительность, если написать её прямо в описании.
| Слой | Что писать | Пример |
|---|---|---|
| Материал | Из чего сделан источник звука | мокрый гравий, сухое дерево, железная крыша |
| Действие | Что именно происходит | восемь шагов, дверь открывается на две трети |
| Характер | Сила, темп, текстура | размеренно, тяжело, ровно, без пиков |
| Пространство | Где это слышно и откуда | пустой подъезд, эхо двора, слушатель внутри помещения |
| Чистота | Чего быть не должно | без музыки, без голосов, без ветра |
Шаги по гравию
Шаги взрослого человека по мокрому гравию, тяжёлые ботинки, размеренный темп,
восемь шагов, близкая запись, лёгкое эхо двора.
Без музыки, без голосов, без посторонних звуков.Скрип старой двери
Медленный скрип старой деревянной двери, сухие несмазанные петли.
Дверь открывается на две трети и останавливается, в конце — глухой удар о косяк.
Пустой холодный подъезд, естественная реверберация, ничего лишнего.Дождь по крыше
Дождь по железной крыше мансарды, средней силы, ровный, без порывов ветра.
Слушатель находится внутри помещения. Редкие крупные капли по подоконнику,
дальний глухой раскат грома ближе к концу. Ровный фон, без нарастания.Гул толпы на вокзале
Гул толпы в помещении вокзала, несколько десятков человек, неразборчивая речь,
редкий смех, шаги по кафелю. Вдалеке объявление по громкой связи —
без разборчивых слов. Ровный фон без пиков, пригоден для зацикливания.Сколько это стоит
| Задача | Длительность | Модель | Примерно нейронов |
|---|---|---|---|
| Короткая реплика героя | 10 сек | Seed Audio 1.0 | 6 |
| Закадровый текст для Reels | 30 сек | Seed Audio 1.0 | 19 |
| Минута озвучки ролика | 60 сек | Seed Audio 1.0 | 37 |
| Глава аудиокниги | 10 мин | Seed Audio 1.0 | ≈ 372 |
| Одиночный эффект (дверь, щелчок) | 5 сек | Sonilo | 2 |
| Эффект под сцену (шаги, дождь) | 10 сек | Sonilo | 4 |
| Фоновая атмосфера под эпизод | 60 сек | Sonilo | 22 |
Как собрать сцену целиком
- Разложите сцену на слои: реплики отдельно, эффекты отдельно, фон отдельно. Полноценный микс одним запросом не собирают — собирают дорожками.
- Сначала голос: он задаёт ритм и длительность всей сцены. Под него потом подгоняется остальное.
- Затем точечные эффекты — шаги, дверь, стакан на столе. Каждый отдельным коротким запросом, чтобы можно было переставить его по таймлайну.
- Последним — фоновая атмосфера на всю длину эпизода: дождь, улица, гул помещения. Её проще один раз сгенерировать длинной.
- Сведите в монтажной программе: фон тише голоса, точечные эффекты — по кадрам. Именно на этом шаге сцена начинает звучать как запись, а не как набор файлов.
- Прослушайте целиком до самого хвоста: длинные вдохи в начале и лишние полсекунды в конце подрезаются за десять секунд, а слышны сразу.
Ошибки, из-за которых результат звучит дёшево
| Ошибка | Что слышно | Что делать |
|---|---|---|
| «Мужской голос, прочитай текст» | Ровный безликий диктор | Добавить возраст, тембр, состояние и темп |
| Семь прилагательных подряд | Голос без характера, всё усреднено | Оставить два-три точных определения |
| Реплика написана как в документе | Речь звучит зачитанной | Переписать так, как это говорят вслух |
| «Шаги» | Случайные шаги не по вашей сцене | Указать материал, обувь, темп и количество |
| Одна генерация и сразу в монтаж | Обрывы, лишние паузы, не тот тон | Сделать 2–3 варианта и выбрать лучший |
| Эффект и голос одним запросом | Слои невозможно свести и подвинуть | Генерировать дорожками и сводить самому |
| Весь материал одним куском | Проблемы с длиной и стыками | Резать на фрагменты по сценам и абзацам |
Частые вопросы
Как проверить, как модель звучит на вашем языке?
Дёшево и за минуту: сгенерируйте одну фразу на десять секунд — это около 6 нейронов — и послушайте, как звучат имена собственные, цифры и окончания слов. По короткому тесту сразу понятно, годится ли голос под ваш текст и не стоит ли переписать реплику проще. Ту же проверку удобно делать при смене описания: сравнивайте варианты на одной и той же фразе, тогда разница слышна честно.
Можно ли получить один и тот же голос в нескольких роликах?
Держите описание голоса как отдельный текстовый пресет и вставляйте его без изменений во все запросы серии — меняйте только реплику. Даже перестановка слов может слегка сдвинуть тембр, поэтому формулировку лучше не переписывать от ролика к ролику. Удобно завести файл с описаниями всех персонажей проекта и копировать оттуда.
Какой длины делать одну генерацию?
Режьте материал по сценам и абзацам, а не пытайтесь озвучить главу одним куском. Короткие фрагменты проще перегенерировать, если не понравилась одна фраза, и проще двигать по таймлайну. Платите вы за секунды звука, поэтому дробление ничего не удорожает: та же минута озвучки стоит около 37 нейронов, собрана она из одного куска или из шести.
Что выбрать, если в сцене есть и речь, и фон?
Для речи — Seed Audio 1.0, для шумов и атмосферы — Sonilo. Музыку эти две модели не делают, зато разделение дорожек даёт главное: любой слой можно перегенерировать отдельно, не трогая остальные, и свести громкости под себя. Если задача проще — прочитать вслух готовый текст без режиссуры, — загляните в гайд по озвучке текста в чате, там разобраны более простые сценарии.


