Чтобы получить нужную подачу, голос описывают словами — как персонажа, а не как настройку в списке. В модели bytedance/seed-audio-1.0 нет каталога готовых дикторов: вы пишете, кто говорит, с какой скоростью, с каким настроением и в каком помещении, и модель отыгрывает это описание. Удобно собирать описание из четырёх слоёв — тембр и возраст, темп и подача, эмоция, акустика и обработка. Секунда озвучки стоит 0.62 нейрона, минута — около 37 нейронов.
Четыре слоя описания голоса
| Слой | Что задаёт | Что писать | Что бывает, если пропустить |
|---|---|---|---|
| Тембр и возраст | Кто говорит | Пол, возраст, высота, плотность, придыхание, хрипотца, особенность речи | Нейтральный взрослый голос по умолчанию — узнаваемости мало |
| Темп и подача | Как говорит | Скорость, длина и место пауз, ровность, манера: читает, рассказывает, объявляет | Одинаковое среднее чтение и для рекламы, и для сказки |
| Эмоция | С каким настроением | Состояние и его причина: тёплое участие, сдержанная гордость, усталая ирония | Плоская интонация — тот самый «голос навигатора» |
| Акустика и обработка | Где записано | Студия, комната, зал, улица, рация, телефонная линия, расстояние до микрофона | Стерильная студийная дорожка, которая не ложится в сцену |
Слои можно перечислять в любом порядке — важнее плотность, а не последовательность. Практика простая: одно предложение на слой. Пропущенный слой модель достраивает сама, и обычно в сторону усреднённого диктора — поэтому «энергичный женский голос» и «строгий мужской голос» так часто дают безликий результат.
Насколько подробным должно быть описание?
Подробнее, чем кажется разумным. Сравните: «весёлый женский голос» — и «женский голос около тридцати, светлый и высокий, говорит неспешно, с игровыми паузами перед важными словами, с тёплым озорством, записано в маленькой уютной комнате близко к микрофону». Первое даёт лотерею, второе заметно повышает шанс попасть в нужную подачу с первого-второго дубля. При этом не надо превращать описание в сочинение: четыре плотных предложения обычно работают лучше, чем десять рыхлых.
Как задать темп и паузы?
Темп задают не одним словом, а скоростью и правилом пауз сразу. Плюс часть работы делает сам читаемый текст: длина фраз и знаки препинания влияют на дыхание не меньше, чем описание голоса.
- Называйте скорость словами и ориентиром сразу: «неспешно, около 130 слов в минуту».
- Отдельно проговаривайте правило пауз: «пауза после каждого вопроса», «дышит между абзацами», «тяжёлая пауза перед последним словом».
- Пунктуация в читаемом тексте работает как разметка: точка задаёт паузу длиннее, чем запятая. Спорную запятую честнее заменить точкой.
- Режьте длинные предложения — длинная фраза ломает дыхание даже при удачном описании голоса.
- Ударение в редких словах, фамилиях и терминах можно подсказать заглавным ударным слогом: «договОр», «мАркетинг». Проверьте на коротком фрагменте, помогло ли.
- Аббревиатуры и числа, где важна точность, расписывайте словами прямо в тексте.
Как описать эмоцию и не переиграть?
Называйте не силу, а состояние и его причину. «Очень эмоционально» часто превращается в театр, а «спокойное участие, будто объясняет близкому человеку» — в живую речь. Второе правило: эмоция должна совпадать с текстом. Азартный рекламный диктор на аккуратном юридическом абзаце звучит фальшиво, и описанием это обычно не лечится — проще переписать текст разговорнее. И проверяйте подачу на паре предложений, прежде чем запускать весь сценарий.
Готовые описания голоса под задачу
Каждое описание ниже собрано по четырём слоям, поэтому править их можно точечно: смените возраст — сдвинется тембр, смените акустику — та же подача ляжет в другую сцену. Описание идёт отдельно от текста, который нужно прочитать: текст подставляете свой.
Реклама: энергичный диктор
Мужской голос 30–35 лет, средне-низкий, плотный, с лёгкой улыбкой в тембре. Говорит быстро и упруго, без пауз внутри фраз, к концу реплики чуть подгоняет ритм. Настроение — уверенный азарт, будто делится хорошей новостью, но не кричит. Акустика: сухая рекламная студия, микрофон близко, голос крупный, без эха.Премиальный бренд: сдержанный диктор
Мужской голос 40–45 лет, низкий, бархатный, с мягким придыханием на окончаниях. Темп медленный, длинные паузы между предложениями, каждое слово договаривает до конца. Настроение — спокойное достоинство, ни грамма напора. Акустика: заглушённая студия, тёплый ближний микрофон, мягкая ровная громкость.Аудиокнига: нон-фикшн
Женский голос 35–40 лет, средней высоты, ровный, с ясной дикцией и без вокальных украшений. Темп размеренный, около 140 слов в минуту, короткая пауза после каждой мысли и подлиннее между абзацами. Настроение — доброжелательный интерес человека, которому тема действительно нравится. Акустика: тихая домашняя студия, почти нет реверберации, дыхание слышно, но не мешает.Аудиокнига: художественная проза, вечернее чтение
Мужской голос 50–55 лет, низкий, чуть шершавый, с возрастной теплотой. Читает неторопливо, держит длинные паузы на абзацах, слегка меняет высоту на прямой речи персонажей, но не изображает их. Настроение — спокойная задумчивость, будто вспоминает. Акустика: небольшая комната с мягкой мебелью, короткий естественный отзвук.Детская сказка
Женский голос около 30 лет, светлый, высокий, с округлым мягким тембром. Темп неспешный, игровые паузы перед важными словами, интонация заметно уходит вверх на вопросах. Настроение — тёплое озорство, будто рассказывает у кровати и сама улыбается. Акустика: маленькая уютная комната, ближний микрофон, никакого эха.Служба поддержки: живой оператор
Женский голос 28–33 лет, средней высоты, тёплый и чистый, без напевности. Темп чуть медленнее обычного, короткие ясные фразы, пауза после каждого вопроса, чтобы собеседник успел ответить. Настроение — спокойное участие: слышно, что человек не спешит и готов помочь. Акустика: офисный колл-центр, гарнитура, узкая телефонная полоса, едва слышный фон помещения.Голосовое меню и уведомления приложения
Женский голос около 30 лет, нейтральный, ровный, без личных красок. Темп размеренный и одинаковый от фразы к фразе, чёткая пауза перед цифрами и после каждого пункта меню. Настроение — дружелюбная нейтральность без эмоциональных всплесков. Акустика: сухая студия, обработанный телефонный канал, голос слегка сжат по частотам.Экскурсовод в музее
Мужской голос 45–50 лет, средне-низкий, с ясной артикуляцией и лёгкой преподавательской напевностью. Темп неспешный, паузы после дат и имён, ключевые слова выделяет силой, а не громкостью. Настроение — увлечённость человека, который рассказывает это в сотый раз и всё ещё любит. Акустика: просторный зал с высоким потолком, небольшой естественный отзвук, голос чуть отдалён.Подкаст: ведущий выпуска
Мужской голос 33–38 лет, средний по высоте, чуть хрипловатый, с разговорной небрежностью. Темп живой, речь идёт волнами: разгоняется на интересном, притормаживает на выводах, есть короткие вдохи и слова-связки. Настроение — расслабленный интерес, говорит как с другом за столом. Акустика: небольшая заглушённая комната, крупный ближний микрофон, слышна близость к мембране.Игра: суровый страж
Мужской голос около 50 лет, очень низкий, грудной, с песком и хрипотцой. Говорит медленно, короткими рублеными фразами, тяжёлая пауза перед последним словом. Настроение — усталая угроза без крика: человек уверен, что его послушают. Акустика: каменный зал у ворот крепости, холодный отзвук, голос слегка отдалён и обрамлён эхом.Игра: ехидный торговец
Мужской голос 40–45 лет, средний, гнусавый, с шершавыми окончаниями. Темп быстрый и скользкий, фразы налезают друг на друга, интонация постоянно уходит вверх, будто он всё время что-то предлагает. Настроение — приторная доброжелательность, за которой слышен расчёт. Акустика: тесная лавка с деревянными стенами, короткая близкая реверберация, вдали едва слышен рынок.Обучающий ролик и скринкаст
Мужской голос 30–35 лет, средней высоты, ясный, без дикторского пафоса. Темп спокойный, обязательная пауза после каждого шага инструкции, ключевые действия произносит чуть медленнее и отчётливее. Настроение — доброжелательная собранность наставника, который заранее знает, где вы споткнётесь. Акустика: сухая домашняя студия, ближний микрофон, никакого эха, ровная громкость.Объявление в транспорте
Женский голос 35–40 лет, средне-низкий, собранный, с очень чёткой дикцией. Темп ровный и одинаковый на всех фразах, отчётливая пауза между названием остановки и предупреждением. Настроение — спокойная официальность, без всякой эмоции. Акустика: вагонная громкая связь, узкая полоса частот, лёгкая жестяная окраска и короткое эхо салона.Трейлер и анонс
Мужской голос 40–45 лет, очень низкий, плотный, с грудным резонансом. Говорит медленно, между фразами длинные тяжёлые паузы, к финалу наращивает силу и опускает высоту. Настроение — сдержанное напряжение, которое в последней фразе переходит в обещание. Акустика: большая студия, широкий объём вокруг голоса, ощущение пространства.Медитация и чтение перед сном
Женский голос около 35 лет, низкий для женского, мягкий, с заметным придыханием. Темп очень медленный, длинные паузы между фразами, громкость почти на уровне шёпота, окончания слов растворяются. Настроение — ровное спокойствие без единого всплеска. Акустика: тихая комната, микрофон очень близко, слышно дыхание, фон полностью чистый.Что делать, если подача не та
| Что слышно | Какого слоя не хватает | Что дописать в описание |
|---|---|---|
| Ровно, как навигатор | Эмоции | Состояние и его причину: «тёплое участие, будто объясняет близкому человеку» |
| Тараторит или тянет | Темпа и пауз | Скорость и правило пауз: «около 130 слов в минуту, пауза после каждого вопроса» |
| Голос красивый, но не в сцене | Акустики | Помещение и канал: «вагонная громкая связь», «каменный зал», «телефонная линия» |
| Каждый дубль звучит по-новому | Конкретики в тембре | Возраст, высоту, плотность и одну особенность: «низкий, грудной, с лёгкой хрипотцой» |
| Переигрывает, звучит театрально | Меры | Снять усилители: вместо «очень эмоционально» — «сдержанно, почти не повышая голос» |
| Спотыкается на терминах и ударениях | Подсказок в самом тексте | Ударный слог заглавными, аббревиатуры и числа расписать словами |
- Тестируйте на паре предложений, а не на всём сценарии — так дешевле ловить промахи.
- Держите описание обычным текстом: эмодзи и лишняя разметка описанию голоса ничего не добавляют.
- Не спасайте канцелярит интонацией — «осуществить настройку» проще переписать как «настроить».
- Храните описание голоса в отдельном файле проекта и подставляйте слово в слово: так меньше шансов, что голос разъедется между сериями. Полной идентичности между запусками модель не гарантирует.
- Меняйте по одному слою за раз. Правка сразу всех четырёх превращает подбор в лотерею.
Сколько это стоит
| Модель | Что делает | Цена | Уровень |
|---|---|---|---|
| bytedance/seed-audio-1.0 | Речь по текстовому описанию голоса | 0.62 нейрона за секунду — минута около 37 нейронов | STANDARD |
| sonilo/v1.1/text-to-sound-effects | Звуковые эффекты и фоны по описанию | 0.36 нейрона за секунду | STANDARD |
Фон под озвучку: звуковой эффект
Тихий фон читального зала: приглушённые шаги по паркету вдалеке, редкий шелест страниц, ровный низкий гул вентиляции, без голосов и без музыки, ровная громкость на всю длительность.Частые вопросы
Как получить один и тот же голос в разных выпусках?
Сохраните описание как шаблон и используйте его слово в слово. Любая правка формулировки — это правка голоса, даже замена «низкий» на «глубокий». Для сериала, курса или серии роликов заведите один текст описания и меняйте только читаемый текст. Небольшие расхождения между дублями всё равно возможны, поэтому ключевые фрагменты лучше озвучивать подряд, одним заходом. Готовые описания удобно хранить рядом с проектом в чате, чтобы не собирать их заново.
Сколько стоит озвучить ролик на пять минут?
Пять минут — это 300 секунд, то есть 186 нейронов по цене 0.62 нейрона за секунду. К этому стоит заложить черновые дубли: несколько коротких тестов по паре секунд, пока описание не попадёт в цель. Считать заранее удобно по минуте — около 37 нейронов.
На каком тарифе доступны модели звука?
Обе модели — bytedance/seed-audio-1.0 и sonilo/v1.1/text-to-sound-effects — относятся к уровню STANDARD. Какие тарифы включают этот уровень, смотрите на странице тарифов: там состав уровней всегда актуальный. Запустить генерацию можно в MediaLab на my.suin.ai.
Чем описание голоса лучше выбора готового диктора?
Готовый диктор — это фиксированный голос: он либо подходит проекту, либо нет, и подогнать его почти нечем. Описание — конструктор: вы правите его по одному слою, пока подача не совпадёт с задачей, и можете собрать голос под конкретную сцену, а не выбирать ближайший из каталога. Плата за это — дисциплина: описание нужно хранить, иначе повторить голос будет нечем.
Куда дальше: Звуковые эффекты и озвучка нейросетью · Генерация музыки нейросетью · Каталог нейросетей · Тарифы




