Часовая запись превращается в готовый текст за 72 нейрона — а если взять модель с фиксированной ценой, то за 4 нейрона независимо от длины. На СуперИнтеллекте расшифровкой занимаются четыре модели: Scribe v2 и Cohere Transcribe считаются посекундно, по 0,02 нейрона за секунду, а Wizper и Nemotron ASR берут ровно 4 нейрона за запуск. Десять минут созвона у посекундных моделей стоят 12 нейронов, полчаса — 36. И главное: все четыре работают на уровне BASIC, то есть доступны на любом тарифе, включая бесплатный.
Какую модель брать под вашу задачу
| Задача | Модель | Цена | Почему именно она |
|---|---|---|---|
| Созвон или интервью с несколькими участниками | Scribe v2 | 0,02 нейрона/сек | Единственная из четырёх различает говорящих и размечает реплики по ролям — не придётся вспоминать, кто что сказал |
| Диктофонная запись на русском | Scribe v2 | 0,02 нейрона/сек | Самая точная на русском, сразу расставляет знаки препинания |
| Двухчасовая лекция или подкаст | Wizper | 4 нейрона за запуск | Цена не зависит от длины, а обработка идёт вдвое быстрее обычного Whisper v3 Large |
| Монолог, надиктовка, лекция одного спикера | Cohere Transcribe | 0,02 нейрона/сек | Та же цена, что у Scribe v2, и аккуратная пунктуация — когда роли не нужны |
| Смешанные языки или сбой автоопределения | Nemotron ASR | 4 нейрона за запуск | Язык задаётся вручную — модель не гадает и не срывается на чужую раскладку |
| Много коротких файлов подряд | Scribe v2 или Cohere Transcribe | 0,02 нейрона/сек | Минута записи — 1,2 нейрона: на коротких фрагментах посекундная оплата дешевле фиксированной |
Сколько стоит расшифровка: считаем в нейронах
Посекундные модели тарифицируются честно по длине аудио: 0,02 нейрона за каждую секунду. Модели с ценой за запуск списывают 4 нейрона и на длительность не смотрят вовсе. Это две разные экономики, и между ними есть точка перелома.
| Длительность | Секунд | Scribe v2 / Cohere Transcribe | Wizper / Nemotron ASR |
|---|---|---|---|
| 1 минута | 60 | 1,2 | 4 |
| 5 минут | 300 | 6 | 4 |
| 10 минут | 600 | 12 | 4 |
| 30 минут | 1800 | 36 | 4 |
| 1 час | 3600 | 72 | 4 |
| 2 часа | 7200 | 144 | 4 |
Перелом наступает на 200 секундах — это 3 минуты 20 секунд. Всё, что короче, дешевле прогонять через посекундные модели. Всё, что длиннее, выгоднее отдавать Wizper или Nemotron: восьмичасовая запись конференции обойдётся в те же 4 нейрона, что и трёхминутная голосовая заметка.
Четыре модели: сильные стороны и на что смотреть при выборе
Scribe v2 — когда нужны русский и роли говорящих
Универсальный выбор по умолчанию: самая точная модель на русском — и ещё на 90 с лишним языках. Она сама расставляет знаки препинания и, что важнее всего для созвонов, размечает реплики по говорящим: в тексте видно, кто именно что сказал. Цена — 0,02 нейрона за секунду, то есть час записи обойдётся в 72 нейрона.
- Сильные стороны: русский язык, разметка по говорящим, готовая пунктуация
- Оплата по секундам: 10 минут — 12 нейронов, час — 72, два часа — 144
- Совет: чем чётче слышен каждый голос, тем аккуратнее разделение по ролям — по возможности пишите участников отдельными дорожками или ставьте микрофон ближе к говорящим
- Идеально для: интервью, планёрок, подкастов, любых многоголосых записей
Cohere Transcribe — чистый текст без лишних деталей
Вторая посекундная модель, по той же цене — 0,02 нейрона за секунду. Тоже сама расставляет знаки препинания, но реплики по ролям не размечает: на выходе получается сплошной аккуратный текст. Удобная альтернатива Scribe v2 там, где говорящий один и делить некого.
- Сильные стороны: аккуратная пунктуация и та же цена, что у Scribe v2
- Ролей говорящих не размечает — для созвонов и интервью берите Scribe v2
- Оплата по секундам: 10 минут — 12 нейронов, час — 72
- Идеально для: надиктовок, монологов, лекций одного спикера, голосовых заметок
Wizper — скорость и фиксированная цена
Это ускоренная версия Whisper v3 Large — того самого стандарта, на который до сих пор ориентируется вся индустрия. Точность у неё та же, что у оригинала, а работает она вдвое быстрее. Но главное — цена: 4 нейрона за запуск, сколько бы ни длилась запись. Двухчасовая лекция и восьмичасовая конференция стоят одинаково.
- Сильные стороны: фиксированные 4 нейрона за запуск и вдвое более быстрая обработка при точности Whisper v3 Large
- Разметки по говорящим нет — если роли важны, это Scribe v2
- Совет: обрежьте длинную тишину и музыкальную заставку в начале файла, чтобы модель сразу начинала с речи
- Идеально для: длинных лекций, записей конференций, архивов подкастов, черновой расшифровки перед вычиткой
Nemotron ASR — страховка от неверного языка
Многоязычная модель NVIDIA с одной решающей особенностью: язык вы указываете вручную. Это звучит скучно ровно до того момента, когда автоопределение принимает одну речь за другую и вместо расшифровки вы получаете страницу фонетического мусора. Цена такая же фиксированная — 4 нейрона за запуск.
- Сильная сторона: ручной выбор языка — модель не гадает и не переключается посреди записи
- Вторая сильная сторона: 4 нейрона за запуск независимо от длины
- Когда особенно полезна: в записи смешаны языки, сильный акцент или диалект, первые секунды заняты музыкой и шумом
- Идеально для: полевых интервью, многоязычных встреч, записей с региональной речью
Что чаще всего портит расшифровку?
- Длинная тишина или заставка в начале файла. Обрежьте пустоту перед загрузкой — модель сразу возьмётся за речь.
- Один микрофон на всю переговорную. Разделение по говорящим держится на разнице голосов: чем ближе микрофон к участникам, тем чище роли.
- Неверно угаданный язык. Если запись начинается на одном языке, а продолжается на другом, берите Nemotron ASR и укажите основной язык вручную.
- Ожидание готового протокола. Расшифровка — это стенограмма, а не саммари. Итоги, решения и задачи из неё делает уже сама нейросеть в чате, следующим сообщением.
- Выбор модели наугад. Короткое — посекундным моделям, длинное — моделям с ценой за запуск: на часовой записи разница выходит в 68 нейронов.
Что делать с текстом после расшифровки
Самое ценное начинается там, где заканчивается стенограмма. Полученный текст остаётся в том же диалоге, поэтому его можно тут же попросить свернуть в протокол, вытащить решения, собрать список задач с ответственными или превратить в статью. Одна расшифровка — и дальше сколько угодно форматов из неё.
Промпт: из стенограммы — в протокол встречи
Ниже стенограмма рабочей встречи. Сделай из неё протокол:
1. Одним абзацем — о чём была встреча.
2. Принятые решения списком, каждое одной строкой.
3. Задачи в формате: что сделать — кто отвечает — к какому сроку. Если срок не назвали, пиши «срок не обозначен».
4. Открытые вопросы, по которым не договорились.
5. Спорные моменты, где участники явно расходились во мнениях.
Ничего не додумывай: если в тексте чего-то нет, так и напиши. Имена бери из разметки говорящих.
Стенограмма:
[вставьте расшифровку]Кому это заменяет часы работы
| Кто | Что расшифровывает | Какая модель | Что получает дальше |
|---|---|---|---|
| Руководитель | Планёрки и созвоны с клиентами | Scribe v2 | Протокол с решениями и задачами по ответственным |
| Журналист | Интервью на диктофон | Scribe v2 | Цитаты с привязкой к спикеру и черновик текста |
| Студент | Лекции по 1,5–2 часа | Wizper | Конспект по темам и список вопросов к экзамену |
| Врач | Записи приёма (с согласия пациента) | Scribe v2 | Структурированные заметки: жалобы, назначения, контроль |
| Юрист | Заседания и консультации | Scribe v2 | Хронология выступлений и ключевые формулировки |
| Подкастер | Выпуски целиком | Wizper | Шоуноты, темы выпуска, посты для соцсетей |
| Исследователь | Полевые интервью на разных языках | Nemotron ASR | Единый текстовый корпус для анализа |
Где это включается
Модели расшифровки доступны в чате и в МедиаЛабе: загружаете аудиофайл, выбираете модель — и получаете текст. Уровень доступа BASIC означает, что пробовать можно сразу, без перехода на платный тариф: зайдите в кабинет, посмотрите каталог моделей и сравните, какая из четырёх лучше ляжет на ваши записи. Если расшифровок становится много, стартовых нейронов перестанет хватать — тогда имеет смысл заглянуть в тарифы.
Частые вопросы
Сколько стоит расшифровать часовой созвон?
У Scribe v2 и Cohere Transcribe час записи — это 3600 секунд по 0,02 нейрона, то есть 72 нейрона. У Wizper и Nemotron ASR тот же час стоит 4 нейрона, потому что цена фиксированная за запуск. Разница в том, что за 72 нейрона вы получаете ещё и разметку по говорящим.
Нужен ли платный тариф, чтобы расшифровывать аудио?
Нет. Все четыре модели работают на уровне BASIC — он доступен на всех тарифах, включая бесплатный. Ограничивает вас только остаток нейронов на балансе, а не уровень подписки.
Какая модель лучше понимает русский язык?
Scribe v2 — самая точная на русском и ещё 90+ языках, знаки препинания расставляет сама. Вторым вариантом для русского идёт Wizper: та же точность, что у Whisper v3 Large, и фиксированные 4 нейрона за запуск. Cohere Transcribe стоит столько же, что и Scribe v2, и тоже даёт пунктуацию, но роли говорящих не размечает.
Что делать, если в записи смешаны два языка?
Берите Nemotron ASR и укажите основной язык вручную — так модель не будет метаться между вариантами. Автоопределение чаще всего сбоит именно на переключениях языка внутри одной фразы, и ручной выбор снимает эту проблему целиком.
Можно ли получить текст с разделением по ролям говорящих?
Да, это умеет Scribe v2: реплики размечаются по говорящим. Остальные три модели дают сплошной текст без ролей. Для стенограммы совещания или интервью на двоих разница принципиальная.


