Часовая запись превращается в готовый текст за 72 нейрона — а если взять модель с фиксированной ценой, то за 4 нейрона независимо от длины. На СуперИнтеллекте расшифровкой занимаются четыре модели: Scribe v2 и Cohere Transcribe считаются посекундно, по 0,02 нейрона за секунду, а Wizper и Nemotron ASR берут ровно 4 нейрона за запуск. Десять минут созвона у посекундных моделей стоят 12 нейронов, полчаса — 36. И главное: все четыре работают на уровне BASIC, то есть доступны на любом тарифе, включая бесплатный.

Какую модель брать под вашу задачу

ЗадачаМодельЦенаПочему именно она
Созвон или интервью с несколькими участникамиScribe v20,02 нейрона/секЕдинственная из четырёх различает говорящих и размечает реплики по ролям — не придётся вспоминать, кто что сказал
Диктофонная запись на русскомScribe v20,02 нейрона/секСамая точная на русском, сразу расставляет знаки препинания
Двухчасовая лекция или подкастWizper4 нейрона за запускЦена не зависит от длины, а обработка идёт вдвое быстрее обычного Whisper v3 Large
Монолог, надиктовка, лекция одного спикераCohere Transcribe0,02 нейрона/секТа же цена, что у Scribe v2, и аккуратная пунктуация — когда роли не нужны
Смешанные языки или сбой автоопределенияNemotron ASR4 нейрона за запускЯзык задаётся вручную — модель не гадает и не срывается на чужую раскладку
Много коротких файлов подрядScribe v2 или Cohere Transcribe0,02 нейрона/секМинута записи — 1,2 нейрона: на коротких фрагментах посекундная оплата дешевле фиксированной
Задача → модель → цена → почему

Сколько стоит расшифровка: считаем в нейронах

Посекундные модели тарифицируются честно по длине аудио: 0,02 нейрона за каждую секунду. Модели с ценой за запуск списывают 4 нейрона и на длительность не смотрят вовсе. Это две разные экономики, и между ними есть точка перелома.

ДлительностьСекундScribe v2 / Cohere TranscribeWizper / Nemotron ASR
1 минута601,24
5 минут30064
10 минут600124
30 минут1800364
1 час3600724
2 часа72001444
Цена расшифровки в нейронах по длительности записи

Перелом наступает на 200 секундах — это 3 минуты 20 секунд. Всё, что короче, дешевле прогонять через посекундные модели. Всё, что длиннее, выгоднее отдавать Wizper или Nemotron: восьмичасовая запись конференции обойдётся в те же 4 нейрона, что и трёхминутная голосовая заметка.

Четыре модели: сильные стороны и на что смотреть при выборе

Scribe v2 — когда нужны русский и роли говорящих

Универсальный выбор по умолчанию: самая точная модель на русском — и ещё на 90 с лишним языках. Она сама расставляет знаки препинания и, что важнее всего для созвонов, размечает реплики по говорящим: в тексте видно, кто именно что сказал. Цена — 0,02 нейрона за секунду, то есть час записи обойдётся в 72 нейрона.

  • Сильные стороны: русский язык, разметка по говорящим, готовая пунктуация
  • Оплата по секундам: 10 минут — 12 нейронов, час — 72, два часа — 144
  • Совет: чем чётче слышен каждый голос, тем аккуратнее разделение по ролям — по возможности пишите участников отдельными дорожками или ставьте микрофон ближе к говорящим
  • Идеально для: интервью, планёрок, подкастов, любых многоголосых записей

Cohere Transcribe — чистый текст без лишних деталей

Вторая посекундная модель, по той же цене — 0,02 нейрона за секунду. Тоже сама расставляет знаки препинания, но реплики по ролям не размечает: на выходе получается сплошной аккуратный текст. Удобная альтернатива Scribe v2 там, где говорящий один и делить некого.

  • Сильные стороны: аккуратная пунктуация и та же цена, что у Scribe v2
  • Ролей говорящих не размечает — для созвонов и интервью берите Scribe v2
  • Оплата по секундам: 10 минут — 12 нейронов, час — 72
  • Идеально для: надиктовок, монологов, лекций одного спикера, голосовых заметок

Wizper — скорость и фиксированная цена

Это ускоренная версия Whisper v3 Large — того самого стандарта, на который до сих пор ориентируется вся индустрия. Точность у неё та же, что у оригинала, а работает она вдвое быстрее. Но главное — цена: 4 нейрона за запуск, сколько бы ни длилась запись. Двухчасовая лекция и восьмичасовая конференция стоят одинаково.

  • Сильные стороны: фиксированные 4 нейрона за запуск и вдвое более быстрая обработка при точности Whisper v3 Large
  • Разметки по говорящим нет — если роли важны, это Scribe v2
  • Совет: обрежьте длинную тишину и музыкальную заставку в начале файла, чтобы модель сразу начинала с речи
  • Идеально для: длинных лекций, записей конференций, архивов подкастов, черновой расшифровки перед вычиткой

Nemotron ASR — страховка от неверного языка

Многоязычная модель NVIDIA с одной решающей особенностью: язык вы указываете вручную. Это звучит скучно ровно до того момента, когда автоопределение принимает одну речь за другую и вместо расшифровки вы получаете страницу фонетического мусора. Цена такая же фиксированная — 4 нейрона за запуск.

  • Сильная сторона: ручной выбор языка — модель не гадает и не переключается посреди записи
  • Вторая сильная сторона: 4 нейрона за запуск независимо от длины
  • Когда особенно полезна: в записи смешаны языки, сильный акцент или диалект, первые секунды заняты музыкой и шумом
  • Идеально для: полевых интервью, многоязычных встреч, записей с региональной речью

Что чаще всего портит расшифровку?

  1. Длинная тишина или заставка в начале файла. Обрежьте пустоту перед загрузкой — модель сразу возьмётся за речь.
  2. Один микрофон на всю переговорную. Разделение по говорящим держится на разнице голосов: чем ближе микрофон к участникам, тем чище роли.
  3. Неверно угаданный язык. Если запись начинается на одном языке, а продолжается на другом, берите Nemotron ASR и укажите основной язык вручную.
  4. Ожидание готового протокола. Расшифровка — это стенограмма, а не саммари. Итоги, решения и задачи из неё делает уже сама нейросеть в чате, следующим сообщением.
  5. Выбор модели наугад. Короткое — посекундным моделям, длинное — моделям с ценой за запуск: на часовой записи разница выходит в 68 нейронов.

Что делать с текстом после расшифровки

Самое ценное начинается там, где заканчивается стенограмма. Полученный текст остаётся в том же диалоге, поэтому его можно тут же попросить свернуть в протокол, вытащить решения, собрать список задач с ответственными или превратить в статью. Одна расшифровка — и дальше сколько угодно форматов из неё.

Промпт: из стенограммы — в протокол встречи

Ниже стенограмма рабочей встречи. Сделай из неё протокол:

1. Одним абзацем — о чём была встреча.
2. Принятые решения списком, каждое одной строкой.
3. Задачи в формате: что сделать — кто отвечает — к какому сроку. Если срок не назвали, пиши «срок не обозначен».
4. Открытые вопросы, по которым не договорились.
5. Спорные моменты, где участники явно расходились во мнениях.

Ничего не додумывай: если в тексте чего-то нет, так и напиши. Имена бери из разметки говорящих.

Стенограмма:
[вставьте расшифровку]

Кому это заменяет часы работы

КтоЧто расшифровываетКакая модельЧто получает дальше
РуководительПланёрки и созвоны с клиентамиScribe v2Протокол с решениями и задачами по ответственным
ЖурналистИнтервью на диктофонScribe v2Цитаты с привязкой к спикеру и черновик текста
СтудентЛекции по 1,5–2 часаWizperКонспект по темам и список вопросов к экзамену
ВрачЗаписи приёма (с согласия пациента)Scribe v2Структурированные заметки: жалобы, назначения, контроль
ЮристЗаседания и консультацииScribe v2Хронология выступлений и ключевые формулировки
ПодкастерВыпуски целикомWizperШоуноты, темы выпуска, посты для соцсетей
ИсследовательПолевые интервью на разных языкахNemotron ASRЕдиный текстовый корпус для анализа
Сценарии по профессиям

Где это включается

Модели расшифровки доступны в чате и в МедиаЛабе: загружаете аудиофайл, выбираете модель — и получаете текст. Уровень доступа BASIC означает, что пробовать можно сразу, без перехода на платный тариф: зайдите в кабинет, посмотрите каталог моделей и сравните, какая из четырёх лучше ляжет на ваши записи. Если расшифровок становится много, стартовых нейронов перестанет хватать — тогда имеет смысл заглянуть в тарифы.

Частые вопросы

Сколько стоит расшифровать часовой созвон?

У Scribe v2 и Cohere Transcribe час записи — это 3600 секунд по 0,02 нейрона, то есть 72 нейрона. У Wizper и Nemotron ASR тот же час стоит 4 нейрона, потому что цена фиксированная за запуск. Разница в том, что за 72 нейрона вы получаете ещё и разметку по говорящим.

Нужен ли платный тариф, чтобы расшифровывать аудио?

Нет. Все четыре модели работают на уровне BASIC — он доступен на всех тарифах, включая бесплатный. Ограничивает вас только остаток нейронов на балансе, а не уровень подписки.

Какая модель лучше понимает русский язык?

Scribe v2 — самая точная на русском и ещё 90+ языках, знаки препинания расставляет сама. Вторым вариантом для русского идёт Wizper: та же точность, что у Whisper v3 Large, и фиксированные 4 нейрона за запуск. Cohere Transcribe стоит столько же, что и Scribe v2, и тоже даёт пунктуацию, но роли говорящих не размечает.

Что делать, если в записи смешаны два языка?

Берите Nemotron ASR и укажите основной язык вручную — так модель не будет метаться между вариантами. Автоопределение чаще всего сбоит именно на переключениях языка внутри одной фразы, и ручной выбор снимает эту проблему целиком.

Можно ли получить текст с разделением по ролям говорящих?

Да, это умеет Scribe v2: реплики размечаются по говорящим. Остальные три модели дают сплошной текст без ролей. Для стенограммы совещания или интервью на двоих разница принципиальная.