Транскриба
ФорматыПлатформыЗадачиИнструментыСтатьиЦеныРасшифровать
Главная / Статьи / Почему «точность 98%» ничего не значит

Почему «точность 98%» ничего не значит

Почти каждый сервис расшифровки пишет на главной «точность до 98%». Проверить эту цифру невозможно, и вот почему.

8,3% средний WER GigaAM v3 RNNTпротив 21% у Whisper large-v3 — в 2,5 раза меньше ошибок15 мин бесплатно без регистрациидо 10 часов на файл

Чтение примерно 6 мин · обновлено 2026-08-27

Что вообще измеряется

Стандартная метрика распознавания речи — WER, Word Error Rate: сумма замен, вставок и пропусков слов, делённая на число слов в эталоне. Ниже — лучше.

«Точность 98%» подразумевает WER 2%. Такие значения достижимы — на чистой начитанной речи в студии, на подготовленном тексте. На реальной спонтанной речи с фоном они недостижимы ни для одной существующей модели.

Три вопроса, которые убивают любую заявленную цифру

Прежде чем верить числу на лендинге, спросите.

  • На каком датасете? Точность на дикторской начитке и на записи совещания различается в четыре раза.
  • При какой нормализации? Считать ли ошибкой «5» вместо «пять», «ё» вместо «е», отсутствие запятой — от этого WER меняется на единицы процентов.
  • Какая модель под капотом? Если сервис поддерживает ровно 57 языков, это Whisper. Список языков — самая честная подпись, которую невозможно спрятать.

Что показывают открытые измерения

Сбер опубликовал бенчмарк семейства GigaAM: десять русскоязычных датасетов, единая нормализация, усреднённый WER. Цифры воспроизводимы, модели выложены под MIT.

Разница между лидером и Whisper large-v3 — два с половиной раза по среднему и более четырёх раз на записях с далёкого микрофона.

МодельЛицензияСредний WER, %Далёкий микрофонКол-центр
GigaAM v3 RNNT (Сбер)MIT8,33,99,5
GigaAM v2 RNNTMIT10,6——
T-one + LM (Т-Банк)Apache-2.016,3——
Whisper large-v3 (OpenAI)MIT21,016,423,1

Почему Whisper проседает именно на русском

Whisper обучался на разноязычном вебе с сильным перекосом в английский. Русский там есть, но его доля мала, а спонтанной русской речи с плохим микрофоном — ещё меньше.

GigaAM обучался на русском целенаправленно. Это не «лучше вообще» — на английском картина иная. Это лучше на той задаче, ради которой вы сюда пришли.

Что это значит на практике

WER 8,3% — примерно одно ошибочное слово из двенадцати. WER 21% — одно из пяти. Разница в объёме вычитки: час записи с первой моделью правится за 20–30 минут, со второй — за час и больше.

Именно это, а не строчка «98%» на лендинге, определяет, сколько вашего времени уйдёт после расшифровки.

Частые вопросы

Как понять, на чём работает сервис?
Посмотрите список поддерживаемых языков. Ровно 57 языков — это список Whisper, он публичный и легко сверяется.
WER 8,3% — это хорошо?
Для спонтанной русской речи по десяти разным датасетам — это текущий верх открытых моделей. На чистой студийной начитке та же модель даёт значительно меньше.
Вы измеряли WER сами?
Нет. Мы приводим опубликованный бенчмарк GigaAM от Сбера и не выдаём чужие измерения за свои.

Смотрите также

  • Статьи — весь каталог
  • Как перевести аудио в текст бесплатно — статья
  • Как перевести видео в текст — статья
  • Как расшифровать голосовое в Telegram — статья
  • Как перевести голосовое в текст в WhatsApp — статья
  • Как из диктофонной записи сделать текст — статья
  • Как сделать субтитры к видео — статья
  • Как записать звук, чтобы расшифровка была точной — статья
Транскриба

Расшифровка аудио и видео в текст

Отменять ничего не нужно: у нас нет автопродления и мы не храним данные платёжных карт.

КаталогиФорматыПлатформыЗадачиСтатьи
СервисАудио в текстВидео в текстСубтитрыТочность
ИнструментыВсе инструментыЗвук из видеоДиктофон онлайнAPIMCP-сервер
КомпанияО сервисеДля бизнесаДанныеВопросыКонтакты