Почему «точность 98%» ничего не значит
Почти каждый сервис расшифровки пишет на главной «точность до 98%». Проверить эту цифру невозможно, и вот почему.
Чтение примерно 6 мин · обновлено 2026-08-27
Что вообще измеряется
Стандартная метрика распознавания речи — WER, Word Error Rate: сумма замен, вставок и пропусков слов, делённая на число слов в эталоне. Ниже — лучше.
«Точность 98%» подразумевает WER 2%. Такие значения достижимы — на чистой начитанной речи в студии, на подготовленном тексте. На реальной спонтанной речи с фоном они недостижимы ни для одной существующей модели.
Три вопроса, которые убивают любую заявленную цифру
Прежде чем верить числу на лендинге, спросите.
- На каком датасете? Точность на дикторской начитке и на записи совещания различается в четыре раза.
- При какой нормализации? Считать ли ошибкой «5» вместо «пять», «ё» вместо «е», отсутствие запятой — от этого WER меняется на единицы процентов.
- Какая модель под капотом? Если сервис поддерживает ровно 57 языков, это Whisper. Список языков — самая честная подпись, которую невозможно спрятать.
Что показывают открытые измерения
Сбер опубликовал бенчмарк семейства GigaAM: десять русскоязычных датасетов, единая нормализация, усреднённый WER. Цифры воспроизводимы, модели выложены под MIT.
Разница между лидером и Whisper large-v3 — два с половиной раза по среднему и более четырёх раз на записях с далёкого микрофона.
| Модель | Лицензия | Средний WER, % | Далёкий микрофон | Кол-центр |
|---|---|---|---|---|
| GigaAM v3 RNNT (Сбер) | MIT | 8,3 | 3,9 | 9,5 |
| GigaAM v2 RNNT | MIT | 10,6 | — | — |
| T-one + LM (Т-Банк) | Apache-2.0 | 16,3 | — | — |
| Whisper large-v3 (OpenAI) | MIT | 21,0 | 16,4 | 23,1 |
Почему Whisper проседает именно на русском
Whisper обучался на разноязычном вебе с сильным перекосом в английский. Русский там есть, но его доля мала, а спонтанной русской речи с плохим микрофоном — ещё меньше.
GigaAM обучался на русском целенаправленно. Это не «лучше вообще» — на английском картина иная. Это лучше на той задаче, ради которой вы сюда пришли.
Что это значит на практике
WER 8,3% — примерно одно ошибочное слово из двенадцати. WER 21% — одно из пяти. Разница в объёме вычитки: час записи с первой моделью правится за 20–30 минут, со второй — за час и больше.
Именно это, а не строчка «98%» на лендинге, определяет, сколько вашего времени уйдёт после расшифровки.
Частые вопросы
- Как понять, на чём работает сервис?
- Посмотрите список поддерживаемых языков. Ровно 57 языков — это список Whisper, он публичный и легко сверяется.
- WER 8,3% — это хорошо?
- Для спонтанной русской речи по десяти разным датасетам — это текущий верх открытых моделей. На чистой студийной начитке та же модель даёт значительно меньше.
- Вы измеряли WER сами?
- Нет. Мы приводим опубликованный бенчмарк GigaAM от Сбера и не выдаём чужие измерения за свои.