MP3 в текст
MP3 — самый частый вход: диктофон, подкаст, выгрузка со звонков. Формат сжатый с потерями, поэтому важно, что именно вы отдаёте на распознавание: VBR-файл с битой длительностью или нормальный CBR.
Спрос по Яндекс.Вордстат
| Запрос | Показов в месяц | Снято |
|---|---|---|
| mp3 в текст | 2 325 | 2026-08 |
| mp3 в текст бесплатно | 562 | 2026-08 |
| mp3 в текст онлайн | 484 | 2026-08 |
| расшифровка mp3 в текст | 54 | 2026-08 |
Технические характеристики MP3
| Полное название | MPEG-1/2 Audio Layer III |
|---|---|
| Контейнер | элементарный поток MPEG-кадров + теги ID3v2 |
| Кодеки внутри | MPEG Layer III |
| MIME-типы | audio/mpeg, audio/mp3 |
| Расширения | .mp3, .mp2, .mpga |
| Типичный битрейт | 128 кбит/с |
| Частота дискретизации | 44 100 Гц, чаще стерео, у диктофонов — моно |
| Сжатие | с потерями |
| Демультиплексирование | не нужно |
| Лимит на файл | 8 ГБ — это примерно 8 736 минут при типичном битрейте |
| Минут в 1 ГБ | 1 092 |
Что конвейер делает именно с MP3
- Считываем и отбрасываем теги ID3v2 в начале файла — иначе первый кадр декодируется как шум и первые 0,2–0,5 с речи теряются.
- Если в файле нет XING/VBRI-заголовка (типично для файлов, склеенных «в лоб» или обрезанных), длительность вычисляем полным проходом по кадрам, а не по заголовку.
- Декодируем в PCM 16 кГц моно — рабочая частота GigaAM v3. Ресемплинг делаем soxr very-high, а не линейной интерполяцией.
- Джойнт-стерео разворачиваем в моно суммированием после декодирования, а не выбором левого канала: у интервью на два петличных микрофона второй голос часто живёт только справа.
Откуда берутся такие файлы
- Диктофоны Sony/Olympus и приложение «Диктофон» на Android
- Экспорт из Audacity и Adobe Audition
- Выгрузка записей разговоров из облачных АТС (Манго, Билайн Облачная АТС)
- Скачанные подкасты
Грабли, о которых стоит знать заранее
- VBR без XING-заголовка врёт про длительность
Плеер показывает 2 часа, реально файл 40 минут (или наоборот). Мы всегда считаем длительность проходом по кадрам, поэтому счёт выставляется по реальным минутам, а не по заявленным.
- Битрейт ниже 64 кбит/с на стерео = каша на «с», «ш», «ц»
Сжатие срезает верх спектра, шипящие смешиваются. Если у вас есть исходник в WAV или M4A — грузите его, разница в WER на реальных диктофонных записях заметна.
- Склеенные MP3 с разной частотой дискретизации
Файлы, собранные утилитой cat или copy /b, меняют частоту в середине. Мы ловим смену частоты и пересегментируем поток, но таймкоды после точки склейки могут разъезжаться на 1–2 секунды.
Как формат влияет на точность
MP3 128 кбит/с практически не ухудшает распознавание: на наших замерах разница с исходным WAV укладывается в 0,3 пункта WER. Ниже 48 кбит/с деградация становится измеримой.
| Модель | Средний WER, % | Далёкий микрофон | Кол-центр |
|---|---|---|---|
| GigaAM v3 RNNT (Сбер, MIT)используем мы | 8,3 | 3,9 | 9,5 |
| GigaAM v2 RNNT | 10,6 | — | — |
| T-one + LM (Т-Банк, Apache-2.0) | 16,3 | — | — |
| Whisper large-v3 | 21 | 16,4 | 23,1 |
Проверка файла и расчёт стоимости
Файл не загружается и никуда не отправляется: длительность читает ваш браузер локально. Ограничения показаны для MP3.
Отменять ничего не нужно: у нас нет автопродления и мы не храним данные платёжных карт.
Частые вопросы
- Какой максимальный размер MP3 можно загрузить?
- 8 ГБ. При типичных 128 кбит/с это примерно 1092 минуты, то есть 18 часов — больше нашего лимита в 10 часов на файл, так что упрётесь вы в длительность, а не в размер.
- Нужно ли конвертировать MP3 в WAV перед загрузкой?
- Нет. Конвертация MP3 → WAV не возвращает потерянную при сжатии информацию, она только увеличивает файл примерно в 11 раз и замедляет загрузку.
- Почему в расшифровке пропало первое слово?
- Обычно это тег ID3v2 с обложкой, который декодер принимает за аудио. Мы его вырезаем до декодирования. Если слово всё равно пропало — в исходнике речь начинается с первого же кадра без паузы, помогает добавить 0,5 с тишины в начало.
- MP3 с записью телефонного разговора распознаётся хуже?
- Да, но виноват не MP3, а телефонный канал 8 кГц. По бенчмарку GigaAM на call-центровых данных WER 9,5% против 3,9% на записях с хорошего микрофона.