О сервисе

Мы делаем одну вещь: превращаем русскую речь в текст, который не стыдно читать. Ниже — из чего это собрано.

8,3% средний WER GigaAM v3 RNNTпротив 21% у Whisper large-v3 — в 2,5 раза меньше ошибок15 мин бесплатно без регистрациидо 10 часов на файл

Стек

  • GigaAM v3 RNNT (Сбер, MIT) — распознавание русской речи
  • GigaChat Audio (Сбер, открытые веса) — разделение на говорящих
  • Whisper large-v3 — запасной путь для 56 неосновных языков
  • NVIDIA A100 на Modal — примерно 40× реального времени
  • Yandex Object Storage, ru-central1 — хранение с удалением через 24 часа

Почему открытые модели

Потому что их цифры можно проверить. Бенчмарк GigaAM опубликован, лицензия MIT, веса доступны. Мы не просим верить нам на слово.

Ценность сервиса не в секретной модели, а в конвейере вокруг неё: разбор двадцати с лишним форматов, выбор дорожки, узкополосные и far-field-профили, выравнивание таймкодов, диаризация, выгрузка в DOCX, SRT, VTT и JSON.

Почему нет подписки

Спрос на расшифровку неравномерный: месяц с одним интервью и месяц с тридцатью. Подписка в такой ситуации выгодна сервису, а не пользователю.

Мы берём деньги за обработанные минуты. Карту не храним, автосписаний нет, отменять нечего.

Что мы не делаем

  • Не обещаем «точность 98%» — это непроверяемое число
  • Не додумываем неразборчивые участки в юридическом режиме
  • Не храним файлы дольше суток
  • Не подключаем автопродление ни в каком виде

Частые вопросы

Кто вы?
Небольшая российская команда. Пишите на почту поддержки — отвечаем мы, а не бот.
Где физически обрабатываются файлы?
Распознавание — на GPU в облаке Modal, хранение — в Yandex Object Storage, регион ru-central1.
Можно ли развернуть это у себя?
Модели открытые, конвейер — наш. Для контура без интернета обсуждаем отдельно.

Смотрите также