О сервисе
Мы делаем одну вещь: превращаем русскую речь в текст, который не стыдно читать. Ниже — из чего это собрано.
8,3% средний WER GigaAM v3 RNNTпротив 21% у Whisper large-v3 — в 2,5 раза меньше ошибок15 мин бесплатно без регистрациидо 10 часов на файл
Стек
- GigaAM v3 RNNT (Сбер, MIT) — распознавание русской речи
- GigaChat Audio (Сбер, открытые веса) — разделение на говорящих
- Whisper large-v3 — запасной путь для 56 неосновных языков
- NVIDIA A100 на Modal — примерно 40× реального времени
- Yandex Object Storage, ru-central1 — хранение с удалением через 24 часа
Почему открытые модели
Потому что их цифры можно проверить. Бенчмарк GigaAM опубликован, лицензия MIT, веса доступны. Мы не просим верить нам на слово.
Ценность сервиса не в секретной модели, а в конвейере вокруг неё: разбор двадцати с лишним форматов, выбор дорожки, узкополосные и far-field-профили, выравнивание таймкодов, диаризация, выгрузка в DOCX, SRT, VTT и JSON.
Почему нет подписки
Спрос на расшифровку неравномерный: месяц с одним интервью и месяц с тридцатью. Подписка в такой ситуации выгодна сервису, а не пользователю.
Мы берём деньги за обработанные минуты. Карту не храним, автосписаний нет, отменять нечего.
Что мы не делаем
- Не обещаем «точность 98%» — это непроверяемое число
- Не додумываем неразборчивые участки в юридическом режиме
- Не храним файлы дольше суток
- Не подключаем автопродление ни в каком виде
Частые вопросы
- Кто вы?
- Небольшая российская команда. Пишите на почту поддержки — отвечаем мы, а не бот.
- Где физически обрабатываются файлы?
- Распознавание — на GPU в облаке Modal, хранение — в Yandex Object Storage, регион ru-central1.
- Можно ли развернуть это у себя?
- Модели открытые, конвейер — наш. Для контура без интернета обсуждаем отдельно.