API транскрибации
Если расшифровка нужна регулярно и внутри вашего процесса, интерфейс в браузере лишний. Есть программный доступ.
Что умеет
- Загрузка файла или прямой ссылки на него
- Выбор режима: дословно, чистый текст, протокол
- Диаризация с указанием ожидаемого числа спикеров
- Результат в JSON с пословными таймкодами
- Готовые SRT, VTT, DOCX по тому же идентификатору задачи
Как считается
Минутами из пакета, по фактической длительности записи с округлением вверх до минуты. Никаких отдельных тарифов за API и никаких автосписаний.
Что приходит в ответе
Результат — JSON с полем segments и полем words. В сегменте лежат текст, границы в секундах и метка говорящего; в words — то же самое на уровне слова. Пословные границы нужны не для красоты: по ним собираются субтитры с корректной длиной строки и работает перемотка к слову в плеере.
Уверенность модели возвращается по каждому слову. Это то, на чём строится ручная вычитка: подсветив слова ниже порога, редактор правит десятую часть текста вместо всего.
- segments[]: start, end, speaker, text
- words[]: start, end, word, confidence
- language и модель, которой сделана расшифровка
- duration — фактическая длительность, по ней списываются минуты
Как получить доступ
Ключ выдаётся по запросу: напишите на b2b-адрес объём в минутах и сценарий, в ответ придут ключ, документация и тестовый лимит. Открытой самостоятельной регистрации в API пока нет — так мы понимаем нагрузку заранее и не упираемся в очередь на GPU в момент, когда у вас пойдёт поток.
Ограничение на параллельные задачи обсуждается при подключении и зависит от объёма пакета: одиночные файлы обрабатываются на A100 примерно в сорок раз быстрее реального времени, но десять одновременных потоков — это уже десять контейнеров.
Частые вопросы
- Есть ли вебхуки?
- Да, задача может сообщить о завершении на ваш URL.
- Какой лимит по параллельным задачам?
- Зависит от объёма пакета, обсуждаем при подключении.
- Формат результата стабилен?
- Да, версия схемы указывается в ответе.