РУКОВОДСТВО · ОБНОВЛЕНО 2026-09-15
Speech-to-text API: как выбрать распознавание речи
Качество транскрибации зависит от языка, микрофона, шума, говорящих и словаря, поэтому его проверяют на собственных записях.
Соберите репрезентативные аудио и сравните модели по ошибкам слов и критичных сущностей, временным меткам, разделению говорящих, задержке и стоимости минуты. Для звонков заранее определите согласие, хранение записи и момент передачи оператору.
1. Разделите режимы
Готовая запись допускает асинхронную обработку и повтор, а субтитры звонка требуют низкой задержки и устойчивого streaming. Уточните языки, максимальную длину, число каналов, timestamps и speaker labels. Перевод речи и транскрибация исходного языка являются разными задачами и endpoints.
2. Соберите реальные записи
Добавьте тишину, фоновую музыку, телефонный канал, акценты, быстрый темп, перебивания и редкие названия. Получите законное основание и обезличьте набор, где возможно. Эталон размечает не только слова, но говорящих и важные сущности. Чистая студийная запись завышает ожидания от звонков.
3. Подготовьте вход
Используйте поддерживаемый codec и sample rate, не перекодируйте многократно. Разделение длинного файла делают с небольшим перекрытием и последующим объединением. Два канала оператор/клиент могут дать более надёжных говорящих, чем diarization смешанного mono. Подсказка словаря не должна заставлять модель вставлять отсутствующий термин.
4. Измерьте значимые ошибки
WER подходит для общей оценки, но отдельно считайте имена, суммы, даты, отрицания и команды. Для realtime измеряйте задержку частичного и финального текста, исправления уже показанного фрагмента и обрывы. Человек проверяет выборку и случаи низкой уверенности. Резюме разговора оценивается отдельно от транскрипта.
5. Посчитайте эксплуатацию
Учитывайте тарификацию по минутам или токенам, загрузку файлов, хранение, повторы и постобработку. Поставьте лимит размера и времени, проверяйте MIME и удаляйте записи по сроку. В логах храните request id и технические метрики, а доступ к аудио ограничьте. Ошибка сервиса не должна потерять исходный файл без статуса.
Частые вопросы
Что лучше: файл или realtime?
Файл подходит отложенной обработке, realtime — живым субтитрам и агентам.
Что такое WER?
Доля замен, удалений и вставок слов относительно эталона.
Как распознать говорящих?
Использовать отдельные каналы или diarization и проверить на своих диалогах.
Поддерживается ли русский?
Это проверяют у конкретной модели и на реальных записях.
Как считать цену?
По правилу API плюс хранение, повторы и проверка.