Термин

ASR (распознавание речи)

Англ.: STT, распознавание речи
Короткое определение

Automatic Speech Recognition – превращение звучащей речи в текст. Базовый слой для субтитров, транскриптов, голосовых команд и заметок встреч.

ASR преобразует речь в текст, пригодный для софта. Качество измеряется word error rate, а трудные случаи – шум, акценты, перекрытие и жаргон. Это первый шаг почти любой аудио-ИИ-функции в видеопродукте.

Считаете параметры для своего продукта?

Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.