Термин
ASR (распознавание речи)
Англ.: STT, распознавание речи
Короткое определение
Automatic Speech Recognition – превращение звучащей речи в текст. Базовый слой для субтитров, транскриптов, голосовых команд и заметок встреч.
ASR преобразует речь в текст, пригодный для софта. Качество измеряется word error rate, а трудные случаи – шум, акценты, перекрытие и жаргон. Это первый шаг почти любой аудио-ИИ-функции в видеопродукте.
Считаете параметры для своего продукта?
Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.