Материал
Клиентский ASR (Whisper в браузере) – инженерная шпаргалка
Одна страница: распутывание названия ('faster-whisper' – серверная библиотека на CTranslate2, НЕ браузерный движок; реальные движки – whisper.cpp через WebAssembly и Transformers.js через WebGPU; плюс встроенный Web Speech API, шлющий звук в Google по умолчанию); конвейер в браузере (микрофон -> 16 кГц моно -> гейт Silero VAD -> Whisper -> субтитр, всё во вкладке); WebAssembly против WebGPU (CPU против GPU, ~100x, изоляция источника COOP+COEP для потоков Wasm); реестр затрат (загрузка модели 31-182 МБ квантизованной, память, батарея); проверка коэффициента реального времени (RTF ниже 1,0 – успевает вживую); Moonshine для тесных живых циклов; и таблица решения «клиент против сервера».
Что внутри
- Распутаем название (ошибка №1)
- Конвейер в браузере (всё во вкладке)
- Два движка: WebAssembly против WebGPU
- Реестр затрат (нет облачного счёта – затраты на устройстве)
- Успевает ли вживую? Коэффициент реального времени (RTF)
- Клиент или сервер? Чек-лист
Кому пригодится
Фронтенд-разработчикам, которым сказали «распознавай речь прямо в браузере». Шпаргалка разбирает путаницу в названиях, собирает конвейер от микрофона до субтитра, сравнивает WebAssembly и WebGPU, считает загрузку модели в 31-182 МБ, память и батарею и вводит проверку RTF ниже 1,0 – встроенный Web Speech API при этом по умолчанию отправляет звук в Google.

Без регистрации и почты – файл открывается сразу
Источник
Из какого курса материал
ИИ в видеоинженерии
Компьютерное зрение, речь, мультимодальные модели, генеративное видео, агенты и регламент ЕС об ИИ.
Клиентский ASR С Faster-Whisper-WASM В Браузере
Клиентское распознавание речи – это когда слова, сказанные в микрофон, превращаются в текст кодом, который работает…
Ещё материалы
Похожие материалы
Все материалы →Выбираете технологию под проект?
Пройдём чек-лист вместе и посчитаем стоимость вариантов на ваших объёмах.