Глава 3 из 10
Глава 3. Звук и речь: распознавание, синтез, шумоподавление
Десять статей по порядку – 4 часа 18 минут чтения. Ниже маршрут главы: высота каждого шага соответствует времени чтения.
Глава 3 из 10дальше: Мультимодальные модели: от CLIP до видео-VLM
Речь в видеопродукте от распознавания до синтеза: потоковый ASR, диаризация, клонирование голоса и согласие по NO FAKES Act, TTS, шумо- и эхоподавление, перевод речи в реальном времени. Здесь же цены поставщиков, из которых складывается стоимость минуты.
Маршрут главы
10 статей · 4 ч 18 мин3.1Streaming ASR в проде – Whisper, Deepgram и AssemblyAI в 2026Потоковое распознавание речи (streaming ASR) – это превращение живого аудио в текст, пока человек ещё говорит, и именно…26 мин·от начала главы 0 ч 0 мин3.2WhisperX подробно – диаризация и пословные таймкодыWhisperX – это бесплатный open-source инструмент, который берёт речевую модель OpenAI Whisper и закрывает две её главные…28 мин·от начала главы 0 ч 26 мин3.3Диаризация дикторов с Pyannote в рабочей системеPyannote – это открытый инструмент, отвечающий на вопрос, который другие речевые системы игнорируют: не *что* было…33 мин·от начала главы 0 ч 54 мин3.4Цены ElevenLabs, клонирование голоса и инженерия согласия по NO FAKES ActElevenLabs – самый используемый коммерческий сервис синтеза речи и клонирования голоса, а его цены 2026 года тянутся от…19 мин·от начала главы 1 ч 27 мин3.5Потоковый TTS – Kokoro, ElevenLabs Turbo, Cartesia и OpenAI TTSПотоковый синтез речи превращает текст в звук, который начинает проигрываться ещё до того, как предложение…17 мин·от начала главы 1 ч 46 мин3.6Шумоподавление в реальном времени в проде – Krisp, RNNoise и DeepFilterNetШумоподавление в реальном времени – это софт, который убирает фоновый звук (стук клавиш, лай собаки, гул кафе) из живого…18 мин·от начала главы 2 ч 3 мин3.7Эхоподавление – классический AEC + ИИ-гибридЭхоподавление – это программа, которая не даёт собеседнику услышать собственный голос, вернувшийся обратно; так…30 мин·от начала главы 2 ч 21 мин3.8Speech-to-speech – Realtime API, Gemini Live, SeamlessM4TSpeech-to-speech – это система, которая слышит произнесённую речь и отвечает голосом, причём читаемый текст в середине…31 мин·от начала главы 2 ч 51 мин3.9Многоязычный перевод речи в реальном времени в звонкахПеревод речи в реальном времени позволяет двум людям на звонке, говорящим на разных языках, понимать друг друга прямо в…29 мин·от начала главы 3 ч 22 мин3.10Whisper Flow / Whisper App – разбор инженерии приложения для диктовкиПриложение для диктовки вроде Wispr Flow позволяет нажать одну клавишу, говорить и смотреть, как чистый written-текст…27 мин·от начала главы 3 ч 51 мин
Строите такую систему?
Поможем выбрать кодек и собрать пайплайн под ваши объёмы – 20 лет в видеоразработке, 250+ проектов.