Содержание статьи +
- Кратко
- Почему это важно
- Что такое эхо на самом деле
- Один вход, который делает подавление возможным
- Как работает классический подавитель
- Случай, который ломает всё: double-talk
- Как работает ИИ-гибрид
- Число, которое открывает дорогу живому звонку: задержка
- Как понять, что подавитель действительно хорош – метрики
- Сначала бесплатная база – браузер уже подавляет эхо
- Частая ошибка – стек из двух подавителей
- Где здесь Фора Софт
- Как выбрать – пять вопросов
- Главные выводы
- Что почитать дальше
Кратко
Эхоподавление – это программа, которая не даёт собеседнику услышать собственный голос, вернувшийся обратно; так происходит, когда динамик одного человека воспроизводит голос другого, а микрофон ловит его и отправляет назад. Классическое решение, отточенное с 1990-х, использует адаптивный фильтр: он выучивает путь от динамика до микрофона, предсказывает эхо и вычитает его, после чего вторая ступень убирает то, что осталось. Решение 2026 года сохраняет этот классический фильтр для основной работы и добавляет поверх небольшую нейросеть, чтобы справляться с теми сложными случаями, которые одна математика так и не закрыла, – нелинейными искажениями дешёвого динамика, резкими изменениями комнаты и double-talk, когда оба говорят одновременно. Статья объясняет, как возникает эхо, как устроены классический подавитель и ИИ-гибрид, во что они обходятся по задержке и вычислениям и как выбрать между бесплатным встроенным подавителем браузера и платным ИИ.
Почему это важно
Если ваш продукт передаёт живой двусторонний разговор – видеоконференции, телемедицину, голосового агента поддержки, breakout-комнату онлайн-класса, – эхо это тот дефект, который пользователь замечает первым и прощает последним. Собеседник, слышащий свой голос с долей секунды задержки, не может вести нормальный разговор: он сбивается, делает паузы и винит ваше приложение. Эхоподавление – это функция, которая предотвращает такое, и в 2026 году она стоит на развилке: классический подавитель на основе обработки сигналов, который каждый браузер отдаёт бесплатно, хорош, но не безупречен, а новая волна ИИ-подавителей закрывает его слабые места ценой вычислений и денег. Статья – для продакт-менеджера, основателя или ведущего инженера, которому нужно решить, хватит ли бесплатного подавителя или продукту нужен ИИ. К концу вы поймёте, почему возникает эхо, как работают оба типа подавителей, почему double-talk – это случай, отделяющий хороший подавитель от плохого, и какой тест приводит к правильному выбору.
Что такое эхо на самом деле
Начнём с петли, которая порождает проблему. Представьте двух людей в звонке – Анну и Бориса. Анна говорит. Её голос доходит до устройства Бориса, выходит из его динамика и заполняет комнату, в которой он сидит. Микрофон Бориса, стоящий тут же, ловит всё в этой комнате – включая голос Анны, выходящий из его собственного динамика. Эта пойманная копия голоса Анны отправляется обратно по сети к Анне, и та слышит саму себя мгновением позже. Эта вернувшаяся копия её собственного голоса и есть эхо.
Невыносимым это делает задержка. Если бы путь туда и обратно был мгновенным, Анна ничего бы не заметила. Но путь занимает время – сеть, буферы, дорога от динамика до микрофона, – поэтому Анна слышит свои слова, вернувшиеся через десятки или сотни миллисекунд после того, как она их произнесла. Международный ориентир, когда это становится проблемой, задаёт стандарт ITU-T по эху говорящего: чем больше задержка, тем сильнее даже слабое эхо раздражает слушателя (ITU-T G.131). За примерно несколькими десятками миллисекунд кругового пути слышимое эхо превращает разговор в мучение.
У этой проблемы есть две разновидности, и различие определяет всё дальнейшее. Первая – акустическое эхо: тот случай, что описан выше, когда звук физически выходит из динамика, проходит через воздух комнаты и снова попадает в микрофон. Это главная проблема на любом устройстве с открытым динамиком и микрофоном – ноутбуке, телефоне на громкой связи, конференц-системе. Вторая – сетевое эхо (его ещё называют линейным): более старая проблема внутри телефонной сети, где сигнал отражается от электрического узла, преобразующего четырёхпроводную линию в двухпроводную, идущую к домашнему телефону. Акустическое эхо – то, что важно для видеопродуктов в 2026 году; сетевое – в основном наследие телефонии со своим стандартом (ITU-T G.168).
Важная граница, потому что её постоянно путают: эхоподавление – это не подавление шума. Подавление шума убирает фоновые звуки вашей комнаты – вентилятор, собаку, стук клавиатуры – из вашего же микрофона. Эхоподавление убирает голос другого человека, просочившийся обратно через ваш динамик. Это разные задачи с разными входами, и полноценному продукту нужны обе. У подавления шума есть только сигнал микрофона; у эхоподавления есть второй, решающий вход, с которым мы встретимся через минуту. Подавление шума разобрано в отдельной статье про подавление шума в реальном времени; эта – только об эхе. Обе функции живут в одном чистом аудио-фронтенде, который кормит всё, что дальше, включая потоковое распознавание речи, превращающее звонок в субтитры и транскрипты.
Один вход, который делает подавление возможным
Вот идея, на которой держится вся область, и ради неё стоит притормозить. У эхоподавителя есть огромное преимущество перед подавлением шума: у него уже есть чистая копия звука, который нужно убрать.
Подумайте, что знает устройство. Когда голос Анны приходит на устройство Бориса, программа получает этот звук до того, как воспроизведёт его в динамике. Этот входящий звук дальнего конца называется опорным сигналом (reference) – известная, чистая копия того, что вот-вот выйдет из динамика. Долей секунды позже микрофон ловит грязную смесь: собственный голос Бориса, плюс шум комнаты, плюс эхо голоса Анны, который только что прозвучал. Задача подавителя – посмотреть на чистый опорный сигнал, который у него уже есть, понять, как этот опорный сигнал преобразился в пути через динамик и комнату, и вычесть эту преображённую копию из микрофонной смеси.
Инженеры используют фиксированный словарь для четырёх сигналов, и его освоение делает читаемыми любую диаграмму и любую документацию вендора. Аудио-SDK NVIDIA раскладывает их аккуратно: сигнал дальнего конца x – это голос другого человека (опорный); микрофонный сигнал ближнего конца y – это то, что ловит ваш микрофон, то есть ваша речь s плюс эхо e; а выход подавителя s' – это микрофонный сигнал с убранным эхом (NVIDIA, 2026). Вся операция – одно вычитание, выраженное простыми словами:
микрофон ближнего конца (y) = ваша речь (s) + эхо (e)
выход (s') = y − оценка e
≈ ваша речь (s), эхо убраноЕсли присутствует только голос дальнего конца, а вы молчите, идеальный подавитель выдаёт тишину – он убрал эхо, а больше ничего не было (NVIDIA, 2026). Сложность, и причина, почему это целая область, а не одно вычитание, – в словах «оценка e». Подавителю никогда не передают эхо напрямую; у него есть только опорный сигнал x, и он должен предсказать, чем этот опорный сигнал стал к моменту повторного входа в микрофон. Всё дальше – о том, как сделать это предсказание хорошим.
Как работает классический подавитель
Классический акустический эхоподавитель – конструкция, которая стоит в телефонах и конференц-системах с 1990-х и по сей день составляет ядро каждого браузера, – предсказывает эхо инструментом под названием адаптивный фильтр. Слово «фильтр» здесь означает небольшую математическую модель, которая принимает опорный сигнал и выдаёт предсказанное эхо. Слово «адаптивный» означает, что фильтр непрерывно подстраивается, потому что моделируемая им комната постоянно меняется.
Чтобы понять, что моделирует фильтр, представьте путь голоса Анны внутри комнаты Бориса. Он выходит из динамика, отражается от стола, стены, окна и потолка, и каждое отражение приходит к микрофону чуть в другое время и с другой громкостью. Этот набор задержанных, ослабленных копий называется эхо-путём (echo path) – именно он превращает чистый опорный сигнал в то конкретное эхо, которое порождает эта комната. Задача адаптивного фильтра – выучить этот эхо-путь, стать математической копией «что эта комната делает со звуком», чтобы применить то же преобразование к опорному сигналу и получить совпадающее предсказание.
Фильтр учится методом проб и ошибок, много раз в секунду. Он начинает с догадки, применяет её к опорному сигналу, чтобы предсказать эхо, вычитает это предсказание из микрофонного сигнала и смотрит на остаток – ошибку (error). Если в ошибке всё ещё есть эхо, фильтр чуть подкручивает свои настройки, чтобы её уменьшить, и повторяет. Стандартное правило этой подкрутки – алгоритм Normalized Least Mean Squares, или NLMS, который подстраивает фильтр после каждого кусочка звука так, чтобы уменьшить ошибку, масштабируя каждую поправку по громкости входа, чтобы внезапный громкий фрагмент не сбил его с пути (Benesty и др., 2015). Современные реализации делают это в частотной области – разбивая звук на частотные полосы и подстраивая каждую отдельно, – что быстрее и используется в широко распространённом open-source-подавителе SpeexDSP (Xiph.Org, 2026).
Идеальных фильтров не бывает, поэтому у классического подавителя обязательна вторая ступень. После того как фильтр вычел своё лучшее предсказание, подавитель остаточного эха (residual echo suppressor) – исторически называемый нелинейным процессором, NLP – гасит то эхо, которое фильтр не смог смоделировать, оценивая, сколько энергии эха осталось в каждой частотной полосе, и приглушая эти полосы (VOCAL Technologies, 2026). Из-за этой второй ступени даже хороший классический подавитель может делать дальний конец слегка обрезанным или «пульсирующим»: он агрессивно глушит полосы, чтобы убить остаточное эхо, и заодно цепляет часть настоящей речи.
Случай, который ломает всё: double-talk
Каждый эхоподавитель встречает одну ситуацию, которая решает, хорош он или всего лишь сносен, и это момент, когда оба говорят одновременно. Инженеры называют его double-talk.
Вспомните, как учится фильтр: он смотрит на остаточную ошибку и считает её остаточным эхом, которое надо свести к нулю. Теперь представьте, что Анна и Борис говорят одновременно. Микрофон Бориса теперь содержит эхо голоса Анны и собственную речь Бориса. Сигнал ошибки внезапно содержит настоящий голос Бориса, который вовсе не эхо. Если фильтр продолжит подстраиваться, чтобы свести эту ошибку к нулю, он примет голос Бориса за эхо и испортит свою аккуратную модель комнаты – а как только модель испорчена, эхо, которое он подавлял, просачивается обратно (Benesty и др., 2015).
Классическая защита – детектор double-talk: отдельный модуль, который следит за моментом, когда говорят обе стороны, и, сработав, замораживает адаптивный фильтр, чтобы тот перестал учиться, пока ближний говорящий не замолчит (VOCAL Technologies, 2026). Это работает, но это грубый инструмент. Заморозишь слишком рьяно – фильтр никогда не подстроится к меняющейся комнате; заморозишь слишком поздно – он уже сам себя испортил. Настройка этого компромисса – то, куда ушли десятилетия классических исследований AEC, и именно тот шов, где ИИ-подавители вырываются вперёд.
Второй сложный случай – нелинейность. Адаптивный фильтр предполагает, что динамик воспроизводит опорный сигнал точно, лишь с задержкой и ослаблением. Дешёвые динамики ноутбуков и телефонов так не делают: на большой громкости они искажают сигнал, добавляя гармоники, которых в опорном сигнале не было. Линейный фильтр не может предсказать искажение, чистой копии которого у него нет, поэтому такое нелинейное эхо проскальзывает мимо фильтра и попадает на подавитель остаточного эха, который может лишь грубо его приглушить. Нелинейное эхо динамика – главная причина, по которой классические подавители недорабатывают на потребительском железе.
Как работает ИИ-гибрид
Подход 2026 года не выбрасывает классический подавитель. Он сохраняет адаптивный фильтр – быстрый, дешёвый и по-настоящему хороший в линейной части задачи – и заменяет хрупкий бэкенд нейросетью. Поэтому тема звучит как «классический AEC плюс ИИ-гибрид», а не «ИИ вместо AEC»: лучшие системы – гибриды.
Разделение труда – ключевая идея. Классический адаптивный фильтр делает то, что всегда делал хорошо: дёшево предсказывает и вычитает основную массу линейного эха. Затем, вместо настроенного вручную нелинейного процессора, за сложный остаток берётся небольшая нейросеть. Она получает микрофонный сигнал, опорный сигнал и выход фильтра и обучена на тысячах часов реального эха распознавать, как выглядит остаточное эхо в отличие от настоящей речи ближнего конца, – включая нелинейные искажения динамика и случаи double-talk, на которых классический бэкенд спотыкается (Westhausen и Meyer, 2020). Там, где классический детектор double-talk принимает грубое решение «замораживать или нет», сеть выучила куда более тонкое суждение о том, какие части сигнала – эхо, а какие – ближний говорящий, поэтому она может подавлять эхо во время double-talk, не глуша того, кто говорит.
Широко цитируемый пример такой конструкции – DTLN-AEC, open-source-модель, чьё имя – Dual-signal Transformation LSTM Network for AEC – описывает ровно то, что она делает: берёт два сигнала (микрофон и опорный) и компактной сетью с памятью отделяет речь ближнего конца от эха (Westhausen и Meyer, 2020). Её намеренно сделали маленькой, чтобы работала в реальном времени, и это важно, потому что, как мы увидим, задержка – ворота для всего этого.
Почему это актуально сейчас, а не пять лет назад: исследовательское сообщество организовалось вокруг проблемы. С 2021 по 2023 год Microsoft проводила на главной конференции по обработке сигналов, ICASSP, ежегодный конкурс по акустическому эхоподавлению, который стандартизировал датасеты и оценку и потянул вперёд всю область. Издание 2023 года обучало модели на записях с более чем 10 000 реальных аудиоустройств и живых людей в реальных условиях, добавило персонализированный трек и – критично для живого использования – требовало от участников держать суммарную алгоритмическую плюс буферную задержку на уровне 20 миллисекунд или ниже (Cutler и др., 2023). Этот конкурс – причина, по которой готовое ИИ-эхоподавление существует как продукт с полки в 2026 году.
Таблица ниже ставит два подхода рядом по осям, которые решают продуктовый выбор. Читайте её как размены, а не как турнирную таблицу: классический подавитель выигрывает по цене и задержке, гибрид – на сложных случаях эха, а правильный столбец зависит от железа, на котором работает ваш продукт.
| Ось | Классический AEC | ИИ-гибрид |
|---|---|---|
| Линейное эхо (чистый динамик) | Сильно | Сильно (тот же адаптивный фильтр) |
| Нелинейное эхо (дешёвый динамик) | Слабо – фильтр не моделирует | Сильно – сеть выучила |
| Double-talk (оба говорят) | Грубая заморозка, глушит или течёт | Тонко, подавляет без приглушения |
| Добавленная задержка | ~0–2 мс | до ~20 мс |
| Вычисления | Очень мало (CPU, посэмплово) | Больше (CPU или GPU, кадрами) |
| Цена | Бесплатно (AEC3, SpeexDSP) | Бесплатно open (DTLN-AEC) или платный SDK (Krisp, NVIDIA) |
| Кому подходит | Гарнитуры, чистые аудиотракты | Громкие открытые динамики, искажающее железо |
Число, которое открывает дорогу живому звонку: задержка
Как и у любой аудио-функции реального времени, одно число решает, можно ли вообще использовать подавитель в живом разговоре: задержка, которую он добавляет. Подавитель, идеально звучащий на записи, но добавляющий 60 миллисекунд задержки, может быть бесполезен в двустороннем звонке, потому что эта задержка наслаивается на всё остальное и выталкивает разговор за границу, где он перестаёт ощущаться естественным.
Конкурс AEC зафиксировал планку задержки в 20 миллисекунд именно потому, что это примерно потолок, который живой канал связи может принять от одного блока обработки (Cutler и др., 2023). У задержки два источника. Первый – размер кадра: подавитель обрабатывает звук короткими кусочками и не может закончить кусочек, пока тот не пришёл целиком, поэтому кадр 10 миллисекунд означает минимум 10-миллисекундное ожидание. Второй – look-ahead (заглядывание вперёд): модель, которая тянется в предстоящий звук ради лучшего решения, должна дождаться его прихода, добавляя ещё задержку. Классические подавители добавляют очень мало – они работают посэмплово. ИИ-подавители добавляют больше, поэтому их проектируют под жёсткий бюджет задержки, а не только ради качества.
Сделаем конкретным через бюджет разговора. Ориентир ITU-T для односторонней задержки «рот-в-ухо» – держать её на уровне 150 миллисекунд или ниже, чтобы разговор ощущался естественным (ITU-T G.114). Допустим, остальной конвейер – сеть, захват, кодирование, декодирование – уже занимает 110 миллисекунд:
150 мс (цель G.114) − 110 мс (остальной конвейер) = 40 мс осталосьКлассический подавитель, добавляющий пару миллисекунд, едва трогает эти 40 миллисекунд запаса. ИИ-подавитель, построенный под 20-миллисекундный бюджет AEC-конкурса, тратит половину:
40 мс запаса − 20 мс (AI-подавитель) = 20 мс остаётсяЭто правильный размен, когда выигрыш ИИ-подавителя в качестве стоит задержки, и неправильный, когда конвейер и так на пределе. Правило – сначала зафиксировать бюджет задержки и искать качество внутри него, никогда наоборот. Более широкий вопрос о том, куда уходит каждая миллисекунда и где должен жить подавитель (на устройстве, на edge или в облаке), разобран в статье про задержку и топологию развёртывания.
Как понять, что подавитель действительно хорош – метрики
Вендоры обожают клип «до и после», который ничего не доказывает, потому что клип выбрали они. Две объективные меры позволяют читать любой бенчмарк критически, и отвечают они на разные вопросы.
Классическая инженерная мера – Echo Return Loss Enhancement, или ERLE: сколько децибел эха убирает подавитель, измеренных, когда говорит только дальний конец. Высокий ERLE означает сильное подавление эха в простом случае single-talk. Его ограничение в том, что он ничего не говорит о double-talk и не отслеживает, как звонок воспринимает человек, – подавитель может выдать отличный ERLE, калеча при этом голос ближнего конца (Purin и др., 2021).
Современная мера это исправляет. AECMOS, нейросетевая модель от Microsoft, слушает обработанный клип и предсказывает оценку, которую дала бы человеческая панель прослушивания, оценивая раздражающее эхо и прочие ухудшения отдельно, и для этого ей не нужен чистый опорный клип (Purin и др., 2021). Поскольку она оценивает эхо и деградацию речи порознь, она ловит подавитель, который убивает эхо, заодно убивая голос, – провал, который ERLE прячет. AECMOS – метрика, по которой AEC-конкурс ранжировал решения, и она в свободном доступе, так что вы можете оценить своих кандидатов на собственных записях (Cutler и др., 2023). Для продуктового решения запускайте AECMOS на клипах, записанных в ваших реальных условиях – на ваших реальных устройствах, в ваших реальных комнатах, – а любой демо-ролик вендора считайте маркетингом.
Сначала бесплатная база – браузер уже подавляет эхо
Прежде чем интегрировать любой ИИ-подавитель, проверьте, нужно ли это, потому что веб-платформа уже подавляет эхо, и включение – это одна строка. Стандарт W3C, определяющий, как веб-страница получает доступ к микрофону, включает ограничение echoCancellation, и когда вы запрашиваете микрофон с ним, браузер применяет встроенный подавитель (W3C, 2026).
// Запросить микрофон со встроенным эхоподавлением браузера.
navigator.mediaDevices.getUserMedia({
audio: { echoCancellation: true, noiseSuppression: true }
});Этот встроенный подавитель – не игрушка. В Chrome и любом Chromium-браузере это AEC3, эхоподавитель третьего поколения из WebRTC, зрелый классический гибрид, который хорошо справляется с линейным эхом и double-talk и бесплатно поставляется на миллиарды устройств (BlogGeek.me, 2026). Для значительной доли продуктов – особенно настольных конференций, где пользователи в гарнитурах и эхо-путь слабый, – AEC3 с echoCancellation: true действительно достаточно, и правильное инженерное решение – отгрузить его и идти дальше.
За базу вы выходите в конкретных случаях: использование «на громкой связи», где динамик громкий и близко к микрофону; дешёвое железо, которое искажает и даёт сильное нелинейное эхо; или продукт, где качество звука – заголовочная фича и остаточные артефакты AEC3 недопустимы. Тогда вы лицензируете ИИ-подавитель – Krisp, чей SDK включает ИИ-эхоподавление по умолчанию и работает целиком на устройстве, или аудио-SDK NVIDIA с GPU-ускоренным эффектом AEC на 16 или 48 кГц – и пропускаете звук через него вместо браузерного или вдобавок к нему (Krisp, 2026; NVIDIA, 2026). Тот же выбор вендора и размен «на устройстве или в облаке» возникает и для подавления шума, и мы подробно разбираем эту развилку «делать или покупать» в статье про подавление шума. Глубокая механика встраивания собственного подавителя в живой WebRTC-конвейер – где он стоит, как избежать двойного подавления – это тема нашего инженерного playbook по ИИ в видеоконференциях.
Частая ошибка – стек из двух подавителей
Самая частая ошибка команд – гонять на одном потоке два эхоподавителя, сами того не замечая. Лицензируют ИИ-подавитель, подают на него микрофонный звук и забывают, что браузерное echoCancellation всё ещё включено, так что сигнал проходит сначала через AEC3, а потом через ИИ-подавитель.
Результат хуже, чем любой из них по отдельности. Браузерный подавитель уже вычел свою оценку эха и применил подавление остатка, так что звук, доходящий до ИИ-подавителя, больше не совпадает с опорным сигналом, который ИИ-подавитель ждёт, – эхо, которое он обучен убирать, уже частично искажено первой ступенью. Два подавителя борются друг с другом, адаптация путается, и часто слышно больше артефактов, а не меньше. Решение – выбрать один подавитель на поток: если используете ИИ-подавитель, выключите браузерный через echoCancellation: false и подавайте на ИИ-подавитель сырые микрофонный и опорный сигналы, которые ему нужны. Подавитель работает только тогда, когда получает необработанные входы, под которые спроектирован.
Где здесь Фора Софт
Мы строим продукты, где эхо непростительно, – платформы видеоконференций, телемедицинские системы, где врач и пациент должны вести естественный разговор, онлайн-классы со множеством открытых микрофонов и инструменты прямого вещания. В этой работе выбор подавителя редко про единственную высшую оценку качества; он про соответствие подавителя устройству, на котором продукт реально работает. Настольному конференц-инструменту, ориентированному на гарнитуры, обычно достаточно встроенного AEC3, и платить за большее не стоит. Мобильный или киоск-продукт с громким открытым динамиком близко к микрофону – худший случай для нелинейного эха – это там, где ИИ-подавитель на устройстве оправдывает свою цену. Мы применяем такой порядок: сначала зафиксировать бюджет задержки, затем определить худший эхо-путь, который продукт обязан пережить, и только потом решать, закрывает ли его бесплатный подавитель или нужен ИИ, – потому что подавитель, который рвёт бюджет задержки, это не высокое качество, а непригодность.
Как выбрать – пять вопросов
Идите по ним по порядку; каждый сужает поле.
- Достаточно ли встроенного подавителя браузера? Включите echoCancellation: true, протестируйте на реальных пользователях и реальных устройствах, и если жалобы на эхо прекратились – отгружайте и остановитесь здесь. AEC3 бесплатен и хорош.
- Каков эхо-путь? У гарнитур и наушников слабый эхо-путь, который встроенный подавитель легко тянет. Громкий открытый динамик рядом с микрофоном – громкая связь, киоск, переговорка – это сложный случай, где может понадобиться ИИ.
- На каком железе это будет работать? Дешёвые искажающие динамики дают нелинейное эхо, которое классические подавители пропускают; это указывает на ИИ-подавитель. Чистому аудиотракту он может и не понадобиться.
- Каков ваш бюджет задержки? Посчитайте арифметику G.114 для вашего конвейера. Классический подавитель стоит почти ничего; ИИ – до ~20 миллисекунд: убедитесь, что запас есть, прежде чем брать.
- Хостить или покупать? Открытые модели вроде DTLN-AEC или SpeexDSP бесплатны, но интегрируете, настраиваете и поддерживаете их вы; Krisp и NVIDIA – платные SDK, отдающие готовое качество и покрытие платформ за деньги.
Главные выводы
- Эхо – это голос дальнего конца, просочившийся через ваш динамик и микрофон, а не фоновый шум.
- Суперсила подавителя – опорный сигнал: чистая копия звука, который надо убрать.
- Классический AEC адаптивным фильтром предсказывает и вычитает эхо плюс подавитель остатка.
- Double-talk и нелинейные искажения динамика – случаи, где классика работает хуже всего.
- ИИ-гибриды сохраняют фильтр и добавляют нейросеть, которая бьёт оба слабых места.
- Сначала пробуйте бесплатное echoCancellation браузера (AEC3); ИИ – только если его не хватает.