Krisp, NVIDIA Maxine и Dolby – покупать или строить движок улучшения речи

Автор: Николай СапуновОбновлено: август 202616 мин чтения
Содержание статьи +

Кратко

Когда вам нужно чистое аудио в живом видеопродукте, перед вами одно решение из двух слоёв: собрать движок улучшения речи самому или купить, а если купить – выбрать вендора, чья модель работы подходит вашему продукту. Три самых известных коммерческих имени – Krisp, NVIDIA Maxine (переименованный в 2026 году в NVIDIA AI for Media) и Dolby – не взаимозаменяемы: Krisp работает на устройстве пользователя и не требует серверов, Maxine работает на ваших собственных видеокартах NVIDIA и меняет более высокую цену на самый широкий набор эффектов, а у Dolby self-service-путь к real-time-голосу фактически закрылся после того, как Dolby свернул свою платформу для разработчиков в Dolby OptiView для стриминга. Бесплатная альтернатива – открытые модели вроде RNNoise и DeepFilterNet – ничего не стоит по лицензии, но делает вас сопровождающим, интегратором и владельцем потолка качества. Эта статья даёт понятную карту того, чем на самом деле является каждый вариант, сколько он стоит, где работает, и фреймворк выбора, чтобы вы выбрали один раз и выбрали правильно.

Почему Это Важно

Если ваш продукт ведёт живые звонки – видеоконференции, телемедицина, голосовой ИИ-агент, инструмент для продаж, виртуальный класс – фоновый шум это самый быстрый способ сделать продукт дешёвым на ощупь, а движок улучшения речи это лекарство. Ловушка в том, что выбор выглядит как конкурс качества («какая модель звучит лучше?»), хотя на деле это решение про операции и стоимость («какую модель я смогу запустить там, где реально находится моё аудио, по цене, переживающей рост, от вендора, который будет существовать и через год?»). Статья для продакт-менеджера, основателя или инженерного лида, которому нужно принять это решение и защитить его, не дав обмануть себя гладкой демкой. К концу вы поймёте, что на самом деле продают Krisp, NVIDIA Maxine и Dolby, почему два из них сдвинулись под ногами индустрии в 2024–2026 годах, как устроены деньги для «собрать» против каждого «купить» и какой простой набор вопросов ведёт к правильному ответу для вашего продукта. Глубокий вопрос о том, где в WebRTC-звонке физически цепляется подавитель, разобран в нашей спутниковой статье про шумоподавление в WebRTC; эта же статья про то, какой движок выбрать.

Сначала – Что Значит «Улучшение Речи»

Прежде чем сравнивать вендоров, зафиксируем то, что все они продают. Движок улучшения речи в этой статье это софт, который берёт поток речевого аудио и убирает то, что вы не хотите слышать – постоянный шум вроде вентилятора, резкий шум вроде двери, эхо комнаты, а в лучших движках и чужие голоса, – сохраняя при этом естественное звучание основного говорящего. Самая базовая задача называется шумоподавлением (noise suppression, оно же noise cancellation): приглушить не-речевой звук. Более сильная задача, которую делают только некоторые движки, это подавление фоновых голосов, обычно сокращаемое до BVC (background voice cancellation): удаление близких человеческих голосов, не принадлежащих основному говорящему, чтобы коллега, говорящий через комнату, не попал в ваш звонок или транскрипт.

Два факта про эти движки определяют всё дальнейшее. Первый: они должны работать с сырым, несжатым звуком – самими аудиосэмплами, – потому что модель читает, какие частоты это речь, а какие шум. Второй: эта работа стоит вычислений, и где эти вычисления происходят – на ноутбуке и телефоне самого говорящего или на ваших серверах – это и есть самое большое различие между вендорами ниже. Держите обе мысли.

Это Спектр «Собрать–Купить», А Не Бинарность

Говорят «собрать или купить», как будто есть две коробки. В улучшении речи есть спектр, и вендоры стоят в разных его точках. На одном конце вы собираете: берёте бесплатную открытую модель и сами обслуживаете каждую её часть. На другом конце вы покупаете полностью управляемый движок, который работает на устройстве пользователя и ничего не просит у ваших серверов. Между ними сидит гибрид, где вы лицензируете модель вендора, но запускаете её на своём железе. Понимание того, какую точку занимает вендор, говорит больше, чем любая оценка качества.

Рисунок 1. «Собрать против купить» это спектр, измеряемый тем, сколько вы обслуживаете – от открытых моделей, которые вы запускаете полностью сами, через средний путь Maxine «лицензируй модель и запусти сам», до полностью управляемых движков вроде Krisp, работающих на устройстве пользователя.

Ось на Рисунке 1 намеренно не «как хорошо звучит». Качество важно, но это второй вопрос. Первый операционный: каждый шаг вправо убирает работу и железо с ваших плеч и заменяет их лицензионной платой. Где именно приземлиться – зависит от вашего бюджета, команды, устройств, с которых приходит аудио, и от того, насколько вы доверяете вендору держать курс. Дальше мы разместим каждое имя на этом спектре и превратим его в решение.

Собрать: Бесплатный Конец, Где Сопровождающий – Вы

Самый левый вариант – взять открытую модель и запустить всё самому. Здесь доминируют две модели. RNNoise это крошечный бесплатный подавитель шума, который сжимается до нескольких сотен килобайт и работает в любом браузере; он хорош на постоянном шуме и слабее на сложных случаях вроде перекрывающихся голосов. DeepFilterNet это более тяжёлая открытая модель, звучащая заметно лучше ценой большего размера и большей обработки. Обе действительно бесплатны по лицензии – RNNoise под разрешительной BSD, DeepFilterNet под MIT и Apache, – поэтому «собрать» так заманчиво.

Слово «бесплатно» прячет настоящий счёт. Когда вы собираете, вы компилируете модель, встраиваете её в звуковой тракт, управляете буферизацией, которой требует real-time-аудио, тестируете на каждом браузере и телефоне и владеете результатом навсегда. Если новая версия браузера ломает вашу звуковую обвязку – это ваш баг. Если пользователи жалуются, что модель пропускает какой-то шум, – эскалировать некуда, её улучшение это ваш проект. Лицензия бесплатна; инженерия, сопровождение и потолок качества – ваши. Для браузерного продукта с обычным шумом и инженерной командой, которая хочет контроль, это правильный и самый дешёвый ответ. Для команды, которая хочет, чтобы чистое аудио было чужой заботой, это ловушка, переодетая в экономию. Внутренняя механика этих моделей – как они сравниваются по скорости, качеству и лицензии – разобрана в нашем разборе моделей шумоподавления.

Купить, Полностью Управляемое: Krisp Работает На Устройстве Пользователя

Krisp это имя, которое команды слышат первым, и оно сидит на дальнем конце «Купить» по конкретной причине: его модель работает на устройстве самого говорящего, так что вы не обслуживаете под неё никаких серверов вообще. Krisp это компания Voice ИИ, основанная в 2017 году и базирующаяся в Беркли, Калифорния. По собственному заявлению компании, аудио никогда не покидает устройство – модель обрабатывает звук локально и ничего не загружает, – а это сильное свойство приватности для телемедицины и любого регулируемого продукта. Её технология шумоподавления работает более чем на двухстах миллионах устройств и обрабатывает свыше семидесяти пяти миллиардов минут голоса в месяц, и она стоит за шумоподавлением внутри Discord, RingCentral и Zoho, а через партнёрства подключается к платформам звонков Twilio и Daily.

Что вы реально покупаете у Krisp – это SDK (software development kit, готовая библиотека кода, которую вы вставляете в приложение) для Windows, macOS, Linux, Android, iOS и браузеров, последнее через сборку WebAssembly. SDK делает больше, чем базовое удаление шума. В него входят: подавление фоновых голосов (BVC), модель, убирающая чужие голоса; изоляция голоса, настроенная под голосовых ИИ-агентов, чтобы бота не перебивала фоновая болтовня; конвертация акцента; и поэкадровая статистика, которую можно мониторить. В живом звонке стандартная модель добавляет примерно двадцать пять миллисекунд задержки, а более лёгкая около пятнадцати – достаточно мало, чтобы остаться внутри тайминга естественного разговора, того самого бюджета задержки до 100 мс, который обязана уважать любая real-time-фича.

Подвох коммерческий, а не технический. SDK для разработчиков у Krisp продаётся как корпоративная лицензия – обычно годовой контракт с авансовым обязательством, цена которого согласуется через продажи, а не публикуется за минуту. Конкурент ai-coustics высказывает эту критику открыто, утверждая, что цены Krisp подходят зрелым корпоративным внедрениям, но могут быть жёсткими для маленького стартапа, который хочет скачать, протестировать и масштабироваться постепенно. Относитесь к этому как к фрейму конкурента, а не как к истине – но форма реальна: Krisp это решение «купить», которое вы принимаете осознанно, по контракту, а не по карте. Взамен вы получаете качество продакшен-уровня на каждой платформе с нулём серверных операций, что для многих продуктов ровно стоит своей цены.

Купить Модель, Запустить Самому: NVIDIA Maxine (Теперь AI For Media)

Предложение NVIDIA сидит в середине спектра, и в 2026 году оно носит новое имя, которое стоит назвать прямо: NVIDIA Maxine переименован в NVIDIA AI for Media. Доступ к его SDK и сервисам продолжается без перерыва; технология та же, бренд новый. Мы будем писать «Maxine (AI for Media)», чтобы старое имя, которое вы могли искать, всё ещё связывалось.

Maxine отличается от Krisp в самом важном: он не работает на устройстве пользователя, он работает на видеокартах NVIDIA – то есть на ваших серверах, ваших облачных GPU или рабочих станциях класса NVIDIA. Его компонент Audio Effects даёт real-time-удаление шума, удаление эха комнаты, аудио-суперразрешение и акустическое эхоподавление, а отдельная модель под названием Studio Voice поднимает обычное аудио с микрофона к студийному качеству. Всё это ускоряется тензорными ядрами внутри GPU класса NVIDIA RTX, и SDK требует такого GPU плюс минимум десять гигабайт памяти. Это требование к железу и есть вся суть: Maxine покупает вам, пожалуй, самый широкий и высокопотолочный набор аудиоэффектов на рынке, но только если вы можете поставить GPU NVIDIA туда, где находится ваше аудио.

Коммерческая модель следует за железом. Прототипировать против облачного API-каталога NVIDIA можно бесплатно и запросить 90-дневную ознакомительную лицензию, но продакшен идёт через NVIDIA AI Enterprise – софтверную подписку по цене около четырёх с половиной тысяч долларов за GPU в год, или около одного доллара за GPU-час в облаке, поверх стоимости самого GPU или его аренды. Это делает Maxine самым тяжёлым «купить» в эксплуатации: вы не просто лицензируете модель, вы держите флот. Расплата – полный пайплайн улучшения: аудио плюс видео-суперразрешение, фоновые эффекты и так далее, на инфраструктуре, которую вы контролируете, что подходит вещанию, крупному стримингу и ИИ-агентам, уже живущим на GPU-серверах. О более широкой экономике запуска ИИ на GPU в видеопродукте смотрите нашу статью про модель стоимости.

Числовой Пример: Сколько Стоит «Запустить Самому» На Масштабе

Стоимость Maxine становится реальной, только когда на неё ставят числа, поэтому вот разобранный пример с показанной арифметикой. Допустим, вы держите платформу голосовых ИИ-агентов и вам нужно чистить тысячу входящих аудиопотоков одновременно, на серверной стороне, потому что аудио приходит с телефонов и устройств, которые вы не контролируете. Аудиоэффекты Maxine работают на GPU, поэтому вопрос в том, сколько GPU нужно такому флоту.

В качестве иллюстрации – вы обязаны измерить это для своей нагрузки, потому что NVIDIA не публикует единой цифры «потоков на GPU» – допустим, что один GPU комфортно держит сто одновременных real-time-аудиопотоков. Тогда:

1000 потоков ÷ 100 потоков на GPU = 10 GPU

Теперь применим стоимость лицензии, которая взята из источника, а не выдумана. NVIDIA AI Enterprise стоит около $4 500 за GPU в год:

10 GPU × $4 500 за GPU-год = $45 000 в год только за софтверные лицензии

И это до самих GPU. Аренда их в облаке примерно по доллару за GPU-час, непрерывно, добавляет:

10 GPU × $1 за GPU-час × 24 часа × 365 дней = $87 600 в год за аренду GPU

Итого развёртывание Maxine на тысячу потоков выходит около $132 600 в год за лицензии плюс облачные GPU, и вы всё ещё держите флот. Теперь сравните форму счёта с Krisp, где модель работает на устройстве каждого пользователя: ваша серверная стоимость на чистку аудио по сути нулевая, а вместо неё вы платите годовую лицензию SDK, цена которой не растёт с каждым одновременным потоком так, как растёт аренда GPU. Урок не в том, что одно число побеждает другое – а в том, что форма счёта различается. Стоимость Maxine растёт с серверной нагрузкой; Krisp – с контрактом; «собрать» – с инженерными часами. Выбирайте форму, совпадающую с тем, как растёт ваш продукт.

Поучительная История: Dolby Сдвинулся, И Один «Купить» Закрылся

Dolby принадлежит любому сравнению «Krisp против Maxine против Dolby», потому что команды всё ещё ищут его – и потому что то, что с ним случилось, это самый важный урок «собрать против купить» на этой странице. Годами платформа Dolby для разработчиков, Dolby.io, предлагала self-service-API для real-time-коммуникаций на технологии под названием Voxeet, и эти звонки несли шумоподавление Dolby Voice. Если вы хотели купить голосовую чистку уровня Dolby для живого конференц-продукта – это была та дверь.

В 2024 году эта дверь начала закрываться. В августе 2024 Dolby приобрёл THEO Technologies, разработчика плееров для низколатентного стриминга, и в течение 2025–2026 свернул свою платформу для разработчиков в новый бренд Dolby OptiView. Продукты OptiView сегодня это видеоплеер, live- и real-time-стриминг и рекламные инструменты – среди них нет self-service-продукта для real-time-конференций-и-голоса. Старая документация по Communications теперь редиректит в документацию OptiView по стримингу. Dolby по-прежнему делает отличные аудиотехнологии, и отдельный файловый API для улучшения медиа из записанного аудио существует, но живой self-service-путь «купи Dolby Voice для своего звонка», который конкурирующие статьи всё ещё описывают, фактически свёрнут.

В этом урок, и он дороже любого сравнения фич: «купить» это ставка на дорожную карту вендора, а дорожные карты двигаются. Команда, построившая конференц-продукт на Communications API от Dolby в 2023, провела 2024–2026 в миграции с них. Риск не в том, что Dolby сделал что-то плохое – компании меняют фокус, – а в том, что отдавать ключевую возможность на аутсорс значит наследовать чужую стратегию. Когда вы покупаете, вам нужно читать не только демку, но и направление.

Рисунок 2. Платформа Dolby для разработчиков сдвинулась от self-service real-time-коммуникаций (с Dolby Voice) к ориентированному на стриминг Dolby OptiView после покупки THEO в 2024 – самое ясное напоминание, что купленная возможность едет на дорожной карте вендора.

Частая Ошибка: Купить Демку Вместо Соответствия

Самая дорогая ошибка во всей этой теме – выбрать вендора по звуку демки. Каждый движок на этой странице звучит впечатляюще в контролируемом клипе; демка это лёгкая часть. Вопросы, которые реально решают успех, никогда не в демке, и их пропуск это то, как команды через год оказываются на переписывании.

Задайте их до любого контракта. Работает ли движок там, где физически находится ваше аудио? Krisp работает на устройстве пользователя, поэтому он бесполезен для чистки аудио, приходящего с телефонной линии, которую вы не контролируете; Maxine работает на ваших GPU, поэтому он бесполезен, если у вас нет GPU и вы не хотите флот. Указывает ли дорожная карта вендора в ту же сторону, что и ваш продукт, или вы вот-вот станете следующей историей миграции, как с Dolby? Масштабируется ли цена вместе с тем, с чем масштабируется ваш продукт, – одновременными потоками, устройствами или местами в контракте? И можете ли вы проверить качество реальным повторяемым тестом, а не клипом вендора – для подавителей шума это означает прослушивание в стиле ITU-T P.835, где люди отдельно оценивают речь, фон и общий результат, так что вы измеряете улучшение честно, а не доверяете маркетинговой осциллограмме. Вендор, который проходит демку, но проваливает любой из этих четырёх вопросов, это неправильная покупка.

Вендоры Рядом

Когда каждый вариант размещён на спектре, а ловушка демки названа, сравнительная таблица читается как операции, а не как турнирная таблица.

КритерийСобрать: RNNoise / DeepFilterNetКупить: KrispКупить: NVIDIA Maxine (AI for Media)Купить: Dolby
Что вы получаетеБесплатную открытую модельУправляемый on-device SDKЛицензию на модели для ваших GPUИсторически – управляемый облачный голосовой API
Где работаетГде вы поставитеУстройство самого пользователяВаши GPU NVIDIAБыло облако Dolby
Нужное железоЛюбое (CPU)Любое (CPU, на устройстве)GPU NVIDIA RTX + 10 ГББыло не нужно (облако)
Подавление фоновых голосовНетДаНабор эффектов (шум, эхо, супер-рез)Dolby Voice (легаси)
Форма стоимостиБесплатная лицензия, ваша инженерияГодовой контракт на SDK~$4 500/GPU-год + цена GPUн/д – путь свёрнут
Аудио покидает устройствоНа ваш выборНетНа ваши серверыБыло в облако Dolby
Статус в 2026Активна, сообществоАктивен, широко развёрнутАктивен, переименован в AI for MediaСвёрнут в OptiView (стриминг)
Лучше всего дляТолько браузер, обычный шум, контрольКросс-платформа, on-device, ноль серверных операцийGPU-серверные пайплайны, вещание, агентыНе текущий real-time-вариант покупки

Читайте таблицу как набор компромиссов, а не победителей. «Собрать» это самая дешёвая лицензия и самая дорогая команда. Krisp это самая низкая операционная нагрузка – ничего не работает на ваших серверах – ценой корпоративного контракта. Maxine это самый высокий потолок и самый широкий набор эффектов, оплаченный GPU и операциями. Dolby это напоминание проверить дорожную карту до того, как вы привяжетесь. Есть и быстро растущая четвёртая форма, о которой стоит знать: новые управляемые вендоры вроде ai-coustics предлагают on-device CPU-only SDK – его real-time-модель работает менее чем за тридцать миллисекунд с малым следом и без GPU – и продаётся с self-service-ценами «плати по мере роста», а не авансовым корпоративным контрактом, что сужает старое преимущество Krisp как единственного готового варианта.

От Спектра К Решению

Превратим всё это в путь, по которому реально можно пройти. Дерево решений ниже улаживает по порядку вопросы, которые имеют значение: достаточно ли бесплатной базы, приходит ли ваше аудио с устройств, которые вы контролируете, и держите ли вы уже GPU – потому что каждый ответ отсекает варианты и указывает на один дом.

Рисунок 3. Путь решения: сначала попробуйте бесплатную базу, затем выбирайте по тому, откуда приходит аудио и держите ли вы уже GPU – а не по тому, чья демка звучит лучше.

Дерево кодирует простой приоритет. Начните бесплатно: если встроенный подавитель браузера уже снимает жалобы, выпускайте его и тратьте бюджет на другое. Если нет, решающий вопрос – откуда приходит ваше аудио. Если часть его прилетает с телефонов, ИИ-агентов или устройств, которые вы не контролируете, вам нужен серверный движок, и тогда вопрос в том, держите ли вы уже GPU NVIDIA – если да, набор эффектов Maxine естественно подходит; если нет, управляемый on-device SDK, который вы запускаете и на сервере, или CPU-only управляемый движок, избегают подъёма GPU-флота. Если каждый участник в браузере или приложении, которое вы контролируете, вы выбираете между покупкой готового on-device SDK (Krisp или ai-coustics) ради нуля серверных операций или сборкой из RNNoise или DeepFilterNet ради бесплатной лицензии и полного контроля. Одна ловушка, которой стоит избегать всюду: никогда не запускайте два подавителя сразу – встроенный плюс купленный обрабатывают аудио дважды и делают хуже, ловушка подробно разобрана в статье про интеграцию в WebRTC.

Почему Сравнение Постоянно Сдвигается

Одна причина, по которой тема сложна, в том, что почва постоянно двигается, и три имени сдвинулись в трёх разных направлениях всего за два года. Krisp расширился от шумоподавления к более широкому набору voice-ИИ для агентов – управление очередью реплик, изоляция голоса, конвертация акцента – гонясь за бумом голосовых ИИ-агентов. NVIDIA переименовала Maxine в AI for Media и толкнула его глубже в вещание и GPU-серверные пайплайны. Dolby полностью вышел из self-service real-time-голоса и сфокусировался на стриминге. Сравнение, написанное в 2023, ошиблось бы во всех трёх сегодня. Практическая защита – относиться к выбору вендора как к решению с датой пересмотра, а не вечному браку: хотя бы раз в год переподтверждайте, что купленный движок всё ещё работает там, где нужно, всё ещё стоит ожидаемого и всё ещё сидит на дорожной карте вендора, направленной в вашу сторону. У эхоподавления, соседней проблемы, которую эти движки тоже затрагивают, свой подвижный ландшафт, разобранный в нашей статье про эхоподавление в WebRTC.

Где В Этом Фора Софт

Мы строим живые видеопродукты, зависящие от чистого аудио – платформы видеоконференций, телемедицинские консультации, где врач обязан расслышать каждое слово, e-learning-классы и инструменты для ИИ-встреч, – и в этой работе вопрос «собрать или купить» возникает почти в каждом проекте. Паттерн, который мы применяем, это спектр выше, улаженный по порядку: начать с бесплатной встроенной базы, потянуться за открытой моделью вроде RNNoise, когда браузерному продукту нужно больше, а команда хочет контроль, и перейти к управляемому движку, когда продукт охватывает много платформ, принимает телефонных абонентов или держит голосовых ИИ-агентов на устройствах, которые мы не контролируем. Для чувствительных к приватности вертикалей вроде телемедицины on-device-движок, не загружающий аудио, часто становится решающим фактором сам по себе. Дисциплина, экономящая больше всего переделок, ровно та, за которую агитирует эта статья: выбирать по тому, где живёт аудио и как масштабируется стоимость, проверять реальным прослушиванием, а не клипом вендора, и ставить годовой пересмотр на дорожную карту вендора, чтобы сдвиг вроде дольбиевского никогда не оставил уже выпущенный продукт на мели.

Ключевые Выводы

  • «Собрать против купить» это спектр, ранжированный тем, сколько вы обслуживаете, а не качеством демки.
  • Krisp работает на устройстве пользователя: ноль серверных операций, корпоративный контракт, сильная приватность.
  • NVIDIA Maxine (теперь AI for Media) работает на ваших GPU NVIDIA: шире эффекты, выше стоимость.
  • Dolby свернул платформу для разработчиков в стриминговый OptiView – покупка real-time-голоса закрылась.
  • Форма стоимости различается: GPU растут с нагрузкой, SDK с контрактами, «собрать» с инженерными часами.
  • Выбирайте по тому, где живёт аудио; проверяйте прослушиванием ITU-T P.835, пересматривайте раз в год.

Что Почитать Дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.