Krisp, NVIDIA Maxine и Dolby – покупать или строить движок улучшения речи

Автор: Николай СапуновОбновлено: август 202616 мин чтения
Содержание статьи +

Кратко

Когда вам нужно чистое аудио в живом видеопродукте, перед вами два варианта: собрать движок улучшения речи самостоятельно или купить готовое решение. Если выбирать коммерческое – важно подобрать вендора, подходящего под ваш продукт. Три самых известных имени на рынке – Krisp, NVIDIA Maxine (переименованный в 2026 году в NVIDIA AI for Media) и Dolby – не являются взаимозаменяемыми. Krisp работает на устройстве пользователя и не требует серверов, Maxine использует ваши собственные видеокарты NVIDIA и предлагает самый широкий набор эффектов, но за более высокую цену, а у Dolby путь к real-time-обработке голоса через self-service-формат фактически закрыт после свёртывания платформы для разработчиков в пользу Dolby OptiView для стриминга. Бесплатная альтернатива – открытые модели вроде RNNoise и DeepFilterNet – бесплатны по лицензии, но делают вас ответственным за сопровождение, интеграцию и контроль качества. Эта статья даёт понятную карту каждого из вариантов: что они собой представляют, сколько стоят, где работают, и предлагает фреймворк выбора, чтобы вы один раз приняли правильное решение.

Почему это важно

Если ваш продукт работает с живыми звонками – видеоконференции, телемедицина, голосовой ИИ-агент, инструмент для продаж, виртуальный класс – фоновый шум – это самый быстрый способ сделать продукт дешёвым на ощупь, а движок улучшения речи – лекарство. Ловушка в том, что выбор кажется соревнованием качества («какая модель звучит лучше?»), хотя на деле это вопрос операций и стоимости («какую модель я смогу запустить там, где реально находится моё аудио, по цене, устойчивой к росту, от вендора, который будет существовать и через год?»).

Статья для продакт-менеджера, основателя или инженерного лида, которому нужно принять это решение и защитить его, не попавшись на гладкую демку. К концу вы поймёте, что на самом деле продают Krisp, NVIDIA Maxine и Dolby, почему два из них оказались под ударом в 2024–2026 годах, как устроены деньги в расчёте «собрать» против «купить» и какой простой набор вопросов ведёт к правильному ответу для вашего продукта.

Глубокий вопрос о том, где в WebRTC-звонке физически цепляется подавитель, разобран в нашей спутниковой статье про шумоподавление в WebRTC; эта же статья – про то, какой движок выбрать.

Сначала – Что значит «улучшение речи»

Прежде чем сравнивать вендоров, определим, что именно они продают. В этой статье под «движком улучшения речи» понимается программное обеспечение, которое обрабатывает поток речевого аудио и удаляет всё, что вы не хотите слышать – постоянный шум вроде вентилятора, резкие звуки вроде хлопающей двери, эхо помещения, а в более продвинутых решениях – даже чужие голоса, – при этом сохраняя естественное звучание основного говорящего.

Самая базовая задача называется шумоподавлением (noise suppression, или noise cancellation): она направлена на подавление неречевых звуков. Более сложная задача, которую реализуют только некоторые движки, – подавление фоновых голосов, обычно сокращаемое до BVC (background voice cancellation): удаление близких человеческих голосов, не принадлежащих основному говорящему, чтобы, например, коллега, разговаривающий в соседней комнате, не попал в ваш звонок или транскрипт.

Два факта о этих движках определяют всё дальнейшее. Первый: они должны работать с сырым, несжатым звуком – с аудиосэмплами напрямую, – потому что модель анализирует, какие частоты относятся к речи, а какие – к шуму. Второй: эта обработка требует вычислительных ресурсов, и где происходят эти вычисления – на устройстве говорящего (ноутбуке или телефоне) или на ваших серверах – и есть ключевое различие между вендорами ниже. Держите эти две мысли в голове.

Это спектр «Собрать–Купить», а не бинарность

Говорят «собрать или купить», будто выбор сводится к двум коробкам. На самом деле в улучшении речи – спектр, и вендоры занимают разные его точки. На одном конце – полный контроль: вы берёте бесплатную открытую модель и сами обслуживаете каждую её часть. На другом – полная автономность: покупаете полностью управляемый движок, который работает на устройстве пользователя и не требует доступа к вашим серверам. Между ними – гибридный вариант: вы лицензируете модель у вендора, но запускаете её на собственном железе. Понимание того, где именно находится вендор, говорит больше, чем любая оценка качества.

Рисунок 1. «Собрать против купить» – это спектр, измеряемый тем, насколько активно вы участвуете в обслуживании: от открытых моделей, которые вы запускаете полностью самостоятельно, через промежуточный вариант Maxine «лицензируй модель и запусти сам» на своих GPU, до полностью управляемых решений вроде Krisp, работающих на устройстве пользователя.

Ось на Рисунке 1 намеренно не «как хорошо звучит». Качество важно, но это вопрос вторичный. Первый – операционный: каждый шаг вправо снимает с вас нагрузку и оборудование, заменяя их лицензионными платежами. Где именно остановиться – зависит от вашего бюджета, команды, устройств, с которых поступает аудио, и от того, насколько вы доверяете вендору соблюдать курс. Дальше мы разместим каждое решение на этом спектре и превратим его в конкретное имя.

Собрать: Бесплатный Конец, Где Сопровождающий – Вы

Самый левый вариант – взять открытую модель и запустить всё самостоятельно. Здесь доминируют две модели. RNNoise – это компактный бесплатный шумоподавитель, который сжимается до нескольких сотен килобайт и работает в любом браузере; он хорошо справляется с постоянным фоновым шумом, но хуже справляется со сложными случаями, например, с перекрывающимися голосами. DeepFilterNet – более тяжёлая открытая модель, звучащая заметно лучше, но требующая большего объёма памяти и вычислительных ресурсов. Обе модели действительно бесплатны по лицензии – RNNoise распространяется под разрешительной лицензией BSD, а DeepFilterNet – под MIT и Apache, – поэтому «собрать» решение так и хочется.

Слово «бесплатно» скрывает реальную цену. Когда вы всё делаете сами – собираете, компилируете модель, встраиваете её в звуковой тракт, настраиваете буферизацию для real-time-аудио, тестируете на всех браузерах и устройствах и остаётесь единоличным владельцем результата навсегда – ответственность целиком на вас. Если новая версия браузера сломает вашу звуковую интеграцию – это ваш баг. Если пользователи жалуются, что модель пропускает шум, – обращаться некуда: улучшение модели – это ваш проект. Лицензия бесплатна, а инженерия, поддержка и потолок качества – на вашей стороне.

Для браузерного продукта с типичными требованиями к шумоподавлению и командой, которой важен контроль, такой подход – правильный и самый экономичный выбор. А вот для тех, кто хочет, чтобы чистое аудио было чужой заботой, это ловушка, замаскированная под экономию. Как именно работают эти модели, чем отличаются по скорости, качеству и условиям лицензирования – подробно разбираем в нашем разборе моделей шумоподавления.

Купить, Полностью Управляемое: Krisp Работает На Устройстве Пользователя

Krisp это имя, которое команды слышат первым, и оно сидит на дальнем конце «Купить» по конкретной причине: его модель работает на устройстве самого говорящего, так что вы не обслуживаете под неё никаких серверов вообще. Krisp это компания Voice ИИ, основанная в 2017 году и базирующаяся в Беркли, Калифорния. По собственному заявлению компании, аудио никогда не покидает устройство – модель обрабатывает звук локально и ничего не загружает, – а это сильное свойство приватности для телемедицины и любого регулируемого продукта. Её технология шумоподавления работает более чем на двухстах миллионах устройств и обрабатывает свыше семидесяти пяти миллиардов минут голоса в месяц, и она стоит за шумоподавлением внутри Discord, RingCentral и Zoho, а через партнёрства подключается к платформам звонков Twilio и Daily.

Что вы реально покупаете у Krisp – это SDK (software development kit, готовая библиотека кода, которую вы вставляете в приложение) для Windows, macOS, Linux, Android, iOS и браузеров – последнее через сборку WebAssembly. SDK делает больше, чем просто удаление шума. В него входят: подавление фоновых голосов (BVC) – модель, убирающая чужие голоса; изоляция голоса, настроенная под голосовых ИИ-агентов, чтобы бота не перебивала фоновая болтовня; конвертация акцента; а также поэкадровая статистика, которую можно отслеживать. В живом звонке стандартная модель добавляет примерно двадцать пять миллисекунд задержки, а более лёгкая – около пятнадцати – что достаточно мало, чтобы оставаться в рамках тайминга естественного разговора, то есть в пределах бюджета задержки до 100 мс, который обязана уважать любая real-time-функция.

Подвох здесь коммерческий, а не технический. SDK для разработчиков от Krisp продаётся как корпоративная лицензия – обычно это годовой контракт с предоплатой, цена которого согласовывается через отдел продаж, а не публикуется мгновенно. Конкурент ai-coustics открыто высказывает эту критику, утверждая, что цены Krisp подходят для зрелых корпоративных внедрений, но могут оказаться жёсткими для небольшого стартапа, который хочет скачать, протестировать и масштабироваться постепенно. Относитесь к этому как к позиции конкурента, а не к истине – но сама модель реальна: Krisp – это решение «купить», которое вы принимаете осознанно, по контракту, а не по карте. Взамен вы получаете качество уровня продакшена на всех платформах без необходимости управлять серверами – и для многих продуктов это действительно стоит своих денег.

Купить модель, запустить самому: NVIDIA Maxine (теперь AI For Media)

Предложение NVIDIA занимает центральное место в спектре, и в 2026 году оно получило новое название, которое стоит назвать прямо: NVIDIA Maxine переименована в NVIDIA AI for Media. Доступ к её SDK и сервисам продолжается без перерывов – технология та же, бренд новый. Мы будем использовать обозначение «Maxine (AI for Media)», чтобы старое имя, которое вы могли искать, по-прежнему ассоциировалось с продуктом.

Maxine отличается от Krisp в самом важном: он не работает на устройстве пользователя, он работает на видеокартах NVIDIA – то есть на ваших серверах, ваших облачных GPU или рабочих станциях класса NVIDIA. Его компонент Audio Effects даёт real-time-удаление шума, удаление эха комнаты, аудио-суперразрешение и акустическое эхоподавление, а отдельная модель под названием Studio Voice поднимает обычное аудио с микрофона к студийному качеству. Всё это ускоряется тензорными ядрами внутри GPU класса NVIDIA RTX, и SDK требует такого GPU плюс минимум десять гигабайт памяти. Это требование к железу и есть вся суть: Maxine покупает вам, пожалуй, самый широкий и высокопотолочный набор аудиоэффектов на рынке, но только если вы можете поставить GPU NVIDIA туда, где находится ваше аудио.

Коммерческая модель следует за железом. Прототипирование с использованием облачного API-каталога NVIDIA возможно бесплатно, а также можно получить 90-дневную ознакомительную лицензию, но для продакшена требуется NVIDIA AI Enterprise – программная подписка стоимостью около четырёх с половиной тысяч долларов в год за один GPU, или примерно один доллар за час использования GPU в облаке, сверх стоимости самого GPU или его аренды. Это делает Maxine самым дорогим в эксплуатации решением: вы не просто лицензируете модель, а поддерживаете целый парк оборудования. Взамен вы получаете полный пайплайн улучшений – аудиообработку, видео-суперразрешение, фоновые эффекты и многое другое – на инфраструктуре, которую полностью контролируете. Такой подход подходит для вещания, крупного стриминга и ИИ-агентов, уже работающих на GPU-серверах. Подробнее о более широкой экономике запуска ИИ на GPU в видеопродуктах – в нашей статье про модель стоимости.

Числовой пример: сколько стоит «запустить самому» на масштабе

Стоимость Maxine становится реальной только тогда, когда к ней применяются конкретные цифры – поэтому приведём разбор с расчётами. Допустим, вы управляете платформой голосовых ИИ-агентов и вам необходимо обрабатывать одновременно тысячу входящих аудиопотоков на серверной стороне, поскольку аудио поступает с телефонов и устройств, которые вы не контролируете. Аудиоэффекты Maxine работают на GPU, поэтому ключевой вопрос – сколько GPU потребуется для такого объёма нагрузки.

В качестве примера – вы обязаны измерить это для своей нагрузки, поскольку NVIDIA не публикует единой цифры «потоков на GPU». Допустим, один GPU комфортно обрабатывает сто одновременных real-time-аудиопотоков. Тогда:

1000 потоков ÷ 100 потоков на GPU = 10 GPU

Теперь применим реальную стоимость лицензии, взятую из источника, а не придуманную. Лицензия NVIDIA AI Enterprise стоит около 4 500 долларов за GPU в год:

10 GPU × $4 500 за GPU-год = $45 000 в год только за софтверные лицензии

И это касается даже GPU. Аренда их в облаке – примерно по доллару за час работы – непрерывно, добавляет:

10 GPU × $1 за GPU-час × 24 часа × 365 дней = $87 600 в год за аренду GPU

Итого развёртывание Maxine на тысячу потоков обходится примерно в $132 600 в год – это лицензии плюс облачные GPU, и при этом вы всё ещё владеете инфраструктурой. Теперь сравните с Krisp: модель работает на устройстве каждого пользователя, поэтому серверные затраты на очистку аудио практически нулевые. Вместо этого вы платите годовую лицензию на SDK, цена которой не растёт пропорционально количеству одновременных потоков, как это происходит с арендой GPU. Урок не в том, что одно число лучше другого, – а в том, что форма счёта принципиально различается. Стоимость Maxine растёт с серверной нагрузкой, Krisp – с объёмом контракта, а «собрать» – с затратами на инженерные часы. Выбирайте модель, форма которой соответствует тем темпам, с которыми растёт ваш продукт.

Поучительная история: Dolby сдвинулся, и один «Купить» закрылся

Dolby – победитель любого сравнения «Krisp против Maxine против Dolby», потому что его команда всё ещё работает над проектом – и потому что история с ним стала самым важным уроком «разработать самому или купить» на этой странице. Много лет платформа Dolby для разработчиков, Dolby.io, предлагала self-serve API для real-time-коммуникаций на базе технологии Voxeet, и в этих звонках использовалось шумоподавление Dolby Voice. Если вы хотели получить уровень голосовой очистки, сравнимый с Dolby, для своего живого конференц-продукта – это был единственный путь.

В 2024 году эта дверь начала закрываться. В августе 2024 года Dolby приобрёл THEO Technologies – разработчика плееров для низколатентного стриминга – и в 2025–2026 годах свёл свою платформу для разработчиков к новому бренду Dolby OptiView. Продукты OptiView сегодня включают видеоплеер, live- и real-time-стриминг, а также рекламные инструменты – среди них нет self-service-решения для real-time-конференций и голоса. Старая документация по Communications теперь перенаправляет на документацию OptiView по стримингу. Dolby по-прежнему создаёт отличные аудиотехнологии, и отдельный файловый API для улучшения медиа на основе записанного аудио по-прежнему существует, но живой self-serve-путь «купите Dolby Voice для своего звонка», который до сих пор описывают конкурирующие статьи, фактически свёрнут.

В этом уроке важнее любого сравнения функций следующее: «купить» – это ставка на дорожную карту вендора, а дорожные карты меняются. Команда, построившая конференц-продукт на Communications API от Dolby в 2023 году, провела 2024–2026 годы в миграции с них. Риск не в том, что Dolby сделал что-то плохое – компании меняют фокус, – а в том, что отдавая ключевую возможность на аутсорс, вы наследуете чужую стратегию. Когда вы покупаете, вам нужно читать не только демо, но и направление.

Рисунок 2. Платформа Dolby для разработчиков сместилась с self-service real-time-коммуникаций (на основе Dolby Voice) на стриминговую платформу Dolby OptiView после приобретения THEO Technologies в 2024 году – самый яркий пример того, что купленная возможность зависит от дорожной карты вендора.

Частая ошибка: купить демку вместо соответствия

Самая дорогая ошибка в этой теме – выбирать вендора по звуку демо. Каждый движок на этой странице звучит впечатляюще в контролируемом клипе: демо – это лёгкая часть. Вопросы, которые на самом деле определяют успех, никогда не отражаются в демо, и их игнорирование – вот что через год приводит команды к необходимости переписывать всё с нуля.

Задайте их до любого контракта. Работает ли движок там, где физически находится ваше аудио? Krisp работает на устройстве пользователя, поэтому он бесполезен для чистки аудио, приходящего с телефонной линии, которую вы не контролируете; Maxine работает на ваших GPU, поэтому он бесполезен, если у вас нет GPU и вы не хотите флот. Указывает ли дорожная карта вендора в ту же сторону, что и ваш продукт, или вы вот-вот станете следующей историей миграции, как с Dolby? Масштабируется ли цена вместе с тем, с чем масштабируется ваш продукт, – одновременными потоками, устройствами или местами в контракте? И можете ли вы проверить качество реальным повторяемым тестом, а не клипом вендора – для подавителей шума это означает прослушивание в стиле ITU-T P.835, где люди отдельно оценивают речь, фон и общий результат, так что вы измеряете улучшение честно, а не доверяете маркетинговой осциллограмме. Вендор, который проходит демку, но проваливает любой из этих четырёх вопросов, это неправильная покупка.

Вендоры рядом

Когда каждый вариант размещён на спектре, а ловушка демки определена, сравнительная таблица воспринимается как описание операций, а не как турнирная таблица.

КритерийСобрать: RNNoise / DeepFilterNetКупить: KrispКупить: NVIDIA Maxine (AI for Media)Купить: Dolby
Что вы получаетеБесплатную открытую модельУправляемый on-device SDKЛицензию на модели для ваших GPUИсторически – управляемый облачный голосовой API
Где работаетГде вы поставитеУстройство самого пользователяВаши GPU NVIDIAБыло облако Dolby
Нужное железоЛюбое (CPU)Любое (CPU, на устройстве)GPU NVIDIA RTX + 10 ГББыло не нужно (облако)
Подавление фоновых голосовНетДаНабор эффектов (шум, эхо, супер-рез)Dolby Voice (легаси)
Форма стоимостиБесплатная лицензия, ваша инженерияГодовой контракт на SDK~$4 500/GPU-год + цена GPUн/д – путь свёрнут
Аудио покидает устройствоНа ваш выборНетНа ваши серверыБыло в облако Dolby
Статус в 2026Активна, сообществоАктивен, широко развёрнутАктивен, переименован в AI for MediaСвёрнут в OptiView (стриминг)
Лучше всего дляТолько браузер, обычный шум, контрольКросс-платформа, on-device, ноль серверных операцийGPU-серверные пайплайны, вещание, агентыНе текущий real-time-вариант покупки

Читайте таблицу как набор компромиссов, а не победителей. «Собрать» – это самая дешевая лицензия, но при этом самая дорогая команда. Krisp обеспечивает минимальную операционную нагрузку – всё работает не на ваших серверах, а на стороне провайдера – но требует корпоративного контракта. Maxine предлагает самый высокий потолок возможностей и самый широкий набор эффектов, однако за счёт использования GPU и вычислительных операций. Dolby напоминает: стоит проверить дорожную карту перед тем, как привязываться к решению.

Есть и быстро растущая четвёртая форма, о которой стоит знать: новые управляемые вендоры, такие как ai-coustics, предлагают on-device SDK, работающий исключительно на CPU. Его модель в реальном времени обрабатывает данные менее чем за тридцать миллисекунд, имеет малый след и не требует GPU. Такие решения продаются по модели self-service с ценами «плати по мере роста», а не по авансовым корпоративным контрактам – это сужает старое преимущество Krisp как единственного готового варианта.

От Спектра к Решению

Превратим всё это в путь, по которому реально пройти. Дерево решений ниже упорядочивает ключевые вопросы: хватит ли бесплатной базы, поступает ли аудио с устройств, которые вы контролируете, и есть ли у вас уже GPU – ведь каждый ответ сужает варианты и ведёт к одному решению.

Рисунок 3. Путь решения: сначала попробуйте бесплатную базу, затем выбирайте по тому, откуда приходит аудио и держите ли вы уже GPU – а не по тому, чья демка звучит лучше.

Дерево решает простой приоритет. Начните с бесплатного варианта: если встроенный подавитель шума в браузере уже справляется с жалобами – используйте его и сэкономьте бюджет на другие задачи. Если нет, ключевой вопрос – откуда поступает ваш аудиосигнал. Если часть звука идёт с телефонов, ИИ-агентов или устройств, которые вы не контролируете, вам нужен серверный движок. Тогда важно: есть ли у вас GPU NVIDIA? Если да – набор эффектов Maxine подходит естественным образом; если нет – используйте управляемый on-device SDK, который можно запускать и на сервере, или CPU-ориентированный движок, чтобы избежать покупки GPU-инфраструктуры.

Если все участники подключены через браузер или приложение, которое вы контролируете, выбор сводится к двум вариантам: приобрести готовый on-device SDK (например, Krisp или ai-coustics) ради полного отказа от серверной обработки или собрать решение на базе RNNoise или DeepFilterNet – ради бесплатной лицензии и полного контроля.

Одну ловушку стоит избегать во всех случаях: никогда не запускайте два подавителя одновременно – встроенный и сторонний – они обрабатывают аудио дважды и ухудшают качество. Подробный разбор этой проблемы приведён в статье про интеграцию в WebRTC.

Почему сравнение постоянно сдвигается

Одна из причин, по которой тема сложна, – в том, что рынок постоянно меняется, и за два года три ключевых игрока сместились в трёх разных направлениях. Krisp расширил свои возможности от простого шумоподавления до более широкого набора решений на основе voice-ИИ для агентов – управление очередью реплик, изоляция голоса, конвертация акцента – стремясь воспользоваться бумом голосовых ИИ-агентов. NVIDIA переименовала Maxine в AI for Media и углубила его применение в сфере вещания и GPU-серверных пайплайнов. Dolby полностью вышел из сегмента self-service real-time голоса и сосредоточился на стриминге. Сравнение, сделанное в 2023 году, сегодня было бы ошибочным во всех трёх случаях. Практическая защита – рассматривать выбор поставщика как временное решение с фиксированной датой пересмотра, а не как вечный брак: хотя бы раз в год проверяйте, что приобретённый движок по-прежнему работает там, где нужен, по-прежнему оправдан с точки зрения стоимости и по-прежнему соответствует дорожной карте вендора, направленной в вашу сторону. У эхоподавления, соседней проблемы, которую эти движки тоже затрагивают, – свой подвижный ландшафт, подробно разобранный в нашей статье про эхоподавление в WebRTC.

Где это в Фора Софт

Мы создаём живые видеопродукты, для которых критически важна чистота аудио – платформы видеоконференций, телемедицинские консультации, где врач должен чётко слышать каждое слово, e-learnings-классы и инструменты для ИИ-встреч. В каждом таком проекте возникает вопрос: «разработать самому или купить готовое решение». Наш подход – это последовательный спектр решений: начать с бесплатной встроенной базы, перейти к открытой модели вроде RNNoise, когда браузерному продукту нужно больше возможностей, а команда хочет сохранить контроль, и перейти к управляемому движку, когда продукт работает на множестве платформ, принимает звонков с телефонов или использует голосовых ИИ-агентов на устройствах, которые мы не контролируем. Для чувствительных к приватности направлений, таких как телемедицина, on-device-движок, не передающий аудио на серверы, часто становится решающим фактором сам по себе. Самая эффективная дисциплина, минимизирующая переделки, – та, за которую призывает эта статья: выбирать решение исходя из того, где обрабатывается аудио и как растёт стоимость, тестировать качество реального прослушивания, а не демонстрационных клипов от вендора, и закладывать ежегодный пересмотр дорожной карты вендора, чтобы изменения вроде дольбиевского не оставили уже выпущенный продукт без поддержки.

Ключевые выводы

  • «Собрать против купить» это спектр, ранжированный тем, сколько вы обслуживаете, а не качеством демки.
  • Krisp работает на устройстве пользователя: ноль серверных операций, корпоративный контракт, сильная приватность.
  • NVIDIA Maxine (теперь AI for Media) работает на ваших GPU NVIDIA: шире эффекты, выше стоимость.
  • Dolby свернул платформу для разработчиков в стриминговый OptiView – покупка real-time-голоса закрылась.
  • Форма стоимости различается: GPU растут с нагрузкой, SDK с контрактами, «собрать» с инженерными часами.
  • Выбирайте по тому, где живёт аудио; проверяйте прослушиванием ITU-T P.835, пересматривайте раз в год.

Что Почитать Дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.