Нейросетевые аудиокодеки: Lyra, EnCodec, SoundStream и что дальше

Автор: Николай СапуновОбновлено: август 202628 мин чтения
Содержание статьи +

Кратко

Нейросетевой аудиокодек – это программа сжатия, в которой не вручную написанный алгоритм, а нейросеть учится по данным упаковывать звук в крошечный поток чисел и убедительно восстанавливать его; с 2021 года лучшие из них дают качество старых кодеков при в три-четыре раза меньшем числе бит. Поле построили три системы: SoundStream от Google ввёл ключевой приём (обученный энкодер плюс остаточное векторное квантование), Lyra v2 от Google превратила его в продукт, который реально работает на телефоне и в звонках, а EnCodec от Meta поднял качество настолько, что справляется и с музыкой, а не только с речью. Те же сжатые токены, что делают кодек, оказались способом «скормить» звук большой языковой модели – поэтому нейрокодеки теперь тихий движок голосового ИИ, и «что дальше» уже не про экономию полосы, а про то, чтобы сделать звук тем, в чём софт может «думать». Статья объясняет простым языком, как эти кодеки работают, даёт реальные цифры 2026 года по битрейту, качеству и нагрузке на процессор и честно говорит, почему пятнадцатилетний Opus всё ещё выигрывает почти любой реальный сценарий реального времени.

Почему это важно

Если вы делаете что угодно со звуком – конференц-приложение, стриминг, телемедицину, голосового ассистента, – вы постоянно слышите, что «нейрокодеки вот-вот всё изменят», и вам нужно понять, правда ли это для вашего продукта или это заголовок с конференции. Честный ответ в 2026 году состоит из двух половин. Для обычных звонков в реальном времени пятнадцатилетний кодек Opus остаётся правильным выбором по умолчанию, а нейрокодек – строка в исследовательском бюджете, а не решение для запуска. Но всё, что касается голосового ИИ – модель, которая слушает и отвечает, автоматический дубляж, генерация речи на устройстве, – уже стоит на нейрокодеках, потому что именно они переводят звук в модель и обратно. Эта статья – для продакт-менеджера, основателя или инженера, которому надо различать эти случаи: что эти системы делают, во что обходятся, где реально работают и что несут ближайшие три года. Это углублённое продолжение нашего обзора ИИ в аудио для видео, где нейрокодеки были одним из четырёх семейств; здесь мы открываем коробку.

Что такое кодек и чем нейросетевой отличается

Начнём с обычного. Кодек (от «кодер-декодер») – это программа, которая сжимает звук в меньшее число бит, чтобы передать или сохранить, а потом разворачивает обратно. Любой звонок и любой стриминг использует кодек. Около сорока лет кодеки проектировали вручную: инженеры изучали слух, замечали, что тихий тон сразу после громкого мы не слышим, и писали алгоритмы, которые выбрасывают то, что ухо не заметит. Это семейство дало нам MP3, AAC и Opus; устройство мы разбираем в статье как работает сжатие звука. Это блестящая инженерия, и она построена вручную, кирпич за кирпичом, людьми.

Нейросетевой аудиокодек заменяет людей-проектировщиков процессом обучения. Вместо того чтобы инженер решал, какие части звука сохранить, берут нейросеть – математическую модель с миллионами настраиваемых чисел – и показывают ей огромные объёмы аудио, пока она сама не научится представлять звук компактно и восстанавливать его. Правила никто не пишет; модель выводит их из данных. В итоге кодек берёт битрейты, недоступные рукотворным при том же качестве, потому что сеть находит в реальном звуке закономерности, которые человек не догадался закодировать вручную.

Аналогия, которую стоит держать в голове: традиционный кодек – это переводчик, выучивший грамматику по учебнику, а нейрокодек – тот, кто вырос двуязычным. Переводчик по учебнику быстр, предсказуем и дёшев. Двуязычный – свободнее, ловит нюансы, которых нет в правилах, – и куда дороже в обучении и в работе. Именно эта разница в цене, как мы увидим, и есть вся история о том, почему нейрокодеки ещё не вытеснили остальных.

Одна идея, которая всё решила: остаточное векторное квантование

Почти каждый нейрокодек, о котором вы прочтёте – SoundStream, Lyra, EnCodec, новейшие исследования, – построен на одной и той же трёхчастной форме, и одна из трёх частей – та самая хитрость, что сделала поле практичным. Пройдём её медленно: усвоив её, вы поймёте, что любой кодек в этой статье – её вариация.

Сначала энкодер: нейросеть, которая берёт звуковую волну и сжимает её в компактный поток чисел, называемый латентным представлением. Считайте это личной стенограммой сети для «что это за звук». В конце декодер: зеркальная сеть, которая берёт стенограмму и восстанавливает волну, которую можно проиграть. Энкодер и декодер обучают вместе, сквозным образом, так что стенограмма, которую пишет энкодер, – ровно та, которую умеет читать декодер.

Сложность – и хитрость – в середине. Стенограмма энкодера состоит из непрерывных чисел вроде 0,3719 или −1,882, а числа бесконечной точности по сети не передашь. Их надо округлить к фиксированному меню допустимых значений – это квантование. Загвоздка жестокая: чтобы передать богатый, качественный звук, понадобилось бы меню из миллионов значений, а такое меню слишком дорого по памяти и вычислениям.

Прорыв, введённый для аудио в SoundStream в 2021 году, называется остаточным векторным квантованием, или RVQ, и работает как сдача монетами. Допустим, вы должны 8,37, а в первой «банке монет» только рубли. Вы платите 8 и остаётесь с остатком 0,37, который не сумели представить. Идёте ко второй банке с гривенниками, платите три (0,30) – остаток уменьшается до 0,07. Третья банка с копейками добирает остальное. Каждая банка мала и дешева, но сложенные слоями они точно представляют любую сумму. RVQ делает ровно это со звуком: первый квантователь берёт грубую форму, второй – ошибку, оставленную первым, третий – ошибку после второго, и так далее через стек слоёв. Горстка маленьких меню, сложенных вместе, делает работу одного невозможно огромного.

Рисунок 1. Общая форма любого нейрокодека: обученный энкодер, стек остаточных квантователей, уточняющих сигнал слой за слоем, и обученный декодер. Меньше слоёв – ниже битрейт, прямо на лету.

У RVQ есть второй дар, который на практике оказывается огромным. Поскольку слои уточняют звук постепенно, можно просто остановиться раньше. Используете все слои – получаете высшее качество при высшем битрейте; отбрасываете нижние – получаете меньшее качество при меньшем битрейте, из той же модели, решая на ходу. Поэтому один нейрокодек предлагает несколько битрейтов без выпуска нескольких моделей. Авторы SoundStream обучили одну модель, работающую от 3 до 18 кбит/с почти без потерь против моделей, обученных под каждый битрейт отдельно. Запомните это свойство; именно из-за него такие кодеки изящно подстраиваются под плохую сеть.

Ещё одна деталь – она объясняет, почему восстановленный звук убедителен, а не глух. Ранние попытки восстановить аудио из крошечного представления выходили тусклыми и размытыми. Нейрокодеки решили это, позаимствовав приём из генерации изображений – состязательное обучение: рядом с декодером обучают вторую сеть, дискриминатор, единственная задача которого – отличать реальные записи от реконструкций декодера. Декодер же подталкивают обмануть дискриминатор. Две сети гонятся друг за другом, и декодер учится выдавать звук достаточно чёткий, чтобы сойти за настоящий. Именно этот состязательный толчок отделяет нейрокодек 2021 года и позже от мутных автоэнкодеров, что были до него.

Три кодека, построившие поле

SoundStream – тот, что начал

SoundStream, опубликованный исследователями Google в 2021 году, – фундамент, на котором стоит всё остальное. Это был первый сквозной нейрокодек, объединивший все три идеи выше – обученный свёрточный энкодер-декодер, остаточное векторное квантование и состязательное обучение – в систему, которая явно обогнала рукотворные кодеки. Заголовочный результат – число, которое цитируют повсюду: в слепых тестах на 24 kHz SoundStream при 3 кбит/с обогнал Opus при 12 кбит/с и приблизился к качеству речевого кодека EVS при 9,6 кбит/с, расходуя в три-четыре раза меньше бит при том же воспринимаемом качестве. Он также работал в реальном времени на процессоре телефона и мог встроить шумоподавление в тот же проход, очищая звук «бесплатно» по ходу сжатия.

Как потребительский продукт под этим именем SoundStream не выходил. Его важность – в роли чертежа: RVQ-для-аудио было его вкладом, и все кодеки ниже наследуют его.

Lyra v2 – тот, что реально работает

Lyra v2 – продакшен-кодек речи от Google, и это SoundStream, доведённый до практики. Выпущенный в сентябре 2022 года, он построен прямо на архитектуре SoundStream, с остаточным квантователем по обе стороны канала передачи. Он предлагает три битрейта – 3,2, 6 и 9,2 кбит/с – и переключаться между ними можно прямо в звонке, просто меняя число слоёв квантования: свойство RVQ из раздела выше делает реальную работу в реальном продукте.

Цифры качества конкретны и стоят прямого изложения. В слепых тестах Google Lyra v2 при 3,2, 6 и 9,2 кбит/с совпала по качеству с Opus при 10, 13 и 14 кбит/с соответственно. Иначе говоря, Lyra даёт речь уровня Opus, используя примерно половину или шестьдесят процентов полосы. Против телефонных кодеков, на смену которым она идёт, она обходит EVS и AMR-WB при доле их бит.

Но число, объясняющее, почему Lyra важна, вовсе не про битрейт – оно про скорость. На телефоне Pixel 6 Pro Lyra v2 кодирует и декодирует 20-миллисекундный кадр звука за 0,57 миллисекунды, то есть примерно в 35 раз быстрее реального времени, а её алгоритмическая задержка – 20 миллисекунд, сравнимо с Opus. Google сделала Lyra именно так, чтобы нейрокодек работал на обычном телефоне, не сажая батарею и не добавляя лага. Эта инженерия – а не качество исследования – и позволила ей попасть в звонковые продукты Google для пользователей в слабых сетях. Lyra – доказательство, что нейрокодек может быть продуктом. И она же, показательно, остаётся исключением, а не правилом.

EnCodec – тот, что справляется с музыкой

EnCodec от Meta, октябрь 2022 года, взял форму SoundStream и поднял потолок качества, особенно для музыки. Там где SoundStream и Lyra нацелены на речь, EnCodec построен на весь диапазон: речь 24 kHz моно на нижнем краю и стереомузыка 48 kHz на верхнем, при битрейтах от 1,5 до 24 кбит/с. В тестах MUSHRA – стандартном методе субъективного тестирования качества звука – EnCodec набрал больше SoundStream при равном битрейте, а при 3 кбит/с обошёл и Lyra v2 при 6 кбит/с, и Opus при 12 кбит/с.

EnCodec добавил два уточнения, о которых стоит знать. Он использовал один многомасштабный спектрограммный дискриминатор, чтобы упростить и ускорить обучение, и «балансировщик потерь», державший обучение стабильным. И он показал, что поверх выхода кодека можно навесить небольшую модель-Transformer и сжать битстрим ещё на 25–40 процентов – превратив поток 3 кбит/с примерно в 1,9 кбит/с – оставаясь быстрее реального времени. Этот последний приём – анонс того, куда поле пошло дальше: трактовать выход кодека не как финальный битстрим, а как язык, который другая модель может сжимать и предсказывать.

Рисунок 2. Где каждый кодек на оси «битрейт при равном качестве». Нейрокодеки выигрывают на битах; вся остальная статья – о том, во что обходится этот выигрыш.

Цифры, которые решают: битрейт, качество и счёт за процессор

С нейрокодеками возникает соблазн прочитать экономию битрейта и заключить, что они очевидно лучше. Дисциплина – выложить на стол сразу все три цены, потому что экономия полосы реальна, но платится она по другой оси.

Вот сравнение, которое важно для реального продуктового решения, с цифрами при том качестве, под которое спроектирован каждый кодек.

КодекГодДиапазон битрейтаЭталон равного качестваТип звукаЦена процессораВ проде?
Opus20126–510 кбит/сбаза, с которой все сравниваютречь + музыкаочень низкая (микросекунды)да – основа WebRTC
SoundStream20213–18 кбит/с3 кбит/с ≈ Opus 12речь + общийсредняя (тянет телефон)нет – чертёж
Lyra v220223,2 / 6 / 9,29,2 кбит/с ≈ Opus 14речьнизкая–средняя (0,57 мс/кадр на телефоне)да – звонки Google
EnCodec20221,5–24 кбит/с3 кбит/с > Opus 12речь + музыкавысокаянет – топливо для моделей
Mimi2024~1,1 кбит/стокенайзер речевых LLM, не hi-fiречьвысокаяда – внутри голосовых ИИ

Прочтите таблицу дважды. Левые столбцы – триумф: нейрокодеки берут качество Opus при трети-четверти бит, а новейшие речевые LLM-кодеки работают около 1 кбит/с. Правые столбцы – загвоздка. Opus декодирует за микросекунды на любом устройстве этого века; нейрокодекам нужно гонять сеть на каждом кадре, что стоит на порядки больше процессорного времени, больше батареи, а тяжёлым – мощного телефона или GPU. Lyra – единственный, спроектированный достаточно жёстко, чтобы уйти от этого на обычном телефоне, и даже Lyra – речевой кодек, не универсальный.

Посчитаем экономию, чтобы она стала конкретной. Пусть встреча на 50 человек стримит звук и каждый говорящий использует Opus при 12 кбит/с:

50 говорящих × 12 кбит/с = 600 кбит/с звука

Подставим нейрокодек при равном качестве и 3 кбит/с на говорящего:

50 говорящих × 3 кбит/с = 150 кбит/с звука

Это сокращение полосы звука в 4 раза, и оно приходится туда, где полосы мало – пациент на сельском мобильном интернете в телемедицинском звонке, студент на перегруженной сети кампуса. Экономия настоящая. А причина, по которой её всё ещё нельзя развернуть везде, – в крайнем правом столбце: гонять сеть на каждом клиенте, на каждом кадре, стоит дороже полосы, которую она экономит, если только ваши устройства и бюджет батареи не вытянут это.

«Подводный камень – «обгоняет Opus» почти никогда не значит «замени Opus». Почти каждая статья про нейрокодек сообщает, что обгоняет Opus на низком битрейте, и при условиях статьи это правда. И почти неважно для реального продукта, потому что преимущество Opus – не его битрейт, а то, что он декодирует бесплатно на любом устройстве, не стоит лицензии и встроен в стандарт WebRTC. Прежде чем взять результат «3 кбит/с обгоняет Opus 12» как повод переходить, задайте три вопроса, которых статья не задала: во что это обойдётся на худшем устройстве клиента, что это сделает с батареей и какова задержка. Для большинства живых звонков в 2026 эти ответы всё ещё за Opus. Берите нейрокодек там, где сеть – жёсткое ограничение, а вычисления доступны, а не по умолчанию.»

Где нейрокодеки реально работают в 2026: как рот и уши голосового ИИ

Вот поворот, удививший поле, и это важнейшее, что нужно понять о том, почему нейрокодеки значимы, хотя Opus всё ещё выигрывает живые звонки.

Большая языковая модель предсказывает следующий токен в последовательности. Для текста это просто – токенайзер режет письмо на несколько тысяч возможных кусочков-слов, и модель предсказывает по одному. Звук куда сложнее: сырое аудио – это десятки тысяч чисел в секунду; модель, пытающаяся предсказывать его отсчёт за отсчётом, тонет. Что нейрокодеки дали миру ИИ почти как побочный эффект – это способ превратить секунду звука в короткую последовательность дискретных токенов – индексов квантователей из стека RVQ – которые языковая модель предсказывает ровно так, как предсказывает слова. Кодек стал токенайзером для аудио. Энкодер – это уши модели; декодер – её рот.

Это переосмысляет всё. EnCodec был взят как аудио-токенайзер внутрь MusicGen от Meta. Открытый Descript Audio Codec (2023), сжимающий звук 44,1 kHz примерно в 90 раз, стал готовым топливом для аудио-языковых моделей. А самый чёткий пример нового подхода – Mimi, кодек, построенный Kyutai для речевой модели Moshi в 2024 году. Mimi работает на ~1,1 кбит/с и всего 12,5 кадра в секунду, и делает то, чего не делали ранние кодеки: разбивает свои токены на два вида. Первый поток – семантический: дистиллированный из модели понимания речи, он несёт что говорится, как текст, без голоса. Остальные потоки – акустические: они несут как это звучит: тембр, высоту, эмоцию говорящего. Разделяя смысл и голос, Mimi позволяет языковой модели рассуждать о содержании и подаче как о двух разных вещах – ровно то, что нужно системе, чтобы естественно слушать и говорить. Moshi, построенный на нём, может слушать и говорить одновременно с задержкой около 200 миллисекунд.

Так что продакшен-ответ в 2026 чётко раздваивается. Чтобы передать известный голос по сети в реальном времени, Opus – выбор по умолчанию, и нейрокодек редко стоит своих вычислений. Чтобы генерировать или понимать голос моделью – голосовые ассистенты, ИИ-дубляж, TTS на устройстве, перевод в реальном времени – нейрокодек не опция; это то, что вообще даёт модели слышать и говорить. Тот же стек RVQ, что сжимает звонок, токенизирует звук для LLM. Одна идея, два будущих.

Рисунок 3. Один кодек, две задачи. Как транспорт (слева) Opus всё ещё выигрывает по цене. Как токенайзер для языковой модели (справа) нейрокодек уже фундамент – а разделение на семантические и акустические токены – это то, почему голосовой ИИ может отделять что сказано от как звучит.

Что дальше

Три направления определяют ближайшие годы, и ни одно из них – не «нейрокодеки наконец обходят Opus на телефоне для обычных звонков». Эта гонка по большей части окончена: Opus остаётся выбором по умолчанию для обычного транспорта, а форк под названием AOMedia Open Audio Codec (OAC) – начатый в начале 2026 года на исходниках Opus – это ставка индустрии на следующий традиционный кодек, цель которого – обойти Opus на его же поле, а не заменить его нейросетевым.

Первый настоящий рубеж – сделать нейрокодеки достаточно дешёвыми для развёртывания на краю сети. Всё поле теперь считает твёрдой проблемой цену процессора, а не качество. Исследовательские конкурсы 2025 года прямо нацелены на кодеки, работающие при жёстких ограничениях на вычисления, задержку и битрейт на обычных устройствах в шумных реальных условиях – те ограничения, что отделяют победителя бенчмарка от того, что можно выпустить. Lyra показала, что это возможно для речи на хорошем телефоне; работа теперь – сделать это правдой для большего числа устройств, типов звука и при меньшей мощности.

Второй рубеж – линия «кодек как токенайзер» взрослеет в инфраструктуру. По мере того как голосовые ИИ-модели переходят из лаборатории в продукты – ассистенты, слышащие тон, дубляж в реальном времени с сохранением подачи, перевод, сохраняющий ваш голос, – нейрокодек под ними становится частью «водопровода», такой же стандартной, как видеокодек сегодня. Открытые вопросы там – про устройство токенов: как чисто разделить семантику и акустику, сколько токенов в секунду нужно модели и сохранят ли следующие системы вообще дискретные токены – некоторые исследования 2025 года генерируют звук из непрерывных представлений и пропускают квантование целиком.

Третий – тот, за которым стоит следить ради собственной дорожной карты: граница между «кодеком» и «генератором» растворяется. Нейрокодек, способный восстановить голос из 1,1 кбит/с токенов, механически очень близок к модели, способной сгенерировать этот голос с нуля. Та же машинерия, что скрывает потерянный пакет, предсказывая недостающий звук (см. восстановление при потере пакетов), – это машинерия, которая клонирует голос. Как мы отметили в обзоре ИИ в аудио, именно на этом схождении живёт право о согласии, образе и раскрытии – и приходит оно через слой кодека, а не только через инструменты дубляжа. Когда ваше сжатие и ваш синтез – одна и та же сеть, «реален ли этот звук» перестаёт быть вопросом, на который кодек может ответить за вас.

Где здесь Фора Софт

Мы строим конференции, телемедицину, e-learning, OTT-стриминг и видеонаблюдение, и наш совет по нейрокодекам нарочито немоден: для живого звука в реальном времени в 2026 мы первым берём Opus, потому что его почти нулевая цена декодирования, отсутствие лицензии и обязательный статус в WebRTC бьют экономию битрейта, в которой большинство клиентов не нуждается и которую большинство устройств не потянет. Где мы внимательно следим за нейрокодеками – это слой ИИ: когда продукту нужна модель, чтобы понимать или генерировать голос, кодек уже не выбор сжатия, а выбор фундамента, и правильно выстроить вокруг него аудио-конвейер WebRTC (бюджет задержки, вычисления на клиента, откат к Opus) – это и есть инженерия, решающая, будет ли функция пригодной. Правильная постановка для клиента почти никогда не «перейти ли на нейрокодек», а «где в нашем конвейере обученная модель оправдывает свою цену процессора» – и ответ год за годом движется от «нигде» к ИИ-функциям по краям.

Главное

  • Нейрокодек даёт сети выучить сжатие по данным вместо рукотворных правил.
  • Остаточное векторное квантование – уточнение звука слоями – это идея, что всё сделала.
  • SoundStream задал чертёж; Lyra v2 вывела его на телефоны; EnCodec расширил на музыку.
  • Нейрокодеки берут качество Opus при 3–4 раза меньшем числе бит, но дороже по CPU и батарее.
  • Для живых звонков в 2026 Opus – правильный выбор по умолчанию; нейрокодеки редко его бьют.
  • Их реальный дом в 2026 – голосовой ИИ: кодек делает звук токенами, которые предсказывает LLM.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.