Содержание статьи +
- Кратко
- Почему это важно
- Что такое кодек и чем нейросетевой отличается
- Одна идея, которая всё решила: остаточное векторное квантование
- Три кодека, построившие поле
- Цифры, которые решают: битрейт, качество и счёт за процессор
- Где нейрокодеки реально работают в 2026: как рот и уши голосового ИИ
- Что дальше
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Кратко
Нейросетевой аудиокодек – это программа сжатия, в которой не вручную написанный алгоритм, а нейросеть учится по данным упаковывать звук в крошечный поток чисел и убедительно восстанавливать его; с 2021 года лучшие из них дают качество старых кодеков при в три-четыре раза меньшем числе бит. Поле построили три системы: SoundStream от Google ввёл ключевой приём (обученный энкодер плюс остаточное векторное квантование), Lyra v2 от Google превратила его в продукт, который реально работает на телефоне и в звонках, а EnCodec от Meta поднял качество настолько, что справляется и с музыкой, а не только с речью. Те же сжатые токены, что делают кодек, оказались способом «скормить» звук большой языковой модели – поэтому нейрокодеки теперь тихий движок голосового ИИ, и «что дальше» уже не про экономию полосы, а про то, чтобы сделать звук тем, в чём софт может «думать». Статья объясняет простым языком, как эти кодеки работают, даёт реальные цифры 2026 года по битрейту, качеству и нагрузке на процессор и честно говорит, почему пятнадцатилетний Opus всё ещё выигрывает почти любой реальный сценарий реального времени.
Почему это важно
Если вы делаете что угодно со звуком – конференц-приложение, стриминг, телемедицину, голосового ассистента, – вы постоянно слышите, что «нейрокодеки вот-вот всё изменят», и вам нужно понять, правда ли это для вашего продукта или это заголовок с конференции. Честный ответ в 2026 году состоит из двух половин. Для обычных звонков в реальном времени пятнадцатилетний кодек Opus остаётся правильным выбором по умолчанию, а нейрокодек – строка в исследовательском бюджете, а не решение для запуска. Но всё, что касается голосового ИИ – модель, которая слушает и отвечает, автоматический дубляж, генерация речи на устройстве, – уже стоит на нейрокодеках, потому что именно они переводят звук в модель и обратно. Эта статья – для продакт-менеджера, основателя или инженера, которому надо различать эти случаи: что эти системы делают, во что обходятся, где реально работают и что несут ближайшие три года. Это углублённое продолжение нашего обзора ИИ в аудио для видео, где нейрокодеки были одним из четырёх семейств; здесь мы открываем коробку.
Что такое кодек и чем нейросетевой отличается
Начнём с обычного. Кодек (от «кодер-декодер») – это программа, которая сжимает звук в меньшее число бит, чтобы передать или сохранить, а потом разворачивает обратно. Любой звонок и любой стриминг использует кодек. Около сорока лет кодеки проектировали вручную: инженеры изучали слух, замечали, что тихий тон сразу после громкого мы не слышим, и писали алгоритмы, которые выбрасывают то, что ухо не заметит. Это семейство дало нам MP3, AAC и Opus; устройство мы разбираем в статье как работает сжатие звука. Это блестящая инженерия, и она построена вручную, кирпич за кирпичом, людьми.
Нейросетевой аудиокодек заменяет людей-проектировщиков процессом обучения. Вместо того чтобы инженер решал, какие части звука сохранить, берут нейросеть – математическую модель с миллионами настраиваемых чисел – и показывают ей огромные объёмы аудио, пока она сама не научится представлять звук компактно и восстанавливать его. Правила никто не пишет; модель выводит их из данных. В итоге кодек берёт битрейты, недоступные рукотворным при том же качестве, потому что сеть находит в реальном звуке закономерности, которые человек не догадался закодировать вручную.
Аналогия, которую стоит держать в голове: традиционный кодек – это переводчик, выучивший грамматику по учебнику, а нейрокодек – тот, кто вырос двуязычным. Переводчик по учебнику быстр, предсказуем и дёшев. Двуязычный – свободнее, ловит нюансы, которых нет в правилах, – и куда дороже в обучении и в работе. Именно эта разница в цене, как мы увидим, и есть вся история о том, почему нейрокодеки ещё не вытеснили остальных.
Одна идея, которая всё решила: остаточное векторное квантование
Почти каждый нейрокодек, о котором вы прочтёте – SoundStream, Lyra, EnCodec, новейшие исследования, – построен на одной и той же трёхчастной форме, и одна из трёх частей – та самая хитрость, что сделала поле практичным. Пройдём её медленно: усвоив её, вы поймёте, что любой кодек в этой статье – её вариация.
Сначала энкодер: нейросеть, которая берёт звуковую волну и сжимает её в компактный поток чисел, называемый латентным представлением. Считайте это личной стенограммой сети для «что это за звук». В конце декодер: зеркальная сеть, которая берёт стенограмму и восстанавливает волну, которую можно проиграть. Энкодер и декодер обучают вместе, сквозным образом, так что стенограмма, которую пишет энкодер, – ровно та, которую умеет читать декодер.
Сложность – и хитрость – в середине. Стенограмма энкодера состоит из непрерывных чисел вроде 0,3719 или −1,882, а числа бесконечной точности по сети не передашь. Их надо округлить к фиксированному меню допустимых значений – это квантование. Загвоздка жестокая: чтобы передать богатый, качественный звук, понадобилось бы меню из миллионов значений, а такое меню слишком дорого по памяти и вычислениям.
Прорыв, введённый для аудио в SoundStream в 2021 году, называется остаточным векторным квантованием, или RVQ, и работает как сдача монетами. Допустим, вы должны 8,37, а в первой «банке монет» только рубли. Вы платите 8 и остаётесь с остатком 0,37, который не сумели представить. Идёте ко второй банке с гривенниками, платите три (0,30) – остаток уменьшается до 0,07. Третья банка с копейками добирает остальное. Каждая банка мала и дешева, но сложенные слоями они точно представляют любую сумму. RVQ делает ровно это со звуком: первый квантователь берёт грубую форму, второй – ошибку, оставленную первым, третий – ошибку после второго, и так далее через стек слоёв. Горстка маленьких меню, сложенных вместе, делает работу одного невозможно огромного.
У RVQ есть второй дар, который на практике оказывается огромным. Поскольку слои уточняют звук постепенно, можно просто остановиться раньше. Используете все слои – получаете высшее качество при высшем битрейте; отбрасываете нижние – получаете меньшее качество при меньшем битрейте, из той же модели, решая на ходу. Поэтому один нейрокодек предлагает несколько битрейтов без выпуска нескольких моделей. Авторы SoundStream обучили одну модель, работающую от 3 до 18 кбит/с почти без потерь против моделей, обученных под каждый битрейт отдельно. Запомните это свойство; именно из-за него такие кодеки изящно подстраиваются под плохую сеть.
Ещё одна деталь – она объясняет, почему восстановленный звук убедителен, а не глух. Ранние попытки восстановить аудио из крошечного представления выходили тусклыми и размытыми. Нейрокодеки решили это, позаимствовав приём из генерации изображений – состязательное обучение: рядом с декодером обучают вторую сеть, дискриминатор, единственная задача которого – отличать реальные записи от реконструкций декодера. Декодер же подталкивают обмануть дискриминатор. Две сети гонятся друг за другом, и декодер учится выдавать звук достаточно чёткий, чтобы сойти за настоящий. Именно этот состязательный толчок отделяет нейрокодек 2021 года и позже от мутных автоэнкодеров, что были до него.
Три кодека, построившие поле
SoundStream – тот, что начал
SoundStream, опубликованный исследователями Google в 2021 году, – фундамент, на котором стоит всё остальное. Это был первый сквозной нейрокодек, объединивший все три идеи выше – обученный свёрточный энкодер-декодер, остаточное векторное квантование и состязательное обучение – в систему, которая явно обогнала рукотворные кодеки. Заголовочный результат – число, которое цитируют повсюду: в слепых тестах на 24 kHz SoundStream при 3 кбит/с обогнал Opus при 12 кбит/с и приблизился к качеству речевого кодека EVS при 9,6 кбит/с, расходуя в три-четыре раза меньше бит при том же воспринимаемом качестве. Он также работал в реальном времени на процессоре телефона и мог встроить шумоподавление в тот же проход, очищая звук «бесплатно» по ходу сжатия.
Как потребительский продукт под этим именем SoundStream не выходил. Его важность – в роли чертежа: RVQ-для-аудио было его вкладом, и все кодеки ниже наследуют его.
Lyra v2 – тот, что реально работает
Lyra v2 – продакшен-кодек речи от Google, и это SoundStream, доведённый до практики. Выпущенный в сентябре 2022 года, он построен прямо на архитектуре SoundStream, с остаточным квантователем по обе стороны канала передачи. Он предлагает три битрейта – 3,2, 6 и 9,2 кбит/с – и переключаться между ними можно прямо в звонке, просто меняя число слоёв квантования: свойство RVQ из раздела выше делает реальную работу в реальном продукте.
Цифры качества конкретны и стоят прямого изложения. В слепых тестах Google Lyra v2 при 3,2, 6 и 9,2 кбит/с совпала по качеству с Opus при 10, 13 и 14 кбит/с соответственно. Иначе говоря, Lyra даёт речь уровня Opus, используя примерно половину или шестьдесят процентов полосы. Против телефонных кодеков, на смену которым она идёт, она обходит EVS и AMR-WB при доле их бит.
Но число, объясняющее, почему Lyra важна, вовсе не про битрейт – оно про скорость. На телефоне Pixel 6 Pro Lyra v2 кодирует и декодирует 20-миллисекундный кадр звука за 0,57 миллисекунды, то есть примерно в 35 раз быстрее реального времени, а её алгоритмическая задержка – 20 миллисекунд, сравнимо с Opus. Google сделала Lyra именно так, чтобы нейрокодек работал на обычном телефоне, не сажая батарею и не добавляя лага. Эта инженерия – а не качество исследования – и позволила ей попасть в звонковые продукты Google для пользователей в слабых сетях. Lyra – доказательство, что нейрокодек может быть продуктом. И она же, показательно, остаётся исключением, а не правилом.
EnCodec – тот, что справляется с музыкой
EnCodec от Meta, октябрь 2022 года, взял форму SoundStream и поднял потолок качества, особенно для музыки. Там где SoundStream и Lyra нацелены на речь, EnCodec построен на весь диапазон: речь 24 kHz моно на нижнем краю и стереомузыка 48 kHz на верхнем, при битрейтах от 1,5 до 24 кбит/с. В тестах MUSHRA – стандартном методе субъективного тестирования качества звука – EnCodec набрал больше SoundStream при равном битрейте, а при 3 кбит/с обошёл и Lyra v2 при 6 кбит/с, и Opus при 12 кбит/с.
EnCodec добавил два уточнения, о которых стоит знать. Он использовал один многомасштабный спектрограммный дискриминатор, чтобы упростить и ускорить обучение, и «балансировщик потерь», державший обучение стабильным. И он показал, что поверх выхода кодека можно навесить небольшую модель-Transformer и сжать битстрим ещё на 25–40 процентов – превратив поток 3 кбит/с примерно в 1,9 кбит/с – оставаясь быстрее реального времени. Этот последний приём – анонс того, куда поле пошло дальше: трактовать выход кодека не как финальный битстрим, а как язык, который другая модель может сжимать и предсказывать.
Цифры, которые решают: битрейт, качество и счёт за процессор
С нейрокодеками возникает соблазн прочитать экономию битрейта и заключить, что они очевидно лучше. Дисциплина – выложить на стол сразу все три цены, потому что экономия полосы реальна, но платится она по другой оси.
Вот сравнение, которое важно для реального продуктового решения, с цифрами при том качестве, под которое спроектирован каждый кодек.
| Кодек | Год | Диапазон битрейта | Эталон равного качества | Тип звука | Цена процессора | В проде? |
|---|---|---|---|---|---|---|
| Opus | 2012 | 6–510 кбит/с | база, с которой все сравнивают | речь + музыка | очень низкая (микросекунды) | да – основа WebRTC |
| SoundStream | 2021 | 3–18 кбит/с | 3 кбит/с ≈ Opus 12 | речь + общий | средняя (тянет телефон) | нет – чертёж |
| Lyra v2 | 2022 | 3,2 / 6 / 9,2 | 9,2 кбит/с ≈ Opus 14 | речь | низкая–средняя (0,57 мс/кадр на телефоне) | да – звонки Google |
| EnCodec | 2022 | 1,5–24 кбит/с | 3 кбит/с > Opus 12 | речь + музыка | высокая | нет – топливо для моделей |
| Mimi | 2024 | ~1,1 кбит/с | токенайзер речевых LLM, не hi-fi | речь | высокая | да – внутри голосовых ИИ |
Прочтите таблицу дважды. Левые столбцы – триумф: нейрокодеки берут качество Opus при трети-четверти бит, а новейшие речевые LLM-кодеки работают около 1 кбит/с. Правые столбцы – загвоздка. Opus декодирует за микросекунды на любом устройстве этого века; нейрокодекам нужно гонять сеть на каждом кадре, что стоит на порядки больше процессорного времени, больше батареи, а тяжёлым – мощного телефона или GPU. Lyra – единственный, спроектированный достаточно жёстко, чтобы уйти от этого на обычном телефоне, и даже Lyra – речевой кодек, не универсальный.
Посчитаем экономию, чтобы она стала конкретной. Пусть встреча на 50 человек стримит звук и каждый говорящий использует Opus при 12 кбит/с:
50 говорящих × 12 кбит/с = 600 кбит/с звука
Подставим нейрокодек при равном качестве и 3 кбит/с на говорящего:
50 говорящих × 3 кбит/с = 150 кбит/с звука
Это сокращение полосы звука в 4 раза, и оно приходится туда, где полосы мало – пациент на сельском мобильном интернете в телемедицинском звонке, студент на перегруженной сети кампуса. Экономия настоящая. А причина, по которой её всё ещё нельзя развернуть везде, – в крайнем правом столбце: гонять сеть на каждом клиенте, на каждом кадре, стоит дороже полосы, которую она экономит, если только ваши устройства и бюджет батареи не вытянут это.
«Подводный камень – «обгоняет Opus» почти никогда не значит «замени Opus». Почти каждая статья про нейрокодек сообщает, что обгоняет Opus на низком битрейте, и при условиях статьи это правда. И почти неважно для реального продукта, потому что преимущество Opus – не его битрейт, а то, что он декодирует бесплатно на любом устройстве, не стоит лицензии и встроен в стандарт WebRTC. Прежде чем взять результат «3 кбит/с обгоняет Opus 12» как повод переходить, задайте три вопроса, которых статья не задала: во что это обойдётся на худшем устройстве клиента, что это сделает с батареей и какова задержка. Для большинства живых звонков в 2026 эти ответы всё ещё за Opus. Берите нейрокодек там, где сеть – жёсткое ограничение, а вычисления доступны, а не по умолчанию.»
Где нейрокодеки реально работают в 2026: как рот и уши голосового ИИ
Вот поворот, удививший поле, и это важнейшее, что нужно понять о том, почему нейрокодеки значимы, хотя Opus всё ещё выигрывает живые звонки.
Большая языковая модель предсказывает следующий токен в последовательности. Для текста это просто – токенайзер режет письмо на несколько тысяч возможных кусочков-слов, и модель предсказывает по одному. Звук куда сложнее: сырое аудио – это десятки тысяч чисел в секунду; модель, пытающаяся предсказывать его отсчёт за отсчётом, тонет. Что нейрокодеки дали миру ИИ почти как побочный эффект – это способ превратить секунду звука в короткую последовательность дискретных токенов – индексов квантователей из стека RVQ – которые языковая модель предсказывает ровно так, как предсказывает слова. Кодек стал токенайзером для аудио. Энкодер – это уши модели; декодер – её рот.
Это переосмысляет всё. EnCodec был взят как аудио-токенайзер внутрь MusicGen от Meta. Открытый Descript Audio Codec (2023), сжимающий звук 44,1 kHz примерно в 90 раз, стал готовым топливом для аудио-языковых моделей. А самый чёткий пример нового подхода – Mimi, кодек, построенный Kyutai для речевой модели Moshi в 2024 году. Mimi работает на ~1,1 кбит/с и всего 12,5 кадра в секунду, и делает то, чего не делали ранние кодеки: разбивает свои токены на два вида. Первый поток – семантический: дистиллированный из модели понимания речи, он несёт что говорится, как текст, без голоса. Остальные потоки – акустические: они несут как это звучит: тембр, высоту, эмоцию говорящего. Разделяя смысл и голос, Mimi позволяет языковой модели рассуждать о содержании и подаче как о двух разных вещах – ровно то, что нужно системе, чтобы естественно слушать и говорить. Moshi, построенный на нём, может слушать и говорить одновременно с задержкой около 200 миллисекунд.
Так что продакшен-ответ в 2026 чётко раздваивается. Чтобы передать известный голос по сети в реальном времени, Opus – выбор по умолчанию, и нейрокодек редко стоит своих вычислений. Чтобы генерировать или понимать голос моделью – голосовые ассистенты, ИИ-дубляж, TTS на устройстве, перевод в реальном времени – нейрокодек не опция; это то, что вообще даёт модели слышать и говорить. Тот же стек RVQ, что сжимает звонок, токенизирует звук для LLM. Одна идея, два будущих.
Что дальше
Три направления определяют ближайшие годы, и ни одно из них – не «нейрокодеки наконец обходят Opus на телефоне для обычных звонков». Эта гонка по большей части окончена: Opus остаётся выбором по умолчанию для обычного транспорта, а форк под названием AOMedia Open Audio Codec (OAC) – начатый в начале 2026 года на исходниках Opus – это ставка индустрии на следующий традиционный кодек, цель которого – обойти Opus на его же поле, а не заменить его нейросетевым.
Первый настоящий рубеж – сделать нейрокодеки достаточно дешёвыми для развёртывания на краю сети. Всё поле теперь считает твёрдой проблемой цену процессора, а не качество. Исследовательские конкурсы 2025 года прямо нацелены на кодеки, работающие при жёстких ограничениях на вычисления, задержку и битрейт на обычных устройствах в шумных реальных условиях – те ограничения, что отделяют победителя бенчмарка от того, что можно выпустить. Lyra показала, что это возможно для речи на хорошем телефоне; работа теперь – сделать это правдой для большего числа устройств, типов звука и при меньшей мощности.
Второй рубеж – линия «кодек как токенайзер» взрослеет в инфраструктуру. По мере того как голосовые ИИ-модели переходят из лаборатории в продукты – ассистенты, слышащие тон, дубляж в реальном времени с сохранением подачи, перевод, сохраняющий ваш голос, – нейрокодек под ними становится частью «водопровода», такой же стандартной, как видеокодек сегодня. Открытые вопросы там – про устройство токенов: как чисто разделить семантику и акустику, сколько токенов в секунду нужно модели и сохранят ли следующие системы вообще дискретные токены – некоторые исследования 2025 года генерируют звук из непрерывных представлений и пропускают квантование целиком.
Третий – тот, за которым стоит следить ради собственной дорожной карты: граница между «кодеком» и «генератором» растворяется. Нейрокодек, способный восстановить голос из 1,1 кбит/с токенов, механически очень близок к модели, способной сгенерировать этот голос с нуля. Та же машинерия, что скрывает потерянный пакет, предсказывая недостающий звук (см. восстановление при потере пакетов), – это машинерия, которая клонирует голос. Как мы отметили в обзоре ИИ в аудио, именно на этом схождении живёт право о согласии, образе и раскрытии – и приходит оно через слой кодека, а не только через инструменты дубляжа. Когда ваше сжатие и ваш синтез – одна и та же сеть, «реален ли этот звук» перестаёт быть вопросом, на который кодек может ответить за вас.
Где здесь Фора Софт
Мы строим конференции, телемедицину, e-learning, OTT-стриминг и видеонаблюдение, и наш совет по нейрокодекам нарочито немоден: для живого звука в реальном времени в 2026 мы первым берём Opus, потому что его почти нулевая цена декодирования, отсутствие лицензии и обязательный статус в WebRTC бьют экономию битрейта, в которой большинство клиентов не нуждается и которую большинство устройств не потянет. Где мы внимательно следим за нейрокодеками – это слой ИИ: когда продукту нужна модель, чтобы понимать или генерировать голос, кодек уже не выбор сжатия, а выбор фундамента, и правильно выстроить вокруг него аудио-конвейер WebRTC (бюджет задержки, вычисления на клиента, откат к Opus) – это и есть инженерия, решающая, будет ли функция пригодной. Правильная постановка для клиента почти никогда не «перейти ли на нейрокодек», а «где в нашем конвейере обученная модель оправдывает свою цену процессора» – и ответ год за годом движется от «нигде» к ИИ-функциям по краям.
Главное
- Нейрокодек даёт сети выучить сжатие по данным вместо рукотворных правил.
- Остаточное векторное квантование – уточнение звука слоями – это идея, что всё сделала.
- SoundStream задал чертёж; Lyra v2 вывела его на телефоны; EnCodec расширил на музыку.
- Нейрокодеки берут качество Opus при 3–4 раза меньшем числе бит, но дороже по CPU и батарее.
- Для живых звонков в 2026 Opus – правильный выбор по умолчанию; нейрокодеки редко его бьют.
- Их реальный дом в 2026 – голосовой ИИ: кодек делает звук токенами, которые предсказывает LLM.