MPEG-H 3D Audio: открытый стандарт иммерсивного звука ISO

Автор: Николай СапуновОбновлено: август 202618 мин чтения
Содержание статьи +

Кратко

MPEG-H 3D Audio – это открытая, стандартизованная в ISO система звука, на которой построены вещание нового поколения и иммерсивная музыка; эта статья разбирает её устройство изнутри, а не снаружи. Главный приём, из которого вытекает всё остальное, – блок описательных данных под названием Metadata Audio Elements: он движется вместе со звуком и сообщает плееру, что представляет собой каждый элемент, что разрешено менять зрителю и насколько громким должен остаться результат. Эти данные едут внутри пакетного формата MHAS, который можно резать, переключать и объединять одновременно через эфирную антенну и интернет-канал – именно так одна программа несёт стадионный микс в эфире и редкоязычный комментарий по broadband. К концу вы поймёте модель сцены, пакетный транспорт, профили, которые реально реализует телевизионный чип, механику громкости и то, где формат применяется в 2026 году.

Почему это важно

Если вы делаете OTT-сервис, продукт интернет-ТВ, приложение иммерсивной музыки или что-либо, что отправляет звук на современный smart-TV или в наушники, MPEG-H – одна из двух звуковых систем, на которых работает новая эра вещания, и решение по нему – это решение по всему вашему конвейеру доставки. Это глубокий разбор для продакт-менеджера, основателя или операционного руководителя, который уже примерно знает, что делает MPEG-H – это описано в статье MPEG-H 3D Audio простыми словами – и которому теперь нужно понять, как он устроен, достаточно глубоко, чтобы оценить интеграцию, поставить задачу команде или проверить заявление вендора. Старший инженер тоже это прочитает и должен счесть точным: каждое число здесь восходит к управляющему стандарту – ISO/IEC 23008-3 и ATSC A/342 Part 3, – а не к чужому пересказу.

Короткая отстройка: что здесь значит «система 3D-звука»

Перед механикой – одно определение, потому что из него следует весь дизайн. Традиционный формат звука – это запись: фиксированный набор каналов, замороженный в один микс, который плеер просто декодирует и проигрывает. MPEG-H – не запись. Это сцена – описание звуков программы плюс инструкции по их сборке, – которую плеер рендерит заново под те колонки или наушники, что есть у слушателя.

Слово «рендерит» здесь – ключевое. Renderer в этом контексте – часть декодера, которая берёт описанные звуки и решает, куда они пойдут для вашей конкретной системы. Одна и та же сцена становится миксом 7.1.4 на одном устройстве, стереомиксом в наушниках с имитацией высоты на другом и миксом для саундбара на третьем – без перекодирования, потому что сборка происходит при воспроизведении. Сравните это с более старыми кодеками из статьи короткая история аудиокодеков, где микс запекался в студии и у плеера не было права голоса.

MPEG-H публикуется группой ISO/IEC Moving Picture Experts Group как ISO/IEC 23008-3, «High efficiency coding and media delivery – Part 3: 3D audio». Издание, на которое нормативно ссылается текущий вещательный профиль США, – ISO/IEC 23008-3:2022 (ATSC A/342-3:2025-10, §2.1). Он несёт три вида звука одновременно – фиксированные каналы, подвижные объекты и записанное звуковое поле – и позволяет вещателю открыть зрителю выбранные элементы управления. Это и есть рассказ из MPEG-H 3D Audio простыми словами. Всё ниже – слой под ним.

Звуковая сцена: как MPEG-H описывает звук

Самая важная структура в MPEG-H – это звуковая сцена, формальное описание всего, что содержит программа, и всего, что слушателю с ней разрешено делать. Она несётся в блоке статических данных, который стандарт называет Metadata Audio Elements, сокращённо MAE (ISO/IEC 23008-3, Clause 15; ATSC A/342-3:2025-10, §4.2.1). MAE – это разница между кодеком и системой. Кодек сжимает звук; MAE его объясняет.

MAE организована как небольшая иерархия, и имена стоит выучить, потому что любая интерактивная функция восходит к ним. На вершине – AudioSceneInfo, корень, который говорит «это вся программа целиком». Под ним – три вида структур (ATSC A/342-3:2025-10, §4.2.1.1–4.2.1.3):

Group собирает сигналы-элементы, которые надо обрабатывать как единое целое. Стереозапись, два канала которой всегда должны двигаться вместе, – одна группа; сабмикс микрофонов толпы – другая. Группировка – это способ инженера сказать «эти принадлежат друг другу, обрабатывайте их как один объект».

Switch Group собирает элементы, которые взаимоисключающи: в один момент активен ровно один. Это механизм выбора языка: три комментаторских дорожки (скажем, два варианта английского и один иноязычный фид) живут в одной switch group, и декодер гарантирует, что вы слышите ровно одну. Случайно наложить два языка нельзя – структура это запрещает.

Preset – это сохранённая именованная комбинация групп и объектов со своими усилениями и позициями, опыт «в одно касание». Собственные примеры стандарта показательны: пресет «Dialogue Enhancement», который поднимает диалог и опускает фон, и пресет «Live Mix» для спорта с усиленной атмосферой, дополнительным объектом толпы и приглушённым комментарием (ATSC A/342-3:2025-10, §A.4.1). Пресеты – это почему зритель может выбрать «только стадион», не понимая ни одного из лежащих под этим объектов.

Рис. 1. Иерархия MAE. AudioSceneInfo в корне; Groups объединяют связанные звуки; Switch Group обеспечивает «выбери ровно один язык»; Presets – это именованные режимы «в одно касание», которые видит зритель.

Ключевое свойство: MAE описывает не только что в сцене, но и что зрителю разрешено менять и насколько. Каждый элемент несёт флаги – может ли пользователь регулировать усиление, может ли двигать позицию – и пределы этих изменений (ATSC A/342-3:2025-10, §A.4.1). Вещатель задаёт свободу; декодер её соблюдает. Поэтому персонализация никогда не ломает художественный замысел: микс-инженер решает, что комментарий можно поднять максимум на 12 dB, и ни один ползунок зрителя это не превысит.

MHAS: пакетный формат, который всё это несёт

Описанию сцены и трём видам звука нужен контейнер, который можно резать, переключать и объединять на лету – в точке вещательного сплайса, при смене канала, посреди потока при смене раскладки программы. Этот контейнер – MPEG-H Audio Stream, сокращённо MHAS (ISO/IEC 23008-3, Clause 14; ATSC A/342-3:2025-10, §5.2.1). Думайте о MHAS как о поезде из подписанных вагонов: каждый вагон – это пакет с типом, и тип сообщает любому устройству на линии, что внутри, без необходимости декодировать звук.

Несколько типов пакетов несут всю систему. Пакет конфигурации PACTYP_MPEGH3DACFG хранит настройку декодера – раскладку каналов, число объектов, параметры ядра-кодека. Пакет сцены PACTYP_AUDIOSCENEINFO хранит описанную выше MAE, и спецификация требует, чтобы он шёл прямо за пакетом конфигурации в каждой точке входа (ATSC A/342-3:2025-10, §5.2.2.2). Сам звук едет в пакетах PACTYP_MPEGH3DAFRAME. Когда зритель крутит ручку, результат возвращается в поток как пакет PACTYP_USERINTERACTION, который декодер читает перед рендером следующего кадра (ATSC A/342-3:2025-10, §A.4.3).

Два проектных решения делают MHAS необычно гибким. Во-первых, полезная нагрузка каждого пакета выровнена по байтам, так что устройство сплайсинга может найти границу и резать, не декодируя звук – это необходимо для вставки рекламы на точный видеокадр (ATSC A/342-3:2025-10, §4.2.3). Во-вторых, специальный пакет усечения PACTYP_AUDIOTRUNCATION позволяет укоротить последний звуковой кадр перед сплайсом, чтобы аудио закончилось ровно там, где видео, хотя аудио и видео почти никогда не используют одну частоту кадров.

Рис. 2. Поток MHAS как поезд из типизированных пакетов. Sync sample несёт конфиг и сцену, чтобы декодер стартовал «с нуля»; пакеты взаимодействия и усечения вставляются на лету без перекодирования звука.

Подключение и переключение без щелчка

Вещательный зритель постоянно переключает каналы, а стриминговый плеер меняет битрейт всякий раз, когда сеть проседает. И то и другое требует, чтобы декодер мог чисто запуститься или перезапуститься посреди потока. MPEG-H решает это через Random Access Point, или RAP – «sync sample», содержащий всё необходимое для холодного старта: пакет конфигурации, пакет сцены, пакет тайминга буфера и аудиокадр, именно в этом порядке (ATSC A/342-3:2025-10, §5.2.2.2). Попали на RAP – можете начать декодирование с нуля. Стандарт даже рекомендует 100-миллисекундный fade-in на первом выходном буфере после подключения, чтобы звук пришёл плавно, а не щелчком (ATSC A/342-3:2025-10, §A.3.1).

Для бесшовной адаптации битрейта – звукового аналога того, что видео делает в аудио в HLS, DASH, CMAF – MPEG-H использует Immediate Play-out Frames, или IPF. IPF несёт достаточно информации о предыдущих кадрах, чтобы декодер мог перепрыгнуть в другое битрейтовое представление на границе сегмента без слышимого шва (ATSC A/342-3:2025-10, §4.2.4). Размещение IPF на границах сегментов и делает возможным адаптивный стриминг MPEG-H без щелчков.

Два потока, одна программа: гибрид «эфир + broadband»

Вот возможность, которой нет ни у одного классического вещательного кодека, и это самый ясный аргумент, почему звук нового поколения – система, а не просто лучший компрессор. Одну программу MPEG-H можно разделить на два или более независимых потока – один в эфире, один или несколько в интернете, – и декодер объединит их в одну сцену (ATSC A/342-3:2025-10, §4.2.2, §5.2.2.4).

Механизм – sample entry mhm2 (многопотоковый вариант обычной записи mhm1). Главный поток несёт как минимум презентацию по умолчанию и помечен mae_isMainStream = 1; вспомогательные потоки несут дополнительные части – дополнительные языки, дорожку аудиоописания – и помечены 0. Пока потоки синхронизированы по времени и их точки доступа выровнены, декодер сшивает их в одну звуковую сцену при воспроизведении (ATSC A/342-3:2025-10, §5.2.2.4).

Практическая выгода велика. Вещатель передаёт популярный контент – программу и два основных языка – по дефицитному дорогому вещательному спектру, а длинный хвост – редкий язык, дорожку аудиоописания, авторский комментарий – по broadband, где полоса дешёвая. Зритель получает одну бесшовную программу; оператор платит вещательные тарифы только за то, что смотрит большинство. Это та экономика мультидорожек, которую мы разбираем в статье хранение и CDN-математика мультиязычного аудио, теперь решённая на уровне кодека.

Ядро-кодек: где на самом деле экономятся биты

Под моделью сцены и пакетным транспортом лежит обычная задача: эффективно сжать звуковые сигналы. Движок сжатия MPEG-H построен на том же семействе математики, что AAC и система Unified Speech and Audio Coding, USAC, используя улучшенное модифицированное дискретное косинусное преобразование – MDCT, – чтобы превратить звук во «частотные ингредиенты» и тратить биты только там, где замечает ухо (ISO/IEC 23008-3; четыре идеи за этим – в статье как работает сжатие звука). Ядро может обрабатывать до 128 core-каналов кодека, и это позволяет одному декодеру обрабатывать большую подложку плюс много объектов плюс амбисонические компоненты вместе.

Когда сцена включает записанное звуковое поле – Higher Order Ambisonics, или HOA, естественный выбор для звука VR с поворотом головы, разобранного в статье Ambisonics, HRTF и бинауральный рендеринг – энкодер раскладывает это поле на набор преобладающих направленных сигналов плюс сигнал атмосферы и кодирует каждый ядром на базе USAC (ISO/IEC 23008-3). Renderer обращает процесс под раскладку слушателя, включая поворот всего поля вслед за наушниками с head-tracking.

Стоит запомнить: ядро-кодек компетентно, но это не отличительная черта. У AAC и AC-4 ядра тоже компетентные. Преимущество MPEG-H – всё, что наложено поверх ядра: сцена, метаданные, интерактивность, – поэтому статья тратит большую часть слов именно там.

Профили и уровни: что реально реализует телевизионный чип

Гибкой системе нужны ограничители, иначе дешёвый телевизор и премиальный ресивер не могли бы оба честно заявлять о поддержке «MPEG-H». Эти ограничители – профили (какие инструменты обязаны быть реализованы) и уровни (сколько звука обязан обрабатывать декодер). Полный набор – Main profile с пятью уровнями, на вершине – 64 канала колонок и 128 core-каналов, достаточно для зала 22.2 и далеко за пределами нужд дома (ISO/IEC 23008-3). Но Main почти никто не реализует в потребительском устройстве.

Для вещания и стриминга важны два урезанных профиля. Low Complexity (LC) profile, добавленный в Amendment 3 (конец 2016), сохраняет инструменты каналов, объектов и HOA, но снижает сложность декодера примерно вдвое относительно более полного набора – достаточно дёшево, чтобы поместить в TV-SoC (Fraunhofer IIS; ISO/IEC 23008-3). Baseline (BL) profile, доведённый до финального статуса в 2020 году, – подмножество LC, настроенное под вещание, стриминг и иммерсивную музыку; он несёт каналы и объекты, упрощает обработку метаданных и убирает продвинутую обработку HOA (Fraunhofer IIS; audioXpress, 2020).

Что отгружается в ATSC 3.0 сегодня – конкретно: ревизия вещательного стандарта США 2025 года добавила Baseline-профиль рядом с LC, и оба ограничены только Уровнями 1, 2 или 3 – высокие уровни Main в эфире не используются (ATSC A/342-3:2025-10, §5.1). Из этого выбора следуют два реальных потолка. LC Profile Level 3 ограничивает выход декодера на колонки 12 каналами – с запасом хватает на 7.1.4 (двенадцать колонок), что и есть практическая иммерсивная цель для дома (ATSC A/342-3:2025-10, §A.2.1). А вещательный максимум битрейта ограничен 1 200 kbps, поднимаясь до 1 540 или 2 400 kbps лишь в специфических конфигурациях с большим числом каналов (ATSC A/342-3:2025-10, §5.2.1).

ПрофильГде применяетсяНесомые инструментыИспользуется в ATSC 3.0
Main (5 уровней)Reference / студияКаналы + объекты + полный HOA, до 64 колонокНет
Low Complexity (LC)Вещательные TV-чипыКаналы + объекты + HOA, ~50% ниже сложностьДа (Уровни 1–3)
Baseline (BL)Телевизоры, муз. устройстваКаналы + объекты, упрощённые метаданные, без продвинутого HOAДа (Уровни 1–3)

Табл. 1. Три профиля MPEG-H, которые важны на практике. Потребительское вещание и музыка работают на LC или Baseline на Уровнях 1–3; полный Main – это студийная и эталонная цель. Источник: ISO/IEC 23008-3; ATSC A/342-3:2025-10, §5.1; Fraunhofer IIS.

Рабочий пример: почему объект выгоднее второго микса

У персонализации есть стоимость в полосе, и число легко посчитать – что важно, когда вы бюджетируете вещательный мультиплекс. Допустим, спортивная программа хочет стадионную подложку 5.1 плюс два языка комментария. Старый подход отгружает два полных микса 5.1 и даёт плееру выбрать один:

два полных микса 5.1 = 2 × 192 kbps = 384 kbps

Подход MPEG-H отгружает одну подложку 5.1 и добавляет каждый язык как моно-объект комментария внутри switch group:

одна подложка 5.1 + два моно-объекта = 192 kbps + (2 × 48 kbps) = 288 kbps

Это 96 kbps экономии – сокращение на 25%, – и разрыв растёт с каждым дополнительным языком, потому что каждая новая опция – это один маленький объект, а не целый surround-микс. Пять языков «в лоб» дали бы 5 × 192 = 960 kbps; «объектным» способом это 192 + (5 × 48) = 432 kbps, экономия 55%. Точные цифры зависят от энкодера, но урок – в структуре: объекты дают персонализации расти сублинейно, а дублированные миксы растут линейно.

Громкость и динамический диапазон: то, на чём настаивают вещатели

У системы, позволяющей зрителям крутить ручки, есть регуляторная проблема: если поднять диалог, программа становится громче, а правила громкости – CALM Act в США и аналоги в других странах, все построенные на измерении из статьи громкость, peak, RMS, LUFS – этого не позволяют. MPEG-H решает это, встраивая контроль громкости в формат, а не оставляя его playout-цепочке вещателя.

MPEG-H наследует механику громкости и динамического диапазона от MPEG-D DRC, формально ISO/IEC 23003-4:2025 (ATSC A/342-3:2025-10, §4.2.5, §2.1). Поток несёт метаданные громкости, измеренные по ITU-R BS.1770 – тому же алгоритму, что стоит за статьёй нормализация громкости: EBU R128, BS.1770, ATSC A/85 – и набор профилей DRC, из которых устройство выбирает в зависимости от того, AV-ресивер это, динамик телевизора или телефон (ATSC A/342-3:2025-10, §A.5). Нормализация громкости в декодере должна быть включена постоянно.

Самое умное – компенсация громкости. Всякий раз, когда вещатель разрешает интерактивность усиления для элемента, поток обязан также нести данные компенсации, и декодер применяет их автоматически: пока зритель поднимает объект диалога, система тихо подрезает общий уровень, чтобы измеренная громкость программы оставалась на месте (ATSC A/342-3:2025-10, §4.2.6, §5.3). Зритель получает чёткий диалог; регулятор – соответствующую нормам программу. Стандарт фиксирует диапазон целевой громкости, который должны покрывать наборы DRC, на от −31 dB до 0 dB, непрерывно (ATSC A/342-3:2025-10, §5.3). DRC также даёт вещателям зависящий от времени ducking – автоматическое понижение выбранных элементов под voice-over или закадровым аудиоописанием, что напрямую относится к статье стек доступности: субтитры и аудиоописание.

Частая ошибка: путать сцену с рендером

Самая частая ошибка продуктовых команд с MPEG-H – относиться к бинауральному выходу в наушники как к мастеру. Это не он. Декодер MPEG-H может отрендерить сцену в наушники, используя head-related transfer functions – данные HRTF и бинауральные импульсные характеристики, поданные по ISO/IEC 23008-3, Clause 13, – и стандарт масштабирует этот рендеринг по уровню: максимум 2 бинауральные пары на Уровне 1, 6 на Уровне 2, 11 на Уровне 3 (ATSC A/342-3:2025-10, §A.2.2). Этот бинауральный микс – производный рендер, вычисленный на устройстве для одной пары ушей. Поставляемое и архивируемое – это сцена: каналы, объекты, HOA и MAE. Путаница приводит к тому, что команды «мастерят в бинаурале», выбрасывая ту самую гибкость, за которую заплатили. Создавайте сцену; пусть renderer делает бинаурал.

Где MPEG-H реально применяется в 2026 году

MPEG-H – система для вещания и музыки, и в 2026 году карта яснее, чем когда-либо. Якорь по-прежнему – Южная Корея, где стандарт TTA, опубликованный в июне 2016 года, назвал MPEG-H единственным аудиокодеком для наземного UHD, а вещатели SBS, MBC и KBS запустили постоянные сервисы ATSC 3.0 31 мая 2017 года – первый аудиокодек нового поколения в эфире 24/7 в мире (TTA, 2016; Fraunhofer IIS; audioXpress, 2017). Он нёс зимнюю Олимпиаду 2018 в Пхёнчхане в иммерсивном звуке и работает непрерывно с тех пор.

Более крупная история 2026 года – два новых национальных обязательства. В США ATSC 3.0 («NextGen TV») добровольный, но продвигается; пересмотренный национальный план развёртывания теперь указывает на 2027 год, а сам аудиостандарт снова ревизирован – A/342-3:2026-04 (апрель 2026) – это текущая версия после ревизии октября 2025, добавившей Baseline-профиль (ATSC; ATSC A/342-3:2025-10). А Бразилия официально приняла систему на базе ATSC 3.0 под брендом DTV+ (TV 3.0), с MPEG-H Audio как обязательным компонентом, нацеливаясь на коммерческую готовность к Чемпионату мира по футболу FIFA 2026 (ATSC; V-Nova; TV Tech, 2025). Бразилия – первая национальная система, обязывающая MPEG-H-звук рядом с видео VVC и LCEVC.

Со стороны музыки Sony 360 Reality Audio, запущенный 8 января 2019 года, построен на объектной модели MPEG-H и поставляется через стриминговых партнёров; Sony лицензировала декодер MPEG-H и для ATSC 3.0, и для DVB-устройств (Sony / Fraunhofer IIS, 2021). Вывод для продуктовой команды: если вы отгружаете в корейское или бразильское вещание, на приёмники ATSC 3.0, в приложения иммерсивной музыки или на новейшие smart-TV, MPEG-H – формат, который вы встретите, – и теперь вы знаете, что движется под поверхностью.

Где здесь Фора Софт

Мы строим платформы OTT и интернет-ТВ, бэкенды видеостриминга, системы конференций и телемедицины, и звуковой слой – это там, где продукты тихо удаются или проваливаются. Для клиентов, присматривающихся к вещанию нового поколения или доставке иммерсивной музыки, работа редко состоит в написании кодека – это интеграция вокруг него: упаковка MPEG-H в нужный контейнер, проводка элементов персонализации в UI плеера, соблюдение компенсации громкости от начала до конца и обработка гибридного слияния «эфир + broadband», чтобы редкоязычная дорожка приходила чисто. Мы отгружаем звуковые конвейеры стриминга и конференций с 2005 года, и уроки объектного, управляемого метаданными звука переносятся прямо в функции пространственных конференций и доступности, которые клиенты всё чаще запрашивают.

Ключевые выводы

  • MPEG-H – это модель сцены, а не запись: плеер собирает микс под каждое устройство.
  • Metadata Audio Elements (MAE) – Groups, Switch Groups, Presets – движут всей персонализацией.
  • Пакеты MHAS несут конфиг, сцену, аудио и взаимодействие; сплайс без перекодирования.
  • Гибридная доставка объединяет эфирный поток и broadband-потоки в одну программу.
  • Потребительские устройства работают на профиле LC или Baseline, Уровни 1–3, а не на полном Main.
  • Компенсация громкости держит программы в норме, даже когда зритель меняет микс.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.