MPEG-H 3D Audio: иммерсивный стандарт ISO

Автор: Николай СапуновОбновлено: август 202621 мин чтения
Содержание статьи +

Опубликовано: 2026-06-05 · Время чтения: 14 мин · Автор: Николай Сапунов, CEO Фора Софт

Коротко

MPEG-H 3D Audio – это открытая, стандартизированная в ISO аудиосистема для телевидения нового поколения и иммерсивной музыки, и она прямой конкурент кодека Dolby AC-4 внутри нового вещательного стандарта ATSC 3.0. Её ключевой приём в том, что один поток может нести сразу три вида звука – фиксированные каналы, подвижные «объекты» и записанное звуковое поле целиком – и давать зрителю персонализировать результат, например прибавить комментатора или вовсе его выключить. Это единственная аудиосистема наземного 4K-вещания в Южной Корее, где она работает круглосуточно с 2017 года, и движок музыкального сервиса Sony 360 Reality Audio. Если ваш продукт отдаёт звук в корейский эфир, в приложения иммерсивной музыки или на новейшие смарт-ТВ, MPEG-H – формат, с которым вы столкнётесь; если вы стримите широкой аудитории, пока вы обычно отдаёте AAC или Dolby.

Почему это важно

Если вы строите OTT-сервис, продукт интернет-ТВ, музыкальное приложение или что-либо, доставляющее звук на современные телевизоры и наушники, MPEG-H 3D Audio – одна из двух систем, на которых стоит следующая эпоха вещания, и стоит понять, что она делает и где реально применяется, до планирования конвейера. Эта статья написана для продакт-менеджера, основателя или операционного руководителя без бэкграунда в звуке: к концу вы поймёте, что такое MPEG-H, какие три вида звука она несёт в одном потоке, как работает персонализация, где она применяется в 2026 году и чем отличается от Dolby AC-4. Каждое техническое число восходит к управляющему стандарту – ISO/IEC 23008-3 и ATSC A/342 Part 3 – или к опубликованным её создателями цифрам, а не к пересказу из блога.

Открытый стандарт для иммерсивного, интерактивного звука

Почти всю историю звука «канал» означал динамик. Стерео – это два канала, левый и правый. Микс 5.1 – это шесть каналов, разлитых по шести конкретным динамикам. Вся система ломается, как только сетап слушателя не совпадает: микс 5.1 на стерео-наушниках или на саундбаре с динамиками не на тех местах – компромисс, которого микс-инженер не слышал. Мир, под который создавали MPEG-H, – это именно тот хаотичный мир: телефоны, наушники, саундбары и домашние кинотеатры, все разные и все ждут хорошего звука.

MPEG-H 3D Audio – ответ от ISO/IEC Moving Picture Experts Group, органа стандартизации, известного как MPEG, той же группы, что стоит за MP3, AAC и видеокодеком HEVC. Формально он издан как ISO/IEC 23008-3, «MPEG-H Part 3: 3D audio»; текущая редакция – ISO/IEC 23008-3:2026 (каталог ISO). MPEG выпустила запрос предложений в январе 2013 года, а в феврале 2015 года объявила, что технология будет издана как международный стандарт (MPEG, февраль 2015). Технологию разработал и продвигает MPEG-H Audio Alliance – Fraunhofer IIS, Technicolor и Qualcomm, – где Fraunhofer IIS выступает основным разработчиком (Fraunhofer IIS, MPEG-H Audio).

Как AAC и кодеки Dolby, MPEG-H построен на математическом инструменте – модифицированном дискретном косинусном преобразовании, или MDCT, которое превращает фрагмент звука в частотные «ингредиенты» и тратит биты только там, где их заметит ухо. Это то же семейство математики, что описано в статье как работает сжатие звука. MPEG-H использует улучшенную версию преобразования. Но движок сжатия – не суть. Суть в том, что потоку разрешено нести.

Один факт, который стоит держать в голове: MPEG-H – это не просто более эффективный кодек, а гибкая аудиосистема, несущая в одном потоке каналы, объекты и записанное звуковое поле, и отдающая управление зрителю.

Рис. 1. MPEG-H от заявки 2013 года до вещательного стандарта 2026. Запуск в Корее в 2017-м и музыкальный сервис Sony в 2019-м – два внедрения, сделавшие его реальным.

Три вида звука в одном потоке

Это сердце MPEG-H и то, чего не делает ни один старый вещательный кодек. MPEG-H может представлять звук тремя разными способами одновременно и свободно их смешивать (ISO/IEC 23008-3; Wikipedia, MPEG-H 3D Audio).

Канальный звук. Традиционный способ: фиксированный набор каналов, каждый нацелен на конкретный динамик – стерео, 5.1, 7.1 или 3D-схема вроде 7.1.4 с потолочными динамиками. Каналы – по-прежнему верный инструмент для готового музыкального микса или киноподложки, где артист решил, где именно сидит каждый звук. Идея и то, как называют схемы каналов, описаны в статье каналы и схемы каналов.

Объектный звук. Аудиообъект – это отдельный звук (голос, инструмент, эффект), помеченный метаданными о том, где он должен быть в 3D-пространстве и насколько громким. Объект не привязан к динамику. При воспроизведении рендерер MPEG-H ставит его корректно для тех динамиков (или наушников), что реально есть у слушателя. Поскольку объект – отдельный элемент со своими настройками, зрителю можно разрешить двигать его или менять громкость – так и работает персонализация (ниже).

Сценовый звук. Это запись всего звукового поля вокруг точки, в формате под названием Higher Order Ambisonics, или HOA. Вместо описания отдельных источников он фиксирует, «как звучит воздух» в этом месте, и может поворачиваться и рендериться на любую схему динамиков. Сценовый звук естественно ложится на виртуальную и дополненную реальность, где слушатель поворачивает голову и весь звуковой ландшафт должен поворачиваться вместе с ним; см. Ambisonics, HRTF и бинауральный рендеринг.

Три философии – каналы, объекты, сцены – и где уместна каждая, разобраны в статье канальный, объектный и сценовый звук. Отличие MPEG-H в том, что он не заставляет выбирать: один битстрим может нести канальную подложку 5.1 для музыки и эффектов, горсть объектов диалога и комментария поверх и компоненты HOA для атмосферы – всё декодируется вместе.

Рис. 2. Один поток MPEG-H, три вида звука, один рендерер. Рендерер подстраивает микс под то, что реально есть у слушателя – кинотеатр 7.1.4, саундбар или стерео-наушники.

Как на самом деле работает персонализация

Функция, которую зритель ощущает первой, – персонализация, и она естественно вытекает из объектов. Поскольку диалог, комментарий и эффекты могут идти как отдельные объекты, а не запекаться в один микс, декодер может выставить их как выбор.

Три конкретных примера, и все работают сегодня. Спортивный эфир может нести домашний и гостевой комментарий как два объекта и дать выбрать – или нести объект «только стадион», чтобы выключить комментатора и слышать одну толпу. Слабослышащий зритель может прибавить объект диалога относительно музыки и эффектов – тот же выигрыш доступности, что даёт AC-4, но через отдельные объекты. Драма может отдать трек аудиоописания – закадровый рассказ о происходящем на экране для слепых и слабовидящих зрителей, описанный в статье многоязычный и описательный звук – как ещё один малый объект, который декодер подмешивает по запросу, вместо целой второй программы.

Вещатель задаёт рамки: какие объекты зрителю можно трогать и насколько. Декодер показывает только разрешённый выбор, так что художественный замысел защищён, а зритель всё равно получает осмысленный контроль. Ничего этого нельзя сделать, когда диалог и эффекты смешаны в одни каналы, – потому именно объектный звук, а не «голая» эффективность, и есть причина, по которой вещатели вообще выбрали системы нового поколения.

Профили, уровни и насколько большим может быть звук

Гибкой системе нужны рамки, чтобы и дешёвый телевизор, и премиальный ресивер могли заявлять о поддержке «MPEG-H» и при этом совместимо работать. MPEG-H даёт их через профили и уровни.

Главный профиль (Main) – полный набор инструментов, заданный с пятью уровнями, которые ограничивают, сколько звука обязан обрабатывать декодер (ISO/IEC 23008-3 DAM, 3D Audio Profiles, MPEG). Таблица ниже показывает потолок на каждом уровне.

УровеньМакс. каналов ядраМакс. каналов динамиков
188
21616
33224
46424
512864

Таблица 1. Пять уровней главного профиля MPEG-H 3D Audio. «Каналы ядра» – сколько сжатых аудиопотоков обязан обработать декодер; «каналы динамиков» – на сколько динамиков он может рендерить. Источник: ISO/IEC 23008-3 3D Audio Profiles (MPEG).

На вершине MPEG-H поддерживает до 64 каналов динамиков и 128 каналов ядра кодека (ISO/IEC 23008-3) – намного больше, чем нужно дому, и в этом смысл: один стандарт масштабируется от наушников до зала с 22.2-канальным звуком.

Для вещания MPEG справилась со сложностью набора, задав профиль низкой сложности (Low Complexity, LC) в Поправке 3 (финализирована в конце 2016 года): он добавляет эффективность кодирования и функции для вещания, оставаясь достаточно дешёвым, чтобы поместиться в чип телевизора (Wikipedia, MPEG-H 3D Audio; Fraunhofer IIS). Ещё одно подмножество – профиль Baseline – максимизирует совместимость и снижает усилия на реализацию и тестирование; именно его использует Sony 360 Reality Audio на потребительских устройствах (Fraunhofer IIS, Sony licenses MPEG-H Audio Decoder, октябрь 2021). На практике вещательные и стриминговые устройства реализуют профиль LC или Baseline, а не полный Main.

Разбор на числах: цена персонализации

Персонализация не бесплатна, но дешевле очевидной альтернативы. Допустим, спортивный эфир хочет подложку стадиона 5.1 плюс два варианта языка комментария. Лобовой подход – отдать два полных микса 5.1, по одному на язык, и пусть плеер выбирает:

два полных микса 5.1 = 2 × 192 кбит/с = 384 кбит/с

Подход MPEG-H – отдать одну подложку 5.1 плюс два моно-объекта комментария:

одна подложка 5.1 + два моно-объекта ≈ 192 кбит/с + (2 × 48 кбит/с) = 288 кбит/с

Это примерно 25% экономии на этом примере, и экономия растёт с каждым дополнительным языком, потому что каждая новая опция – это один малый объект, а не целый объёмный микс. Точные числа зависят от кодировщика, но структурный смысл держится: объекты позволяют добавлять персонализацию, не умножая всю программу.

Где MPEG-H реально применяется в 2026 году

MPEG-H – это система вещания и музыки, и именно там она работает. Её якорное внедрение – Южная Корея. Корейская Telecommunications Technology Association издала стандарт наземного UHD-ТВ в июне 2016 года на базе ATSC 3.0 и назвала MPEG-H 3D Audio единственным аудиокодеком для 4K-сервиса, запущенного в феврале 2017 года (TTA, июнь 2016; Fraunhofer IIS). С тех пор он в эфире круглосуточно, и корейский вещатель SBS использовал его, чтобы нести иммерсивный звук на событиях вроде чемпионата мира (TV Tech). Корея – доказательство, что целая национальная система вещания может работать на MPEG-H.

В США MPEG-H – одна из двух аудиосистем, стандартизированных для ATSC 3.0 («NextGen TV»). ATSC задаёт её в A/342 Part 3, «MPEG-H System», а конкурента от Dolby – в A/342 Part 2, «AC-4 System»; обе – действующие системы «Next Generation Audio» в семействе A/342. Текущая редакция MPEG-H – A/342:2026-04, принята 14 апреля 2026 года (ATSC A/342-3). Но рынок США разделился иначе: North American Broadcasters Association ещё в мае 2016 года рекомендовала AC-4 как предпочтительный эфирный аудиокодек, и большинство эфиров NextGen TV в США с тех пор используют AC-4, о чём – статья AC-4 – кодек Dolby нового поколения для вещания. Так что две системы сосуществуют в одном стандарте, но выиграли разные регионы: MPEG-H владеет Кореей, AC-4 лидирует в США.

Вне телевидения крупнейший потребительский след MPEG-H – музыка. Sony 360 Reality Audio, запущенный в январе 2019 года, – это объектный иммерсивный музыкальный формат на базе MPEG-H: отдельные звуки (вокал, инструменты, даже живая публика) ставятся как объекты в 360-градусной сфере вокруг слушателя (Sony, январь 2019). В октябре 2021 года Sony лицензировала декодер Fraunhofer профиля Baseline и вошла в программу товарного знака MPEG-H, поставив декодирование MPEG-H в широкий ряд потребительских устройств (Fraunhofer IIS, октябрь 2021).

Заметка о товарном знаке: Fraunhofer ведёт товарный знак MPEG-H, который опознаёт продукты, доказавшие совместимость, – ту же роль играет значок «Dolby» для форматов Dolby (Fraunhofer IIS, январь 2017). Для продуктовой команды этот значок – практический сигнал, что устройство действительно корректно декодирует поток MPEG-H.

Частая ошибка: считать, что «звук ATSC 3.0» – это один кодек

Самая частая ошибка планирования – считать звук ATSC 3.0 чем-то единым. Это не так. ATSC 3.0 стандартизирует две системы Next Generation Audio – MPEG-H и AC-4, – и конкретный рынок, вещатель или устройство могут поддерживать одну, другую или обе. Ресивер, сертифицированный под AC-4, не обязательно декодирует MPEG-H, и наоборот. Если ваш продукт должен принимать или воспроизводить звук ATSC 3.0 в разных регионах, нельзя считать кодек одним: поток, собранный для корейского эфира, – это MPEG-H, а эфир NextGen TV в США – скорее всего AC-4, и надёжный конвейер должен определять, какую систему несёт поток, и направлять его в нужный декодер. Отдать плеер только под MPEG-H аудитории NextGen в США – или только под AC-4 в Корею – гарантирует тишину на большой доле контента.

MPEG-H против AC-4 – кратко

Обе – объектные системы «Next Generation Audio», стандартизированные внутри ATSC 3.0, и для большинства практических задач решают одни и те же проблемы – иммерсивный звук, управление диалогом, доступность – разными путями. Таблица сводит различия, важные для решения о доставке.

СвойствоMPEG-H 3D AudioDolby AC-4
ОрганISO/IEC MPEG (открытый)Dolby / ETSI
СпецификацияISO/IEC 23008-3ETSI TS 103 190
Виды звукаканалы + объекты + сцена (HOA)каналы + объекты
Макс. каналов динамиков64 (128 ядра)ядро 5.1 → 7.1.4 + объекты
ПерсонализацияДа (объектная)Да (объектная)
Роль в ATSC 3.0A/342 Part 3A/342 Part 2
Якорный рынок вещанияЮжная Корея (единств. кодек)США (выбор NABA)
Флагман в музыкеSony 360 Reality Audio – (AC-4 – для вещания)

Таблица 2. MPEG-H 3D Audio против Dolby AC-4. Обе – объектные системы NGA в ATSC 3.0; главные отличия – открытое управление MPEG-H в ISO и нативная поддержка сценового звука (HOA) против экосистемы Dolby у AC-4. Номера стандартов – из ISO/IEC и ETSI; внедрение – из TTA, NABA и Sony.

Более глубокое различие – управление и охват. MPEG-H – это открытый стандарт ISO/IEC со многими реализаторами и нативной поддержкой сценового звука, что делает его привлекательным для VR/AR и для рынков, предпочитающих непроприетарный путь. AC-4 – продолжение экосистемы Dolby, уже владеющей гостиной, и это своё преимущество. Ни один не «лучше» в вакууме; верный зависит от того, какой рынок и какие устройства вам нужно охватить.

Чем тут занимается Фора Софт

Мы строим OTT- и интернет-ТВ-продукты, платформы видеостриминга и конференций, системы телемедицины и e-learning, ПО для видеонаблюдения и AR/VR, и выбор аудиосистемы встаёт всякий раз, когда продукт касается современных телевизоров или иммерсивных медиа. Когда клиент отдаёт звук в корейский эфир, в иммерсивную музыку или на новейшие смарт-ТВ, MPEG-H входит в разговор, и инженерная работа практична: определить, какую систему Next Generation Audio несёт поток, направить его в нужный декодер, сохранить метаданные объектов, на которых держится персонализация, через все транскодирования и держать разумный запасной путь на AAC или Dolby для устройств, не декодирующих MPEG-H. Эти компромиссы мы делаем в стриминговых, вещательных и AR/VR-проектах с 2005 года.

Ключевые выводы

  • MPEG-H 3D Audio – открытый стандарт ISO/IEC 23008-3.
  • Один поток несёт каналы, объекты и сцену (HOA) вместе.
  • Объекты дают персонализацию: выбрать комментарий, поднять диалог, подмешать описание.
  • В главном профиле пять уровней, до 64 динамиков и 128 каналов ядра.
  • Это единственный аудиокодек наземного 4K-эфира Кореи с 2017 года.
  • В ATSC 3.0 он сосуществует с AC-4; AC-4 лидирует в США, MPEG-H – в Корее.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.