MPEG-H 3D Audio: иммерсивный стандарт ISO

Автор: Николай СапуновОбновлено: август 202622 мин чтения
Содержание статьи +

Опубликовано: 2026-06-05 · Время чтения: 14 мин · Автор: Николай Сапунов, CEO Фора Софт

Коротко

MPEG-H 3D Audio – открытая аудиосистема, стандартизированная ISO, предназначенная для телевидения нового поколения и иммерсивной музыки. Она является прямым конкурентом кодека Dolby AC-4 в рамках нового вещательного стандарта ATSC 3.0. Её главное преимущество – возможность передавать в одном потоке сразу три типа звука: фиксированные каналы, подвижные «объекты» и записанное звуковое поле целиком, что позволяет зрителю персонализировать прослушивание – например, увеличить громкость комментатора или вообще отключить его. Это единственная аудиосистема наземного 4K-вещания в Южной Корее, где она работает круглосуточно с 2017 года, а также используется в музыкальном сервисе Sony 360 Reality Audio. Если ваш продукт транслирует звук в корейский эфир, в приложения иммерсивной музыки или на современные смарт-ТВ, формат MPEG-H 3D Audio – тот, с которым вы столкнётесь; если же вы стримите контент широкой аудитории, скорее всего, вы пока используете AAC или Dolby.

Почему это важно

Если вы разрабатываете OTT-сервис, интернет-ТВ, музыкальное приложение или любой продукт, доставляющий звук на современные телевизоры и наушники, MPEG-H 3D Audio – одна из двух систем, на которых строится следующая эпоха вещания. Перед тем как проектировать конвейер, важно понять, что это за технология и где она реально применяется. Эта статья адресована продакт-менеджерам, основателям и операционным руководителям без технического бэкграунда в области звука: к концу вы узнаете, что такое MPEG-H, какие три формата звука она объединяет в одном потоке, как работает персонализация, где используется в 2026 году и чем отличается от Dolby AC-4. Все технические данные взяты из официальных стандартов – ISO/IEC 23008-3 и ATSC A/342 Part 3 – или из опубликованных создателями источников, а не из блогов.

Открытый стандарт для иммерсивного и интерактивного звука

Почти всю историю звука слово «канал» означало динамик. Стерео – это два канала, левый и правый. Микс 5.1 – шесть каналов, распределённых по шести конкретным динамикам. Вся система рушится, как только конфигурация слушателя не совпадает: микс 5.1 на стерео-наушниках или на саундбаре с динамиками, расположенными не так, как задумано, – это компромисс, на который микс-инженер не рассчитывал. Мир, для которого создавался MPEG-H 3D Audio (MPEG-H), – именно такой хаотичный: телефоны, наушники, саундбары и домашние кинотеатры, все разные и все требуют качественного звука.

MPEG-H 3D Audio – ответ ISO/IEC Moving Picture Experts Group, известного как MPEG, той же организации, что стоит за форматами MP3, AAC и видеокодеком HEVC. Официально стандарт опубликован как ISO/IEC 23008-3, «MPEG-H Часть 3: 3D-аудио»; действующая редакция – ISO/IEC 23008-3:2026 (каталог ISO). В январе 2013 года MPEG объявил о начале приёма предложений, а в феврале 2015 года сообщил, что технология будет принята в качестве международного стандарта (MPEG, февраль 2015). Разработкой и продвижением технологии занимается MPEG-H Audio Alliance – консорциум, в который входят Fraunhofer IIS, Technicolor и Qualcomm, причём Fraunhofer IIS выступает в роли основного разработчика (Fraunhofer IIS, MPEG-H Audio).

Как AAC и кодеки Dolby, MPEG-4 Audio (MPEG-H) построен на математическом инструменте – модифицированном дискретном косинусном преобразовании, или MDCT, которое преобразует фрагмент звука в частотные «ингредиенты» и расходует биты только там, где их способно воспринять человеческое ухо. Это та же математическая основа, что описана в статье как работает сжатие звука. MPEG-H использует улучшенную версию этого преобразования. Но сам алгоритм сжатия – не главное. Главное – то, что может передавать поток.

Один важный факт: MPEG-HEVC – это не просто более эффективный кодек, а гибкая аудиосистема, способная передавать в одном потоке каналы, объекты и записанное звуковое поле, отдавая управление зрителю.

Рис. 1. MPEG-H от заявки 2013 года до вещательного стандарта 2026. Запуск в Южной Корее в 2017 году и музыкальный сервис Sony в 2019 году – два внедрения, которые превратили его в реальную технологию.

Три вида звука в одном потоке

Это сердце MPEG-H и то, чего не может сделать ни один старый вещательный кодек. MPEG-H способен представлять звук тремя разными способами одновременно и свободно их смешивать (ISO/IEC 23008-3; Wikipedia, MPEG-H 3D Audio).

Канальный звук. Традиционный подход – фиксированный набор каналов, каждый из которых ориентирован на определённый динамик: стерео, 5.1, 7.1 или 3D-конфигурации вроде 7.1.4 с потолочными динамиками. Каналы по-прежнему остаются надёжным инструментом для готовых музыкальных миксов или киноподложек, где автор заранее определяет, где должен находиться каждый звук. Идея и названия таких схем подробно описаны в статье каналы и схемы каналов.

Объектный звук. Аудиообъект – это отдельный звук (голос, инструмент, эффект), снабжённый метаданными о его положении в 3D-пространстве и уровне громкости. Он не привязан к конкретному динамику. При воспроизведении рендерер MPEG-H 3D корректно размещает его с учётом реально доступных у слушателя динамиков или наушников. Поскольку каждый объект представляет собой самостоятельный элемент со своими параметрами, пользователю можно позволить перемещать его или регулировать громкость – именно так реализуется персонализация (см. ниже).

Сценовый звук. Это запись всего звукового поля вокруг определённой точки в формате под названием Higher Order Ambisonics, или HOA. Вместо описания отдельных источников он фиксирует, «как звучит воздух» в этом месте, и может быть ориентирован и воспроизведён на любой схеме динамиков. Сценовый звук естественно подходит для виртуальной и дополненной реальности, где слушатель поворачивает голову, и весь звуковой ландшафт должен поворачиваться вместе с ним; см. Ambisonics, HRTF и бинауральный рендеринг.

Три философии – каналы, объекты, сцены – и где уместна каждая, подробно разобраны в статье канальный, объектный и сценовый звук. Отличие MPEG-H в том, что он не заставляет делать выбор: один битстрим может одновременно содержать канальную подложку 5.1 для музыки и эффектов, несколько объектных диалогов и комментариев поверх них, а также компоненты HOA для атмосферы – всё это декодируется вместе.

Рис. 2. Один поток MPEG-H, три вида звука, один рендерер. Рендерер подстраивает микс под то, что реально есть у слушателя – кинотеатр 7.1.4, саундбар или стерео-наушники.

Как на самом деле работает персонализация

Первое, что ощущает зритель, – это персонализация, и она естественно вытекает из объектов. Поскольку диалог, комментарий и эффекты могут существовать как отдельные объекты, а не быть «запечёнными» в единый микс, декодер может предлагать их в качестве выбора.

Три конкретных примера, и все они работают уже сегодня. Спортивный эфир может передавать домашний и гостевой комментарии как два отдельных объекта, позволяя зрителю выбирать – или включать объект «только стадион», чтобы отключить комментаторов и слышать только шум толпы. Слабослышащий зритель может увеличить громкость диалогов по отношению к музыке и звуковым эффектам – тот же прирост доступности, что обеспечивает AC-4, но через отдельные объекты. Драма может включить трек аудиоописания – закадровый рассказ о происходящем на экране для слепых и слабовидящих зрителей, описанный в статье многоязычный и описательный звук – как ещё один небольшой объект, который декодер добавляет по запросу, вместо запуска целой второй программы.

Вещатель задаёт границы: какие объекты зритель может трогать и в какой степени. Декодер показывает только разрешённые варианты, так что художественный замысел остаётся защищённым, а зритель при этом сохраняет осмысленный контроль. Ничего подобного невозможно реализовать, если диалог и звуковые эффекты смешаны в одних и тех же каналах – именно поэтому вещатели выбрали системы нового поколения не ради «голой» эффективности, а ради объектного звука.

Профили, уровни и насколько большим может быть звук

Гибкой системе нужны рамки, чтобы и дешёвый телевизор, и премиальный ресивер могли заявлять о поддержке «MPEG-H» и при этом корректно взаимодействовать. MPEG-4 даёт их через профили и уровни.

Главный профиль (Main) – полный набор инструментов, включающий пять уровней, которые определяют, сколько звука должен обрабатывать декодер (ISO/IEC 23008-3 DAM, 3D Audio Profiles, MPEG). Ниже приведена таблица с максимальными значениями для каждого уровня.

УровеньМакс. каналов ядраМакс. каналов динамиков
188
21616
33224
46424
512864

Таблица 1. Пять уровней основного профиля MPEG-H 3D Audio. «Каналы ядра» – количество сжатых аудиопотоков, которые должен обрабатывать декодер; «каналы динамиков» – количество динамиков, на которые он может рендерить. Источник: ISO/IEC 23008-3 3D Audio Profiles (MPEG).

На вершине MPEG-H поддерживает до 64 каналов динамиков и 128 каналов ядра кодека (ISO/IEC 23008-3) – намного больше, чем нужно в домашних условиях, и именно в этом заключается его суть: один и тот же стандарт масштабируется – от наушников до концертного зала с 22.2-канальным звуком.

Для вещания MPEG справилась со сложностью набора, задав профиль низкой сложности (Low Complexity, LC) в Поправке 3 (финализирована в конце 2016 года): он повышает эффективность кодирования и добавляет функции для вещания, оставаясь при этом достаточно простым и дешёвым, чтобы уместиться в чип телевизора (Wikipedia, MPEG-H 3D Audio; Fraunhofer IIS). Ещё одно подмножество – профиль Baseline – максимизирует совместимость и снижает трудозатраты на реализацию и тестирование; именно его использует Sony 360 Reality Audio на потребительских устройствах (Fraunhofer IIS, Sony licenses MPEG-H Audio Decoder, октябрь 2021). На практике вещательные и стриминговые устройства реализуют профиль LC или Baseline, а не полный Main.

Разбор на числах: цена персонализации

Персонализация не бесплатна, но дешевле очевидной альтернативы. Допустим, спортивный эфир требует подложку стадиона в формате 5.1 плюс два варианта комментирования на разных языках. Прямой подход – передать два полных микса 5.1, по одному на каждый язык, и пусть плеер сам выбирает нужный.

два полных микса 5.1 = 2 × 192 кбит/с = 384 кбит/с

Подход MPEG-H – использовать одну подложку 5.1 и два монообъекта для комментариев:

одна подложка 5.1 + два моно-объекта ≈ 192 кбит/с + (2 × 48 кбит/с) = 288 кбит/с

Это примерно 25%-ная экономия на данном примере, и она растёт с каждым дополнительным языком, поскольку каждая новая опция – это один небольшой объект, а не целый объёмный микс. Точные цифры зависят от кодировщика, но общий принцип остаётся: объекты позволяют добавлять персонализацию, не удваивая весь объём программы.

Где MPEG-2 реально применяется в 2026 году

MPEG-H – это система телевизионного вещания и аудио, и именно в этой области она применяется. Её ключевое внедрение – Южная Корея. Корейская ассоциация телекоммуникационных технологий (TTA) в июне 2016 года утвердила стандарт наземного UHD-ТВ на базе ATSC 3.0 и назначила MPEG-H 3D Audio единственным аудиокодеком для 4K-услуг, запущенных в феврале 2017 года (TTA, июнь 2016; Fraunhofer IIS). С тех пор он работает в эфире круглосуточно, и вещательная компания SBS использовала его для передачи иммерсивного звука на таких мероприятиях, как чемпионат мира (TV Tech). Южная Корея стала доказательством того, что целая национальная система вещания может функционировать на базе MPEG-H.

В США MPEG-H – одна из двух аудиосистем, стандартизированных для ATSC 3.0 («NextGen TV»). ATSC определяет её в A/342 Part 3, «MPEG-H», а альтернативу от Dolby – в A/342 Part 2, «AC-4 System»; обе являются действующими системами «Next Generation Audio» в семействе A/342. Текущая редакция MPEG-H – A/342:2026-04, принятая 14 апреля 2026 года (ATSC A/342-3). Однако рынок США сложился иначе: ещё в мае 2016 года North American Broadcasters Association рекомендовала AC-4 в качестве предпочтительного эфирного аудиокодека, и с тех пор большинство трансляций NextGen TV в США используют именно AC-4, о чём рассказывает статья AC-4 – кодек Dolby нового поколения для вещания. Таким образом, две системы сосуществуют в рамках одного стандарта, но доминируют в разных регионах: MPEG-H закрепилась в Корее, а AC-4 лидирует в США.

Вне телевидения крупнейшим потребителем MPEG-H стала музыка. Sony 360 Reality Audio, запущенный в январе 2019 года, – это объектный иммерсивный музыкальный формат на базе MPEG-H: отдельные звуки (вокал, инструменты, даже живая публика) размещаются как объекты в 360-градусной сфере вокруг слушателя (Sony, январь 2019). В октябре 2021 года Sony лицензировала у Fraunhofer декодер профиля Baseline и вошла в программу товарного знака MPEG-H, обеспечив поддержку декодирования MPEG-2 в широком спектре потребительских устройств (Fraunhofer IIS, октябрь 2021).

Заметка о товарном знаке: Fraunhofer ведёт товарный знак MPEG-H, который подтверждает совместимость продуктов – такую же роль играет значок «Dolby» для форматов Dolby (Fraunhofer IIS, январь 2017). Для продуктовой команды этот значок – практичный сигнал о том, что устройство действительно корректно декодирует поток MPEG-2.

Частая ошибка: считать, что «звук ATSC 3.0» – это один кодек

Самая частая ошибка при планировании – считать звук ATSC 3.0 единым целым. Это не так. ATSC 3.0 стандартизирует две системы Next Generation Audio – MPEG-H и AC-4, – и конкретный рынок, вещатель или устройство могут поддерживать одну, другую или обе. Ресивер, сертифицированный под AC-4, не обязательно декодирует MPEG-H, и наоборот. Если ваш продукт должен принимать или воспроизводить звук ATSC 3.0 в разных регионах, нельзя считать кодек единым: поток, собранный для корейского эфира, – это MPEG-4, а эфир NextGen TV в США – скорее всего AC-4, и надёжный конвейер должен определять, какую систему несёт поток, и направлять его в нужный декодер. Отдать плеер только под MPEG-4 аудитории NextGen в США – или только под AC-4 в Корею – гарантирует тишину на большой доле контента.

MPEG-4 против AC-4 – кратко

Обе – объектные системы «Next Generation Audio», стандартизированные в рамках ATSC 3.0, – решают для большинства практических задач одни и те же проблемы: иммерсивный звук, управление диалогом, доступность – но разными путями. Таблица подводит итог различий, важных при выборе способа доставки.

СвойствоMPEG-H 3D AudioDolby AC-4
ОрганISO/IEC MPEG (открытый)Dolby / ETSI
СпецификацияISO/IEC 23008-3ETSI TS 103 190
Виды звукаканалы + объекты + сцена (HOA)каналы + объекты
Макс. каналов динамиков64 (128 ядра)ядро 5.1 → 7.1.4 + объекты
ПерсонализацияДа (объектная)Да (объектная)
Роль в ATSC 3.0A/342 Part 3A/342 Part 2
Якорный рынок вещанияЮжная Корея (единств. кодек)США (выбор NABA)
Флагман в музыкеSony 360 Reality Audio – (AC-4 – для вещания)

Таблица 2. MPEG-H 3D Audio против Dolby AC-4. Обе – объектные системы NGA в ATSC 3.0; основные различия – открытое управление MPEG-H 3D Audio в ISO и нативная поддержка сценового звука (HOA) по сравнению с экосистемой Dolby у AC-4. Номера стандартов приведены по ISO/IEC и ETSI; данные о внедрении – от TTA, NABA и Sony.

Более существенная разница – в управлении и охвате. MPEG-H – это открытый стандарт ISO/IEC, имеющий множество реализаций и нативную поддержку сценического звука, что делает его привлекательным для VR/AR и для рынков, отдающих предпочтение непроприетарным решениям. AC-4 – развитие экосистемы Dolby, которая уже прочно закрепилась в гостиной, и это её главное преимущество. Ни один из форматов не является «лучшим» сам по себе; выбор зависит от того, какие рынки и устройства вы планируете охватить.

Чем тут занимается Фора Софт

Мы разрабатываем OTT- и интернет-ТВ-продукты, платформы видеостриминга и видеоконференций, системы телемедицины и e-learning, ПО для видеонаблюдения и AR/VR. Выбор аудиосистемы становится актуальным каждый раз, когда продукт работает с современными телевизорами или иммерсивными медиа. Как только клиент передаёт звук в корейский эфир, в иммерсивную музыку или на новейшие смарт-ТВ, в игру вступает MPEG-H и инженерная задача становится конкретной: определить, какую систему Next Generation Audio несёт поток, направить его в нужный декодер, сохранить метаданные объектов – основу персонализации – на всех этапах транскодирования и предусмотреть разумный резервный путь на AAC или Dolby для устройств, не поддерживающих MPEG-H. Эти компромиссы мы учитываем в стриминговых, вещательных и AR/VR-проектах с 2005 года.

Ключевые выводы

  • MPEG-H 3D Audio – открытый стандарт ISO/IEC 23008-3.
  • Один поток объединяет каналы, объекты и сцену (HOA).
  • Объекты обеспечивают персонализацию: можно выбрать комментарий, усилить диалог или добавить описание.
  • В основном профиле предусмотрено пять уровней, поддержка до 64 динамиков и 128 каналов ядра.
  • С 2017 года это единственный аудиокодек для наземного 4K-эфира в Корее.
  • В ATSC 3.0 он используется параллельно с AC-4; AC-4 доминирует в США, а MPEG-H 3D Audio – в Корее.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.