Dolby Atmos для кино, вещания, музыки и стриминга

Автор: Николай СапуновОбновлено: август 202625 мин чтения
Содержание статьи +

Кратко

Dolby Atmos – это один формат, принимающий четыре разных облика: в кинозале – до 128 аудиодорожек, рендеримых в реальном времени на как минимум 64 независимых динамика; в гостиной – тот же творческий мастер, сжатый в обычный поток Dolby Digital Plus, совместимый с устаревшим 5.1-декодером; в музыке – тихо сведённый объектный микс, доступный в Apple Music, Tidal и Amazon; а в AirPods – тот же объектный мастер, в реальном времени преобразованный в двухканальный бинауральный рендер, который поворачивается вместе с вашей головой. Под всеми четырьмя формами лежит одна идея – хранить звуки и их позиции, а не каналы для динамиков, – и один производственный мастер-файл в формате ADM BWF. Продакт-менеджеру стриминговой платформы важно понимать разницу между студийным форматом (128 входов, без потерь) и форматом доставки (около 16 пространственно закодированных элементов, несколько сотен кбит/с, с потерями), потому что это не одно и то же. Путаница между ними ведёт к неверному выбору кодека, неправильному распределению битрейта и ошибочной цели по громкости. Эта статья проходит всю цепочку – от рендеринга в студии до бинаурального рендера в вашем ухе – с цифрами и управляющими стандартами для каждого звена.

Почему это важно

Если вы разрабатываете или используете продукт с видео или аудио – стриминг, OTT/Internet TV, e-learning, телемедицину или AR/VR, – рано или поздно клиент или продакт-менеджер произнесёт слово «Atmos». И что он под этим понимает, зависит от того, с какой стороны на него смотрел. Маркетолог видит «ту иммерсивную штуку, что рекламирует Apple Music»; вещательный инженер – «AC-4 или E-AC-3 с метаданными объектов»; кинопрофессионал – «64 динамика». Эта статья даёт нетехническому читателю полную картину: что хранит Atmos, как он передаётся на разных платформах, сколько стоит по битрейту и какой уровень громкости применяется – чтобы вы могли оценить иммерсивную аудиофишку, составить обоснованный бюджет на хранение и CDN и общаться с аудиоинженерами без догадок. Статья опирается на классификацию канальное-объектное-сценное, но не требует её предварительного изучения: каждый термин объясняется до первого употребления.

Atmos – это объектное аудио с канальной подложкой

Перед четырьмя обликами – тело под ними. Dolby Atmos – это объектное аудио, то есть файл не указывает: «воспроизведи этот сигнал из левого тылового динамика». Он говорит: «вот звук вертолёта, вот его позиция в комнате – сверху, сзади, смещается влево». Такой звук называют аудиообъектом, а его положение во времени – метаданными: информацией о звуке. Программа под названием рендерер считывает эти данные и при воспроизведении вычисляет, какие из ваших реальных динамиков и с какой громкостью должны воспроизводить этот объект, чтобы он оказался в нужном месте. В этом и заключается суть технологии, и поэтому один мастер-запись Atmos корректно звучит в наушниках, на саундбаре, в системе 5.1 или в кинозале с 64 динамиками – без необходимости отдельного микса для каждого формата.

Но Atmos – не чистые объекты. Это гибрид, и именно его чаще всего понимают неправильно. Микс Atmos состоит из двух слоёв. Первый – подложка (bed): набор обычного канального аудио – фиксированные каналы на динамики – для фона, музыки и всего, что не должно двигаться точно. Подложки записываются трёхчисленным обозначением, которое мы расшифруем чуть ниже, часто это 7.1.2 в домашнем рендерере. Второй слой – объекты: отдельные звуки с позиционными метаданными, которые рендерер размещает динамически. Хлопок двери, проезжающая машина, отдельная реплика – это объекты.

Рендерер Dolby Atmos – программа, в которой студии создают микс, – поддерживает до 128 входов суммарно, причём каждый канал подложки и каждый объект считаются отдельным входом. В рамках этого лимита рендерер позволяет использовать до 118 путей объектов, а оставшиеся слоты отводятся под подложку. Это единственное ограничение – 128 входов, из которых до 118 могут быть движущимися объектами, – постоянно возникает снова и снова, поскольку каждый проект Atmos строится на основе одного и того же мастера на 128 входов.

Рис. 1. Анатомия микса Atmos: канальная подложка и до 118 позиционных объектов – всего 128 входов, формирующих один мастер.

Удобная аналогия объединяет всю статью. Канальный микс – это стопка заранее подписанных конвертов: на каждом написано «левый тыловой динамик», звук запечатан внутри, и он доставляется идеально только в том случае, если в вашей комнате действительно стоит левый тыловой динамик в нужном месте. Объектный микс – это стопка GPS-адресов: «этот звук живёт по таким-то координатам», а рендерер – как местный водитель, который знает ваш район, расположение ваших динамиков и доставляет каждый звук точно в нужную точку, независимо от планировки комнаты. Подложка – это горстка конвертов, которые вы держите для фона; объекты – это GPS-адресованные посылки, которые должны попасть точно в цель.

Облик 1: Atmos в кинозале

Кинозал – это место, где Atmos появился в 2012 году с выходом фильма «Храбрая сердцем» (Brave), и именно здесь формат наиболее близок к оригинальному мастер-записи. Чтобы понять, почему Dolby выбрала именно такой подход, стоит разобраться с особенностями всей технологии.

Раньше звук в кино был канальным: фиксированное количество каналов (5.1, затем 7.1), которые подключались одинаково в любом зале. Проблема заключалась в том, что и маленькая комната, и огромный зал с тысячей мест получали одинаковое количество каналов. В результате большой зал просто подключал к одному каналу больше динамиков – например, задний левый канал мог управлять десятком одинаковых колонок, воспроизводящих одну и ту же информацию. Из-за этого звук не мог плавно перемещаться вдоль стены: все динамики работали как единый канал.

Atmos изменил ситуацию, превратив каждый динамик в отдельную адресуемую зону и позволив композитору описывать звуки как объекты, которые система размещает сама. Благодаря этому звук может плавно пройти от экрана до задней стены зала, задействовав все 64 динамика. Именно здесь родилась идея объектного звука, которую унаследовали все последующие реализации формата.

Кино-пакет Atmos поддерживает до 128 аудиодорожек – подложку 9.1 и до 118 аудиообъектов, а зал может использовать до 64 независимых каналов на динамики, где каждый динамик представляет собой отдельную адресуемую зону, а не часть связного surround-массива. Тот же единственный пакет, передаваемый внутри Digital Cinema Package (DCP – файла, который получает кинобудка), адаптируется под оборудование зала, «от 5.1 и 7.1 до 64 каналов».

Адаптация происходит в реальном времени. Кинопроцессор Dolby Atmos в зале считывает подложку и 118 объектовых путей и рендерит их на лету с учётом известных позиций динамиков именно этого зала. Поэтому идентичный мастер Atmos звучит корректно как в зале с 24 динамиками, так и с 64: творческий замысел («вертолёт сверху и сзади, движется влево») сохраняется, а каждый зал решает задачу размещения под свою геометрию.

Две оговорки важны для любого, кто рассуждает об Atmos в продукте. Во-первых, Dolby описывает кино-пакет как несущий аудио без потерь – это верно для DCP, и это единственное место, где «lossless Atmos» имеет смысл в повседневном употреблении. Стриминговые версии из следующего раздела – с потерями. Не переносите термин «без потерь» из кинообработки в стриминговый пайплайн. Во-вторых, цифра 118 объектов в кинозале и цифра 118 объектов в домашнем рендерере – это одно и то же архитектурное ограничение (128 входов минус подложка из примерно 9–10 каналов), а не два независимых факта. Упомяните это значение один раз и используйте далее по тексту.

Облик 2: Atmos дома и в стриминге

Отгружать 128 отдельных аудиоканалов в гостиную непрактично: при частоте дискретизации 48 кГц и глубине 24 бита на отсчёт, без сжатия, один канал занимает:

48 000 отсчётов/с × 24 бита/отсчёт = 1 152 000 бит/с = 1.152 Мбит/с на канал
128 каналов × 1.152 Мбит/с          = 147.5 Мбит/с

Около 147 Мбит/с только на аудио – абсурдно для домашней доставки, ведь это превысило бы пропускную способность даже самого качественного видео. Поэтому домашний Atmos делает две вещи: пространственно кодирует сцену в несколько элементов, а затем передаёт эти элементы внутри обычного кодека.

Пространственное кодирование: со 128 элементов до ~16

Пространственное кодирование – это алгоритм, который объединяет 128 подложек и объектов в 12, 14 или 16 перцептивно различимых элементов, обычно называемых кластерами: объекты, находящиеся близко в пространстве или которые ухо не различает, объединяются в один переносимый элемент, а метаданные фиксируют, как их снова восстановить. Это ключевое число для доставочного формата Atmos: студия собирает до 128 элементов, но передаётся всего около 12–16 элементов. Вы не стримите 128 каналов. Если вендор или коллега говорит: «Atmos – это 128 аудиоканалов по проводу», он путает студийный формат с форматом доставки.

Рис. 2. Цепочка домашней доставки: 128 студийных входов пространственно кодируются до ~16 элементов, после чего передаются в E-AC-3 JOC или AC-4 – сжатие составляет примерно 100:1.

Кодек переноса: Dolby Digital Plus с Joint Object Coding

Самый распространённый способ, которым стриминговый Atmos попадает в дома в 2026 году, – это Dolby Digital Plus, технически известный как Enhanced AC-3, или E-AC-3, поддерживающий функцию Joint Object Coding (JOC). Управляющим стандартом для E-AC-3 является ETSI TS 102 366 (действующая опубликованная редакция V1.4.1, 2017-09), где Enhanced AC-3 описан в приложении E; американский эквивалент – ATSC A/52, также приложение E. Диапазон битрейтов E-AC-3 составляет от 32 кбит/с до 6,144 Мбит/с.

Хитрость JOC – обратная совместимость. Поток DD+ JOC представляет собой обычное ядро Dolby Digital Plus в формате 5.1 (или 7.1) плюс боковую нагрузку – данные JOC и метаданные объектов (OAMD), – которые позволяют современному декодеру реконструировать объектную сцену. Устройство, не поддерживающее Atmos, просто декодирует ядро 5.1 и игнорирует боковые данные. Таким образом, один и тот же поток работает и со старым саундбаром, и с новым ресивером Atmos. Именно такая «плавная деградация» и нужна стриминговому продукту: один рендеринг – две аудитории.

Практические битрейты – это как раз то место, где различие между «студийным» и «стриминговым» подходами становится ощутимым. Кодер Dolby устанавливает минимальные значения: 384 кбит/с для пространственного кодирования в 12 каналов и 448 кбит/с для 16 каналов. В реальном премиальном видеостриминге типичные значения выше – часто 640–768 кбит/с, – но это фактические, а не регламентированные показатели. Сравните 768 кбит/с с наивными 147,5 Мбит/с из предыдущего примера – и получите сжатие примерно 100:1. Именно этот разрыв объясняет, почему «студийный Atmos» и «стриминговый Atmos» нельзя считать одним и тем же битстримом.

(Побочный плюс: DD+ JOC легко умещается в лимит примерно 1 Мбит/с обратного канала HDMI ARC, поэтому Atmos из ТВ-приложения может передаваться на саундбар по обычному ARC без необходимости в более новом eARC.)

Кодек нового поколения для передачи звука: Dolby AC-4

Кодек-преемник – Dolby AC-4, стандартизированный в ETSI TS 103 190-1 (ядро кодека) и ETSI TS 103 190-2 (иммерсивное и персонализированное аудио, действующая редакция V1.3.1, 2025-07), со ссылочным рендерером, описанным в ETSI TS 103 448. AC-4 передаёт иммерсивное и объектное аудио Atmos примерно на половине битрейта DD+ при сопоставимом качестве, используя более продвинутую схему кодирования объектов, которую Dolby называет A-JOC (Advanced Joint Object Coding).

Белая книга Dolby приводит цифры эффективности: иммерсивный микс 7.1.4 оценивается как «хороший» при примерно 192 кбит/с и «отличный» – при 320 кбит/с, а двухканальный вариант Immersive Stereo (IMS) становится почти прозрачным уже на 256 кбит/с, остаётся хорошим на 112 кбит/с и остаётся приемлемым даже от 64 кбит/с. Считайте эти показатели собственными качественными ориентирами Dolby, а не жёсткими ограничениями стандарта. На 2026 год AC-4 в стриминге скорее появится, чем станет повсеместным – большинство подписок на видео по запросу по-прежнему транслируют Atmos в формате DD+ JOC, а внедрение AC-4 в стриминговых сервисах пока находится на ранних стадиях. Поэтому для продукта, ориентированного на максимально широкую совместимость с устройствами сегодня, DD+ JOC остаётся безопасным выбором по умолчанию, а AC-4 – опцией на будущее.

Исключение без потерь: TrueHD на диске

Есть одно потребительское место, где Atmos действительно без потерь: Dolby TrueHD на Blu-ray и 4K UHD Blu-ray. TrueHD использует Meridian Lossless Packing (MLP) и встраивает метаданные объектов Atmos в поток без потерь. Это работает только с дисками; ни один стриминговый сервис не передаёт TrueHD Atmos, поскольку требуемый битрейт составил бы десятки мегабит в секунду. Если указано требование «без потерь Atmos», речь идёт о физическом носителе, а не о потоковом воспроизведении.

ПереносСтандартГде отгружаетсяТипичный битрейтС потерями / без
<span>E-AC-3 (DD+) JOC</span>ETSI TS 102 366, прил. ENetflix, Disney+, Prime Video, Apple Music<span>384–768 кбит/с</span>С потерями
Dolby AC-4 (A-JOC)ETSI TS 103 190-2Появляется в стриминге; вещание ATSC 3.0<span style="background:#E8F4EC">~192–320 кбит/с (7.1.4)</span>С потерями
Dolby TrueHDMLPТолько Blu-ray / 4K UHD Blu-rayнесколько Мбит/с<span style="background:#E8F4EC">Без потерь</span>

Таблица 1. Три пути переноса Atmos, с которыми сталкивается продакт, с управляющим стандартом и местом появления каждого. Подсвеченные ячейки выделяют ключевое свойство кодека.

Облик 3: Atmos в музыке

Atmos перешёл из кино в музыку, когда Apple запустила Spatial Audio в Apple Music в 2021 году, и у музыкального формата свои правила – отличающиеся от видео в двух ключевых аспектах, на которых люди обращают внимание: иное разделение каналов и, что особенно важно, иная цель по громкости.

С точки зрения доставки Apple Music передаёт Atmos через DD+ JOC, тогда как отраслевые СМИ сообщают, что Amazon Music и Tidal используют AC-4 Immersive Stereo (IMS) для воспроизведения, оптимизированного под наушники. Разделение кодеков по платформам фиксирует именно отраслевая пресса, а не единая спецификация вендора, поэтому утверждения о том, «кто что использует», требуют подтверждения перед включением в договор. Более безопасное и долгосрочное утверждение – музыкальный Atmos распространяется с использованием тех же двух кодеков передачи, что и видеоверсия.

Правило громкости – главное, что нужно запомнить. Музыкальный Atmos не должен превышать −18 LKFS по интегрированной громкости, измеренной по ITU-R BS.1770-4, с истинным пиком не выше −1 dBTP, и альбомы оцениваются по отдельным трекам, а не в агрегированном виде. (LKFS и LUFS – для наших целей одна и та же шкала; вещательные и ATSC-стандарты используют термин LKFS, а стриминговые платформы и музыкальные индустрии чаще говорят о LUFS.) Цель в −18 LUFS намеренно тише типичного стереомастера, который после «войны громкостей» обычно находится в диапазоне −10…−14 LUFS. Это реальное следствие, и его стоит предупредить всех, кто отправляет музыку: микс Atmos рядом со стереоверсией может звучать тише, и инженеры, не учитывающие этого, жалуются, что версия Atmos «глуховата». Она не глуховата – она корректно сведена к более тихому, более динамичному уровню.

«Подводный камень – неверная цель по громкости. Музыкальный Atmos ориентирован на −18 LUFS интегрированных (по трекам). Стриминговое видео Atmos использует совершенно другой референс: Netflix и Dolby устанавливают примерно −27 LKFS dialogue-gated для домашних и стриминговых миксов (диалог-взвешенное измерение, не то же самое, что интегрированная музыкальная громкость). Это разные значения, полученные разными методами и применяемые к разному контенту. Если применить музыкальные −18 к киномиксу или видео-−27 к музыкальному мастеру, материал провалит проверку качества. Подбирайте цель под тип контента.»

Ещё одна музыкальная деталь привлекает внимание инженеров. Поскольку большую часть музыки в формате Atmos слушают в наушниках, специфика доставки Apple требует, чтобы микшер установил для каждого канала подложки и каждого объекта режим бинаурального рендеринга – Binaural Render Mode – в одном из значений: Off, Near, Mid или Far. Это позволяет контролировать, насколько «далёким» будет звучать тот или иной элемент при бинауральной обработке, а также требует держать пик-лимитинг бинаурала не выше примерно 3 дБ.

Музыкальная индустрия тихо признаёт: бинауральный рендер (Облик 4) – это реальная доставка для большинства слушателей. Поэтому микшеру дают прямой контроль над тем, как каждый объект виртуализуется в наушниках, а не оставляют это на откуп обобщённому сведению.

Для продукта, обрабатывающего музыкальный ингест, вывод таков: мастер-трек в формате Atmos содержит в себе намерение по рендеру в наушники. Удаление или игнорирование этих метаданных меняет звучание трека в AirPods.

Производственный мастер для музыки – и для всего остального – использует один и тот же формат файла, о котором речь пойдёт ниже.

Облик 4: Apple Spatial Audio (бинауральный рендеринг)

Четвёртый облик – тот, который большинство потребителей реально слышит: Apple Spatial Audio, Atmos с трекингом головы, доступный в AirPods. Главное различие, которое важно понимать: мастер Atmos – объектный и не привязан к динамикам, тогда как до ваших ушей в наушниках доходит бинауральный рендер – двухканальный сигнал, сконструированный так, чтобы ваши два уха воспринимали полное 3D-расположение звука. Бинауральное аудио – не производственный формат; это выход рендерера.

Apple производит этот рендер на устройстве в реальном времени. Согласно документации Apple по доставке, путь обработки следующий: свести мастер Atmos в 7.1.4, а затем виртуализовать этот сигнал в бинауральный формат – то есть Apple использует собственный рендерер, а не бинауральный движок Dolby. Над этим базовым процессом работают две дополнительные функции. Трекинг головы использует датчики движения наушников: когда вы поворачиваете голову, звуковое поле остаётся привязанным к устройству – та же идея, что делает сценное аудио привлекательным для VR, но здесь она применяется к объектному рендеру. Персонализированный Spatial Audio с помощью камеры TrueDepth iPhone (начиная с iOS 16) сканирует форму вашей головы и ушей, чтобы построить индивидуальную модель того, как ваша анатомия влияет на восприятие звука с разных направлений – то есть head-related transfer function, о которой мы подробно писали в статье про амбисонику, HRTF и бинауральный рендеринг.

Рис. 3. Apple Spatial Audio: мастер Atmos в формате 7.1.4 преобразуется в бинауральную стереопару с поддержкой трекинга головы и опциональной персонализацией HRTF.

То, что объединяет всех четырёх: мастер ADM BWF

Кино, дом, музыка и бинаураль – это четыре формата доставки из одного источника. Этот источник – мастер Dolby Atmos, существующий в двух эквивалентных формах. Первая – специфичная для Dolby тройка файлов: заголовок метаданных .atmos, PCM-данные .atmos.audio и файл .atmos.metadata с позициями объектов и автоматизацией. Вторая, всё чаще становящаяся стандартом обмена, – единый файл ADM BWF .wav: Broadcast Wave File, в котором встроенные метаданные соответствуют модели описания аудио – Audio Definition Model, заданной в ITU-R BS.2076 (действующая редакция – BS.2076-2), с EBU Tech 3364 в качестве дополнительного документа. Dolby публикует «Dolby Atmos Master ADM Profile», который точно определяет, как мастер Atmos использует ADM.

Технический базис этого мастера прост для запоминания: 24-битный линейный PCM на 48 кГц с таймкодом 24 кадра в секунду. Каждый облик в этой статье рендерится из этого одного файла. Когда инженер говорит: «Пришли мне ADM», ему нужен именно объектный, не привязанный к динамикам источник – а не сведение 5.1 и не бинауральный рендер.

Здесь же возникает вопрос «настоящий Atmos против фейкового». Правила доставки музыки в Apple прямо указывают: стереомикс, просто помещённый в звуковое поле с добавленной реверберацией, не допускается – настоящий мастеринг в формате Atmos требует авторского объектного сведения, при котором звуки размещаются как объекты с осознанным замыслом. Автоматический апмикс стерео в Atmos, который просто «разбрасывает» реверберацию вокруг плоского микса, – это не настоящий мастеринг Atmos, и такие файлы платформы отклонят. Для продуктового решения вывод однозначен: фраза «мы поддерживаем Atmos» должна означать «мы принимаем и доставляем авторские объектные мастера», а не «мы запускаем апмиксер».

Как работает громкость в формате Atmos

Громкость заслуживает отдельного короткого раздела, потому что это самое частое место, где материалы Atmos проваливают QC, и потому что значения громкости различаются в зависимости от домена. Важны три референса:

Музыкальный референс – −18 LUFS интегрированных, −1 dBTP истинный пик, измеренные по ITU-R BS.1770-4 по трекам. Стриминговый и домашний видео-референс – примерно −27 LKFS dialogue-gated (значение, к которому профессиональный кодер Dolby по умолчанию приводит диалог-нормализацию, или «dialnorm», для киносаундтреков, и которое Netflix предписывает для домашних миксов Atmos). При измерении как полнопрограммная интегрированная громкость это значение садится около −24 LKFS. Само значение dialnorm – это метаданные: они указывают декодеру, насколько громким был сведён диалог, чтобы устройство воспроизведения могло нормализовать разные программы к единому уровню без перекодирования аудио.

Вывод продуктового уровня: на вопрос «какой LUFS должен быть у Atmos?» нет однозначного ответа – он зависит от того, отправляете ли вы музыку или видео, и от того, какой метод измерения (интегрированный или диалог-взвешенный) требует платформа. Ошибётесь – материал отклонят; ошибётесь в методе измерения – и можно попасть в нужное число неверным путём и всё равно провалить QC.

Расшифровка обозначений раскладки динамиков

Трёхкомпонентное обозначение встречается по всей документации Atmos, и одна расшифровка устраняет большую часть путаницы. Шаблон – пол . LFE . высота:

  • Первое число указывает количество полных диапазонов динамиков, расположенных на уровне ушей вокруг слушателя.
  • Второе число обозначает канал низкочастотных эффектов – «LFE», глубокобасовый канал, который воспроизводит сабвуфер. Это «точка один», потому что он охватывает лишь примерно 20–120 Гц – около десятой части полосы полного диапазона, а не потому, что он единственный.
  • Третье число указывает количество потолочных динамиков – слоя высоты, который придаёт Atmos иммерсивность.

Так 5.1.2 – это пять динамиков на уровне ушей, один сабвуфер и два потолочных; 7.1.4 (домашняя референсная раскладка Dolby) – семь динамиков на уровне ушей, один сабвуфер и четыре потолочных – всего двенадцать динамиков; а 9.1.6, крупнейшая именованная домашняя конфигурация, для которой Dolby публикует руководства по настройке, – шестнадцать. Тот же поток Atmos автоматически адаптируется под все эти конфигурации, поскольку рендерер размещает звуковые объекты с учётом любой обнаруженной раскладки. Чётко разделяйте сферы применения: домашние системы ограничены именованной конфигурацией 9.1.6 (а большинство потребительских ресиверов – 7.1.4, что соответствует 11-канальному аппаратному лимиту, а не формату), тогда как кинотеатральные системы масштабируются до 64 независимых каналов. Кино и дом – разные миры; не используйте количество динамиков из кинозала для оценки домашней или стриминговой функции.

Где Atmos находится среди конкурентов

Для полноты – два смежных формата появляются вместе с Atmos. DTS: X – главный конкурент Dolby: такой же объектный, такой же гибкий к раскладке, конкурирующий не на уровне базовой философии, а на экосистеме и лицензировании; с точки зрения продуктового решения DTS: X и Atmos следует относить к одной категории. MPEG-H 3D Audio, определённый как ISO/IEC 23008-3, – это открытый ISO-стандарт иммерсивного звука, объединяющий канальное, объектное и сценное аудио в одном битстриме (до 64 каналов на динамики и 128 кодек-ядерных каналов). Это вещательная альтернатива: единственная аудиосистема сервиса ATSC 3.0 в Южной Корее и один из двух вариантов (наряду с Dolby AC-4) в аудиостандарте ATSC 3.0 США A/342. Atmos – не MPEG-H; когда задача требует использования MPEG-H, это другой путь авторинга и переноса, подробно рассмотренный в MPEG-H 3D Audio: открытый ISO-стандарт иммерсивного звука.

Где здесь Фора Софт

Фора Софт занимается видеопродуктами с 2005 года – стримингом, OTT/Internet TV, видеоконференциями, e-learning, телемедициной, видеонаблюдением и AR/VR. Иммерсивный звук – это та часть таких пайплайнов, которую пользователи замечают первой, как только что-то ломается. В OTT- и стриминговых проектах мы настраиваем доставку Atmos в формате E-AC-3 JOC – как широко совместимый вариант по умолчанию – с поддержкой AC-4 там, где это позволяют устройства, и сохраняем канальные стерео- и 5.1-резервные версии, чтобы контент корректно воспроизводился – от смартфона до домашнего кинотеатра. Мы считаем мастер-файл ADM BWF единственным источником истины и рендерим из него все облики, а не апмиксуем стерео. В AR/VR-проектах, где звуковое поле должно следовать за движением гарнитуры, мы используем подходы рендера с трекингом головы, популяризированные Apple Spatial Audio. Знание всех четырёх облика имеет практический смысл: так вы можете оценить, как работает функция Atmos на устройствах пользователей, с реальными битрейтами и уровнями громкости, требуемыми вашими платформами.

Главное

  • Atmos – объектное аудио с канальной подложкой: один мастер, 128 входов, до 118 объектов.
  • Кино рендерит до 128 дорожек в реальном времени на до 64 динамиков; DCP – без потерь.
  • Стриминг кодирует пространственный звук до ~12–16 элементов в E-AC-3 JOC (~384–768 кбит/с) или AC-4.
  • AC-4 передаёт Atmos примерно вдвое дешевле, чем DD+; TrueHD на диске – единственный потребительский lossless-формат для Atmos.
  • Музыка настраивается на −18 LUFS (интегральный уровень); стриминговое видео – ~−27 LKFS (с диалоговым гейтом); не путать.
  • Apple Spatial Audio – это бинауральный рендер мастера Atmos с трекингом головы, а не сам мастер.
  • ADM BWF .wav (24 бита/48 кГц, ITU-R BS.2076) – единственный мастер, из которого рендерятся все четыре формата.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.