Atmos и иммерсивный звук в стриминге: Netflix, Disney+, Apple TV+, Tidal

Автор: Николай СапуновОбновлено: август 202619 мин чтения
Содержание статьи +

Кратко

Стриминговые сервисы не отправляют вам домой полный студийный микс Atmos – они передают сжатый поток с потерями, в котором содержится обычный surround-звук и набор инструкций для создания трёхмерной версии. В видеоприложениях вроде Netflix и Disney+ используется поток Dolby Digital Plus с Joint Object Coding, ограниченный примерно 768 кбит/с. В музыкальных приложениях, таких как Tidal и Apple Music, обычно применяется Dolby AC-4 в режиме иммерсивного стерео, а пространственный рендеринг осуществляется уже на устройстве – телефоне или AirPods. Сложность иммерсивного звука почти никогда не в пропускной способности – она заключается в мастеринге, правилах громкости и метаданных, которые подсказывают плееру, какую дорожку воспроизводить.

Зачем это нужно

Если вы запускаете OTT-видеосервис, музыкальное приложение или платформу для прямых трансляций, фраза «добавить Atmos» может показаться одной простой галочкой, но на деле это решение, затрагивающее архитектуру всего конвейера. Выбор кодека определяет, на каких устройствах будет воспроизводиться звук, сколько вы заплатите за хранение и доставку контента, а также как будет вести себя громкость на телефонах, саундбарах и наушниках. Эта статья объясняет, какие решения принимают крупные сервисы в 2026 году, почему они сделали такой выбор и где скрывается настоящая инженерная сложность. К концу вы сможете оценить возможности иммерсивного звука и уверенно обсуждать с вендором кодирования, не прибегая к блефу.

Сначала – что вообще такое «иммерсивный звук»

Стерео обеспечивает два канала – левый и правый. Surround-звук добавляет колонки вокруг слушателя: распространённая схема «5.1» включает пять полнодиапазонных динамиков (фронт-лево, фронт-право, центр, тыл-лево, тыл-право) и один канал низкочастотных эффектов – та самая «.1». Иммерсивный звук, или трёхмерный, или объектно-ориентированный, добавляет третье измерение – высоту. Теперь звук может приходить не только сбоку и сзади, но и сверху.

Звуковую сцену можно описать двумя способами, и именно разница между ними определяет всё дальнейшее.

Старый способ – канальный (channel-based): микс представляет собой фиксированный набор сигналов для колонок. Микс 7.1.4 – семь колонок на уровне ушей, один низкочастотный канал и четыре потолочных – это двенадцать отдельных аудиоканалов, каждый из которых заранее привязан к конкретной колонке. Если в вашей комнате другое количество колонок, эти двенадцать каналов придётся «сворачивать» (downmix).

Новый способ – объектный (object-based): вместо сигналов для колонок микс сохраняет отдельные звуки (например, вертолёт, реплику диалога) как «объекты». У каждого из них есть метаданные, описывающие, где он должен находиться в пространстве и когда воспроизводиться. Метаданные, сопровождающие объект – его положение, размер и уровень громкости во времени – называются Object Audio Metadata (OAMD). При воспроизведении программа-рендерер анализирует объекты и их метаданные, после чего размещает каждый звук с помощью доступных колонок или наушников. Благодаря этому один и тот же микс корректно воспроизводится на саундбаре 5.1, домашнем кинотеатре 7.1.4 или даже на паре AirPods.

Dolby Atmos – самая известная объектная система. Она использует гибридную модель: bed (подложка) из канального звука – фон, атмосфера, музыка, шум комнаты – и до 118 объектов поверх. MPEG-H 3D Audio, стандарт для Sony 360 Reality Audio, является чисто объектным и сценовым. Обе системы «иммерсивные»; они различаются способом описания сцены и тем, кто лицензирует технологию.

«Запомните это различие – оно объясняет всю статью: стриминговый сервис хранит один объектный мастер и позволяет каждому устройству самостоятельно его отрендерить. Поэтому «Atmos на телефоне» и «Atmos на домашнем кинотеатре 7.1.4» могут идти из одного и того же файла.»
Рис. 1. Канальный и объектный звук: канальный микс привязан к карте колонок, а объектный пересобирается под реальную систему слушателя.

Проблема полосы пропускания и трюк, который её решает

Очевидное противоречие. Полный мастер Atmos – большой. Студия работает со звуком как с файлом 48 кГц, 24 бита, где bed плюс десятки объектов – легко десятки мегабит в секунду. Протолкнуть это в домашний интернет рядом с 4K-видео и ждать плавности нельзя. Netflix рекомендует для Atmos-тайтлов соединение всего около 3 Мбит/с, и видео съедает почти всё.

Трюк, который делает иммерсивный звук пригодным для доставки, называется Joint Object Coding (JOC). Идея заключается в том, чтобы не передавать каждый объект отдельным потоком. Вместо этого энкодер сворачивает иммерсивную сцену в обычный surround-микс – 5.1 или 7.1 – и сжимает его стандартным кодеком. Вместе с этим миксом передаётся небольшой набор параметров: инструкции, по которым декодер может восстановить исходные объекты из свёрнутого сигнала. Объём аудиоданных остаётся примерно таким же, как у обычного surround-потока; «трёхмерность» передаётся в виде лёгких side-данных.

Кухонная аналогия: вместо того чтобы возить каждый ингредиент в отдельной коробке, вы перевозите готовый суп и карточку рецепта – как разделить его обратно на ингредиенты. Суп – это surround-bed; карточка рецепта – метаданные JOC.

На стороне видео кодек, несущий этот bed, – Dolby Digital Plus, он же E-AC-3 (Enhanced AC-3). Он стандартизован как ETSI TS 102 366; расширение JOC описано в Приложении E этого стандарта. E-AC-3 поддерживает до пятнадцати каналов и может достигать скорости до 6,144 Мбит/с, однако для стриминга его настраивают на значительно более низких параметрах. Полное название стримингового формата – «Dolby Digital Plus with Joint Object Coding», обычно сокращают до DD+ JOC или E-AC-3 JOC.

Одно свойство DD+ JOC важнее всех остальных для оператора сервиса – его обратная совместимость. Декодер, не поддерживающий Atmos, просто считывает ядро 5.1 и игнорирует дополнительные данные JOC. Декодер, способный работать с Atmos, обрабатывает и ядро, и дополнительные данные, восстанавливая пространственное звучание. Это означает, что сервис передаёт один поток, а не два, и он корректно воспроизводится как на новом ресивере с поддержкой объёмного звука, так и на десятилетнем ресивере 5.1. Именно этот факт – главная причина, по которой стриминг стандартизировался на JOC, а не на отдельном иммерсивном потоке.

Рис. 2. Конвейер JOC: как многомегабитный мастер Atmos становится потоком до мегабита, который всё равно восстанавливает высоту.

Считаем битрейт

Полезно увидеть, зачем нужен трюк, на цифрах. Возьмём полнометражный фильм продолжительностью 90 минут – это 5400 секунд.

Стереодубляж на 128 кбит/с стоит:

128 000 бит/с × 5400 с ÷ 8 бит/байт = 86 400 000 байт ≈ 86 MB

Дорожка Atmos в DD+ JOC на потолке Netflix при скорости 768 кбит/с стоит:

768 000 бит/с × 5400 с ÷ 8 бит/байт = 518 400 000 байт ≈ 518 MB

То есть дорожка Atmos примерно в шесть раз больше стереозвука – разница заметна, но всё равно мала по сравнению с видео. Тот же 90-минутный фильм при видеобитрейте 1080p в 5 Мбит/с займёт:

5 000 000 бит/с × 5400 с ÷ 8 бит/байт = 3 375 000 000 байт ≈ 3.4 GB

Звук Atmos занимает примерно 15% от объёма видео. Аудио обходится значительно дешевле видео; стоимость иммерсивного звука – не в объёме данных. К тому, где она реально находится, вернёмся в конце.

Что именно отдаёт каждый сервис в 2026 году

Четыре сервиса из этой статьи чётко делятся на два лагеря: видеоприложения на DD+ JOC и музыкальные приложения на AC-4 в режиме иммерсивного стерео для наушников. Понимание этого разделения помогает избежать распространённой ошибки при планировании – считать, будто «Atmos» означает одно и то же.

Netflix и Disney+ – DD+ JOC для гостиной

Netflix передаёт Dolby Atmos в формате DD+ JOC. Максимальный битрейт составляет 768 кбит/с для подписчиков Premium, что выше прежних 448 кбит/с, установленных в мае 2019 года. Компания называет 768 кбит/с уровнем, при котором «дополнительное качество становится неощутимым» – своего рода перцептивно прозрачным пределом, который явно не является lossless. Чтобы воспользоваться Dolby Atmos, пользователю нужен тариф с поддержкой Ultra HD, устройство, совместимое с Atmos, аудиосистема, поддерживающая Atmos, а также качество воспроизведения, установленное на High или Auto.

Disney+ использует тот же подход DD+ JOC для воспроизведения в гостиной. Оба сервиса выбирают E-AC-3 JOC по схожим причинам: он хорошо поддерживается на телевизорах, саундбарах, ресиверах, игровых консолях и стриминговых приставках, а единый обратно совместимый поток упрощает доставку контента.

Apple TV+ – DD+ JOC плюс «Spatial Audio» для наушников

Apple TV+ передаёт иммерсивные звуковые дорожки фильмов и сериалов в формате Dolby Atmos через DD+ JOC на домашний кинотеатр – точно так же, как это делает Netflix. Путаницу вызывает Apple Spatial Audio, но это отдельная технология, работающая поверх основной.

Apple Spatial Audio – это не кодек и не формат доставки. Это система обработки на стороне воспроизведения. Она берёт сигнал в формате 5.1, 7.1 или Atmos и рендерит его в двухканальный микс для наушников, моделируя, как этот звук дошёл бы до ваших ушей в виртуальной комнате. Когда вы используете AirPods, датчики внутри них – гироскоп и акселерометр – отслеживают движения головы, чтобы звуковое поле оставалось закреплённым в пространстве при поворотах. Это и называется «head tracking». Кодек, передающий звук на устройство, остаётся прежним – DD+ JOC или AAC; пространственный эффект вычисляется локально на устройстве.

Так что на Apple TV+ один и тот же мастер Atmos обслуживает три формата: полный иммерсивный микс для домашней системы, бинауральный микс с отслеживанием положения головы на AirPods и стандартное стерео или свёртку 5.1 – на всех остальных устройствах.

Tidal и Apple Music – AC-4 и бинауральный рендеринг для наушников

Музыкальные сервисы оптимизированы под наушники, а не под гостиную, поэтому выбрали другой кодек.

Tidal передаёт Dolby Atmos Music с использованием Dolby AC-4 – кодека, основанного на E-AC-3. AC-4 впервые был стандартизован ETSI как TS 103 190 в 2014 году; его иммерсивные и персонализированные возможности описаны в ETSI TS 103 190-2, последняя редакция которого (V1.3.1) вышла в июле 2025 года. Для прослушивания музыки в наушниках AC-4 работает в режиме «immersive stereo» – бинауральный Atmos предварительно обрабатывается под двухканальное воспроизведение в наушниках. Tidal внедрил эту функцию в тарифе HiFi.

Apple Music идёт похожим путём. Он стримит Atmos на 768 kbps с потерями, а затем использует собственный рендерер на основе head-related transfer functions (HRTF) – математической модели того, как звук с заданного направления доходит до каждого уха, – чтобы преобразовать виртуальный микс 7.1.4 в бинауральный звук для наушников. Полезная оговорка: Atmos в Apple Music – это lossy на 768 kbps, тогда как стереоверсия того же трека может предлагаться в lossless-формате. Слушатель, выбравший Atmos, жертвует частью стереочёткости ради пространственного эффекта.

«Частая ошибка. Считать «Atmos» единым deliverable. Atmos, который зритель слышит на саундбаре Disney+ (DD+ JOC, восстановление из канального bed), и Atmos, который слушатель воспринимает в Tidal через наушники (AC-4 immersive stereo, бинауральный рендер), – это разные кодеки, обрабатываемые разным софтом. Если в техническом задании просто указано «поддержать Atmos», вендор по кодированию не сможет оценить объём работы. Указывайте кодек, целевые устройства и тип вывода – на колонки или в наушники.»
Рис. 3. Кто что отдаёт: кодек и путь рендеринга различаются у видео- и музыкальных приложений.

Как плеер понимает, что дорожка иммерсивная

Стриминговый плеер не угадывает. Манифест – текстовый файл, перечисляющий все аудио- и видеорендиции, – записывается в формате HLS или DASH Media Presentation Description и объявляет кодек и конфигурацию каналов каждой дорожки. Плеер выбирает подходящую дорожку на основе возможностей устройства. Выбору помогают два атрибута, а точные значения берутся из собственных спецификаций доставки Dolby.

В HLS для DD+ JOC атрибут CODECS имеет значение ec-3, а строка #EXT-X-MEDIA содержит атрибут CHANNELS. Именно в значении CHANNELS содержится иммерсивная сигнализация: 12/JOC указывает на микс Atmos 5.1.4 или 7.1.4, а 16/JOC – на микс 9.1.6. Число обозначает количество декодируемых каналов; тег JOC информирует плеер о наличии side-данных Joint Object Coding, и Atmos-совместимый декодер понимает, что необходимо восстановить высоту.

Для AC-4 immersive stereo – музыкального формата для наушников – рекомендуемое значение CHANNELS составляет 2/IMSA,ATMOS. 2 – это двухканальный носитель, IMSA указывает на immersive stereo для рендеринга в наушниках, а ATMOS обозначает опыт в формате Atmos. Для MPEG-H 3D Audio (включая Sony 360 Reality Audio и вещание ATSC 3.0) строка кодека – mhm1.

Практический вывод: иммерсивность для плеера обеспечивают не сами байты, а сигнализация. Если манифест объявляет ec-3 с CHANNELS="6" вместо 12/JOC, Atmos-совместимый клиент проигрывает ядро 5.1 и никогда не восстанавливает высоту – самая частая причина «Atmos не работает» оказывается багом манифеста, а не багом кодирования.

Сравниваем иммерсивные кодеки

КритерийDD+ JOC (E-AC-3 JOC)AC-4 (immersive stereo)MPEG-H 3D Audio
СтандартETSI TS 102 366, Annex EETSI TS 103 190-1 / -2ISO/IEC 23008-3
Типичное применениеOTT-видео (Netflix, Disney+, Apple TV+)Музыка в наушниках (Tidal, Apple Music)Вещание ATSC 3.0, Sony 360RA
Модель сценыbed + объекты через JOC-downmixbed + объекты; channel/object/immersivechannel + object + scene (HOA)
Типичный битрейт стриминга384–768 kbps~256–768 kbps256–768 kbps
Обратная совместимость с surroundДа – ядро 5.1 всегда естьДа – внутри AC-4Да – внутри MPEG-H
Строка кодека HLS/DASHec-3ac-4mhm1
Сигнал иммерсивных каналовCHANNELS="12/JOC", "16/JOC"CHANNELS="2/IMSA,ATMOS"profile/level в строке кодека
ЛицензированиеDolby (проприетарный)Dolby (проприетарный)Fraunhofer/MPEG (проприетарный)

Победитель для OTT-видео сегодня – DD+ JOC, и это связано исключительно с охватом: он работает на самом широком наборе устройств для гостиной. AC-4 – лучший кодек на перспективу: он эффективнее, гибче в плане персонализации и усиления диалогов и доминирует в сценарии «музыка в наушниках». MPEG-H лидирует в вещании (это звук ATSC 3.0 «NextGen TV») и в объектно-ориентированной музыке, но имеет меньший охват в OTT.

Производственный конвейер – где реально сидит стоимость

Сквозная мысль раздела: иммерсивный звук легко доставлять, но сложно создавать. Вот цепочка.

Звукорежиссёр работает в digital audio workstation с Dolby Atmos Renderer, который записывает микс – каналы bed и положения объектов во времени – в мастер Atmos. Универсальный deliverable мастера – файл ADM BWF (Audio Definition Model Broadcast Wave Format), соответствующий стандарту 48 кГц / 24 бита. ADM – это модель метаданных, описывающая объекты и их положения; BWF – контейнер формата wave, в котором хранятся аудиоданные и эти метаданные.

Из мастер-файла ADM BWF энкодер создаёт стриминговый deliverable: Dolby Digital Plus с контентом Atmos (элементарный поток .ec3) для видео или поток AC-4 для музыки. Затем это аудио мультиплексируется со сжатым видео (H.264 или H.265) в контейнер MP4 и сегментируется для доставки – тем же способом упаковки, что и любая стриминговая аудиодорожка. Облачные энкодеры, например Dolby Hybrik, автоматизируют процесс render-to-DD+-JOC в масштабах.

Узкие места – человеческие и вычислительные, а не сетевые:

Шаг мастеринга требует квалифицированных инженеров и калиброванных помещений. Микс Atmos создаётся вручную, а не генерируется автоматически; апмикс стерео в Atmos возможен, но редко устраивает требовательный сервис.

Ферма кодирования должна запускать объектно-ориентированные энкодеры, которые тяжелее стереоэнкодера AAC и лицензируются по потоку или по тайтлу.

Контроль качества – скрытая статья расходов. Кто-то должен убедиться, что объекты высоты сохранились после кодирования, что свёртка 5.1 по-прежнему звучит корректно, что уровень громкости соответствует цели и что манифест объявляет правильный сигнал каналов. Исправить опечатку в CHANNELS на этапе контроля качества – дёшево; исправить её по жалобам клиентов – нет.

Громкость – важная часть этого. Даже иммерсивные мастера обязаны соблюдать нормализацию громкости – практику выдачи каждого трека на стабильном, воспринимаемом уровне, измеряемом в LUFS (Loudness Units relative to Full Scale – перцептивная шкала громкости, где программный материал отображается отрицательным числом). Стриминговые сервисы ориентируются на уровень около −24 LKFS в некоторых спецификациях доставки и используют метаданные dialnorm, чтобы тихие и громкие треки звучали сбалансированно. Ошибка в громкости Atmos – один из самых заметных дефектов, потому что зрители сразу тянутся к пульту управления.

Где здесь Фора Софт

Мы разрабатываем видео- и аудиопрограммы для OTT и интернет-ТВ, видеоконференций, e-learning, телемедицины, видеонаблюдения и AR/VR. Когда клиент хочет иммерсивный звук в OTT-продукте, задача редко сводится к простому «включить Atmos» – нужно правильно настроить конвейер кодирования, чтобы нужный кодек доходил до нужного устройства, заставить плеер корректно объявлять и выбирать иммерсивные рендеры в HLS и DASH, а также внедрить проверки QC, которые ловят ошибки в манифесте до того, как их заметит пользователь. Мы создавали стриминговые плееры и конвейеры упаковки, где выбор аудиодорожки, откат к surround-звуку и поведение громкости должны были работать корректно на телефонах, смарт-ТВ и наушниках. Та же дисциплина применима – будь то киносервис, платформа прямых трансляций или музыкальное приложение.

Главное

  • Стриминг передаёт сжатый lossy-поток вместе с метаданными, а не полный студийный мастер Atmos.
  • Видеоприложения (Netflix, Disney+, Apple TV+) используют DD+ JOC с ограничением примерно в 768 кбит/с.
  • DD+ JOC обратно совместим: один и тот же поток поддерживает как декодеры Atmos, так и обычные 5.1.
  • Музыкальные приложения (Tidal, Apple Music) применяют AC-4 с иммерсивным стерео или lossy Atmos с бинауральным рендерингом на устройстве.
  • Apple Spatial Audio – это обработка на стороне воспроизведения, а не кодек и не формат доставки.
  • Иммерсивность определяется манифестом (ec-3 + CHANNELS="12/JOC"); опечатка здесь ломает воспроизведение Atmos, а не процесс кодирования.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.