Содержание статьи +
- Кратко
- Почему это важно
- Один вопрос, который делит весь пространственный звук
- Подход 1: канальное аудио – называем динамики
- Подход 2: объектное аудио – называем звуки, а не динамики
- Подход 3: сценное аудио – называем всё звуковое поле
- Два частных случая ADM: matrix и binaural
- Три подхода рядом
- MPEG-H: стандарт, который делает все три сразу
- Как выбрать, в одном абзаце
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
Описать звуковую сцену компьютеру можно лишь тремя способами: перечислить динамики (канальное аудио), перечислить звуки и их положение (объектное аудио) или описать всё звуковое поле как набор математических слоёв (сценное аудио). Канальное – самое старое и простое («5.1» означает шесть фиксированных каналов на динамики», – но оно ломается, как только комната не совпадает со студией. Объектное аудио, на котором построен Dolby Atmos, хранит каждый звук и его позицию и позволяет «рендереру» пересобрать микс под те динамики, что у вас есть, – от наушников до кинозала с 64 динамиками. Сценное аудио на базе амбисоники описывает само звуковое поле и нужно VR и видео 360°, потому что поворачивается вместе с головой.
Почему это важно
Если вы делаете или покупаете продукт с видео – стриминг, конференции, OTT, e-learning, телемедицину, видеонаблюдение или VR – рано или поздно вас спросят про «пространственный звук», «Dolby Atmos» или «амбисонику». Эти три слова соответствуют трём подходам из статьи, и путаница обходится дорого: запустили pipeline на 5.1, когда клиенту нужна была объектная доставка, или сохранили плоское stereo там, где VR-гарнитуре нужно было вращаемое поле. Эта статья даёт продакт-менеджеру полную картину – что хранит каждый подход, чего стоит, где выигрывает и как современные стандарты (Dolby Atmos, MPEG-H, амбисоника) связаны между собой, – чтобы оценить аудиофичу и говорить с инженерами без догадок. Никакого аудиобэкграунда не требуется: каждый термин объясняется до его первого употребления.
Один вопрос, который делит весь пространственный звук
Любой формат иммерсивного звука отвечает на один и тот же вопрос одним из трёх способов. Вопрос звучит так: что именно мы записываем в файл?
Можно записать динамики – «играй этот сигнал из левого тылового динамика». Можно записать звуки и их позиции – «вертолёт сверху справа, смещается влево; разберись сам, какие динамики задействовать». Или можно записать всё звуковое поле как стопку математических слоёв и декодировать его потом под любой набор динамиков. Это и есть вся классификация: канальное, объектное и сценное. Всё остальное – Atmos, DTS:X, MPEG-H, амбисоника, Apple Spatial Audio – это продукты, собранные из одной или нескольких этих идей.
Деление на три – не маркетинг. Оно зафиксировано в международном стандарте, которым пользуются вещатели и разработчики инструментов, – Рекомендации ITU-R BS.2076, известной как Audio Definition Model, или ADM. ADM – это формальный словарь; считайте его грамматикой, которая позволяет файлу заявить «я звук такого-то типа». Действующая редакция, BS.2076-3, опубликована в феврале 2025 года. Вообще-то ADM называет пять типов (добавляя matrix и binaural как частные случаи – о них кратко ниже), но для почти любого продуктового решения важны три: канал, объект и сцена.
Подход 1: канальное аудио – называем динамики
Канальное аудио – то, которым человечество пользуется со времён первого воскового цилиндра. Канал – это один поток звука, который без изменений проигрывается из одного динамика в известной позиции. Stereo – два канала: левый и правый. «5.1» – шесть каналов. Руководство EBU по ADM называет этот тип DirectSpeakers именно для того, чтобы подчеркнуть суть: сигнал идёт напрямую на динамик, без обработки.
Разберём «5.1» как следует – обозначение путает почти всех. Первое число считает полнодиапазонные каналы на уровне ушей; второе – особый канал только для баса.
«5.1 = пять полнодиапазонных каналов (Left, Centre, Right, Left Surround, Right Surround), каждый несёт примерно от 20 Hz до 20 000 Hz, плюс один канал низкочастотных эффектов – «LFE» – несущий только глубокий бас, около 20–120 Hz. «.1» означает, что этот басовый канал занимает примерно десятую часть полосы обычного канала. Это канал вашего сабвуфера. Он «точка один», потому что это частичный канал, а не потому что он один.»
Полезная аналогия: канальный микс – это набор заранее подписанных конвертов. Студия пишет «левый тыловой динамик» на конверте и запечатывает звук внутри. Пока в вашей комнате есть левый тыловой динамик в нужном месте, письмо доставлено идеально.
Сила очевидна – это просто и не требует вычислений при воспроизведении. Слабость столь же очевидна: микс звучит правильно только в комнате, повторяющей расстановку студии. Если студия микшировала под пять динамиков, а у вас два, что-то должно свести пять в два. Это сведение называется downmix и всегда теряет информацию. Сдвиньте динамик или уберите один – и пространственная картина исказится.
Есть и вторая, менее заметная слабость, важная для стриминга. Каждая расстановка динамиков – это отдельный файл. Хотите отдавать stereo, 5.1 и 7.1.4 (раскладку с потолочными динамиками – о третьем числе чуть ниже) – храните и стримите три отдельных аудиоверсии. Цифры по стоимости хранения приведём дальше.
Куда дотягивается канальный подход
Канальное аудио не заканчивается на 5.1. Раскладки растут по мере добавления динамиков:
- 7.1 добавляет два surround-канала: восемь каналов на уровне ушей плюс LFE.
- 7.1.4 сохраняет семь каналов на уровне ушей и один LFE, затем добавляет четыре потолочных канала. Третье число – «.4» – считает потолочные динамики. То есть «7.1.4» – это двенадцать динамиков: семь вокруг вас, один сабвуфер, четыре над вами.
- 22.2, вещательная раскладка NHK, использует двадцать четыре динамика в трёх вертикальных слоях.
Заметьте закономерность. Как только звук пошёл вверх – добавилась высота – канальный подход начал трещать. Двадцать четыре подписанных конверта – это очень много конвертов, и почти ни в одной гостиной нет динамиков, чтобы их открыть. Именно это напряжение толкнуло индустрию ко второму подходу.
Подход 2: объектное аудио – называем звуки, а не динамики
Объектное аудио переворачивает вопрос. Вместо «играй это из левого тылового динамика» оно пишет «вот звук вертолёта, а вот его позиция – сверху, сзади, дрейфует влево». Файл хранит звук (он называется аудиообъект) плюс метаданные: данные о звуке, в данном случае его трёхмерную позицию во времени. Отдельная программа на стороне воспроизведения – рендерер – читает позицию и вычисляет, какие из ваших динамиков и насколько должны проиграть этот звук, чтобы он оказался в нужном месте.
Аналогия: объектное аудио – это GPS-адрес, а не запечатанный конверт. Студия пишет «этот звук живёт по таким координатам». Ваш рендерер – местный водитель, знающий ваш район – ваши конкретные динамики – и доставляющий звук в нужную точку независимо от планировки комнаты. Один адрес работает для любого района.
Это и есть главное преимущество, и его стоит сформулировать прямо: один объектный мастер играет правильно на наушниках, саундбаре, системе 5.1 или в кинозале на 64 динамика – без отдельного микса под каждый случай. Рендерер адаптируется. Канальному аудио нужен новый файл под каждую раскладку; объектному – один файл плюс рендерер.
Dolby Atmos – объектный (с канальной подложкой)
Самая известная объектная система – Dolby Atmos. Но Atmos не чисто объектный – это гибрид, и понимание гибрида – ключ к пониманию современного иммерсивного звука.
В миксе Atmos две части. Первая – bed (подложка): набор обычного канального аудио (часто раскладка 7.1.2 – семь на уровне ушей, один LFE, два потолочных) для эмбиента, музыки и всего, что не требует точного перемещения. Вторая – набор объектов: отдельные звуки с метаданными позиции, которые рендерер размещает динамически. Хлопок двери, проезжающая машина, реплика диалога – это объекты.
Dolby Atmos Renderer, программа, которой пользуются студии, принимает до 128 входов суммарно, где каждый канал подложки считается одним входом и каждый объект – одним входом. В кинозале подложка обычно занимает 9.1 из них (часто описывается как 7.1.2), оставляя до 118 объектов свободно перемещаться. При воспроизведении система Atmos каждого зала рендерит эти объекты в реальном времени относительно известных позиций динамиков именно этого зала – поэтому один и тот же мастер Atmos звучит верно в зале на 12 динамиков и в зале на 64.
Трюк домашней доставки: spatial coding
Отдавать в гостиную 128 отдельных каналов звука непрактично – это огромный битрейт. Поэтому для домашней доставки Atmos применяет spatial coding: алгоритм группирует 128 подложек и объектов примерно в 12–16 перцептивно различимых «кластеров», затем несёт эти кластеры плюс метаданные внутри обычного кодека. В тракте Dolby Digital Plus (технически E-AC-3 с «Joint Object Coding», или JOC) именно так стриминговый сервис умещает Atmos в битрейт, который выдержит домашний интернет, оставаясь обратно совместимым – устройство, не понимающее Atmos, всё равно декодирует базовый 5.1.
Этот трюк стоит запомнить для любого стримингового продукта: объектный звук захватывается в студии до 128 элементами, затем разумно сжимается до ~12–16 кластеров для доставки. Вы не стримите 128 каналов.
Расчёт для наглядности. Наивный подход «стримить каждый объект отдельно» при 48 kHz и 24 битах на отсчёт без сжатия стоит на объект:
48 000 отсчётов/с × 24 бита/отсчёт = 1 152 000 бит/с = 1,152 Mbps на объект
128 объектов × 1,152 Mbps = 147,5 Mbps147 Mbps только на звук – абсурд для домашнего стриминга. Spatial coding до ~16 кластеров в E-AC-3 доводит практичную доставку Atmos до нескольких сотен kbps – сжатие примерно 100 к 1. Это и есть разница между «студийным форматом» и «форматом доставки», и поэтому никогда не считайте, что число объектов в студии равно числу стримящихся каналов.
DTS:X – другая объектная система
Главный соперник Dolby, DTS:X, тоже объектный и тоже гибкий по раскладке: он не привязывает микс к фиксированному числу динамиков и позволяет декодеру подстроиться под комнату. Для продуктового решения относитесь к DTS:X и Atmos как к одной категории (объектные, управляемые рендерером, иммерсивные), конкурирующей по экосистеме и лицензированию, а не по базовой философии.
Подход 3: сценное аудио – называем всё звуковое поле
Третий подход не называет ни динамики, ни звуки. Он захватывает всё звуковое поле в точке пространства как набор математических слоёв, а затем восстанавливает его под любую раскладку динамиков – или, что важнее, поворачивает его, когда слушатель крутит головой.
Это амбисоника. Сначала версия простыми словами, без математики. Представьте, что вы стоите в одной точке и спрашиваете: «со всех направлений вокруг меня – сколько звука приходит и откуда?» Амбисоника отвечает на этот вопрос стопкой каналов, которые вместе описывают звук, приходящий со всех направлений сразу. Она вообще не привязана к динамикам; это описание звука у вашей головы.
Самая нижняя, простая версия – First Order Ambisonics (FOA), и она использует ровно четыре канала, обычно называемые W, X, Y и Z. W – всенаправленный канал, суммарное звуковое давление, «сколько звука в целом». X, Y и Z описывают, как этот звук распределён по трём осям: спереди-сзади, слева-справа и сверху-снизу. Четыре числа – и у вас есть грубое, но полное 360°-описание звукового поля.
Чтобы уточнить картину, добавляют слои. Это Higher Order Ambisonics (HOA). Связь между порядком и числом каналов – чистая формула, и показать её один раз стоит:
каналы = (порядок + 1)²
порядок 1 (FOA): (1 + 1)² = 2² = 4 канала
порядок 2: (2 + 1)² = 3² = 9 каналов
порядок 3: (3 + 1)² = 4² = 16 каналов
порядок 7: (7 + 1)² = 8² = 64 каналаВыше порядок – точнее пространственное разрешение (звуки локализуются точнее) ценой большего числа каналов для хранения и передачи. Третий порядок (16 каналов) – частый компромисс для качественного VR; первый порядок (4 канала) использует большинство потребительского видео 360°.
Аналогия: амбисоника – это панорамное фото звука. Захват первого порядка – панорама низкого разрешения: примерно понятно, где что. Захват третьего порядка – панорама выше разрешением: чёткие края, ясные позиции. И как панораму, всё изображение можно потом панорамировать и поворачивать. Последнее свойство и есть магия.
Почему VR и видео 360° хотят сценный звук
Когда вы поворачиваете голову в VR-гарнитуре, всё звуковое поле должно повернуться вместе с вами – звук, что был спереди, теперь сбоку. С канальным аудио это сложно; с объектным возможно, но придётся заново отрендерить каждый объект. Со сценным аудио это одна дешёвая математическая операция поворота, применённая ко всему полю сразу. Поверните четыре (или шестнадцать) амбисонических каналов одной матрицей – и мир повернётся правильно. Поэтому звук VR с отслеживанием головы почти всегда сценный в своей основе.
Поддержка пространственного звука YouTube для видео 360° и VR – массовый пример. YouTube принимает First Order Ambisonics как 4-канальную дорожку (порядок W, Y, Z, X) на 48 kHz, либо FOA плюс «head-locked» стереопару (6-канальная дорожка, W, Y, Z, X, L, R, минимум 768 kbps) для закадрового голоса или музыки, которые не должны вращаться с головой. Когда зритель тянет 360°-вид, YouTube поворачивает амбисоническое поле в реальном времени.
О форматах обмена: ACN и SN3D
Если ваши инженеры работают с амбисоникой, всплывут два акронима. ACN (Ambisonic Channel Number) задаёт порядок хранения каналов – вместо исторических имён W, X, Y, Z каждый компонент получает номер. SN3D (Schmidt Semi-Normalisation) задаёт, как каналы масштабируются относительно друг друга; практическая польза в том, что ни один компонент не превышает уровень всенаправленного канала W, что помогает избежать клиппинга. Широко используемый открытый формат обмена AmbiX – представлен в 2011 году исследователями IEM Graz – сочетает порядок ACN с нормализацией SN3D и хранит каналы как обычный PCM внутри файла WAV/CAF. Математика для продуктового решения не нужна, но фраза «мы используем AmbiX, ACN/SN3D» говорит, что команда работает в сценном аудио.
Два частных случая ADM: matrix и binaural
Ещё два типа ADM дополняют картину; оба удобнее понимать как производные от трёх основных.
Matrix-аудио комбинирует каналы простой арифметикой, создавая другие каналы. Классический пример – кодирование Mid/Side в FM-радио: канал «Mid» – это лево-плюс-право, канал «Side» – лево-минус-право. Если слабый сигнал Side потерян, моно всё равно восстанавливается из Mid. Downmix Lt/Rt, складывающий 5.1 в два канала, тоже matrix. Считайте matrix обратимым трюком сворачивания поверх канального аудио.
Binaural-аудио – это двухканальный сигнал, спроектированный именно под наушники так, чтобы два уха воспринимали полное 3D-размещение. Обычно это выход рендерера, а не формат производства: рендерер берёт объектное или сценное аудио и создаёт бинауральную пару с помощью модели того, как ваша голова и уши окрашивают звук с каждого направления («head-related transfer function», разбираем в статье об амбисонике и HRTF). Apple Spatial Audio – потребительское лицо этого: мастер Atmos (объектный), отрендеренный в бинауральный звук с отслеживанием головы для AirPods.
Три подхода рядом
Вот сравнение, которое реально нужно продакту. Слегка подсвеченные ячейки отмечают, где подход – естественный победитель.
| Критерий | Канальное | Объектное | Сценное |
|---|---|---|---|
| Что хранит файл | Каналы на динамики | Звуки + метаданные позиции | Слои поля (W, X, Y, Z…) |
| Привязка к раскладке? | <span>Да – файл под каждую</span> | <span style="background:#E8F4EC">Нет – рендерер адаптирует</span> | <span style="background:#E8F4EC">Нет – декод под любую</span> |
| Вычисления при playback | <span style="background:#E8F4EC">Минимум (нет)</span> | Средние (рендерер) | Средние (декод/поворот) |
| Поворот головы (VR) | Сложно | Возможно, ререндер объектов | <span style="background:#E8F4EC">Один дешёвый поворот поля</span> |
| Точные движущиеся звуки | Ограниченно | <span style="background:#E8F4EC">Отлично</span> | Хорошо, растёт с порядком |
| Диффузный эмбиент / «эффект присутствия» | Хорошо | Норм | <span style="background:#E8F4EC">Отлично</span> |
| Типичное число каналов | 2–24 | 1 bed + до ~128 объектов (студия) | 4 (FOA) до 16+ (HOA) |
| Флагманы | Stereo, 5.1, 7.1, 22.2 | Dolby Atmos, DTS:X | Амбисоника, YouTube/VR |
| Якорные стандарты | ITU-R BS.775 | ETSI/Dolby; объекты MPEG-H | ITU-R BS.2076 (HOA) |
Таблица 1. Три подхода по осям, которые определяют решение build/buy.
Частая ошибка, которую стоит назвать прямо:
«Подводный камень – «Atmos – это просто больше каналов». Нет. Atmos объектный: он хранит звуки и позиции, затем рендерит под ваши динамики при воспроизведении. Трактовка «это 7.1.4 каналов» с хранением двенадцати фиксированных каналов выбрасывает адаптивность, которая и есть весь смысл, – и звук будет неправильным на любой раскладке, кроме точно 7.1.4. Если поставщик описывает Atmos как фиксированное число каналов, он не понял формат.»
MPEG-H: стандарт, который делает все три сразу
Если три подхода кажутся соперниками, MPEG-H 3D Audio – стандарт, отказывающийся выбирать. Специфицированный как ISO/IEC 23008-3 (MPEG-H Part 3), он несёт канальное, объектное и сценное (HOA) аудио в одном битстриме и позволяет автору их смешивать – канальная подложка плюс движущиеся объекты плюс амбисонический слой эмбиента, всё вместе. Поддерживает до 64 выходных каналов на динамики и 128 кодек-каналов ядра.
Практическая выгода для зрителя – интерактивность: поскольку объекты несут метаданные, декодер MPEG-H может позволить пользователю прибавить диалог, выбрать другой язык комментария или подстроить баланс – всё из одного вещательного потока. Поэтому его приняли вещатели. MPEG-H – единственная аудиосистема UHD-сервиса ATSC 3.0 («Next Gen TV») в Южной Корее. В США аудиостандарт ATSC 3.0 (A/342) допускает и MPEG-H, и Dolby AC-4, и развёртывания в США в основном использовали AC-4. Система нового поколения Бразилии под брендом DTV+ / «TV 3.0» принята в августе 2025 года и тоже построена на технологиях ATSC 3.0. То есть та же классификация из трёх лежит в основе вещательных стандартов, разворачивающихся по миру.
Как выбрать, в одном абзаце
Для большинства стриминговых и OTT-продуктов сегодня опора – объектный подход: авторите в Dolby Atmos (или MPEG-H там, где требует вещание), доставляйте через spatial coding, чтобы битрейт оставался разумным, и пусть устройства рендерят под то, чем владеет зритель. Держите канальный stereo и 5.1 как запасной вариант для старых устройств – это просто гигиена. Берите сценную амбисонику именно тогда, когда в игре отслеживание головы: VR, AR и видео 360°, где поле должно вращаться со зрителем. Чисто канальное аудио сейчас в основном запасной и захватывающий формат, а не основа премиум-уровня.
Где здесь Фора Софт
Фора Софт делает видеопродукты с 2005 года – стриминг, OTT/Internet TV, видеоконференции, e-learning, телемедицину, видеонаблюдение и AR/VR, – и звук в каждом из этих pipeline пользователь замечает первым, когда он ломается. В OTT и стриминге мы настраиваем объектную доставку (Atmos через E-AC-3 JOC или MPEG-H под вещательные цели) с канальными запасными stereo и 5.1, чтобы тайтл играл верно от телефона до домашнего кинотеатра. В AR/VR и 360°-проектах мы работаем в сценной амбисонике, чтобы поле следовало за гарнитурой. Знание всех трёх подходов не академично: так вы оцениваете аудиофичу, которая поедет на устройствах, реально имеющихся у ваших пользователей.
Ключевые выводы
- Подходов три: назвать динамики, назвать звуки или назвать звуковое поле.
- Канальное (5.1, 7.1.4) простое, но нужен файл под каждую раскладку.
- Объектное (Dolby Atmos, DTS:X) хранит звуки и позиции; рендерер адаптирует под комнату.
- Atmos: до 128 студийных элементов, spatial coding до ~12–16 кластеров для доставки.
- Сценное (амбисоника) описывает всё поле; FOA – 4 канала, HOA – (порядок+1)².
- VR и 360° хотят сценный звук, потому что поле вращается с головой.
- MPEG-H (ISO/IEC 23008-3) несёт все три сразу и даёт зрителю интерактивность.