Ambisonics, HRTF и бинауральный рендеринг

Автор: Николай СапуновОбновлено: август 202617 мин чтения
Содержание статьи +

Кратко

Пространственный звук в наушниках держится на трёх идеях, которые складываются в конвейер: способ записать или описать целую сферу звука (ambisonics), измерение того, как именно ваша голова и уши меняют звук с каждого направления (HRTF), и шаг, объединяющий первые два в тот самый двухканальный сигнал, который реально играют наушники (бинауральный рендеринг). Ambisonics хранит звуковое поле как набор каналов – четыре в базовой версии, шестнадцать в версии, которую используют конкуренты YouTube, – и это поле можно мгновенно повернуть, когда вы поворачиваете голову. HRTF – это персональный отпечаток, который сообщает мозгу, что звук сверху, сзади или слева; универсальный HRTF «достаточно хорош», а персональный – заметно лучше. Сделайте все три части правильно – и плоская пара наушников убедит мозг, что звук идёт из фиксированной точки в комнате, даже когда вы двигаетесь; ошибитесь в HRTF – и всё схлопнется в мутный комок внутри головы.

Почему это важно

Если вы делаете VR или AR, видео 360°, иммерсивные видеоконференции или любой продукт, где звук должен идти откуда-то, а не просто из наушников, эти три технологии – весь инструментарий, и выбор между ними задаёт ваш битрейт, задержку и воспринимаемое качество. Статья написана для менеджера продукта, основателя или операционного лидера, которому нужно оценить фичу пространственного звука, поставить задачу инженерам или проверить заявление вендора об «иммерсивном звуке» – и который никогда не слышал про сферические гармоники. Старший аудиоинженер тоже прочтёт её и должен найти каждое число точным; допуски локализации, число каналов и частотные границы здесь восходят к органам стандартизации и первичным исследованиям, а не к маркетинговым страницам. К концу вы поймёте, как звуковое поле захватывается, как уши декодируют направление и как они встречаются в рендерере, который управляет всеми пространственными наушниками, что выпускаются сегодня.

Проблема: у наушников два канала, а у мира бесконечно много направлений

Начнём с задачи, которую решает любая система пространственного звука. В реальной комнате звук приходит к вам со всех сторон сразу – голос спереди, дверь закрылась сзади, шаги слева. Два уха и мозг за ними без всяких усилий раскладывают это в трёхмерную карту. Но пара наушников доставляет ровно два потока звука, по одному на ухо. Вся область пространственного звука – это наука о том, как подать в эти два канала сигналы, так хитро сформированные, что мозг восстанавливает полную 3D-карту, словно вы в исходной комнате.

Два канала звучат как «слишком мало», и долго так и было. Прорыв в том, что мозгу на самом деле не нужно исходное звуковое поле – ему нужны лишь те два ушных сигнала, которые пришли бы, будь поле реальным. Если система умеет вычислить эти два сигнала, иллюзия полна. Это вычисление и есть тема статьи, и оно чётко делится на три задачи: описать поле (ambisonics), измерить, как голова превращает направление в ушной сигнал (HRTF), и прогнать поле через это измерение, чтобы получить два канала (бинауральный рендеринг).

Замечание об охвате. Пространственный звук для фиксированных конфигураций колонок – 5.1, 7.1, 7.1.4 – это другая задача, разобранная в каналах и конфигурациях каналов и в подробных разборах Dolby Atmos и MPEG-H 3D Audio. Эта статья – про случай наушников, потому что именно там живут VR, AR, мобильные устройства и большинство видеоконференций.

Как мозг находит звук: три признака

До всякой технологии – биология. Мозг использует три физических признака, чтобы поместить звук в пространство, и каждая система пространственного звука на Земле – это лишь машина для воспроизведения этих трёх признаков в наушниках. Понять их – ключ, после которого встаёт на место всё остальное.

Первый признак – время, межушная разница во времени, или ITD – промежуток между тем, когда звук достиг одного уха и когда другого. Звук справа попадает в правое ухо на долю миллисекунды раньше, чем в левое, потому что левое ухо дальше. Этот промежуток крошечный – максимум около 0,6–0,7 миллисекунды для звука прямо сбоку, – но мозг читает его точно. ITD – главный признак для низких частот; дуплексная теория локализации, вековая рамка, используемая и сегодня, кладёт переход примерно на 1 500 Гц: ниже него мозг опирается на время (Wikipedia, Sound localization; ряд акустических справочников).

Второй признак – громкость, межушная разница в уровне, или ILD – разница в громкости между ушами. Голова – физическое препятствие, и на высоких частотах она отбрасывает акустическую «тень», так что дальнее ухо слышит более тихую версию. Выше примерно 1 500 Гц именно ILD становится главным признаком, потому что высокие частоты достаточно короткие, чтобы голова их заслоняла (акустические справочники; дуплексная теория).

ITD и ILD вместе прекрасно сообщают мозгу лево–право – но оставляют знаменитую неоднозначность. Звук прямо спереди и звук прямо сзади дают почти одинаковые время и уровень на обоих ушах, потому что оба равноудалены. То же со звуком сверху и под тем же углом снизу. Это «конус неопределённости», и его снимает третий признак.

Третий признак – ушная раковина (pinna), видимое наружное ухо. Её складки и гребни фильтруют входящий звук по-разному в зависимости от угла прихода, вырезая небольшие провалы – спектральные «зарубки» – в частотном содержании. Центральная частота самого заметного провала предсказуемо сдвигается, когда звук движется вверх или вниз, – так мозг читает высоту. Эти признаки живут в высоких частотах: самая выраженная фильтрация раковины – в полосе 4 000–9 000 Гц, а надёжная оценка высоты обычно требует энергии выше примерно 7 000 Гц (по обзорам исследований локализации). Ушная раковина ещё и сугубо индивидуальна – ни у кого нет одинаково устроенных ушей, – поэтому и существует персонализированный пространственный звук, как мы увидим.

Рисунок 1. Три признака, по которым мозг помещает звук. Время (ITD) и уровень (ILD) дают лево-право с переходом около 1 500 Гц; спектральные провалы раковины дают фронт-тыл и верх-низ.

HRTF: ваша голова, превращённая в математику

Теперь сложим все три признака в один объект. Head-related transfer function, или HRTF, – математическое описание того, как звук с одного конкретного направления переформируется вашей головой, торсом и ушами, прежде чем достигнет каждой барабанной перепонки. Оно вмещает ITD, ILD и провалы раковины в одно измерение – для одного направления. Измерьте достаточно направлений по всей сфере вокруг слушателя – и вы получите его полный набор HRTF: таблицу, отвечающую на вопрос «если звук идёт оттуда, что именно приходит в каждое ухо?».

HRTF – важнейший объект в пространственном звуке для наушников, поэтому стоит точно сказать, что это. Для каждого направления – скажем, 30° вправо и 15° вверх – HRTF хранит пару коротких фильтров, по одному на ухо. Пропустите любой звук через нужную пару фильтров – и он приобретает все признаки направления. Мозг слышит результат через обычные наушники и заключает, верно, что звук на 30° вправо и 15° вверх.

Откуда берутся HRTF? Их измеряют. Человек сидит в безэховой камере с миниатюрными микрофонами в ушных каналах, а колонка проигрывает тестовые сигналы из сотен позиций вокруг; записанные ушные сигналы в сравнении с источником и есть HRTF. Поскольку делать это для каждого дорого, индустрия опирается на общие исследовательские базы – CIPIC, SADIE, LISTEN, FABIAN, HUTUBS, ARI и десятки других – многие из которых опубликованы в общем формате файлов, с которым мы скоро встретимся (списки баз SOFA Conventions, 2024–2025). Продукт с «универсальным» пространственным звуком почти всегда использует одну уважаемую HRTF из базы, часто измеренную на манекенной голове, для всех.

Универсальный или персональный HRTF

Универсальный HRTF – компромисс: он построен на чужих ушах, поэтому его провалы раковины лежат на частотах, которые могут не совпасть с вашими. Для большинства людей хороший универсальный HRTF всё же даёт убедительное лево-право и пригодное чувство пространства, потому что ITD и ILD зависят в основном от размера головы и расстояния между ушами, которые варьируются меньше, чем форма раковины. Слабость видна в оценке высоты и фронт-тыла – признаках, зависящих от раковины, – где несовпадающий HRTF даёт ошибки: звук, который должен быть спереди, схлопывается внутрь головы, а высота сглаживается.

Поэтому персональный HRTF стал в 2026 году полем битвы продуктов. Apple Personalized Spatial Audio просит отсканировать голову и уши фронтальной камерой iPhone – повернуть голову влево до сигнала, затем вправо – чтобы построить профиль под вашу анатомию (Apple Support, Control Spatial Audio and head tracking, 2024–2025). Dolby Atmos Personalized Rendering берёт фотографии головы и ушей и вычисляет персональный HRTF, сокращённо PHRTF, в облаке (audioXpress, 2024). Исследования всё чаще используют машинное обучение, чтобы предсказать HRTF по фото или нескольким антропометрическим измерениям вместо полного безэхового измерения, а обзор за декабрь 2024 года перечисляет конкурирующие подходы: физическое моделирование, антропометрию и ML (MDPI Applied Sciences, A Review on HRTF Generation for Spatial Audio, 2024).

«Подводный камень – «звук как будто внутри головы». Это классический симптом несовпадения HRTF (или его отсутствия – просто панорамированное стерео). Если вынос плохой, не тянитесь к большему количеству реверберации; проверьте, что применяется настоящий HRTF и что слежение за головой активно. Лечится почти всегда цепочка рендеринга, а не контент.»

SOFA и AES69: формат файлов, сделавший HRTF переносимыми

Годами каждая база HRTF хранила измерения в своём формате, и использование новой базы означало писать новый парсер. Это закончилось с SOFASpatially Oriented Format for Acoustics – стандартизированным форматом файлов для HRTF и связанных импульсных характеристик помещения, используемых в пространственном звуке. SOFA – не вендорский продукт, а открытый стандарт, утверждённый Audio Engineering Society как AES69, впервые опубликованный как AES69-2015 и переутверждённый как AES69-2020 и AES69-2022 (SOFA Conventions; AES69). Файл SOFA (.sofa) содержит измеренные фильтры плюс точную геометрию – позиции источников, ориентацию слушателя, – так что любой совместимый инструмент загрузит любую базу. Если вы оцениваете SDK пространственного звука, «читает HRTF в SOFA / AES69» – конкретная возможность, о которой стоит спросить; она означает, что позже вы сможете подставить лучшие или персональные HRTF, а не оставаться привязанными к встроенному набору вендора.

Ambisonics: хранение целой сферы звука

HRTF отвечает на «что приходит в уши с одного направления». Но в реальной сцене звук идёт со всех направлений сразу, а слежение за головой означает, что слушатель может вращать всю сцену как угодно. Нужен способ хранить всё звуковое поле – целую сферу – в форме, которую легко вращать и легко прогонять через HRTF. Это представление – ambisonics.

Вот суть простыми словами. Вместо «звук в этой колонке и звук в той колонке» ambisonics хранит звуковое поле как набор перекрывающихся направленных паттернов, которые в сумме восстанавливают давление в центре сферы со всех углов. Думайте об этом как об описании ландшафта не списком объектов, а гладкой математической поверхностью – несколькими широкими формами, схватывающими крупные черты, плюс более мелкими формами для деталей. Эти формы называются сферическими гармониками, и математика вам не нужна; нужно следствие: больше форм – больше пространственной детализации.

Порядок и число каналов: единственная важная формула

Число форм задаёт порядок амбисоники. Амбисоника первого порядка использует четыре самых широких паттерна; высшие порядки добавляют более тонкие. Число каналов следует одной чёткой формуле – для порядка N нужно (N + 1)² каналов (RingBuffer, Understanding Ambisonics; стандартные справочники по амбисонике). Подставьте числа – и компромисс очевиден:

порядок 1 (FOA):  (1 + 1)² = 4 канала
порядок 2:        (2 + 1)² = 9 каналов
порядок 3 (TOA):  (3 + 1)² = 16 каналов
порядок 7:        (7 + 1)² = 64 канала

Амбисоника первого порядка, сокращённо FOA, – это четыре канала: дёшево, поддерживается повсюду, и это формат, который YouTube принимает для видео 360°. Амбисоника третьего порядка, TOA, – это шестнадцать каналов: вчетверо больше данных, заметно более чёткая локализация. Причина, почему высший порядок помогает, прямая: больше паттернов сферических гармоник позволяют восстановить поле с более тонким угловым разрешением, так что направление звука рендерится точнее. Слушательские исследования это подтверждают – точность локализации растёт по порядкам 1, 3 и 5 (рецензируемые исследования локализации, например работы AES/академии по первому и высшим порядкам). Цена столь же прямая: каждый лишний порядок – это больше каналов для кодирования, хранения и передачи.

ПорядокНазваниеКаналыДетализацияТипичное применение
1FOA4Грубая – широкие направленияYouTube 360°, VR с низким битрейтом
29ЛучшеFacebook 360 (исторически), средний VR
3TOA16Чёткая локализацияVR высокого класса, иммерсивное производство
764Эталонное качествоИсследования, студийный мониторинг

Таблица 1. Порядок амбисоники и число каналов по (N+1)². Скачок от грубой к чёткой локализации – это скачок с 4 до 16 каналов. Источники: RingBuffer; стандартные справочники; SSA Plugins о высших порядках.

AmbiX, ACN и SN3D: почему файл вообще играет правильно

Два файла могут оба быть «амбисоникой первого порядка» и всё же быть несовместимы, потому что четыре канала можно упорядочить и масштабировать по разным конвенциям. Победившая конвенция, на которую стоит ориентироваться, – AmbiX. AmbiX фиксирует два выбора. Во-первых, порядок каналов по ACN – Ambisonic Channel Numbering – который нумерует сферические гармоники по фиксированной формуле, так что четыре канала FOA идут W, Y, Z, X именно в этом порядке. Во-вторых, каналы масштабируются нормализацией SN3D (полунормализация Шмидта). Google принял SN3D как основу формата YouTube 360, что закрепило AmbiX как де-факто стандарт обмена (Wikipedia, Ambisonic data exchange formats; RingBuffer).

Более старая конвенция FuMa (Furse-Malham) упорядочивает каналы W, X, Y, Z и масштабирует их иначе; вы ещё встретите её в legacy-материалах и некоторых плагинах. Практическое правило: производите и храните AmbiX (ACN/SN3D), а FuMa конвертируйте на границе. Спецификация пространственного звука самого YouTube однозначна – она требует AmbiX с порядком ACN и нормализацией SN3D, FOA в виде 4-канальной дорожки W,Y,Z,X на 48 кГц или 6 каналов (W,Y,Z,X,L,R), когда вы добавляете head-locked стерео для озвучки или музыки, которые не должны вращаться с головой (спецификация пространственного звука YouTube / Google spatial-media, 2024–2025).

«Подводный камень – несовпадение порядка каналов. Подача файла FuMa в декодер AmbiX (или наоборот) не вызывает ошибку – он играет, но звуковое поле перемешано: лево становится верхом, фронт – размазнёй. Если пространственный микс звучит «неправильно, но не сломан», подозревайте сначала несовпадение ACN/FuMa или SN3D/maxN.»

Бинауральный рендеринг: где ambisonics встречается с HRTF

Теперь обе половины соединяются. У вас есть звуковое поле в ambisonics и слушатель, чьи уши описаны HRTF. Бинауральный рендеринг – шаг, который объединяет их в двухканальный сигнал, играемый наушниками. Концептуально он работает в два хода.

Классический, легко представимый метод – подход виртуальных громкоговорителей. Вообразите слушателя, окружённого кольцом или сферой воображаемых колонок. Сначала декодируйте амбисоник-поле в эти виртуальные позиции – стандартное амбисоник-декодирование, та же математика, что и для реальных массивов колонок. Затем для каждой виртуальной колонки возьмите HRTF слушателя для её направления, отфильтруйте сигнал колонки через него и просуммируйте все результаты в левый и правый каналы. Выход – два канала, несущие признаки направления всего поля. Это интуитивно и верно, но это и много свёрток HRTF – по паре на колонку каждый аудиокадр.

Метод, ставший современным стандартом по умолчанию, пропускает виртуальные колонки и работает прямо в области сферических гармоник: HRTF заранее сводятся в амбисоник-представление один раз, так что рендеринг всего поля стоит столько операций фильтрации, сколько амбисоник-каналов. Доминирующая техника здесь – Magnitude Least Squares, сокращённо MagLS. Амбисоника низкого порядка не может идеально воспроизвести тонкую высокочастотную деталь HRTF, а попытка совпасть и по уровню, и по тонкому времени (фазе) на высоких частотах ведёт к уродливым компромиссам. MagLS использует факт из раздела о биологии: выше примерно 1 500 Гц мозг читает уровень (ILD), а не тонкую фазу. Поэтому MagLS точно совпадает по амплитуде HRTF и отбрасывает высокочастотную фазу, которую не может воспроизвести, тратя ограниченный бюджет низкого порядка там, где ухо это замечает. MagLS сейчас де-факто стандарт для бинаурального рендеринга низкого порядка, и активные исследования – masked MagLS, end-to-end MagLS – продолжают его улучшать (arXiv 2501.18224, Ambisonics Binaural Rendering via Masked Magnitude Least Squares, 2025; DAGA 2023; eMagLS, 2024).

Рисунок 2. Два маршрута от амбисоник-поля к наушникам. Путь виртуальных колонок интуитивен; прямой путь MagLS – то, что в продакшене. Поворот головы применяется к полю до рендеринга – поэтому он ощущается мгновенным.

Слежение за головой: признак, который делает иллюзию настоящей

Единственная фича, отделяющая убедительный пространственный звук от трюка, – слежение за головой: поворот звукового поля для компенсации, когда слушатель поворачивает голову, чтобы источник оставался зафиксированным в комнате, а не приклеенным к голове. Именно тут ambisonics окупается. Поскольку поле хранится как сферические гармоники, поворот всей сцены – одна матричная операция над каналами: быстро, точно и до шага HRTF. Поверните голову на 30° вправо – и система поворачивает поле на 30° влево в том же кадре, так что голос, что был перед вами, остаётся перед вами.

Слежение за головой важно по двум причинам. Оно резко улучшает вынос – ощущение, что звук вне головы, – потому что мозг считает реальным источник, который остаётся на месте при движении. И оно снимает фронт-тыловую неопределённость, оставшуюся от ITD/ILD: крошечное движение головы меняет признаки по-разному для источника спереди и сзади, и мозг это использует. Именно это делают AirPods и подобные наушники – их датчики движения отслеживают положение головы, а звук поворачивается, оставаясь привязанным к iPhone или Mac (Apple Support, 2024–2025). Подвох – задержка: поворот должен следовать за головой в пределах нескольких десятков миллисекунд, иначе само запаздывание становится признаком, что мир ненастоящий. Слежение за головой в пространственном звуке нацелено на задержку «движение–звук», достаточно низкую, чтобы оставаться незаметной, – та же дисциплина, что управляет всей реал-тайм цепочкой в WebRTC аудио-конвейере целиком.

Складываем всё вместе: три реальных стека

Три кирпича сочетаются по-разному в зависимости от продукта. Три конкретных стека покрывают большинство того, что выпускается.

YouTube 360° / VR-видео. Автор создаёт амбисоник-микс первого порядка (AmbiX, ACN/SN3D), при необходимости с head-locked стерео-парой для озвучки. YouTube хранит четырёхканальное поле и при воспроизведении поворачивает его под ориентацию головы зрителя и бинаурально рендерит на HRTF от Google Resonance Audio – те же HRTF, что Google открыл для VR (спецификация YouTube; SSA Plugins о Resonance Audio HRTF, 2018). Четыре канала держат битрейт скромным – поэтому FOA и есть выбор веб-масштаба, хотя высшие порядки локализуют лучше.

Игра или опыт на VR-гарнитуре. Здесь движок обычно рендерит объекты прямо в бинаурал по источникам или использует амбисонику третьего порядка для фонового слоя плюс объектный рендеринг для ключевых звуков – шестнадцать каналов TOA покупают ту чёткость локализации, которой требует визуал нашлемного дисплея. HRTF по умолчанию универсальный, опция персонализации встречается всё чаще.

Иммерсивные видеоконференции. Пространственная конференция помещает каждого удалённого участника в отдельную виртуальную позицию, чтобы мозг разделял накладывающиеся голоса – выигрыш «коктейльной вечеринки». Обычно это рендерит моно-поток каждого говорящего через HRTF для назначенного «места» и суммирует в бинаурал, а не несёт полное амбисоник-поле; это легче и интегрируется с реал-тайм цепочкой и микшированием, разобранными в аудио в SFU, MCU и P2P и групповых звонках в масштабе. Пространственное разнесение голосов измеримо улучшает разборчивость, когда говорят несколько человек, – практическая выгода для конференц-продукта.

Разобранный пример: цена перехода с FOA на TOA

Допустим, вы стримите концерт 360° и выбираете между амбисоникой первого и третьего порядка, обе в Opus при типичных 64 кбит/с на канал. Число каналов берётся прямо из (N+1)²:

FOA:  4 канала × 64 кбит/с  =  256 кбит/с
TOA: 16 каналов × 64 кбит/с = 1 024 кбит/с

Это рост битрейта в 4 раза – 256 кбит/с против чуть более 1 Мбит/с – за переход от грубой к чёткой локализации. Для веб-доставки на обычные наушники грубое поле FOA обычно – верный выбор: визуал – звезда, звук его поддерживает, и 256 кбит/с стримятся всем. Для привязанной VR-гарнитуры, где голова пользователя движется постоянно, а звук несёт иммерсивность, лишний мегабит TOA потрачен с толком. Решение не в «что лучше» – TOA всегда локализует лучше – а в «стоит ли выигрыш локализации вчетверо большего числа бит для этого продукта и этой сети», тот же инженерный компромисс, что разобран для мультидорожек в математике хранения и CDN для аудио.

Где здесь Фора Софт

Пространственный звук возникает во всех продуктах, которые мы строим. В AR/VR амбисоник-слои с бинауральным рендерингом и слежением за головой делают сцену обитаемой, а не пересказанной. В видеоконференциях и e-learning размещение каждого говорящего в отдельной виртуальной позиции помогает следить за накладывающимся разговором – тот же выигрыш разборчивости, что важен в телемедицинских консультациях с несколькими людьми в кадре. В OTT и Internet-TV бинауральный рендеринг – это то, как иммерсивный микс, созданный для колонок, доходит до большой доли зрителей, смотрящих в наушниках. Во всех этих случаях повторяются те инженерные вопросы, которые задаёт статья: какой порядок амбисоники, универсальный или персональный HRTF и как держать задержку слежения за головой достаточно низкой, чтобы сохранить иллюзию.

Главное

  • У наушников два канала; пространственный звук вычисляет ровно те два сигнала, что услышали бы уши.
  • Мозг локализует звук тремя признаками: время (ITD), уровень (ILD) и спектральные провалы раковины.
  • HRTF сводит все три признака на направление; персональные HRTF лучше универсальных по высоте и фронт-тылу.
  • Ambisonics хранит всю сферу; порядку N нужно (N+1)² каналов – 4 для FOA, 16 для TOA.
  • Стандартизируйтесь на AmbiX (порядок ACN, нормализация SN3D) и файлах HRTF в SOFA/AES69.
  • Слежение за головой поворачивает амбисоник-поле до рендеринга; именно это держит иллюзию.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.