Пространственный звук в VR/AR-стриминге

Автор: Николай СапуновОбновлено: август 202615 мин чтения
Содержание статьи +

Кратко

Пространственный звук в VR и AR строится на одном ключевом различии: реагирует ли звук только на то, куда вы смотрите (три степени свободы, 3DoF), или ещё и на то, куда вы идёте (шесть степеней свободы, 6DoF). При 3DoF звуковое поле вращается вокруг головы – это недорого, хорошо поддерживается и подходит для 360-видео. 6DoF требует пересчёта расстояния, направления и акустики помещения по мере движения пользователя, и именно эту сложную задачу решает новый стандарт ISO/IEC 23090-4:2025 «MPEG-Immersive Audio», опубликованный в ноябре 2025 года. Инструменты, которые вы реально используете – Google Resonance Audio, Steam Audio от Valve, Meta XR Audio SDK, Apple PHASE и браузерный Web Audio API – выполняют три одинаковые задачи (расположение звуков, добавление отражений, сведение в наушники через HRTF), но отличаются глубиной симуляции и нагрузкой на CPU и битрейт. Выбирайте 3DoF, если пользователь не перемещается физически, закладывайте акустику помещения с самого начала и никогда не выпускайте пространственный звук без проверки сквозного отслеживания головы.

Почему это важно

Если вы планируете VR-тренажёр, 360-трансляцию, AR-навигацию или опыт «обойти виртуальный шоурум», то решение по звуку, принятое на первой неделе, определяет объём трафика, бюджет задержки и поверит ли пользователь в реальность мира. Эта статья – для продакт-менеджера, основателя или операционного лида, которому нужно поставить задачу команде или оценить заявление вендора об «immersive-аудио», и который никогда не слышал про степень свободы. Старший аудиоинженер тоже её прочтёт и должен найти каждое число точным: число каналов, диапазоны битрейтов и редакции стандартов здесь восходят к ISO, 3GPP, W3C и инженерной документации вендоров, а не к маркетингу. К концу вы поймёте, когда стоит платить за 6DoF, какой SDK подходит вашей платформе, и три ошибки, из-за которых пространственный звук схлопывается в плоский ком внутри головы слушателя.

Различие, которое решает всё: 3DoF и 6DoF

В VR/AR-аудио всё начинается с учёта возможных движений головы. «Степень свободы» – это один независимый способ изменить положение или ориентацию головы. Их ровно шесть.

Первые три – это вращения, то есть способы поворота головы, не вставая со стула. Поворот влево-вправо – yaw. Кивок вверх-вниз – pitch. Наклон уха к плечу – roll. Система, отслеживающая только эти три параметра, называется 3DoF. Она определяет, куда вы смотрите, но не знает, где вы находитесь.

Остальные три – это перемещения, движение всего тела в пространстве. Шаг влево-вправо – одна ось, вперёд-назад – вторая, присесть-встать – третья. Система, отслеживающая все шесть степеней свободы (три вращения плюс три перемещения), называется 6DoF. Она определяет не только ваше местоположение, но и направление взгляда.

Вот почему это единственное различие определяет весь проект. При 3DoF источник звука остаётся на одном и том же расстоянии – к нему невозможно подойти. Системе нужно лишь вращать звуковое поле вокруг головы при повороте. Это простая операция. При 6DoF приближение к источнику звука должно делать его громче, а направление – меняться; проход мимо отправляет звук за спину, а стена между вами глушит его. Это физическая симуляция, и она требует много ресурсов.

Конкретное правило прямо из работы над стандартами: если видео даёт пользователю 6DoF, то и звук должен давать 6DoF, иначе опыт ломается. Требования MPEG-I формулируют это прямо – если картинка позволяет ходить, а звук за ней не следует, вы слышите говорящего не оттуда, где его видите, что раздражает сильнее, чем полное отсутствие пространственного звука. Степени свободы звука = степени свободы видео.

Рисунок 1. Шесть степеней свободы. 3DoF отслеживает три вращения и поворачивает звуковое поле; 6DoF добавляет три перемещения и должен пересчитывать дистанцию, направление и перекрытие при движении слушателя.

Что на самом деле вычисляет «пространственный звук»

Если отбросить маркетинг, любой VR/AR-движок выполняет три задачи последовательно. Понимание этих задач помогает анализировать список функций от вендора и выявлять, чего не хватает.

Первая задача – размещение: определить, где относительно слушателя находится каждый звук, и корректировать его положение при повороте или движении. Для наушников это означает преобразование направления звука в два сигнала, которые он создал бы в ушах, с учётом того, как голова и уши изменяют звук – это передаточная функция головы, или HRTF. Подробно о HRTF, амбисонике и бинауральном рендеринге мы писали в статье амбисоника, HRTF и бинауральный рендеринг; здесь важно лишь одно: любой движок использует HRTF, чтобы плоские наушники звучали так, будто звук исходит из трёхмерного пространства.

Вторая задача – акустика помещения: отражения и реверберация, которые помогают мозгу определить размер пространства и расстояние до источника звука. Голос без отражений звучит сухим и «в голове». Добавьте ранние отражения (первые отскоки от ближайших стен) и позднюю реверберацию (расплывчатый хвост) – и тот же голос оказывается в комнате на реалистичной дистанции. Документация Meta прямо указывает: HRTF обеспечивают сильные признаки направления, но без эффектов помещения звуки «часто звучат сухо и безжизненно», а отражения – ключевой признак дистанции.

Третья задача – рендеринг: преобразовать всю сцену в два канала, которые реально воспроизводят наушники (реже – в раскладку колонок). На этом этапе взаимодействуют амбисоническое поле и HRTF. Удачная оптимизация Resonance Audio заключается в следующем: все источники смешиваются в единое амбисоническое поле высокого порядка, а затем HRTF применяется один раз ко всему полю, а не к каждому источнику по отдельности. Благодаря этому Resonance может обрабатывать сотни звуковых источников в пространстве даже на телефоне: дорогостоящий этап обработки HRTF выполняется фиксированное число раз, независимо от количества звуков.

«Подводный камень – размещение без акустики помещения. Самая частая ошибка – пространственная обработка источников через HRTF: слышишь корректное лево-право-верх-низ и думаешь, что задача решена. Но без ранних отражений и реверберации дистанция остаётся нечитаемой, всё воспринимается как приклеенное к голове. Акустику помещения закладывайте уже на первой неделе, а не оставляйте на «полировку второй фазы».»

Стандарты, которые только что изменили ситуацию

Почти всё прошлое десятилетие у 6DoF-аудио не было единого стандарта – каждая платформа создавала свой. Это изменилось в конце 2025 года.

MPEG-I Immersive Audio (ISO/IEC 23090-4:2025)

Главный стандарт – ISO/IEC 23090-4:2025, который организация MPEG называет MPEG-I Immersive Audio, был опубликован 3 ноября 2025 года как полный международный стандарт (625-страничный документ; ISO/IEC 23090-4:2025). Его аннотация точно определяет область применения: стандарт «специфицирует технологию, обеспечивающую интерактивный рендеринг в реальном времени immersive-аудиопрезентаций для VR или AR, позволяя пользователю перемещаться в аудиосцене с шестью степенями свободы (6DoF)», а также определяет как метаданные для рендеринга, так и синтаксис битстрима для эффективного хранения и потоковой передачи.

Что он добавляет по сравнению с предыдущим поколением – ключевой фактор при выборе формата. Предыдущий стандарт MPEG-H 3D Audio поддерживал только 3DoF – поворот головы в фиксированной «сладкой точке». MPEG-I базируется на MPEG-H и расширяет его до полного 6DoF: слушатель может перемещаться по сцене (x, y, z), а рендерер моделирует реальную акустическую физику – реверберацию, ранние отражения, затухание звука за препятствиями (например, стеной), дифракцию (звук огибает края) и даже эффект Доплера от движущегося источника (обзор MPEG-I Immersive Audio, MPEG WG 6). Стандарт достиг стадии FDIS на 149-м заседании MPEG в Женеве в январе 2025 года и был опубликован в ноябре; сводка результатов верификационных тестов вышла на MPEG 153 в январе 2026 года.

IVAS: пространственный звук в телефонном звонке (3GPP Release 18)

Второй новый стандарт ориентирован на связь в реальном времени, а не на стриминг контента. IVASImmersive Voice and Audio Services – это кодек 3GPP, представленный в Release 18, построенный на базе и обратно совместимый с речевым кодеком EVS из семейства речевых кодеков. IVAS передаёт пространственный звук по мобильной сети: моно, стерео, многоканальный, амбисоника и объектный звук, а также параметрический формат MASA (3GPP IVAS; материалы Fraunhofer IIS).

Число, которое стоит запомнить, – диапазон битрейта: 13,2–512 кбит/с для immersive-режимов. Параметрический режим может передавать три-четыре свободно размещённых звуковых объекта всего на 24,4 или 32 кбит/с и восстанавливать их пространственные позиции на приёмнике. IVAS бинаурализует звук на стороне приёмника, поддерживает отслеживание положения головы и ориентацию слушателя, а также добавляет акустику помещения с помощью бинауральных импульсных характеристик или синтеза отражений – что делает его естественным выбором для пространственного звука в WebRTC-конвейере реального времени, когда его начнут поддерживать операторы и устройства.

Инструменты, которыми вы реально воспользуетесь

Вы редко будете реализовывать HRTF-математику самостоятельно. Вам понадобится SDK. Вот пять ключевых решений в 2026 году и их назначение.

Google Resonance Audio – кроссплатформенная open-source библиотека. Поддерживает Android, iOS, Unity, Unreal, FMOD, Wwise и, что особенно удобно для стриминга, работает в вебе через Web Audio API. Все источники звука проецируются в общее амбисоническое поле высокого порядка – при этом стоимость одного источника остаётся низкой. Поддерживаются регулируемый порядок амбисоники, перекрытие, ближнее поле и геометрическая реверберация (документация Resonance Audio, Google). Это естественный выбор, когда нужен единый подход как для нативных приложений, так и для браузера.

Steam Audio от Valve – выбор, когда важна физическая точность: архитектурные обходы, VR-игры высокого класса. Физически моделирует отражения от геометрии сцены и может рендерить отражения в амбисонике третьего порядка с опциональным GPU-ускорением (Steam Audio; AMD TrueAudio Next). Чем больше симуляции – тем больше нагрузка на CPU и выше реализм.

Meta XR Audio SDK – нативный инструмент для Meta Quest. Обеспечивает объектную и амбисоническую пространственную обработку звука на основе HRTF, а также симуляцию акустики помещения. Поддерживает интеграцию с Unity, Unreal, FMOD и Wwise (документация Meta Horizon OS). Примечание для планирования: в 2025 году SDK будет заморожен на версии 85.0 – стабильный и готов к использованию, но новые функции больше не добавляются.

Apple PHASEPhysical Audio Spatialization Engine – нативный путь на платформах Apple, включая Vision Pro. PHASE позволяет описывать источники звука как геометрические фигуры и поддерживает прямой путь, ранние отражения и позднюю реверберацию; на visionOS ReverbComponent с пресетами сочетает реальную акустику помещения с выбранной реверберацией в зависимости от уровня погружения (Apple Developer, PHASE/WWDC и документация visionOS). Используйте его, если работаете полностью в экосистеме пространственных вычислений Apple.

Web Audio API – браузерный базовый вариант, и первый, к которому тянутся стриминговые команды. Его PannerNode располагает источник в 3D и при panningModel: "HRTF" применяет HRTF-фильтрацию относительно AudioListener, который вы двигаете и вращаете вслед за головой (W3C Web Audio API; MDN). Встроен в каждый современный браузер, не требует установки и сочетается с WebXR для VR в браузере. Независимое исследование нашло, что PannerNode с HRTF разместил цели точнее некоторых библиотечных альтернатив в браузерном тесте – напоминание, что встроенный путь реально пригоден, а не запасной.

SDK / APIПлатформыЛучше дляАкустика помещенияЗаметки
Resonance AudioAndroid, iOS, Unity, Unreal, WebОдин подход вездеГеометрическая реверберацияОбщее амбисоническое поле → дёшево за источник
Steam AudioWindows, Unity, UnrealФизическая точность, VR-игрыФизическое моделирование отраженийTOA-отражения; опционально GPU
Meta XR Audio SDKMeta Quest (Unity/Unreal/FMOD/Wwise)Нативные приложения QuestHRTF + симуляция помещенияЗаморожен на v85.0 (2025)
Apple PHASEiOS, macOS, visionOSПространственные вычисления AppleПрямой путь + отражения + реверберацияПресеты ReverbComponent в visionOS
Web Audio APIЛюбой современный браузерСтриминг, WebXR, без установкиВручную (convolver/reverb)PannerNode panningModel:"HRTF"

Таблица 1. Пять инструментов пространственного звука для VR/AR в 2026 году. Источники: документация Resonance Audio (Google); Steam Audio (Valve/AMD); документация Meta Horizon OS; Apple Developer (PHASE, visionOS); W3C Web Audio API + MDN.

Вопрос полосы: сколько стоит стримить пространственный звук

Пространственный звук в канале не бесплатен, и его стоимость полностью зависит от передаваемого формата.

Для стримингового 360-видео стандартным решением является амбисоника первого порядка, FOA – четыре канала (W, Y, Z, X). Спецификация пространственного звука YouTube, например, поддерживает FOA в виде 4-канальной дорожки с частотой дискретизации 48 кГц, при этом опционально может добавляться 2-канальное head-locked стерео для нарратива или музыки, которые не должны вращаться вместе с головой (подробности см. в статье амбисоника, HRTF и бинауральный рендеринг). Четырёх каналов достаточно для передачи звука со всех сторон; амбисоника третьего порядка (16 каналов) обеспечивает более точную локализацию, хотя требует вчетверо больше каналов.

Поставим цифру. Возьмём FOA, закодированный кодеком Opus на скромной скорости на канал:

каналов FOA       = 4
скорость на канал = 64 кбит/с
итого             = 4 × 64 = 256 кбит/с

Теперь рассмотрим случай третьего порядка при той же скорости на канал:

каналов TOA       = 16
скорость на канал = 64 кбит/с
итого             = 16 × 64 = 1024 кбит/с ≈ 1 Мбит/с

То есть переход от грубого к чёткому пространственному разрешению – это четырёхкратный рост полосы пропускания по звуку, примерно с четверти мегабита до одного мегабита в секунду. Для живой 360°-трансляции на тысячи зрителей такой аудиоформат – это реальные деньги; та же математика хранения и доставки, что и в статье математика хранения и CDN для звука. В режиме реального времени контрапунктом служит параметрический объектный режим IVAS: три–четыре размещённых объекта при скорости 24,4–32 кбит/с, поскольку он передаёт параметры, а не полные аудиоканалы.

Правило планирования: стримьте FOA (≈256 кбит/с), если контенту реально не нужна точность высокого порядка, и резервируйте объектную или MPEG-I-доставку для опыта, где пользователь может перемещаться.

Решение за пять минут

Собрав части, выбор обычно оказывается быстрым. Задайте три вопроса по порядку.

Первый: может ли пользователь физически перемещаться по сцене или только смотреть вокруг? Если только смотреть – сидячий VR, 360-видео, фиксированный AR-оверлей – нужен 3DoF, и FOA через обычный кодек достаточно. Если может ходить – VR в полный рост, игра на Quest, AR «обойти здание» – нужен 6DoF, и вы в зоне объектного звука или MPEG-I Immersive Audio.

Второй: на какой вы платформе? Браузер и кроссплатформенные решения → Web Audio API или Resonance Audio. Meta Quest → Meta XR Audio SDK. Apple Vision Pro → PHASE. Физически точная VR-игра → Steam Audio. Пространственный голос уровня звонка → IVAS, когда устройства начнут поддерживать.

Третий вопрос: нужна ли правдоподобная дистанция? Если да – а для любого опыта с ходьбой ответ однозначно «да» – необходимо учитывать акустику помещения: ранние отражения и реверберацию, а не только HRTF-расположение. Этот шаг команды часто пропускают, а потом удивляются, почему звук получается плоским.

Рисунок 2. Дерево решений на пять минут. Движение решает 3DoF или 6DoF; платформа решает SDK; правдоподобие дистанции решает, обязательна ли акустика помещения.

Где здесь Фора Софт

Фора Софт занимается разработкой видеостриминга, WebRTC-конференций и AR/VR-программного обеспечения с 2005 года, и звук – это то, на чём immersive-проекты чаще всего спотыкаются перед запуском. В работе над VR-тренажёрами и 360-стримингом постоянно возникает одна и та же задача: согласовать степени свободы звука со степенями свободы видео (3DoF-звук для 360-лекции, полноценный позиционный звук для симуляции с возможностью перемещения) и точно реализовать слежение за головой, чтобы поворот головы действительно влиял на звучание. В браузерных и конференц-решениях мы используем Web Audio API и Resonance Audio, поскольку они работают везде без установки плагинов; при работе с нативными приложениями для Quest и Vision Pro – платформенные SDK. Самое ценное, что мы делаем на ранних этапах, – проверяем сквозную цепочку слежения за головой и акустики помещения на реальном оборудовании, потому что именно этот сбой пользователь замечает в первые десять секунд.

Частые ошибки, ломающие иммерсивный звук

Три повторяющихся отказа чаще всего сопровождаются жалобами на то, что «пространственный звук будто сломан».

Первый – несовпадение степеней свободы: 6DoF-видео при 3DoF-звуке. Пользователь идёт к объекту, картинка растёт, звук не двигается, и мозг отвергает всю сцену. Согласуйте степени свободы звука и видео.

Второй – отсутствие акустики помещения: HRTF-расположение без отражений и реверберации. Направление определяется верно, но дистанция не воспринимается, и всё звучит «в голове». Добавьте ранние отражения и позднюю реверберацию.

Третий – сломанное слежение за головой: рендерер работает корректно, но поза головы либо не доходит до него, либо приходит с большой задержкой, из-за чего поворот головы не влияет на изображение. Всегда проверяйте всю цепочку на целевом устройстве, а не только рендерер в изоляции. (О связанной проблеме синхронизации губ в WebRTC – см. синхронизация губ в WebRTC.)

Главное

  • 3DoF отслеживает только повороты головы; 6DoF добавляет перемещение тела и требует физической симуляции.
  • Согласуйте степени свободы звука со степенями свободы видео – иначе сцена будет выглядеть нереалистично.
  • ISO/IEC 23090-4:2025 (MPEG-I Immersive Audio) – новый стандарт для 6DoF-стриминга.
  • 3GPP IVAS (Release 18) поддерживает пространственный звук в вызовах со скоростью 13,2–512 кбит/с.
  • Выбирайте SDK в зависимости от платформы: Web Audio/Resonance, Meta XR, PHASE или Steam Audio.
  • Всегда включайте моделирование акустики помещения и проверяйте отслеживание головы на реальном устройстве.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.