Пространственный звук в VR/AR-стриминге

Автор: Николай СапуновОбновлено: август 202615 мин чтения
Содержание статьи +

Кратко

Пространственный звук в VR и AR держится на одном различии: реагирует ли звук только на то, куда вы смотрите (три степени свободы, 3DoF), или ещё и на то, куда вы идёте (шесть степеней свободы, 6DoF). 3DoF вращает фиксированное звуковое поле вокруг головы – это дёшево, хорошо поддерживается и достаточно для 360-видео; 6DoF должен заново вычислять дистанцию, направление и акустику помещения по мере вашего движения, и именно эту сложную задачу решает новый стандарт ISO/IEC 23090-4:2025 «MPEG-I Immersive Audio», опубликованный в ноябре 2025 года. Инструменты, которыми вы реально пользуетесь – Google Resonance Audio, Steam Audio от Valve, Meta XR Audio SDK, Apple PHASE и браузерный Web Audio API – под капотом делают три одинаковые задачи (разместить звуки, добавить отражения, свести в наушники через HRTF), но различаются глубиной симуляции и ценой в CPU и битрейте. Выбирайте 3DoF, если пользователь не передвигается физически, закладывайте акустику помещения с первого дня и никогда не отгружайте пространственный звук без проверки сквозного слежения за головой.

Почему это важно

Если вы планируете VR-тренажёр, 360-трансляцию, AR-навигацию или опыт «обойти виртуальный шоурум», то звуковое решение, принятое на первой неделе, определяет счёт за трафик, бюджет задержки и поверит ли пользователь в реальность мира. Эта статья – для продакт-менеджера, основателя или операционного лида, которому нужно поставить задачу команде или оценить заявление вендора об «immersive-аудио», и который никогда не слышал про степень свободы. Старший аудиоинженер тоже её прочтёт и должен найти каждое число точным; число каналов, диапазоны битрейтов и редакции стандартов здесь восходят к ISO, 3GPP, W3C и инженерной документации вендоров, а не к маркетингу. К концу вы поймёте, когда стоит платить за 6DoF, какой SDK подходит вашей платформе, и три ошибки, из-за которых пространственный звук схлопывается в плоский ком внутри головы слушателя.

Различие, которое решает всё: 3DoF и 6DoF

В VR/AR-аудио всё начинается с подсчёта того, как может двигаться голова. «Степень свободы» – это один независимый способ изменить положение или ориентацию головы. Их ровно шесть.

Первые три – вращения, то, как голову можно повернуть, не вставая со стула. Поворот влево-вправо – это yaw. Кивок вверх-вниз – pitch. Наклон уха к плечу – roll. Система, отслеживающая только эти три, называется 3DoF. Она знает, куда вы смотрите, но не знает, где вы стоите.

Остальные три – перемещения, движение всего тела в пространстве. Шаг влево-вправо – одна ось, вперёд-назад – вторая, присесть-встать – третья. Система, отслеживающая все шесть (три вращения плюс три перемещения), называется 6DoF. Она знает и где вы, и куда смотрите.

Вот почему это единственное различие управляет всем проектом. При 3DoF источник звука остаётся на той же дистанции что бы вы ни делали – к нему нельзя подойти. Системе нужно лишь вращать поле вокруг головы при повороте. Это дешёвая операция. При 6DoF приближение к звуку должно делать его громче, а направление – смещаться; проход мимо отправляет его за спину, а стена между вами глушит его. Это физическая симуляция, и она дорогая.

Конкретное правило прямо из работы над стандартами: если видео даёт пользователю 6DoF, то и звук должен давать 6DoF, иначе опыт ломается. Требования MPEG-I формулируют это прямо – если картинка позволяет ходить, а звук за ней не следует, вы слышите говорящего не оттуда, где его видите, что раздражает сильнее, чем полное отсутствие пространственного звука. Степени свободы звука = степени свободы видео.

Рисунок 1. Шесть степеней свободы. 3DoF отслеживает три вращения и вращает звуковое поле; 6DoF добавляет три перемещения и должен пересчитывать дистанцию, направление и перекрытие при движении слушателя.

Что на самом деле вычисляет «пространственный звук»

Если убрать маркетинг, любой VR/AR-движок делает три задачи по порядку. Понимание их позволяет читать список функций вендора и видеть, чего не хватает.

Первая задача – размещение: решить, где относительно слушателя находится каждый звук, и корректировать это при повороте или движении. Для наушников это значит превратить направление в два ушных сигнала, которые это направление породило бы, с помощью измерения того, как голова и уши меняют звук, – это передаточная функция головы, или HRTF. Подробно HRTF, амбисонику и бинауральный рендеринг мы разобрали в статье амбисоника, HRTF и бинауральный рендеринг; здесь важен лишь итог: любой движок применяет HRTF, чтобы плоские наушники звучали как 3D-комната.

Вторая задача – акустика помещения: отражения и реверберация, которые сообщают мозгу о размере пространства и дистанции до звука. Голос без отражений сухой и «в голове». Добавьте ранние отражения (первые отскоки от ближних стен) и позднюю реверберацию (рассеянный хвост) – и тот же голос встаёт в комнату на правдоподобной дистанции. Документация Meta говорит прямо: HRTF дают сильные признаки направления, но без эффектов помещения звуки «часто звучат сухо и безжизненно», а отражения – основной признак дистанции.

Третья задача – рендеринг: свести всю сцену к двум каналам, которые реально играют наушники (реже – к раскладке колонок). Здесь встречаются амбисоническое поле и HRTF. Удачная оптимизация Resonance Audio: смешать все источники в одно общее амбисоническое поле высокого порядка, а затем применить HRTF один раз ко всему полю, а не к каждому источнику. Поэтому Resonance может пространственно обрабатывать сотни источников на телефоне: дорогой шаг HRTF выполняется фиксированное число раз независимо от количества звуков.

«Подводный камень – размещение без акустики помещения. Самая частая ошибка: пространственно обработать источники через HRTF, услышать корректное лево-право-верх-низ и объявить победу. Без ранних отражений и реверберации дистанция нечитаема, и всё кажется приклеенным к голове. Закладывайте акустику помещения на первой неделе, а не как «полировку второй фазы».»

Стандарты, которые только что изменили картину

Почти всё прошлое десятилетие у 6DoF-аудио не было единого стандарта – каждая платформа делала своё. Это изменилось в конце 2025 года.

MPEG-I Immersive Audio (ISO/IEC 23090-4:2025)

Главный – ISO/IEC 23090-4:2025, который MPEG называет MPEG-I Immersive Audio, опубликован как полный международный стандарт 3 ноября 2025 года (документ на 625 страниц; ISO/IEC 23090-4:2025). Его аннотация точна в области применения: он «специфицирует технологию, поддерживающую интерактивный рендеринг в реальном времени immersive-аудиопрезентации VR или AR, позволяя пользователю иметь 6DoF-движение в аудиосцене», и определяет как метаданные для рендеринга, так и синтаксис битстрима для эффективного хранения и стриминга.

Что он добавляет к предыдущему поколению – важно для выбора формата. Прежний стандарт MPEG-H 3D Audio поддерживал только 3DoF – поворот головы в фиксированной «сладкой точке». MPEG-I строится на MPEG-H и расширяет его до полного 6DoF: слушатель может перемещаться по сцене (x, y, z), а рендерер симулирует реальную акустическую физику – реверберацию, ранние отражения, перекрытие (стена глушит звук), дифракцию (звук огибает край) и даже эффект Доплера движущегося источника (обзор MPEG-I Immersive Audio, MPEG WG 6). Стандарт достиг стадии FDIS на 149-м заседании MPEG в Женеве в январе 2025 года и был опубликован в ноябре; сводка верификационных тестов вышла на MPEG 153 в январе 2026 года.

IVAS: пространственный звук в телефонном звонке (3GPP Release 18)

Второй новый стандарт нацелен на связь в реальном времени, а не на стриминг контента. IVASImmersive Voice and Audio Services – кодек 3GPP, доступный с Release 18, построенный на и обратно совместимый с речевым кодеком EVS из семейства речевых кодеков. IVAS несёт пространственный звук через мобильную сеть: моно, стерео, многоканальный, амбисоника и объектный звук, плюс параметрический формат MASA (3GPP IVAS; материалы Fraunhofer IIS).

Число, которое стоит запомнить, – диапазон битрейта: 13,2–512 кбит/с для immersive-режимов. Параметрический режим может передавать три-четыре свободно размещённых объекта всего на 24,4 или 32 кбит/с и восстанавливать их пространственные позиции на приёмнике. IVAS бинаурализует на приёмном устройстве, поддерживает слежение за головой и ориентацию слушателя, добавляет акустику помещения через бинауральные импульсные характеристики или синтез отражений – что делает его естественным выбором для пространственного звука в WebRTC-конвейере реального времени, когда его начнут поддерживать операторы и устройства.

Инструменты, которыми вы реально воспользуетесь

Вы редко будете сами реализовывать HRTF-математику. Вы выберете SDK. Вот пять, которые важны в 2026-м, и для чего каждый.

Google Resonance Audio – кроссплатформенная open-source рабочая лошадка. Работает на Android, iOS, Unity, Unreal, FMOD, Wwise и – что особенно полезно для стриминга – в вебе через Web Audio API. Проецирует все источники в общее амбисоническое поле высокого порядка ради дешёвой цены за источник, поддерживает регулируемый порядок амбисоники, перекрытие, ближнее поле и геометрическую реверберацию (документация Resonance Audio, Google). Выбор по умолчанию, когда нужен один подход и в нативных приложениях, и в браузере.

Steam Audio от Valve – выбор, когда важна физическая точность: архитектурные обходы, VR-игры высокого класса. Физически моделирует отражения от геометрии сцены и может рендерить отражения в амбисонике третьего порядка с опциональным GPU-ускорением (Steam Audio; AMD TrueAudio Next). Больше симуляции, больше CPU, выше реализм.

Meta XR Audio SDK – нативный путь для Meta Quest. Даёт объектную и амбисоническую пространственную обработку на основе HRTF плюс симуляцию акустики помещения, с интеграциями для Unity, Unreal, FMOD и Wwise (документация Meta Horizon OS). Заметка для планирования: на 2025 год SDK заморожен на версии 85.0 – стабилен и отгружается, но новые функции не добавляются.

Apple PHASEPhysical Audio Spatialization Engine – нативный путь на платформах Apple, включая Vision Pro. PHASE позволяет описывать источники как геометрические фигуры и поддерживает прямой путь, ранние отражения и позднюю реверберацию; на visionOS ReverbComponent с пресетами смешивает реальную акустику комнаты с выбранной реверберацией в зависимости от уровня погружения (Apple Developer, PHASE/WWDC и документация visionOS). Используйте, когда вы целиком в стеке пространственных вычислений Apple.

Web Audio API – браузерный базовый вариант, и первый, к которому тянутся стриминговые команды. Его PannerNode располагает источник в 3D и при panningModel: "HRTF" применяет HRTF-фильтрацию относительно AudioListener, который вы двигаете и вращаете вслед за головой (W3C Web Audio API; MDN). Встроен в каждый современный браузер, не требует установки и сочетается с WebXR для VR в браузере. Независимое исследование нашло, что PannerNode с HRTF разместил цели точнее некоторых библиотечных альтернатив в браузерном тесте – напоминание, что встроенный путь реально пригоден, а не запасной.

SDK / APIПлатформыЛучше дляАкустика помещенияЗаметки
Resonance AudioAndroid, iOS, Unity, Unreal, WebОдин подход вездеГеометрическая реверберацияОбщее амбисоническое поле → дёшево за источник
Steam AudioWindows, Unity, UnrealФизическая точность, VR-игрыФизическое моделирование отраженийTOA-отражения; опционально GPU
Meta XR Audio SDKMeta Quest (Unity/Unreal/FMOD/Wwise)Нативные приложения QuestHRTF + симуляция помещенияЗаморожен на v85.0 (2025)
Apple PHASEiOS, macOS, visionOSПространственные вычисления AppleПрямой путь + отражения + реверберацияПресеты ReverbComponent в visionOS
Web Audio APIЛюбой современный браузерСтриминг, WebXR, без установкиВручную (convolver/reverb)PannerNode panningModel:"HRTF"

Таблица 1. Пять инструментов пространственного звука для VR/AR в 2026-м. Источники: документация Resonance Audio (Google); Steam Audio (Valve/AMD); документация Meta Horizon OS; Apple Developer (PHASE, visionOS); W3C Web Audio API + MDN.

Вопрос полосы: сколько стоит стримить пространственный звук

Пространственный звук не бесплатен в канале, и цена целиком зависит от передаваемого формата.

Для стримингового 360-видео обычный путь – амбисоника первого порядка, FOA – четыре канала (W, Y, Z, X). Спецификация пространственного звука YouTube, например, принимает FOA как 4-канальную дорожку на 48 кГц, опционально плюс 2-канальное head-locked стерео для нарратива или музыки, которые не должны вращаться с головой (подробно в статье амбисоника, HRTF и бинауральный рендеринг). Четыре канала – минимум для «звука с любой стороны»; амбисоника третьего порядка (16 каналов) даёт более чёткую локализацию при вчетверо большем числе каналов.

Поставим число. Возьмём FOA, закодированный кодеком Opus на скромной скорости на канал:

каналов FOA       = 4
скорость на канал = 64 кбит/с
итого             = 4 × 64 = 256 кбит/с

Теперь случай третьего порядка при той же скорости на канал:

каналов TOA       = 16
скорость на канал = 64 кбит/с
итого             = 16 × 64 = 1024 кбит/с ≈ 1 Мбит/с

То есть переход от грубого к чёткому пространственному разрешению – четырёхкратный скачок полосы по звуку, примерно с четверти мегабита до полного мегабита в секунду. Для живой 360-трансляции на тысячи зрителей этот аудионалог – реальные деньги; та же математика хранения и доставки, что в статье математика хранения и CDN для звука. Для связи в реальном времени контрапункт – параметрический объектный режим IVAS: три-четыре размещённых объекта на 24,4–32 кбит/с, потому что он передаёт параметры, а не полные каналы.

Правило планирования: стримьте FOA (≈256 кбит/с), если контенту реально не нужна точность высокого порядка, и резервируйте объектную или MPEG-I-доставку для опыта, где пользователь может перемещаться.

Решение за пять минут

Сложив части, выбор обычно быстр. Задайте три вопроса по порядку.

Первый: может ли пользователь физически перемещаться по сцене или только смотреть вокруг? Если только смотреть – сидячий VR, 360-видео, фиксированный AR-оверлей – нужен 3DoF, и FOA через обычный кодек достаточно. Если может ходить – VR в полный рост, игра на Quest, AR «обойти здание» – нужен 6DoF, и вы в зоне объектного звука или MPEG-I Immersive Audio.

Второй: на какой вы платформе? Браузер и кроссплатформа → Web Audio API или Resonance Audio. Meta Quest → Meta XR Audio SDK. Apple Vision Pro → PHASE. Физически точная VR-игра → Steam Audio. Пространственный голос уровня звонка → IVAS, когда устройства начнут поддерживать.

Третий: нужна ли правдоподобная дистанция? Если да – а для любого опыта с ходьбой ответ «да» – нужно включить акустику помещения (ранние отражения плюс реверберацию), а не только HRTF-размещение. Этот шаг команды пропускают, а потом удивляются, почему звук плоский.

Рисунок 2. Дерево решений на пять минут. Движение решает 3DoF или 6DoF; платформа решает SDK; правдоподобие дистанции решает, обязательна ли акустика помещения.

Где здесь Фора Софт

Фора Софт строит видеостриминг, WebRTC-конференции и AR/VR-софт с 2005 года, и звук – то, на чём immersive-проекты чаще всего спотыкаются перед запуском. В работе над VR-тренажёрами и 360-стримингом повторяется одна задача – согласовать степени свободы звука со степенями свободы видео (3DoF-звук для 360-лекции, полный позиционный звук для walk-around симуляции) и аккуратно провести слежение за головой, чтобы поворот реально двигал звук. В браузерных и конференц-контекстах мы опираемся на Web Audio API и Resonance Audio, потому что они работают везде без плагина; в нативной работе с Quest и Vision Pro – на платформенные SDK. Самое ценное, что мы делаем рано, – проверяем сквозную цепочку слежения за головой и акустики помещения на реальном железе, потому что это тот режим отказа, который пользователь замечает в первые десять секунд.

Частые ошибки, ломающие immersive-звук

Три повторяющихся отказа дают большинство жалоб «пространственный звук как будто сломан».

Первый – несовпадение степеней свободы: 6DoF-видео при 3DoF-звуке. Пользователь идёт к объекту, картинка растёт, звук не двигается, и мозг отвергает всю сцену. Согласуйте степени свободы звука и видео.

Второй – нет акустики помещения: HRTF-размещение без отражений и реверберации. Направление верное, но дистанция нечитаема, и всё звучит «в голове». Добавьте ранние отражения и позднюю реверберацию.

Третий – сломанное слежение за головой: рендерер корректен, но поза головы до него не доходит или доходит со слишком большой задержкой, так что поворот головы не двигает мир. Всегда тестируйте всю цепочку на целевом устройстве, а не рендерер в изоляции. (О связанной проблеме синхронизации губ в WebRTC – см. синхронизация губ в WebRTC.)

Главное

  • 3DoF отслеживает только вращение головы; 6DoF добавляет положение тела и требует физической симуляции.
  • Согласуйте степени свободы звука со степенями свободы видео, иначе сцена ломается.
  • ISO/IEC 23090-4:2025 (MPEG-I Immersive Audio) – новый стандарт 6DoF-стриминга.
  • 3GPP IVAS (Release 18) несёт пространственный звук в звонках на 13,2–512 кбит/с.
  • Выбирайте SDK по платформе: Web Audio/Resonance, Meta XR, PHASE или Steam Audio.
  • Всегда включайте акустику помещения и проверяйте слежение за головой на реальном железе.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.