Многоязычное аудио: дорожки, дубляж, тифлокомментарий и сурдоперевод

Автор: Николай СапуновОбновлено: август 202621 мин чтения
Содержание статьи +

Опубликовано: 2026-06-06 · Время чтения: 21 мин · Автор: Николай Сапунов, CEO Фора Софт

Коротко

Один и тот же фильм в стриминге может нести сразу много звуковых версий – язык оригинала, несколько дубляжей и отдельную дорожку, которая описывает картинку для незрячих зрителей, – а плеер выбирает одну из них по меткам, которые вы повесили на каждую дорожку в манифесте. В HLS эти метки живут в теге EXT-X-MEDIA (язык, название, дорожка по умолчанию, автовыбор и признак доступности), в DASH – в элементе AdaptationSet с дескриптором Role, значения которого включают main, alternate, dub, commentary и description. Правильные метки теперь не только вопрос качества, но и закона: США требуют 87,5 часа описанного контента в квартал на крупных сетях, а европейский Закон о доступности (EAA) сделал доступное аудио обязательным для стриминговых сервисов с июня 2025 года. Эта статья показывает, как готовить дорожки, чем различаются две модели тифлокомментирования (broadcast-mix и receiver-mix) и как посчитать, во сколько обходится «налог на многодорожечность».

Почему это важно

Если вы ведёте стриминговый продукт, конвейер локализации или OTT-платформу, аудиосторона задачи «выпусти это на семи языках» – то самое место, где мелкие ошибки в метках превращаются в неправильную дорожку у зрителя, провал аудита доступности или письмо от регулятора. Продакт-менеджер, планирующий локализацию, операционный лид, утверждающий спецификацию доставки, и инженер, собирающий манифест, – все трогают один и тот же набор тегов, и правила для этих тегов задают стриминговые стандарты (HLS и DASH) и законы о доступности (американский CVAA, европейский EAA). Эта статья объясняет простым языком, что такое каждый тип дорожки, показывает точную разметку в манифесте, которая заставляет плеер выбрать её правильно, и даёт арифметику хранения, чтобы «налог на многодорожечность» стал числом, которое можно спланировать, а не сюрпризом в облачном счёте.

Задача в одном предложении

Одно видео, много звуковых дорожек. Фильм, снятый на английском, может выйти с оригинальным английским миксом, французским дубляжом, испанским дубляжом, немецким дубляжом – и отдельно с английской дорожкой, которая описывает происходящее на экране для тех, кто не видит картинку. Изображение одинаково для всех. Меняется только звук. Задача стриминговой системы – сохранить все эти дорожки один раз, доставлять только ту, что хочет зритель, и переключаться между ними без повторной загрузки видео.

Последний пункт – это и есть причина, по которой всё работает. В современном адаптивном потоке видео и аудио хранятся в отдельных файлах, а плеер склеивает их во время воспроизведения. (Если идея разделения аудио и видео на независимые дорожки внутри контейнера для вас нова, разбор «как MP4, MKV, fMP4 и MPEG-TS несут звук» проходит по механике.) Поскольку аудио независимо, добавление десятого языка добавляет ещё один маленький звуковой файл – а не десятую полную копию фильма.

Загвоздка в том, что плееру нужно сообщить, что представляет собой каждый звуковой файл. Ему нужно знать, какой из них французский, какой оригинальный, какой описанный и какой включать первым, если зритель не выразил предпочтения. Эти инструкции живут в текстовом файле – манифесте, и остальная часть статьи о том, как его писать.

Четыре типа дорожек, которые вы реально отгрузите

Перед разметкой – словарь. В реальных каталогах встречается четыре вида звуковых дорожек, и три из них легко перепутать, потому что они «просто ещё один язык».

Дорожка языка оригинала – это звук в том виде, в каком сделан тайтл: английский для голливудского фильма, корейский для корейской дорамы. Это эталон, относительно которого измеряется всё остальное.

Дубляж – это полная замена звуковой дорожки на другом языке, где переведённые реплики сведены поверх оригинальной музыки и эффектов. Французский зритель английского фильма слышит французских актёров поверх тех же взрывов и той же музыки. Дубляж – это законченный самостоятельный микс: плеер меняет всю дорожку целиком, ничего не накладывая.

Дорожка тифлокомментария – в Европе её называют audio description (AD), в Северной Америке – described video service (DVS) – это звук для незрячих и слабовидящих зрителей. Поверх обычных реплик, музыки и эффектов диктор описывает происходящее на экране в паузах диалога: «Она прячет письмо во внутренний карман пальто и выходит под дождь». Это отдельная законченная дорожка, а не настройка обычной.

Дорожка сурдоперевода – здесь всё иначе, потому что «звуковая» потребность в доступности на самом деле визуальная: сурдопереводчик, показывающий реплики жестами. В стриминге это обычно несётся как дополнительная видеодорожка (небольшая врезка с переводчиком), а не как аудиодорожка, и где она помещается, мы разбираем в конце. Мы включаем её сюда, потому что продуктовые команды группируют её с «доступными аудиоверсиями», хотя обвязка отличается.

Почему различие важно: дубляж и описанная дорожка обе могут быть «английским аудиофайлом», но плеер не должен их путать. Зрячий французский зритель хочет французский дубляж; незрячий английский зритель хочет английскую описанную дорожку; ни один из них не хочет другую. Метки в манифесте – это то, что их разводит.

Рисунок 1. Одно видео, много дорожек. Видео хранится один раз; каждая звуковая версия – это маленький независимый файл. Плеер выбирает одну дорожку по меткам манифеста. Сурдоперевод едет отдельной видеодорожкой, а не аудио.

Как HLS маркирует звуковые дорожки

HLS – HTTP Live Streaming, стриминговый формат Apple – описывает альтернативное аудио тегом EXT-X-MEDIA. Одна строка EXT-X-MEDIA объявляет одну дорожку, а группа таких строк с одинаковым GROUP-ID говорит плееру: «вот варианты звука для этого видео». Плеер воспроизводит ровно один из них вместе с видео.

Атрибуты, которые решают выбор, определены в спецификации HLS – IETF RFC 8216, раздел 4.3.4.1. Важные для многоязычности и доступности – вот эти.

LANGUAGE несёт языковой тег вроде en, fr или es. NAME – это человекочитаемая подпись, которую видит пользователь в меню звука: «Français», «English (described)», – и RFC 8216 делает NAME обязательным атрибутом каждой дорожки. DEFAULT – перечислимое значение «да/нет»; когда оно YES, спецификация говорит, что клиент «SHOULD play this Rendition … in the absence of information from the user indicating a different choice» – то есть это дорожка, которая играет, если зритель ничего не выбрал.

AUTOSELECT тоньше. Когда оно YES, клиент «MAY choose to play this Rendition in the absence of explicit user preference because it matches the current playback environment, such as chosen system language». Так французский зритель, у которого язык устройства французский, может автоматически попасть на французский дубляж – но только если вы пометили эту дорожку AUTOSELECT=YES. RFC 8216 добавляет правило, которое стоит запомнить: «If the AUTOSELECT attribute is present, its value MUST be YES if the value of the DEFAULT attribute is YES». Дорожка по умолчанию по определению автовыбираема.

Признак доступности – это CHARACTERISTICS. Это список идентификаторов через запятую, и для аудио важен public.accessibility.describes-video. RFC 8216 говорит прямо: «An AUDIO Rendition MAY include the following characteristic: 'public.accessibility.describes-video'». Эта одна строка – то, по чему плеер и инструмент аудита доступности распознают вашу английскую описанную дорожку как тифлокомментарий, а не как второй английский дубляж.

Вот минимальная HLS-группа аудио с оригиналом, дубляжом и описанной дорожкой:

#EXT-X-MEDIA:TYPE=AUDIO,GROUP-ID="aud",LANGUAGE="en",NAME="English",DEFAULT=YES,AUTOSELECT=YES,URI="en/audio.m3u8"
#EXT-X-MEDIA:TYPE=AUDIO,GROUP-ID="aud",LANGUAGE="fr",NAME="Français",DEFAULT=NO,AUTOSELECT=YES,URI="fr/audio.m3u8"
#EXT-X-MEDIA:TYPE=AUDIO,GROUP-ID="aud",LANGUAGE="en",NAME="English (described)",DEFAULT=NO,AUTOSELECT=NO,CHARACTERISTICS="public.accessibility.describes-video",URI="en-ad/audio.m3u8"

Читайте это как три предложения. Первая дорожка английская, она по умолчанию и автовыбираема. Вторая французская, не по умолчанию, но автовыбираема для устройств с французским языком. Третья английская, никогда не по умолчанию, никогда не автовыбирается – играет только когда зритель явно её просит – и помечена как тифлокомментарий. Обратите внимание на здравое правило, зашитое в стандарт: атрибут FORCED, помечающий обязательный контент, допустим только на дорожках субтитров, никогда на аудио – RFC 8216 говорит: «The FORCED attribute MUST NOT be present unless the TYPE is SUBTITLES».

Частая ошибка здесь – оставить у описанной дорожки AUTOSELECT=YES. Устройство с французским языком и выключенным тифлокомментарием может тогда автовыбрать английскую описанную дорожку поверх французского дубляжа, и зритель услышит комментарий, который не просил. Помечайте описанные дорожки AUTOSELECT=NO и показывайте их, только когда зритель включает тифлокомментарий.

Как DASH маркирует звуковые дорожки

DASH – Dynamic Adaptive Streaming over HTTP, стандарт ISO/IEC 23009-1 – использует другую, но параллельную структуру. Каждая независимая звуковая версия – это AdaptationSet, а назначение этого набора объявляется дескриптором Role. Значения ролей берутся из опубликованного списка – схемы urn:mpeg:dash:role:2011, определённой в ISO/IEC 23009-1 и развёрнутой в руководствах DASH-IF (Part 8: Audio).

Значения ролей для многоязычности и доступности: main (основная, полностью воспроизводимая дорожка), alternate (другая полностью воспроизводимая дорожка, например дубляж), dub (дорожка, явно помеченная как переведённая/дублированная), commentary (дорожка, предназначенная для сведения с другой, как авторский комментарий или receiver-mix-тифлокомментарий) и description (дорожка, описывающая видео для доступности). Элемент <Label> несёт человекочитаемое имя для меню, а атрибут lang на AdaptationSet несёт язык.

Руководство DASH-IF точно различает, когда дорожка main/alternate, а когда commentary. Если набор адаптации – это полная звуковая услуга для прямого воспроизведения, его роль main или alternate. Если же его нужно декодировать и свести с другой полной услугой перед воспроизведением – паттерн receiver-mix, который мы объясним дальше, – его роль commentary. Роль description – это то, как плеер отличает описанную дорожку от обычного дубляжа, когда обе на одном языке.

Урезанный DASH-манифест с оригиналом, французским дубляжом и английским тифлокомментарием выглядит так:

<AdaptationSet contentType="audio" lang="en">
  <Role schemeIdUri="urn:mpeg:dash:role:2011" value="main"/>
  <Label>English</Label>
  <!-- representations … -->
</AdaptationSet>
<AdaptationSet contentType="audio" lang="fr">
  <Role schemeIdUri="urn:mpeg:dash:role:2011" value="dub"/>
  <Label>Français</Label>
</AdaptationSet>
<AdaptationSet contentType="audio" lang="en">
  <Role schemeIdUri="urn:mpeg:dash:role:2011" value="description"/>
  <Accessibility schemeIdUri="urn:tva:metadata:cs:AudioPurposeCS:2007" value="1"/>
  <Label>English (described)</Label>
</AdaptationSet>

Структура повторяет HLS один-в-один: дорожка main, дубляж, помеченный как дубляж, и тифлокомментарий с ролью description и дополнительным дескриптором Accessibility (значение 1 в стандартной схеме TV-Anytime означает «для слабовидящих, с описанием»). Если вы публикуете и DASH-поток, межсекционный разбор «структура манифеста MPEG-DASH» подробно проходит по периодам, наборам адаптации и представлениям.

Рисунок 2. Те же три дорожки в HLS и DASH. Структуры различаются, но отображаются чисто: HLS DEFAULT/AUTOSELECT/CHARACTERISTICS соответствуют DASH Role плюс дескриптор Accessibility.

Два способа доставить тифлокомментарий: broadcast-mix и receiver-mix

Тифлокомментарий бывает двух форм доставки, и выбор влияет и на стоимость хранения, и на то, какие плееры его потянут.

В модели broadcast-mix комментарий уже смешан в полную дорожку на студии. Вы отгружаете полный самостоятельный файл: реплики, музыка, эффекты и комментарий – всё сведено вместе. Плеер обращается с ним ровно как с дубляжом – это просто ещё одна законченная дорожка для подмены. Эту модель использует HLS, и она самая простая: любой плеер, умеющий переключать аудио, её воспроизведёт, потому что при декодировании ничего особенного делать не надо. Цена – хранение. 90-минутный фильм, предлагающий комментарий на пяти языках, хранит пять дополнительных полных дорожек.

В модели receiver-mix вы отгружаете только комментарий – тонкую дорожку голоса диктора и тишины – плюс инструкции, как громко сводить его поверх обычной дорожки. Плеер декодирует два потока и совмещает их в реальном времени. Хранить это гораздо дешевле, потому что дорожка комментария – это в основном тишина без музыки и эффектов, и она позволяет зрителю отдельно регулировать громкость комментария. DASH поддерживает это через роль commentary и отдельную разметку receiver-mix; это распространено в европейском вещании (DVB) и системах цифрового ТВ. Цена – возможности плеера: устройство должно уметь декодировать и сводить два потока сразу, а это умеет не каждый веб- или ТВ-плеер.

Практическое правило: если ваш охват включает браузеры и широкий набор смарт-ТВ, broadcast-mix-дорожки тифлокомментария – безопасный выбор по умолчанию, потому что от плеера ничего особенного не требуется. Если вы контролируете плеер и доминирует стоимость хранения – много тайтлов, много языков – receiver-mix эффективнее. Крупные каталоги вроде Netflix поддерживают оба паттерна в зависимости от территории и устройства.

Рисунок 3. Broadcast-mix отгружает одну полную описанную дорожку (просто для плееров, тяжелее хранить). Receiver-mix отгружает дорожку только с комментарием, которую плеер сводит с основным миксом (легко хранить, нужен способный плеер).

Что на самом деле требует закон

Доступное аудио не опционально на двух крупнейших медиарынках. Детали важны, потому что соответствие измеряется конкретными числами и конкретными датами.

В США тифлокомментарий предписан Законом о доступности связи и видео XXI века (CVAA), реализованным Федеральной комиссией по связи (FCC) в правиле 47 CFR 79.3. Крупные вещательные аффилиаты (ABC, CBS, Fox, NBC) и большие кабельные и спутниковые системы должны предоставлять 87,5 часа описанного контента в календарный квартал – примерно семь часов в неделю – из которых 50 часов должны приходиться на прайм-тайм или детские программы. Географический охват расширяется по графику: с 1 января 2026 года правило покрывает телерынки с 111-го по 120-й и продолжает расширяться на десять рынков в год. Для невещательных сетей FCC называет топ-5 раз в три года; текущий список (зафиксирован 1 июля 2024 года) – TLC, HGTV, Hallmark, TNT и TBS, причём TNT и TBS имеют ограниченное освобождение до 30 июня 2027 года.

В Европе Закон о доступности (EAA) вступил в силу 28 июня 2025 года. Он делает функции доступности – включая тифлокомментарий, где применимо – обязательными для широкого набора цифровых услуг, и аудиовизуальные медиауслуги попадают в его сферу. Технический ориентир – гармонизированный стандарт EN 301 549, ссылающийся на Рекомендации по доступности веб-контента (WCAG). EAA работает вместе с Директивой об аудиовизуальных медиауслугах (AVMSD), которая требует от стран-членов поощрять провайдеров постепенно делать контент доступным через субтитры, тифлокомментарий и сурдоперевод. EAA даёт переходный период для части ранее опубликованного контента, но от новых каталогов по запросу ожидают соответствия.

Сами рекомендации по доступности проводят полезную черту. По WCAG тифлокомментарий для записанного видео – требование уровня AA (критерий 1.2.5), на который нацелено большинство законов. Сурдоперевод записанного аудио – критерий 1.2.6 уровня AAA, желательного. Эта разница объясняет, почему тифлокомментарий трактуется как базовая юридическая обязанность, а сурдоперевод чаще остаётся добавленной ценностью.

Практическое следствие для инженерии: описанные дорожки – не «приятное дополнение», которое добавляют потом. Если ваш каталог обслуживает США или ЕС, описанная дорожка и её правильная разметка в манифесте – часть спецификации доставки, и аудит доступности проверит, что public.accessibility.describes-video (HLS) или роль description и дескриптор назначения аудио (DASH) действительно присутствуют и выставлены верно.

Сурдоперевод: визуальная дорожка доступности

Сурдоперевод группируют с доступным аудио при планировании продукта, но технически это задача видео. Переводчик показывает реплики жестами, так что контент доступности – это движущаяся картинка, а не звук.

Доставить его можно двумя способами. Проще – открытый сурдоперевод – впечатывает переводчика навсегда в небольшую врезку внутри основного видео – окно «картинка-в-картинке», обычно в нижнем углу, иногда смещённое, чтобы не закрывать текст на экране. Его видят все; выключить нельзя. Гибче – закрытый сурдоперевод – отгружает переводчика отдельной переключаемой видеодорожкой (в DASH – отдельный видео-AdaptationSet, часто с ролью sign), которую плеер может показать или скрыть и, в идеале, развернуть на полный экран по запросу. Оба подхода работают со стандартными плеерами HLS и DASH; закрытый дружелюбнее, потому что не заставляет смотреть врезку тех, кому она не нужна.

Причина, по которой это уровень AAA, а не AA, отчасти в стоимости, отчасти в меньшей затронутой аудитории, но инженерный паттерн стоит знать: когда продуктовая команда просит «поддержку сурдоперевода», она просит дополнительное видеопредставление и UI плеера для его включения, а не дополнительную запись в группе аудио.

Арифметика хранения и CDN

Каждая лишняя дорожка стоит байтов на хранение и байтов на доставку. Арифметика проста, и проделав её один раз, вы снимаете страх «не взорвут ли десять языков счёт?».

Возьмём 90-минутный фильм. Битрейт аудио измеряется в килобитах в секунду (kbps) – тысячах бит каждую секунду. Стереодубляж на типичном стриминговом битрейте 128 kbps считается так:

размер (бит)   = битрейт (бит/с) × длительность (с)
               = 128 000 × (90 × 60)
               = 128 000 × 5400
               = 691 200 000 бит
размер (байт)  = 691 200 000 ÷ 8
               ≈ 86 400 000 байт
               ≈ 86 МБ

Значит, одна стереодорожка языка для 90-минутного фильма – около 86 МБ. Отгрузите восемь языков дубляжа и добавите примерно 8 × 86 МБ ≈ 691 МБ – меньше трёх четвертей гигабайта. Теперь сравните с видео. Одно представление 1080p того же фильма, скажем, на 5 Mbps (5000 kbps):

5 000 000 × 5400 ÷ 8 ≈ 3 375 000 000 байт ≈ 3,4 ГБ

Одно только представление 1080p – около 3,4 ГБ. Восемь дополнительных языковых дорожек вместе (≈ 0,69 ГБ) стоят примерно пятую часть одного видеопредставления – а реальная адаптивная лестница хранит несколько видеопредставлений, так что аудио – малая доля общего объёма. Ключевая мысль: языки аудио дёшевы относительно видео. Описанная broadcast-mix-дорожка стоит те же ~86 МБ, что и дубляж; receiver-mix-дорожка комментария, в основном тишина, часто сжимается до доли этого.

Исключение – иммерсивное аудио. Дорожка Dolby Atmos для того же фильма, на стриминговом битрейте около 768 kbps, – примерно:

768 000 × 5400 ÷ 8 ≈ 518 400 000 байт ≈ 518 МБ

То есть один язык Atmos – около шести стереоязыков. Предлагать Atmos на восьми языках (≈ 4,1 ГБ) уже сопоставимо с самим видео, поэтому сервисы обычно ограничивают иммерсивное аудио оригиналом и небольшим числом премиальных дубляжей. (Иммерсивную сторону разбирает статья «Atmos и иммерсивное аудио в стриминге».) Чтобы прогнать эти числа для своего каталога, используйте памятку ниже – на одной странице собраны размеры по языкам, теги разметки и юридические пороги.

Частая ошибка: рассинхрон языкового тега

Самый частый продакшен-баг в многоязычном аудио – не битрейт и не микс, а несовпадающий или отсутствующий языковой тег. Если внутренние метаданные файла говорят eng, а LANGUAGE (HLS) или lang (DASH) в манифесте говорит fr, разные плееры разрешают конфликт по-разному – одни верят манифесту, другие файлу – и меню показывает неправильную подпись или автовыбирает неправильную дорожку. Тот же класс багов прячет описанную дорожку, когда её CHARACTERISTICS или дескриптор Accessibility теряется при переупаковке, и тогда тихо проваливается аудит доступности, хотя само аудио идеально. Проверяйте, что тег манифеста, метаданные контейнера и подпись в меню согласованы для каждой дорожки на каждом прогоне упаковки – теги это контракт, а тихий рассинхрон хуже отсутствующей дорожки, потому что его никто не заметит, пока не пожалуется зритель.

Где здесь Фора Софт

Многоязычное и доступное аудио встречается во всех видеопродуктах, которые мы строим. В OTT- и интернет-ТВ-платформах работа – это сборка корректных манифестов HLS и DASH, чтобы дубляжи, оригинальные и описанные дорожки надёжно выбирались в браузерах, на мобильных и на смарт-ТВ. В онлайн-образовании и телемедицине многоязычное аудио и доступность часто требование закупки, и стек описанных дорожек и субтитров должен пройти аудит. В видеоконференцсвязи и AR/VR языковые дорожки и фиды переводчиков в реальном времени поднимают те же вопросы разметки в живом сценарии. Во всех этих вертикалях повторяется одна задача: заставить плеер выбрать правильную дорожку каждый раз для каждого зрителя – и доказать, что он это делает.

Главное

  • Одно видео, много дорожек; плеер выбирает одну по меткам манифеста.
  • HLS размечает аудио тегом EXT-X-MEDIA: LANGUAGE, NAME, DEFAULT, AUTOSELECT, CHARACTERISTICS.
  • DASH размечает аудио через AdaptationSet плюс Role: main, dub, description, commentary.
  • Помечайте описанные дорожки public.accessibility.describes-video (HLS) или ролью description (DASH).
  • Broadcast-mix прост для плееров; receiver-mix дешевле хранить, но нужен способный плеер.
  • Закон США требует 87,5 описанных часа в квартал; EAA сделал доступное аудио обязательным с июня 2025.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.