Субтитры, скрытые субтитры и тифлокомментарии: стек доступности видео

Автор: Николай СапуновОбновлено: август 202611 мин чтения
Содержание статьи +

Коротко

Доступность для видео – это не одна функция, а целый стек отдельных дорожек, и каждая обслуживает своё чувство: текст, показывающий, что говорят, для тех, кто не слышит, и звуковая закадровая речь, рассказывающая, что показывают, для тех, кто не видит. Текстовая сторона делится на обычные скрытые субтитры (captions), субтитры для глухих и слабослышащих (SDH) и переводные субтитры; звуковая сторона – это дорожка тифлокомментария (audio description, AD), дополнительная закадровая речь, втиснутая в паузы между репликами. В 2026 году эти дорожки уже не опциональный лоск: Европейский акт о доступности (EAA) требует их на большинстве коммерческих стримингов с июня 2025 года, а в США действуют правила для вещания и государственного видео. Эта статья простым языком разбирает каждый слой, объясняет, какой формат файла и какой флаг сигнализации его доставляет и как спланировать весь стек, не переделывая конвейер упаковки.

Почему это важно

Если вы ведёте стриминговый сервис, платформу онлайн-обучения или любой продукт, который публикует видео для аудитории в ЕС, дорожки доступности в 2025 году перешли из разряда «было бы хорошо» в «требуется по закону», а ошибка в форматах означает, что плеер не покажет нужную дорожку, даже если сам файл правильный. Статья написана для продакт-менеджеров, основателей и инженеров, которым нужно оценить объём работ по доступности, говорить с вендором упаковки без блефа и понимать, почему «мы добавили субтитры» не означает «мы соответствуем требованиям». К концу вы сможете назвать каждую дорожку стека, сказать, какой формат и флаг её несёт, и распознать три ошибки, которые тихо ломают доступность в продакшене.

Одна идея: два чувства, два направления

Вся тема раскрывается, как только вы видите, что дорожки доступности текут в двух противоположных направлениях, потому что обслуживают две разные особенности.

Человеку, который не слышит, нужно превратить звук во что-то видимое. Это текст на экране – произносимые слова плюс значимые незвуковые события вроде хлопнувшей двери или тревожной музыки. Информация перетекает из звуковой дорожки в текстовую. (Если само понятие «звуковой дорожки» как потока отсчётов для вас новое, начните с нашего вводного материала о том, что такое цифровой звук.)

Человеку, который не видит, нужно превратить картинку во что-то слышимое. Это дополнительные произносимые слова – диктор описывает действие, сцену и любой экранный текст, который никто не проговаривает вслух. Информация перетекает из видеодорожки в дополнительную звуковую дорожку.

Всё остальное в этой статье – детали, навешенные на эту рамку. Субтитры и captions – это сторона «увидеть звук». Тифлокомментарий – сторона «услышать картинку». Их создают разные люди, доставляют в разных форматах файлов и сигнализируют плееру разными флагами – поэтому команда, которая считает «доступность» одним чекбоксом, обычно реализует лишь половину.

Рисунок 1. Два направления доступности. Captions и SDH превращают звук в текст; тифлокомментарий превращает картинку в дополнительную речь.

Сторона «увидеть звук»: captions, SDH и субтитры

Три вещи выглядят на экране почти одинаково – белый текст внизу, – но это не одна и та же дорожка, и путаница между ними – самая частая ошибка доступности.

Субтитры (subtitles) предполагают, что вы слышите. Они нужны, чтобы перевести реплики на другой язык, поэтому несут только произносимые слова. Французский фильм с английскими субтитрами даёт слышащему зрителю диалоги по-английски и ничего больше, ведь взрыв он и так слышит.

Скрытые субтитры (captions) предполагают, что вы не слышите. Дорожка captions, часто называемая closed caption, несёт реплики плюс незвуковую информацию, которую глухой зритель иначе пропустил бы: [хлопает дверь], [напряжённая музыка] и указание, кто говорит, когда это неочевидно. «Closed» означает, что зритель может включить или выключить их; «open» captions впечатаны в картинку и не убираются.

SDH – текст, чьё название расшифровывается как «субтитры для глухих и слабослышащих» (subtitles for the deaf and hard of hearing), – это современная золотая середина. Это переводной субтитр, который также несёт незвуковые события и указания говорящего, как сделали бы captions. SDH существует потому, что стриминг глобален: глухому зрителю в Испании, смотрящему американский сериал, нужны и перевод, и звуковые подсказки, а SDH – единственная дорожка, делающая и то и другое. На практике стриминговые платформы поставляют SDH там, где вещание поставило бы отдельные captions.

«Частая ошибка: поставить субтитры и назвать это captions. Субтитровая дорожка, которая лишь переводит реплики, не удовлетворяет требованию доступности, потому что отбрасывает звуковые эффекты, музыкальные подсказки и идентификацию говорящего, на которые опирается глухой зритель. Автоматически сгенерированные «субтитры» из движка распознавания речи – это субтитры, а не captions: они транскрибируют слова, но не придумают [звонит телефон]. Если в нормативе сказано «captions» или «SDH», обычный переводной субтитр не соответствует, какими бы точными ни были слова.»

Форматы, которые несут текст на экране

Текстовую дорожку нужно упаковать в формат, понятный плееру. Четыре названия покрывают почти всё, что вы встретите.

Два старых вещательных формата – CEA-608 и CEA-708 (также пишутся CTA-608 / CTA-708). CEA-608 – это исходный американский аналоговый caption «line 21», ограниченный единым стилем и несколькими цветами; CEA-708 – его цифровой преемник, переносимый внутри транспортного потока MPEG эфирного и кабельного вещания, с более богатым оформлением и несколькими сервисными каналами. Декодер 708 обязан декодировать и встроенный 608, поэтому они путешествуют вместе. Вы встречаете их всякий раз, когда принимаете видео вещательного происхождения.

Для интернета доминируют два формата. WebVTT (Web Video Text Tracks) – это текстовый формат caption, на котором построена веб-доставка: небольшой файл .vtt из меток времени и строк, – и именно его требует Apple для captions в HLS. IMSC (профиль языка разметки TTML, также называемый IMSC1) – это вариант вещательного класса: он выживает в строгой упаковке, поддерживает точное позиционирование и цвет и является единственным профилем TTML, который допускает современный контейнер CMAF. Правила переноса обоих во фрагментированном MP4 – строки кодеков wvtt для WebVTT и stpp для IMSC – определены в ISO/IEC 14496-30, так что одна и та же полезная нагрузка caption может питать и HLS, и DASH из одного конвейера упаковки.

Практичная позиция в 2026 году – поставлять WebVTT как универсальную текстовую дорожку и добавлять IMSC только там, где этого требует типографика или контракт с платформой. Механику контейнеров для дорожек caption в HLS, DASH и CMAF мы разбираем в статье об аудио в HLS, DASH, CMAF.

Тип дорожкиКого обслуживаетНесёт незвуковые события?Типичный формат
СубтитрыСлышащих, другой языкНетWebVTT, IMSC
Captions (CC)Глухих / слабослышащих, тот же языкДаCEA-608/708, WebVTT
SDHГлухих / слабослышащих, часто переводДаWebVTT, IMSC
Open captionsВсех (впечатаны)ДаПиксели в видео

Сторона «услышать картинку»: тифлокомментарий

Тифлокомментарий, сокращённо AD (audio description, в нормативах США – video description), – это дорожка, о которой большинство команд забывает. Это вторая закадровая речь, записанная диктором-тифлокомментатором, которая объясняет важную визуальную информацию – действия, смены сцен, выражения лиц и экранный текст – и подмешивается в паузы между репликами, чтобы не накладываться на актёров.

Есть две разновидности, и разница между ними – реальный инженерный выбор. Стандартный тифлокомментарий вписывает закадровую речь в существующие паузы фонограммы; он работает, когда реплик достаточно мало, чтобы оставить место. Расширенный тифлокомментарий (extended) может ставить видео на паузу, когда пауз слишком мало для всего, что нужно описать: картинка замирает, диктор говорит, затем воспроизведение продолжается. Стандартный AD – обычное требование уровня AA для веба; расширенный AD – более высокая планка уровня AAA, и в массовом стриминге он редок, потому что пауза в видео ломает поток просмотра. На платформах, где есть и иммерсивный звук, дорожка комментария обычно идёт как обычный стерео-вариант рядом с иммерсивными, а не как объект в иммерсивном миксе Atmos, – это упрощает и авторинг, и выбор.

Важно: тифлокомментарий доставляется как отдельная звуковая дорожка, а не как текст. Это полноценный альтернативный микс – оригинальная фонограмма с подмешанной закадровой речью, – выбираемый так же, как зритель выбирает дублированный язык. Поэтому он относится к звуковому стеку и использует ту же многодорожечную обвязку, что мы описываем в статье про многоязычное аудио, дубляж и описательный звук. Поскольку микс AD – это полная дорожка, он должен соответствовать тем же целям громкости, что и любой другой вариант, – см. нормализацию громкости (EBU R128, ITU-R BS.1770, ATSC A/85), – чтобы закадровая речь не была ни заглушена, ни резка на фоне программного звука.

Сигнализация: как плеер узнаёт, какая дорожка доступная

Правильная дорожка AD или SDH, которую плеер не может найти, не лучше, чем её отсутствие. У каждой системы доставки есть конкретный флаг, помечающий дорожку как доступную, и пропуск этого флага – вторая классическая ошибка.

В HLS звуковой вариант, несущий комментарий, помечается в плейлисте CHARACTERISTICS="public.accessibility.describes-video"; рекомендация Apple по авторингу также советует ставить AUTOSELECT=YES, чтобы плеер мог выбрать его, когда устройство пользователя запрашивает тифлокомментарий. Вариант caption для глухих помечается public.accessibility.describes-spoken-dialog,public.accessibility.describes-music-and-sound.

В DASH ту же задачу несут два дескриптора MPEG-DASH: дескриптор Role и дескриптор Accessibility на adaptation set. Звуковая дорожка тифлокомментария использует схему классификации назначения звука (urn:tva:metadata:cs:AudioPurposeCS:2007), а текстовая дорожка SDH – роль caption. Спецификация совместимости DASH-HLS, CTA-5005, выстраивает эти флаги так, что один пакет может обслуживать обе системы.

«Частая ошибка: непомеченная или включённая по умолчанию дорожка комментария. Повторяются два сценария сбоя. Первый: звук AD присутствует, но не несёт никакой характеристики доступности, поэтому плеер показывает его как ещё один язык, и пользователи скринридеров никогда не получают его автовыбором. Второй – наоборот: дорожка комментария случайно помечена как звук по умолчанию, и тогда каждый зритель слышит диктора, описывающего сцену, заводит баг, а поддержка недоумевает. Ставьте флаг доступности и никогда не делайте дорожку комментария звуком по умолчанию.»
Рисунок 2. Полный стек доступности. У каждой дорожки своя аудитория, формат и флаг сигнализации.

Правила: кто что требует в 2026 году

Коммерческая важность этого стека в том, что он теперь обязателен, а требования различаются по регионам. Приведённые ниже цифры – несущие при оценке объёма работ.

В Европейском союзе Европейский акт о доступности (EAA) вступил в силу 28 июня 2025 года. Он требует, чтобы большинство потребительских цифровых сервисов – включая стриминг и видео по запросу, продаваемые жителям ЕС, даже компаниями вне ЕС, – были доступными, что для видео означает предоставление captions/SDH и тифлокомментария. Новый контент, опубликованный с июня 2025 года, должен соответствовать; у существующих каталогов обычно есть время до 2030 года. Национальные законы, имплементирующие EAA, задают точные пороги, а вещательные квоты доступности (субтитрирование высокого процента программ) продолжают действовать по аудиовизуальным правилам ЕС и техническому стандарту EN 301 549.

В Соединённых Штатах картина разделена по среде. FCC в рамках Закона о коммуникациях и видеодоступности XXI века (CVAA) требует скрытого субтитрирования и – для крупнейших вещателей и сетей – видеоописания на установленном числе часов программ. Для веб-видео, публикуемого органами власти штатов и местного уровня, правило DOJ по ADA Title II от 2024 года требует соответствия WCAG 2.1 уровня AA; сроки соответствия были продлены в 2026 году, поэтому организации, обслуживающие 50 000 и более человек, должны соответствовать к 26 апреля 2027 года, а меньшие – к 26 апреля 2028 года.

Базовая веб-планка, на которую все ссылаются, – это WCAG, Руководство по доступности веб-контента от W3C, в текущей версии 2.2. Релевантные для видео критерии успеха – 1.2.2 Captions (Prerecorded) и 1.2.4 Captions (Live) на текстовой стороне и 1.2.3 и 1.2.5 Audio Description (Prerecorded) на звуковой; стандартный тифлокомментарий находится на уровне AA, а расширенный (1.2.7) – это более строгая цель уровня AAA.

Небольшой расчёт: сколько времени на комментарий у вас реально есть

У тифлокомментария есть жёсткий физический предел, удивляющий продуктовые команды: комментировать можно только в тишине. Допустим, 30-минутный эпизод (1800 секунд) сравнительно небогат репликами, и 25% его хронометража – это паузы между речью:

бюджет комментария = хронометраж × доля тишины
                   = 1800 с × 0,25
                   = 450 с пригодных пауз

При комфортном темпе закадровой речи около 150 слов в минуту это:

450 с ÷ 60 × 150 сл/мин = 1125 слов

То есть у тифлокомментатора примерно 1125 слов, чтобы передать всё важное визуальное за весь эпизод, – меньше 38 слов на минуту хронометража. Вот почему сценарии AD лаконичны, почему быстро смонтированные экшен-сцены описывать труднее всего и почему расширенный тифлокомментарий (пауза видео) существует как аварийный выход, когда пауз попросту не хватает.

Где здесь Фора Софт

Фора Софт делает видеософт с 2005 года – в стриминге и OTT, онлайн-обучении, телемедицине и видеоконференциях, и во всех этих вертикалях доступность теперь требование доставки, а не пожелание. Работа редко состоит в генерации самих субтитров; она в том, чтобы выстроить стек правильно от начала до конца: убедиться, что дорожка SDH помечена как caption, а не как обычный субтитр, что вариант тифлокомментария несёт характеристику доступности и никогда не является звуком по умолчанию и что один конвейер упаковки корректно выдаёт флаги и для HLS, и для DASH. Команды, прикручивающие доступность в конце, обнаруживают, что их плеер молча игнорирует правильные дорожки; продумывание модели дорожек и сигнализации заранее – та часть, которую мы помогаем продуктовым командам сделать верно до того, как упаковка зафиксирована.

Главное

  • Доступность – два встречных потока: звук становится экранным текстом; картинка становится дополнительной речью.
  • Субтитры переводят только реплики; captions и SDH добавляют звуковые эффекты и указания говорящего для глухих.
  • Тифлокомментарий – отдельная звуковая дорожка закадровой речи в паузах между репликами, а не текст.
  • Поставляйте WebVTT как универсальный формат caption; добавляйте IMSC, где требует типографика или контракт.
  • Непомеченная дорожка невидима: HLS использует CHARACTERISTICS, DASH – дескрипторы Role и Accessibility.
  • EAA требует captions и тифлокомментарий на стриминге ЕС с 28 июня 2025 года.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.