Нормализация громкости: EBU R128, ITU-R BS.1770, ATSC A/85

Автор: Николай СапуновОбновлено: август 202626 мин чтения
Содержание статьи +

Опубликовано: 2026-06-05 · Время чтения: 21 мин · Автор: Николай Сапунов, CEO Фора Софт

Коротко

Нормализация громкости – это практика измерения того, насколько громким контент звучит для человеческого уха, и приведения его к фиксированной цели, чтобы программы, реклама и платформы больше не скакали по громкости. Поле задают три документа: ITU-R BS.1770 – это алгоритм измерения, превращающий дорожку в одно число на шкале LUFS; EBU R128 – европейский свод правил, задающий цель −23 LUFS и потолок пика −1 dBTP; ATSC A/85 – американский аналог, задающий −24 LKFS и обязательный по закону через CALM Act. Они совпадают почти во всём, потому что измеряют одним и тем же движком BS.1770; различаются лишь целевое число, обработка диалога и то, может ли регулятор оштрафовать вас за нарушение. Статья объясняет алгоритм простым языком, разбирает арифметику реального измерения и даёт единую таблицу целей, которые вас попросят достичь.

Почему это важно

Если вы строите или обслуживаете сервис, который доставляет звук, – стриминговую платформу, OTT-приложение, продукт видеоконференций, хостинг подкастов, эфирную цепочку вещателя, – кому-то в команде вручают спецификацию доставки со словами «−23 LUFS, −1 dBTP, по BS.1770» и ждут, что он поймёт, что это значит. Статья – для продакт-менеджера, основателя или операционного лида, которому нужно понять эти числа достаточно, чтобы вписать их в договор, отклонить несоответствующий материал или объяснить регулятору, почему ваша реклама не громче программ. К концу вы сможете читать любую спецификацию громкости в индустрии, понимать, какой из трёх стандартов управляет вашим рынком, и сами выполнять арифметику измерения. Каждое число здесь восходит к первоисточнику – Рекомендации ITU-R, R-документу EBU или Recommended Practice ATSC, – а не к блогу вендора.

Какую задачу решает нормализация громкости

Начнём с опыта, который был у каждого. Вы смотрите тихий фильм, диалог спокоен, и вдруг приходит реклама, которая ощущается вдвое громче, хотя ручку громкости никто не трогал. Вы кидаетесь к пульту. Этот скачок – и есть та проблема, ради уничтожения которой существует всё поле нормализации громкости.

Реклама звучит громче потому, что десятилетиями звук выравнивали по пикам – по единственному наивысшему мгновенному отсчёту сигнала. Пиковый измеритель отвечает на вопрос «не было ли клиппинга?» и ни на что больше. Две дорожки могут иметь ровно один и тот же пик и при этом звучать совершенно по-разному, потому что громкость – это не самый громкий момент, а средняя энергия, которой подвергается ухо во времени. Рекламодатель, который сжимает дорожку – подтягивая тихие места к громким, – сохраняет тот же пик, но огромно поднимает среднее. Пиковый измеритель говорит, что обе дорожки в порядке. Ухо говорит, что одна из них кричит.

Нормализация громкости заменяет «выравнивание по пику» на «выравнивание по воспринимаемой громкости». Вместо вопроса «каким был самый громкий миг?» она спрашивает «насколько громко это в среднем звучало для человека?», выдаёт одно число на всю программу и подталкивает каждую программу к одному и тому же числу. Как только весь контент нормализован к одной громкости, ручку можно не трогать. Эта единственная идея – измерить воспринимаемую громкость и нормализовать всё к одной цели – и есть то, что реализуют три стандарта из этой статьи.

«Если LUFS, пик, RMS и базовый словарь громкости для вас в новинку, сначала прочитайте основы: Громкость, peak, RMS, LUFS – как измеряется реальная громкость звука. Эта статья предполагает, что вы знаете, что такое число LUFS, и сосредоточена на стандартах, которые его задают и таргетируют.»

Три документа и как они складываются вместе

Про «стандарт громкости» говорят как про одну вещь. Это три вещи, и делают они разную работу. Их путаница – самая частая ошибка в письмах о доставке, так что картину стоит навести до всяких чисел.

Первый документ, ITU-R BS.1770, – это алгоритм измерения. ITU-R – это сектор радиосвязи Международного союза электросвязи, глобального органа, который стандартизирует измерение вещательных сигналов. BS.1770 – это рецепт: подайте ему дорожку, и он вернёт одно число, описывающее громкость программы на шкале LUFS – Loudness Units relative to Full Scale, единицы громкости относительно полной шкалы. BS.1770 не говорит, к какому числу стремиться. Это линейка, а не правило.

Второй документ, EBU R128, – это европейский свод целей. EBU – это Европейский вещательный союз, альянс европейских общественных вещателей. R128 берёт линейку BS.1770 и говорит: измеряйте ею, стремитесь к −23 LUFS и никогда не позволяйте истинному пику превысить −1 dBTP. Это правило, которое использует линейку.

Третий документ, ATSC A/85, – это американский свод целей. ATSC – это Advanced Television Systems Committee, орган, задающий американские стандарты цифрового ТВ. A/85 тоже использует линейку BS.1770, но стремится к −24 LKFS и иначе обрабатывает диалог. Он весит больше, потому что федеральный закон США – CALM Act – делает соответствие A/85 обязательным для телевизионной рекламы, и Федеральная комиссия по связи может оштрафовать вещателя за нарушение.

Так что связь проста: одна линейка (BS.1770) и два региональных правила поверх неё (EBU R128 в Европе, ATSC A/85 в США). Держите эту картину в голове; остальная статья её наполняет.

Рис. 1. Одна линейка, два правила. BS.1770 измеряет; EBU R128 и ATSC A/85 каждый задают цель, которая использует это измерение.

ITU-R BS.1770: линейка, которой измеряют все

BS.1770 – полное название «Algorithms to measure audio programme loudness and true-peak audio level» – это фундамент. Оба региональных свода ссылаются на него, так что понять его один раз – значит понять измерительную половину любой спецификации громкости. Текущая редакция – ITU-R BS.1770-5 (ноябрь 2023). Алгоритм состоит из четырёх шагов, и каждый можно пройти без всякой инженерной подготовки.

Шаг 1 – K-взвешивание: слышать так, как слышит ухо

Первый шаг исправляет факт о слухе: мы слышим не все частоты одинаково громко. Всплеск энергии на 3 кГц – примерно высота детского плача или пожарной сигнализации – звучит для нас намного громче, чем та же энергия на 50 Гц, низком басовом гуле. Микрофон этого не знает; он обращается со всеми частотами одинаково. Поэтому алгоритм сначала прогоняет сигнал через фиксированную пару фильтров, вместе называемых K-взвешиванием, которые поднимают частоты, к которым ухо чувствительно, и подрезают те, к которым нет. После K-взвешивания числа, которые видит алгоритм, совпадают с тем, что человек реально воспримет как громкое. Поэтому шкала LUFS несёт «K» в вещательном написании – LKFS, Loudness, K-weighted, relative to Full Scale. LUFS и LKFS – это одно и то же число под двумя именами; Европа говорит LUFS, США – LKFS.

Шаг 2 – среднее квадратов: превратить волну в энергию

Волна тысячи раз в секунду качается в плюс и в минус; если её просто усреднить, плюсы и минусы сократятся почти до нуля. Поэтому алгоритм сначала возводит каждый отсчёт в квадрат – возведение делает всякое значение положительным и удобно соответствует мощности сигнала, скорости доставки энергии. Затем он усредняет эти квадраты. Результат – среднеквадратичная энергия K-взвешенного сигнала: одно положительное число, говорящее, сколько перцептивной энергии несла дорожка.

Шаг 3 – гейтинг: игнорировать тишину

Вот шаг, отделяющий BS.1770 от наивного усреднения, и тот, в котором большинство ошибается. Представьте двухчасовой фильм с долгими тихими сценами – задержанный вдох перед репликой, тихая ночная сцена. Если усреднить эти тишины в громкость, фильм с обилием тишины прочитается как искусственно тихий, и вы будете прибавлять громкость, пока громкие сцены не начнут бить по ушам. Гейтинг этому мешает. Алгоритм режет программу на перекрывающиеся окна – блоки по 400 миллисекунд, каждый перекрывает соседний на 75%, – и выбрасывает слишком тихие окна, прежде чем усреднять остальные.

Выбрасывает в два прохода. Абсолютный гейт отбрасывает любой блок тише −70 LUFS – это фактически тишина, и она никогда не считается. Затем алгоритм измеряет среднее того, что выжило, и применяет относительный гейт: отбрасывает любой блок более чем на 10 LU ниже этого первого среднего. (LU, Loudness Units, – единица для разговора о разнице на шкале LUFS; LUFS – абсолютное значение, LU – зазор между двумя значениями.) То, что осталось, – блоки, реально несущие тело программы, – усредняется в последний раз, давая интегральную громкость (integrated loudness), единственное число на всю программу. Гейтинг добавили в BS.1770-2 (2011); в исходной версии 2006 года его не было – поэтому измерение со старого, до-2011 года, измерителя может расходиться с современным.

Шаг 4 – истинный пик: поймать пик между отсчётами

Четвёртый шаг отделён от громкости и отвечает на другой вопрос: не исказится ли сигнал при воспроизведении? Обычный пиковый измеритель смотрит на цифровые отсчёты и сообщает наивысший. Но реальная аналоговая волна, которую воспроизводит динамик, проходит через эти точки отсчёта и иногда выше них – истинный пик может сидеть выше любого отдельного отсчёта. BS.1770 вычисляет истинный пик (true peak) передискретизацией (восстанавливая волну на учетверённой частоте) и находя реальный максимум, сообщаемый в dBTP – децибелах относительно полной шкалы, истинный пик. Коэффициенты фильтра истинного пика уточнили в BS.1770-3 (2012). Поэтому спецификация пишет «−1 dBTP», а не «−1 dBFS»: она хочет, чтобы истинный межотсчётный пик держался чуть ниже цифрового потолка, чтобы ничто не клиппировало, снова став аналоговым.

Рис. 2. Конвейер измерения BS.1770: K-взвесить, возвести в квадрат, прогейтить, проинтегрировать – плюс отдельная ветвь истинного пика. На выходе – одно число LUFS и одно число dBTP.

Разберём арифметику гейта

Шаг гейтинга абстрактен, поэтому вот расчёт относительного гейта на реальных числах. Допустим, абсолютно-гейтированное среднее программы – все блоки выше −70 LUFS, усреднённые – вышло на −21 LUFS. Относительный гейт сидит на 10 LU ниже:

порог относительного гейта = абс.-гейт. громкость − 10 LU
порог относительного гейта = −21 LUFS − 10 LU
порог относительного гейта = −31 LUFS

Теперь алгоритм усредняет заново, оставляя лишь блоки громче −31 LUFS и отбрасывая всё тише. Скажем, итог сел на −20.4 LUFS. Эти −20.4 LUFS – интегральная громкость программы, число, которое вы сравниваете с целью. Поскольку блоки тихих сцен отброшены, цифра отражает громкость реального тела программы, а не её тишин.

EBU R128: европейский свод правил

EBU R128 – «Loudness normalisation and permitted maximum level of audio signals» – это документ, который с 2010 года превратил нормализацию громкости из теории в европейский вещательный закон-по-соглашению. Он короткий и предписывающий. Он выдвигает четыре требования, и их стоит знать точно.

Первое: цель – −23 LUFS, измеренная по BS.1770. Каждая нормализованная программа стремится к этому единственному числу. Второе: допуск ±0.5 LU для контента, который можно обработать точно (большинство файловой доставки), расширяется до ±1 LU для менее предсказуемого материала вроде живого микса, где громкость нельзя отрепетировать. Третье: истинный пик никогда не превышает −1 dBTP. Четвёртое: R128 вводит спутник-меру, Loudness Range (LRA), диапазон громкости – насколько громкость меняется внутри программы, единое число разброса «тихо–громко» в LU, чтобы спецификация могла требовать динамики, которая не плоская и не дико неровная. LRA задан в EBU Tech 3342.

R128 не переопределяет измерение; он указывает на BS.1770 и добавляет практический каркас, нужный вещателям. Этот каркас живёт в семействе спутниковых документов EBU Tech: Tech 3341 задаёт «EBU Mode»-измеритель с тремя показаниями – Momentary (мгновенный, окно 400 мс, ловит всплески), Short-term (краткосрочный, окно 3 секунды, следит за миксом в работе) и Integrated (интегральное гейтированное число на всю программу, которое должно попасть в −23). Tech 3343 покрывает производственную практику, а Tech 3344 – дистрибуцию, включая то, как передавать метаданные громкости современным иммерсивным кодекам вроде AC-4 и MPEG-H.

Стандарт поспевал за тем, как люди реально потребляют звук. Базовая рекомендация – на версии 5.0 (ноябрь 2023), и теперь она несёт четыре дополнения для контекстов, которых исходный вещательный документ 2010 года не предвидел: R128 s1 для короткого контента вроде рекламы и промо, R128 s2 («Loudness in Streaming», ноябрь 2023) для on-demand и стриминговой дистрибуции, R128 s3 для радио и R128 s4 для кинематографического контента. Стриминговое дополнение важно потому, что прослушивание в телефоне и наушниках терпит – и часто предпочитает – цель громче, чем тихая гостиная, поэтому музыкальные стриминги кучкуются ближе к −14 LUFS, чем к −23. Каждое число платформы мы разбираем в LUFS: целевые значения по платформам в 2026.

ATSC A/85 и CALM Act: американский свод с зубами

Американская история – тот же алгоритм с другой целью и юридическим механизмом принуждения, которого нет у европейской системы соглашений.

ATSC A/85 – «Techniques for Establishing and Maintaining Audio Loudness for Digital Television» – задаёт цель цифрового ТВ США на −24 LKFS, на единицу тише европейских −23. Текущий текст – A/85:2013, с Corrigendum No. 1 (февраль 2021), и измеряет он по BS.1770-3. Разница в один LU с EBU R128 историческая и практическая, а не перцептивная; для любого реального процесса −23 и −24 настолько близки, что единый микс под обе цели нуждается лишь в подрезке на один децибел.

A/85 отличается от R128 в одном существенном: как обрабатывает диалог. R128 измеряет всю программу. A/85 опирается на идею Anchor Element (якорного элемента) – части дорожки, по которой слушатель инстинктивно судит о громкости, и в большинстве ТВ это диалог. A/85 нормализует к громкости этого якоря, так что фильм с громкими экшн-сценами и тихим диалогом выравнивается по диалогу – тому, за чем зритель реально следит. Этот якорный, диалого-центричный подход – ещё и причина, по которой американские спецификации доставки говорят про dialnorm (см. ниже) чаще европейских.

Причина, по которой A/85 весит больше обычного recommended practice, – CALM Act, Commercial Advertisement Loudness Mitigation Act, федеральный закон США, действующий с декабря 2012 года. CALM Act не пишет собственных технических правил; он принимает ATSC A/85 по ссылке и делает соответствие обязательным для телевизионной рекламы. Его исполнение обеспечивает Федеральная комиссия по связи (FCC), и вещатель, позволивший рекламе быть громче окружающих программ, может стать предметом жалоб и санкций. Так что в США нормализация громкости – не лучшая практика, которую вещатель может принять: для рекламы это закон, а техническое определение «слишком громко» – это −24 LKFS из A/85.

Dialnorm: метаданные, несущие число громкости

Один термин постоянно всплывает в американской и Dolby-ориентированной доставке и сбивает с толку всех, кто с ним встречается: dialnorm. Это сокращение от dialogue normalization – небольшие метаданные внутри кодеков Dolby (AC-3 и E-AC-3), сообщающие устройству воспроизведения, насколько громок диалог программы, как положительное число децибел ниже полной шкалы. Если диалог вашей программы измеряется на −24 LKFS и вы доставляете его нетронутым, вы ставите dialnorm = 24. Декодер в телевизоре читает эти 24 и автоматически ослабляет сигнал так, чтобы диалог каждой программы выходил на одну и ту же комфортную громкость, как бы каждую ни свели.

Подводный камень жесток в своей простоте: если значение dialnorm неверно – если оно говорит 24, а диалог на самом деле на −31, – декодер применяет неверную коррекцию, и программа звучит на неверной громкости, ломая всю систему. Практическую работу с dialnorm, replay gain и нормализацией в кодировщиках мы разбираем в Громкость на практике: dialnorm, normalize, attenuate, replay gain.

Бок о бок: как три стандарта соотносятся

Стандарты совпадают намного больше, чем различаются, потому что разделяют измерительный движок BS.1770. Таблица ниже – вся та сравнительная картина, вокруг которой вертится спецификация доставки.

АтрибутITU-R BS.1770EBU R128ATSC A/85
Что этоАлгоритм измеренияЕвропейский свод целейАмериканский свод целей
Текущая редакцияBS.1770-5 (ноя 2023)R128 v5.0 (ноя 2023)A/85:2013 + Corr. 1 (фев 2021)
Цель громкостинет – только измеряет−23 LUFS−24 LKFS
Имя единицыLKFS / LUFSLUFSLKFS
Основа измерениясам по себеBS.1770BS.1770-3
Обработка диалогатолько гейтингвся программаAnchor Element (диалог)
Потолок истинного пиказадаёт dBTP−1 dBTP−2 dBTP (рекоменд.)
Допуск±0.5 LU (±1 LU live)±2 LU (типичная практика)
Юридическая силанетсоглашение вещателейобязателен для рекламы (CALM Act)

Таблица 1. Три документа громкости с одного взгляда. Общий движок BS.1770 – причина, по которой цели стоят в одном LU друг от друга, а не в разных мирах. Источники: ITU-R BS.1770-5; EBU R128 v5.0; ATSC A/85:2013.

Заметьте, что делает таблица очевидным: жёсткие различия – это целевое число (−23 против −24), обработка диалога (вся программа против якоря) и юридический статус (соглашение против закона). Всё остальное общее. Команда, которая это усвоила, перестаёт воспринимать спецификации «EBU» и «ATSC» как чужеродные и начинает видеть в них одно измерение с двумя региональными ручками.

Полная нормализация, от начала до конца

Свяжем всё полным примером. Вы получаете готовую программу. Ваш измеритель, реализующий BS.1770-5, сообщает интегральную громкость −20.4 LUFS и истинный пик −0.3 dBTP. Ваша спецификация доставки – EBU R128: цель −23 LUFS, потолок −1 dBTP.

Сначала коррекция громкости. Вы на 2.6 LU громче, так что убавляете всю программу на эту величину:

требуемое усиление = цель − измеренное
требуемое усиление = −23 LUFS − (−20.4 LUFS)
требуемое усиление = −2.6 LU

Вы применяете −2.6 dB усиления ко всей программе. Поскольку вы сдвинули всё на одну и ту же величину, соотношения внутри микса не тронуты – изменился только общий уровень. Теперь перепроверьте пик. Истинный пик был −0.3 dBTP; понижение уровня на 2.6 dB понижает и пик:

новый истинный пик = старый истинный пик + усиление
новый истинный пик = −0.3 dBTP + (−2.6 dB)
новый истинный пик = −2.9 dBTP

−2.9 dBTP ниже потолка −1 dBTP, так что программа проходит оба теста: −23 LUFS интегрально, −2.9 dBTP по истинному пику. Заметьте, порядок важен. Будь коррекция громкости вверх – будь программа слишком тихой – подъём уровня мог бы толкнуть истинный пик выше −1 dBTP, и тогда понадобился бы лимитер истинного пика, чтобы притянуть пики обратно, не меняя интегральной громкости. Эта ловушка порядка – следующий подводный камень.

«Подводный камень – нормализовать громкость и пик в неверном порядке или спутать их. Громкость (LUFS, среднее) и истинный пик (dBTP, максимум) – разные измерения, и удовлетворить надо оба. Классический провал – сначала лимитировать пики, а потом нормализовать громкость вверх, что снова заводит пики выше потолка; или обращаться с числом пика как с числом громкости. Правило: сначала нормализуйте интегральную громкость к цели, потом проверьте истинный пик, потом примените лимитер истинного пика только если потолок превышен – и перемерьте громкость после, потому что жёсткое лимитирование может её сдвинуть. Глубоко про межотсчётные пики – в Истинный пик, dBTP и проблема межотсчётного пика.»

Второй подводный камень: путаница −23 и −14

Самое вредное заблуждение в поле – «−23 LUFS – это тот самый стандарт громкости». Это вещательная цель. Число, которое вас просят достичь, зависит целиком от того, где играет контент. Европейское и американское вещание сидят около −23/−24 LUFS, потому что в гостиной с внимательными слушателями низкий фоновый шум и широкая динамика приветствуются. Музыкальные стриминги нормализуют куда громче – Spotify и другие кучкуются около −14 LUFS, – потому что прослушивание в телефоне и наушниках в шумной среде предпочитает более плотный, громкий и ровный сигнал. Кино – снова иное, калибруется опорным уровнем, а не целью в LUFS.

Доставьте подкаст, сведённый на −23 LUFS, на платформу, ждущую −16, – и слушатели потянутся к громкости, ровно то поведение, которое нормализация должна была прекратить. Стандарты этой статьи задают как измерять и дают вам вещательные цели; цели по платформам – отдельная таблица, и ошибиться в ней – частая, избегаемая оплошность. Полный набор на 2026 живёт в LUFS: целевые значения по платформам в 2026.

Где здесь Фора Софт

В продуктах OTT, видеостриминга, e-learning, телемедицины и видеоконференций, которые мы строим с 2005 года, вопрос громкости всплывает одинаково: приходит спецификация доставки или партнёрская интеграция, цитирующая «−23 LUFS, −1 dBTP, BS.1770», и команде нужно измерение, встроенное в конвейер, а не проверенное вручную в конце. Для OTT- и стриминговых клиентов мы вшиваем измерение громкости BS.1770 и лимитер истинного пика в шаг транскодинга, чтобы каждый ассет нормализовался к цели спецификации до того, как достигнет упаковщика. Для e-learning и телемедицины, где разборчивость диалога – это весь продукт, мы нормализуем захваченный звук к единой цели, чтобы тихий лектор и громкий приходили к слушателю на одной комфортной громкости. Стандарт не меняется; меняется лишь то, какую цель и какой потолок истинного пика требует рынок проекта.

Главное

  • BS.1770 – линейка измерения; EBU R128 и ATSC A/85 – региональные правила.
  • BS.1770 работает в четыре шага: K-взвесить, возвести в квадрат, прогейтить тихое, проинтегрировать.
  • EBU R128 целит в −23 LUFS, −1 dBTP, допуск ±0.5 LU, по BS.1770.
  • ATSC A/85 целит в −24 LKFS, использует якорь-диалог и обязателен по закону CALM Act.
  • Сначала нормализуйте интегральную громкость, потом проверьте и лимитируйте истинный пик.
  • −23 LUFS – вещательная цель; стриминг и музыка используют громче, вроде −14.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.