Содержание статьи +
- Коротко
- Почему это важно
- Какую задачу решает нормализация громкости
- Три документа и как они складываются вместе
- ITU-R BS.1770: линейка, которой измеряют все
- EBU R128: европейский свод правил
- ATSC A/85 и CALM Act: американский свод с зубами
- Бок о бок: как три стандарта соотносятся
- Полная нормализация, от начала до конца
- Второй подводный камень: путаница −23 и −14
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Опубликовано: 2026-06-05 · Время чтения: 21 мин · Автор: Николай Сапунов, CEO Фора Софт
Коротко
Нормализация громкости – это практика измерения того, насколько громким контент звучит для человеческого уха, и приведения его к фиксированной цели, чтобы программы, реклама и платформы больше не скакали по громкости. Поле задают три документа: ITU-R BS.1770 – это алгоритм измерения, превращающий дорожку в одно число на шкале LUFS; EBU R128 – европейский свод правил, задающий цель −23 LUFS и потолок пика −1 dBTP; ATSC A/85 – американский аналог, задающий −24 LKFS и обязательный по закону через CALM Act. Они совпадают почти во всём, потому что измеряют одним и тем же движком BS.1770; различаются лишь целевое число, обработка диалога и то, может ли регулятор оштрафовать вас за нарушение. Статья объясняет алгоритм простым языком, разбирает арифметику реального измерения и даёт единую таблицу целей, которые вас попросят достичь.
Почему это важно
Если вы строите или обслуживаете сервис, который доставляет звук, – стриминговую платформу, OTT-приложение, продукт видеоконференций, хостинг подкастов, эфирную цепочку вещателя, – кому-то в команде вручают спецификацию доставки со словами «−23 LUFS, −1 dBTP, по BS.1770» и ждут, что он поймёт, что это значит. Статья – для продакт-менеджера, основателя или операционного лида, которому нужно понять эти числа достаточно, чтобы вписать их в договор, отклонить несоответствующий материал или объяснить регулятору, почему ваша реклама не громче программ. К концу вы сможете читать любую спецификацию громкости в индустрии, понимать, какой из трёх стандартов управляет вашим рынком, и сами выполнять арифметику измерения. Каждое число здесь восходит к первоисточнику – Рекомендации ITU-R, R-документу EBU или Recommended Practice ATSC, – а не к блогу вендора.
Какую задачу решает нормализация громкости
Начнём с опыта, который был у каждого. Вы смотрите тихий фильм, диалог спокоен, и вдруг приходит реклама, которая ощущается вдвое громче, хотя ручку громкости никто не трогал. Вы кидаетесь к пульту. Этот скачок – и есть та проблема, ради уничтожения которой существует всё поле нормализации громкости.
Реклама звучит громче потому, что десятилетиями звук выравнивали по пикам – по единственному наивысшему мгновенному отсчёту сигнала. Пиковый измеритель отвечает на вопрос «не было ли клиппинга?» и ни на что больше. Две дорожки могут иметь ровно один и тот же пик и при этом звучать совершенно по-разному, потому что громкость – это не самый громкий момент, а средняя энергия, которой подвергается ухо во времени. Рекламодатель, который сжимает дорожку – подтягивая тихие места к громким, – сохраняет тот же пик, но огромно поднимает среднее. Пиковый измеритель говорит, что обе дорожки в порядке. Ухо говорит, что одна из них кричит.
Нормализация громкости заменяет «выравнивание по пику» на «выравнивание по воспринимаемой громкости». Вместо вопроса «каким был самый громкий миг?» она спрашивает «насколько громко это в среднем звучало для человека?», выдаёт одно число на всю программу и подталкивает каждую программу к одному и тому же числу. Как только весь контент нормализован к одной громкости, ручку можно не трогать. Эта единственная идея – измерить воспринимаемую громкость и нормализовать всё к одной цели – и есть то, что реализуют три стандарта из этой статьи.
«Если LUFS, пик, RMS и базовый словарь громкости для вас в новинку, сначала прочитайте основы: Громкость, peak, RMS, LUFS – как измеряется реальная громкость звука. Эта статья предполагает, что вы знаете, что такое число LUFS, и сосредоточена на стандартах, которые его задают и таргетируют.»
Три документа и как они складываются вместе
Про «стандарт громкости» говорят как про одну вещь. Это три вещи, и делают они разную работу. Их путаница – самая частая ошибка в письмах о доставке, так что картину стоит навести до всяких чисел.
Первый документ, ITU-R BS.1770, – это алгоритм измерения. ITU-R – это сектор радиосвязи Международного союза электросвязи, глобального органа, который стандартизирует измерение вещательных сигналов. BS.1770 – это рецепт: подайте ему дорожку, и он вернёт одно число, описывающее громкость программы на шкале LUFS – Loudness Units relative to Full Scale, единицы громкости относительно полной шкалы. BS.1770 не говорит, к какому числу стремиться. Это линейка, а не правило.
Второй документ, EBU R128, – это европейский свод целей. EBU – это Европейский вещательный союз, альянс европейских общественных вещателей. R128 берёт линейку BS.1770 и говорит: измеряйте ею, стремитесь к −23 LUFS и никогда не позволяйте истинному пику превысить −1 dBTP. Это правило, которое использует линейку.
Третий документ, ATSC A/85, – это американский свод целей. ATSC – это Advanced Television Systems Committee, орган, задающий американские стандарты цифрового ТВ. A/85 тоже использует линейку BS.1770, но стремится к −24 LKFS и иначе обрабатывает диалог. Он весит больше, потому что федеральный закон США – CALM Act – делает соответствие A/85 обязательным для телевизионной рекламы, и Федеральная комиссия по связи может оштрафовать вещателя за нарушение.
Так что связь проста: одна линейка (BS.1770) и два региональных правила поверх неё (EBU R128 в Европе, ATSC A/85 в США). Держите эту картину в голове; остальная статья её наполняет.
ITU-R BS.1770: линейка, которой измеряют все
BS.1770 – полное название «Algorithms to measure audio programme loudness and true-peak audio level» – это фундамент. Оба региональных свода ссылаются на него, так что понять его один раз – значит понять измерительную половину любой спецификации громкости. Текущая редакция – ITU-R BS.1770-5 (ноябрь 2023). Алгоритм состоит из четырёх шагов, и каждый можно пройти без всякой инженерной подготовки.
Шаг 1 – K-взвешивание: слышать так, как слышит ухо
Первый шаг исправляет факт о слухе: мы слышим не все частоты одинаково громко. Всплеск энергии на 3 кГц – примерно высота детского плача или пожарной сигнализации – звучит для нас намного громче, чем та же энергия на 50 Гц, низком басовом гуле. Микрофон этого не знает; он обращается со всеми частотами одинаково. Поэтому алгоритм сначала прогоняет сигнал через фиксированную пару фильтров, вместе называемых K-взвешиванием, которые поднимают частоты, к которым ухо чувствительно, и подрезают те, к которым нет. После K-взвешивания числа, которые видит алгоритм, совпадают с тем, что человек реально воспримет как громкое. Поэтому шкала LUFS несёт «K» в вещательном написании – LKFS, Loudness, K-weighted, relative to Full Scale. LUFS и LKFS – это одно и то же число под двумя именами; Европа говорит LUFS, США – LKFS.
Шаг 2 – среднее квадратов: превратить волну в энергию
Волна тысячи раз в секунду качается в плюс и в минус; если её просто усреднить, плюсы и минусы сократятся почти до нуля. Поэтому алгоритм сначала возводит каждый отсчёт в квадрат – возведение делает всякое значение положительным и удобно соответствует мощности сигнала, скорости доставки энергии. Затем он усредняет эти квадраты. Результат – среднеквадратичная энергия K-взвешенного сигнала: одно положительное число, говорящее, сколько перцептивной энергии несла дорожка.
Шаг 3 – гейтинг: игнорировать тишину
Вот шаг, отделяющий BS.1770 от наивного усреднения, и тот, в котором большинство ошибается. Представьте двухчасовой фильм с долгими тихими сценами – задержанный вдох перед репликой, тихая ночная сцена. Если усреднить эти тишины в громкость, фильм с обилием тишины прочитается как искусственно тихий, и вы будете прибавлять громкость, пока громкие сцены не начнут бить по ушам. Гейтинг этому мешает. Алгоритм режет программу на перекрывающиеся окна – блоки по 400 миллисекунд, каждый перекрывает соседний на 75%, – и выбрасывает слишком тихие окна, прежде чем усреднять остальные.
Выбрасывает в два прохода. Абсолютный гейт отбрасывает любой блок тише −70 LUFS – это фактически тишина, и она никогда не считается. Затем алгоритм измеряет среднее того, что выжило, и применяет относительный гейт: отбрасывает любой блок более чем на 10 LU ниже этого первого среднего. (LU, Loudness Units, – единица для разговора о разнице на шкале LUFS; LUFS – абсолютное значение, LU – зазор между двумя значениями.) То, что осталось, – блоки, реально несущие тело программы, – усредняется в последний раз, давая интегральную громкость (integrated loudness), единственное число на всю программу. Гейтинг добавили в BS.1770-2 (2011); в исходной версии 2006 года его не было – поэтому измерение со старого, до-2011 года, измерителя может расходиться с современным.
Шаг 4 – истинный пик: поймать пик между отсчётами
Четвёртый шаг отделён от громкости и отвечает на другой вопрос: не исказится ли сигнал при воспроизведении? Обычный пиковый измеритель смотрит на цифровые отсчёты и сообщает наивысший. Но реальная аналоговая волна, которую воспроизводит динамик, проходит через эти точки отсчёта и иногда выше них – истинный пик может сидеть выше любого отдельного отсчёта. BS.1770 вычисляет истинный пик (true peak) передискретизацией (восстанавливая волну на учетверённой частоте) и находя реальный максимум, сообщаемый в dBTP – децибелах относительно полной шкалы, истинный пик. Коэффициенты фильтра истинного пика уточнили в BS.1770-3 (2012). Поэтому спецификация пишет «−1 dBTP», а не «−1 dBFS»: она хочет, чтобы истинный межотсчётный пик держался чуть ниже цифрового потолка, чтобы ничто не клиппировало, снова став аналоговым.
Разберём арифметику гейта
Шаг гейтинга абстрактен, поэтому вот расчёт относительного гейта на реальных числах. Допустим, абсолютно-гейтированное среднее программы – все блоки выше −70 LUFS, усреднённые – вышло на −21 LUFS. Относительный гейт сидит на 10 LU ниже:
порог относительного гейта = абс.-гейт. громкость − 10 LU
порог относительного гейта = −21 LUFS − 10 LU
порог относительного гейта = −31 LUFSТеперь алгоритм усредняет заново, оставляя лишь блоки громче −31 LUFS и отбрасывая всё тише. Скажем, итог сел на −20.4 LUFS. Эти −20.4 LUFS – интегральная громкость программы, число, которое вы сравниваете с целью. Поскольку блоки тихих сцен отброшены, цифра отражает громкость реального тела программы, а не её тишин.
EBU R128: европейский свод правил
EBU R128 – «Loudness normalisation and permitted maximum level of audio signals» – это документ, который с 2010 года превратил нормализацию громкости из теории в европейский вещательный закон-по-соглашению. Он короткий и предписывающий. Он выдвигает четыре требования, и их стоит знать точно.
Первое: цель – −23 LUFS, измеренная по BS.1770. Каждая нормализованная программа стремится к этому единственному числу. Второе: допуск ±0.5 LU для контента, который можно обработать точно (большинство файловой доставки), расширяется до ±1 LU для менее предсказуемого материала вроде живого микса, где громкость нельзя отрепетировать. Третье: истинный пик никогда не превышает −1 dBTP. Четвёртое: R128 вводит спутник-меру, Loudness Range (LRA), диапазон громкости – насколько громкость меняется внутри программы, единое число разброса «тихо–громко» в LU, чтобы спецификация могла требовать динамики, которая не плоская и не дико неровная. LRA задан в EBU Tech 3342.
R128 не переопределяет измерение; он указывает на BS.1770 и добавляет практический каркас, нужный вещателям. Этот каркас живёт в семействе спутниковых документов EBU Tech: Tech 3341 задаёт «EBU Mode»-измеритель с тремя показаниями – Momentary (мгновенный, окно 400 мс, ловит всплески), Short-term (краткосрочный, окно 3 секунды, следит за миксом в работе) и Integrated (интегральное гейтированное число на всю программу, которое должно попасть в −23). Tech 3343 покрывает производственную практику, а Tech 3344 – дистрибуцию, включая то, как передавать метаданные громкости современным иммерсивным кодекам вроде AC-4 и MPEG-H.
Стандарт поспевал за тем, как люди реально потребляют звук. Базовая рекомендация – на версии 5.0 (ноябрь 2023), и теперь она несёт четыре дополнения для контекстов, которых исходный вещательный документ 2010 года не предвидел: R128 s1 для короткого контента вроде рекламы и промо, R128 s2 («Loudness in Streaming», ноябрь 2023) для on-demand и стриминговой дистрибуции, R128 s3 для радио и R128 s4 для кинематографического контента. Стриминговое дополнение важно потому, что прослушивание в телефоне и наушниках терпит – и часто предпочитает – цель громче, чем тихая гостиная, поэтому музыкальные стриминги кучкуются ближе к −14 LUFS, чем к −23. Каждое число платформы мы разбираем в LUFS: целевые значения по платформам в 2026.
ATSC A/85 и CALM Act: американский свод с зубами
Американская история – тот же алгоритм с другой целью и юридическим механизмом принуждения, которого нет у европейской системы соглашений.
ATSC A/85 – «Techniques for Establishing and Maintaining Audio Loudness for Digital Television» – задаёт цель цифрового ТВ США на −24 LKFS, на единицу тише европейских −23. Текущий текст – A/85:2013, с Corrigendum No. 1 (февраль 2021), и измеряет он по BS.1770-3. Разница в один LU с EBU R128 историческая и практическая, а не перцептивная; для любого реального процесса −23 и −24 настолько близки, что единый микс под обе цели нуждается лишь в подрезке на один децибел.
A/85 отличается от R128 в одном существенном: как обрабатывает диалог. R128 измеряет всю программу. A/85 опирается на идею Anchor Element (якорного элемента) – части дорожки, по которой слушатель инстинктивно судит о громкости, и в большинстве ТВ это диалог. A/85 нормализует к громкости этого якоря, так что фильм с громкими экшн-сценами и тихим диалогом выравнивается по диалогу – тому, за чем зритель реально следит. Этот якорный, диалого-центричный подход – ещё и причина, по которой американские спецификации доставки говорят про dialnorm (см. ниже) чаще европейских.
Причина, по которой A/85 весит больше обычного recommended practice, – CALM Act, Commercial Advertisement Loudness Mitigation Act, федеральный закон США, действующий с декабря 2012 года. CALM Act не пишет собственных технических правил; он принимает ATSC A/85 по ссылке и делает соответствие обязательным для телевизионной рекламы. Его исполнение обеспечивает Федеральная комиссия по связи (FCC), и вещатель, позволивший рекламе быть громче окружающих программ, может стать предметом жалоб и санкций. Так что в США нормализация громкости – не лучшая практика, которую вещатель может принять: для рекламы это закон, а техническое определение «слишком громко» – это −24 LKFS из A/85.
Dialnorm: метаданные, несущие число громкости
Один термин постоянно всплывает в американской и Dolby-ориентированной доставке и сбивает с толку всех, кто с ним встречается: dialnorm. Это сокращение от dialogue normalization – небольшие метаданные внутри кодеков Dolby (AC-3 и E-AC-3), сообщающие устройству воспроизведения, насколько громок диалог программы, как положительное число децибел ниже полной шкалы. Если диалог вашей программы измеряется на −24 LKFS и вы доставляете его нетронутым, вы ставите dialnorm = 24. Декодер в телевизоре читает эти 24 и автоматически ослабляет сигнал так, чтобы диалог каждой программы выходил на одну и ту же комфортную громкость, как бы каждую ни свели.
Подводный камень жесток в своей простоте: если значение dialnorm неверно – если оно говорит 24, а диалог на самом деле на −31, – декодер применяет неверную коррекцию, и программа звучит на неверной громкости, ломая всю систему. Практическую работу с dialnorm, replay gain и нормализацией в кодировщиках мы разбираем в Громкость на практике: dialnorm, normalize, attenuate, replay gain.
Бок о бок: как три стандарта соотносятся
Стандарты совпадают намного больше, чем различаются, потому что разделяют измерительный движок BS.1770. Таблица ниже – вся та сравнительная картина, вокруг которой вертится спецификация доставки.
| Атрибут | ITU-R BS.1770 | EBU R128 | ATSC A/85 |
|---|---|---|---|
| Что это | Алгоритм измерения | Европейский свод целей | Американский свод целей |
| Текущая редакция | BS.1770-5 (ноя 2023) | R128 v5.0 (ноя 2023) | A/85:2013 + Corr. 1 (фев 2021) |
| Цель громкости | нет – только измеряет | −23 LUFS | −24 LKFS |
| Имя единицы | LKFS / LUFS | LUFS | LKFS |
| Основа измерения | сам по себе | BS.1770 | BS.1770-3 |
| Обработка диалога | только гейтинг | вся программа | Anchor Element (диалог) |
| Потолок истинного пика | задаёт dBTP | −1 dBTP | −2 dBTP (рекоменд.) |
| Допуск | – | ±0.5 LU (±1 LU live) | ±2 LU (типичная практика) |
| Юридическая сила | нет | соглашение вещателей | обязателен для рекламы (CALM Act) |
Таблица 1. Три документа громкости с одного взгляда. Общий движок BS.1770 – причина, по которой цели стоят в одном LU друг от друга, а не в разных мирах. Источники: ITU-R BS.1770-5; EBU R128 v5.0; ATSC A/85:2013.
Заметьте, что делает таблица очевидным: жёсткие различия – это целевое число (−23 против −24), обработка диалога (вся программа против якоря) и юридический статус (соглашение против закона). Всё остальное общее. Команда, которая это усвоила, перестаёт воспринимать спецификации «EBU» и «ATSC» как чужеродные и начинает видеть в них одно измерение с двумя региональными ручками.
Полная нормализация, от начала до конца
Свяжем всё полным примером. Вы получаете готовую программу. Ваш измеритель, реализующий BS.1770-5, сообщает интегральную громкость −20.4 LUFS и истинный пик −0.3 dBTP. Ваша спецификация доставки – EBU R128: цель −23 LUFS, потолок −1 dBTP.
Сначала коррекция громкости. Вы на 2.6 LU громче, так что убавляете всю программу на эту величину:
требуемое усиление = цель − измеренное
требуемое усиление = −23 LUFS − (−20.4 LUFS)
требуемое усиление = −2.6 LUВы применяете −2.6 dB усиления ко всей программе. Поскольку вы сдвинули всё на одну и ту же величину, соотношения внутри микса не тронуты – изменился только общий уровень. Теперь перепроверьте пик. Истинный пик был −0.3 dBTP; понижение уровня на 2.6 dB понижает и пик:
новый истинный пик = старый истинный пик + усиление
новый истинный пик = −0.3 dBTP + (−2.6 dB)
новый истинный пик = −2.9 dBTP−2.9 dBTP ниже потолка −1 dBTP, так что программа проходит оба теста: −23 LUFS интегрально, −2.9 dBTP по истинному пику. Заметьте, порядок важен. Будь коррекция громкости вверх – будь программа слишком тихой – подъём уровня мог бы толкнуть истинный пик выше −1 dBTP, и тогда понадобился бы лимитер истинного пика, чтобы притянуть пики обратно, не меняя интегральной громкости. Эта ловушка порядка – следующий подводный камень.
«Подводный камень – нормализовать громкость и пик в неверном порядке или спутать их. Громкость (LUFS, среднее) и истинный пик (dBTP, максимум) – разные измерения, и удовлетворить надо оба. Классический провал – сначала лимитировать пики, а потом нормализовать громкость вверх, что снова заводит пики выше потолка; или обращаться с числом пика как с числом громкости. Правило: сначала нормализуйте интегральную громкость к цели, потом проверьте истинный пик, потом примените лимитер истинного пика только если потолок превышен – и перемерьте громкость после, потому что жёсткое лимитирование может её сдвинуть. Глубоко про межотсчётные пики – в Истинный пик, dBTP и проблема межотсчётного пика.»
Второй подводный камень: путаница −23 и −14
Самое вредное заблуждение в поле – «−23 LUFS – это тот самый стандарт громкости». Это вещательная цель. Число, которое вас просят достичь, зависит целиком от того, где играет контент. Европейское и американское вещание сидят около −23/−24 LUFS, потому что в гостиной с внимательными слушателями низкий фоновый шум и широкая динамика приветствуются. Музыкальные стриминги нормализуют куда громче – Spotify и другие кучкуются около −14 LUFS, – потому что прослушивание в телефоне и наушниках в шумной среде предпочитает более плотный, громкий и ровный сигнал. Кино – снова иное, калибруется опорным уровнем, а не целью в LUFS.
Доставьте подкаст, сведённый на −23 LUFS, на платформу, ждущую −16, – и слушатели потянутся к громкости, ровно то поведение, которое нормализация должна была прекратить. Стандарты этой статьи задают как измерять и дают вам вещательные цели; цели по платформам – отдельная таблица, и ошибиться в ней – частая, избегаемая оплошность. Полный набор на 2026 живёт в LUFS: целевые значения по платформам в 2026.
Где здесь Фора Софт
В продуктах OTT, видеостриминга, e-learning, телемедицины и видеоконференций, которые мы строим с 2005 года, вопрос громкости всплывает одинаково: приходит спецификация доставки или партнёрская интеграция, цитирующая «−23 LUFS, −1 dBTP, BS.1770», и команде нужно измерение, встроенное в конвейер, а не проверенное вручную в конце. Для OTT- и стриминговых клиентов мы вшиваем измерение громкости BS.1770 и лимитер истинного пика в шаг транскодинга, чтобы каждый ассет нормализовался к цели спецификации до того, как достигнет упаковщика. Для e-learning и телемедицины, где разборчивость диалога – это весь продукт, мы нормализуем захваченный звук к единой цели, чтобы тихий лектор и громкий приходили к слушателю на одной комфортной громкости. Стандарт не меняется; меняется лишь то, какую цель и какой потолок истинного пика требует рынок проекта.
Главное
- BS.1770 – линейка измерения; EBU R128 и ATSC A/85 – региональные правила.
- BS.1770 работает в четыре шага: K-взвесить, возвести в квадрат, прогейтить тихое, проинтегрировать.
- EBU R128 целит в −23 LUFS, −1 dBTP, допуск ±0.5 LU, по BS.1770.
- ATSC A/85 целит в −24 LKFS, использует якорь-диалог и обязателен по закону CALM Act.
- Сначала нормализуйте интегральную громкость, потом проверьте и лимитируйте истинный пик.
- −23 LUFS – вещательная цель; стриминг и музыка используют громче, вроде −14.