Содержание статьи +
- Кратко
- Зачем это нужно
- Сначала децибел: это отношение, а не единица громкости
- Peak: самый высокий одиночный сэмпл – и почему он врёт о громкости
- RMS: усреднение энергии – ближе, но всё ещё не громкость
- LUFS: громкость, измеренная так, как слышит ухо
- Словарь вокруг LUFS: LU, LKFS, M, S, I
- Loudness Range (LRA): насколько громкость гуляет
- True Peak и dBTP: выброс, который обычный peak-метр пропускает
- Соберём числа вместе: разбор одного показания
- Частая ошибка: «я нормализовал до 0 dB, значит, громче некуда»
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Кратко
Громкость – это то, насколько громким звук кажется человеку, и это не то же самое, что сырой электрический уровень, который показывает измеритель. Старые измерители показывают peak (один самый высокий сэмпл) или RMS (краткосрочное усреднение энергии), но ни то ни другое не совпадает с тем, что слышит ухо, – поэтому индустрия построила перцептивный показатель LUFS, заданный стандартом ITU-R BS.1770. LUFS фильтрует звук так, как ухо взвешивает частоты (K-weighting), усредняет энергию и игнорирует паузы тишины (гейтинг) – поэтому два фрагмента с одинаковым peak могут отличаться на 8 LUFS. Эта статья даёт весь словарь – децибел, peak, RMS, LUFS, LU, LKFS, K-weighting, Loudness Range и True Peak, – который все последующие статьи о стриминге и вещании считают уже известным.
Зачем это нужно
Если вы ведёте любой видеопродукт – стриминговый сервис, OTT-платформу, приложение для видеосвязи, телемедицину, – самая частая жалоба, которую вы получите, будет про громкость: реклама, которая орёт; следующая серия, которая шепчет; один спикер на звонке, которого никто не слышит. Чтобы это починить, сначала нужно измерить громкость правильно, а большинство команд измеряют её неверно, потому что хватаются за peak-метр, который к воспринимаемой громкости отношения не имеет. Эта статья – фундамент: она определяет каждый термин, который понадобится, чтобы читать таблицы целевых значений платформ, стандарты нормализации и правила ограничения true peak в остальных статьях раздела. Прочитайте её один раз – и «−14 LUFS, −1 dBTP» перестанет быть жаргоном и станет инструкцией, по которой можно действовать.
Сначала децибел: это отношение, а не единица громкости
Почти вся путаница с громкостью идёт от децибела, поэтому начнём с него. Децибел, записывается dB, – это не фиксированное количество чего-либо, это способ выразить, во сколько раз одна величина больше другой, в сжатой шкале. Это отношение, как «вдвое больше» или «в десять раз меньше», только одетое в логарифмы, чтобы очень большие и очень малые отношения помещались на одной оси.
Логарифм нужен потому, что слух логарифмичен. Переход от шёпота к обычному голосу и от обычного голоса к крику ощущаются как один «шаг вверх», хотя второй шаг несёт намного больше физической энергии. Логарифм превращает эти равные на слух шаги в равные по размеру числа – а именно это нам и нужно от шкалы громкости.
Поскольку децибел – это отношение, ему всегда нужна точка отсчёта, «по сравнению с чем». Суффикс после dB как раз называет эту точку отсчёта. dBFS означает децибелы относительно полной шкалы (full scale): 0 dBFS – это самый громкий сэмпл, который цифровая система может сохранить, а любой реальный сигнал сидит ниже него как отрицательное число. Так что −6 dBFS – это половина максимальной амплитуды, −12 dBFS – четверть, и так далее. Вот единственная децибельная арифметика, которую стоит запомнить:
изменение на +6 dB ≈ удвоение амплитуды
изменение на −6 dB ≈ половина амплитуды
изменение на +20 dB = амплитуда в десять раз большеУдержите две мысли из этого раздела. Первая: децибел описывает отношение, а не абсолютную громкость. Вторая: суффикс (FS, TP или семейство LUFS ниже) говорит, относительно чего измеряется отношение. Каждый термин в этой статье – это разный ответ на вопрос «децибелы по сравнению с чем и измеренные как».
Peak: самый высокий одиночный сэмпл – и почему он врёт о громкости
Самое простое, что может показать измеритель, – это peak: значение единственного самого громкого сэмпла на отрезке звука, выраженное в dBFS. Peak-метр отвечает на один узкий вопрос – насколько близко сигнал подошёл к цифровому потолку 0 dBFS, за которым сэмплы «клиппируют» и искажаются. Это реальный и полезный вопрос. Просто это не вопрос «насколько это громко».
Peak не годится как мера громкости потому, что громкость – это устойчивая энергия во времени, а peak – это один миг. Возьмём два фрагмента. Первый – плотный поп-мастер, который три минуты держится у верха шкалы. Второй – разреженная акустическая запись, тихая почти везде, кроме одного резкого удара барабана, который на мгновение касается того же уровня. Peak-метр покажет для обоих одно и то же число, потому что оба достигли одного самого высокого сэмпла. Ухо же сообщит, что первый фрагмент заметно громче, потому что он несёт намного больше энергии на всей длительности. Peak измерил всплеск; устойчивую громкость, которую на самом деле интегрирует ухо, он не измерил.
Есть и более тонкая проблема peak, которую мы отметим сейчас, а разберём ниже. «Peak», который показывает обычный измеритель, – это самый высокий сохранённый сэмпл. Но когда цифровой сигнал восстанавливается в непрерывную аналоговую волну для динамиков, плавная кривая, проведённая между сэмплами, может подняться выше любого отдельного сэмпла. Этот скрытый выброс называется межсэмпловым пиком (inter-sample peak), а измерение, которое его ловит, – это True Peak, в dBTP. Мы определим его как следует в разделе про True Peak ниже; пока просто запомните, что даже peak, которому вы доверяете, может недооценивать реальный сигнал.
RMS: усреднение энергии – ближе, но всё ещё не громкость
Если один peak слишком узок, естественный шаг – усреднить. RMS – от root mean square, среднеквадратичное – это способ усреднить энергию сигнала по окну времени, а не показать один миг. Название описывает рецепт: возвести каждый сэмпл в квадрат (это делает отрицательные положительными и сильно взвешивает большие значения), взять среднее этих квадратов по окну, затем извлечь корень, чтобы вернуться к исходной шкале. Результат – число, которое отслеживает устойчивый уровень звука, а не его мгновенные всплески.
RMS – настоящий шаг к громкости. Вернёмся к двум фрагментам: RMS верно покажет плотный поп-мастер намного выше разреженной акустики, потому что измеряет энергию по окну, а не один сэмпл. Десятилетиями RMS-метры (индикаторы VU и их потомки) были лучшим практическим индикатором громкости, и они до сих пор полезны.
Но у RMS есть одно слепое пятно, которого нет у уха: он считает все частоты одинаково громкими. Слух человека – нет. Мы наиболее чувствительны к середине – примерно к полосе, где живёт речь, – и намного менее чувствительны к очень низкому басу и очень высоким верхам при той же физической энергии. Трек с тяжёлым суб-басом может нести огромную RMS-энергию внизу, которую вы едва воспринимаете как громкость, а трек с сильным вокалом может казаться громким при меньшем RMS. RMS измеряет энергию честно; он просто измеряет её так, будто ваше ухо плоское, а оно не плоское. Закрыть этот разрыв – и есть вся работа следующего измерения.
LUFS: громкость, измеренная так, как слышит ухо
Это термин, на котором построен весь остальной раздел, поэтому определим его аккуратно и сначала простыми словами. LUFS – это Loudness Units relative to Full Scale, единицы громкости относительно полной шкалы. Это число на децибельной шкале ниже потолка 0 (поэтому реальный звук отрицателен, как −23 LUFS или −14 LUFS), спроектированное так, чтобы совпадать с воспринимаемой громкостью – тем, насколько громким звук судит человек, – а не с его сырой электрической энергией.
LUFS – не выдумка вендора. Он задан международным стандартом ITU-R BS.1770, сейчас в редакции 5 (опубликована в ноябре 2023), под названием Algorithms to measure audio programme loudness and true-peak audio level. Когда стриминговая платформа говорит «мы нормализуем к −14 LUFS», она указывает на конкретный воспроизводимый алгоритм из этого документа. У алгоритма три части, и понять все три можно без тяжёлой математики.
Часть первая: K-weighting – отфильтровать звук как ухо
Перед измерением энергии алгоритм пропускает звук через фиксированный двухступенчатый фильтр под названием K-weighting, который перекраивает сигнал, приближая его к собственной частотной чувствительности уха. Фильтр делает две простые вещи. Он срезает глубокий бас фильтром высоких частот (энергия ниже примерно 80 Гц считается меньше, потому что мы воспринимаем её как менее громкую) и даёт мягкий подъём около +4 dB высоким частотам выше примерно 2 кГц «высокочастотной полкой» (high-shelf), отражая лёгкий акцент, который добавляют голова и ухо. K-weighting – это шаг, который чинит слепое пятно RMS: после этого фильтра равная измеренная энергия намного ближе соответствует равной воспринимаемой громкости.
Часть вторая: средняя энергия – усреднить по программе
После K-weighting алгоритм измеряет среднюю энергию (степенное усреднение в духе среднеквадратичного) отфильтрованного сигнала по всему фрагменту. Для многоканального звука он суммирует каналы, и вот число, которое стоит запомнить: каналы окружения взвешиваются чуть выше (множитель около 1,41, примерно +1,5 dB каждый), потому что звук, приходящий сзади, воспринимается чуть громче, а канал низкочастотных эффектов (LFE), та самая «точка один», в сумму громкости не входит вовсе. Суммированная взвешенная энергия переводится в шкалу LUFS с фиксированным калибровочным смещением, встроенным в стандарт.
Часть третья: гейтинг – игнорировать тишину
Длинный фильм полон тихих мест и откровенной тишины. Если усреднить их в число громкости, насыщенная диалогами драма с долгими паузами измерилась бы искусственно тихой, и вы бы её перекрутили. Поэтому BS.1770 применяет гейтинг (gating): он измеряет звук короткими перекрывающимися блоками по 400 миллисекунд и отбрасывает блоки, упавшие ниже двух порогов. Сначала абсолютный гейт отбрасывает всё ниже −70 LUFS – настоящую тишину и «комнатный тон». Затем относительный гейт отбрасывает всё, что более чем на 10 LU ниже среднего по тому, что осталось, – действительно тихие моменты. Итоговая интегральная громкость (integrated loudness) – это среднее только по блокам, пережившим гейтинг: по тем частям, которые слушатель и назвал бы «программой».
Выигрыш всех трёх шагов вместе: два фрагмента с идентичным peak и даже похожим RMS могут оказаться на 8 LUFS врозь, и число LUFS согласится с тем, какой из них ухо называет громче. Именно поэтому весь мир стриминга и вещания стандартизировался на нём.
Словарь вокруг LUFS: LU, LKFS, M, S, I
Вместе с LUFS ходят ещё четыре слова, и они сбивают с толку только потому, что их никогда не определяют. Вот они, каждое в одну строку.
LKFS (Loudness, K-weighted, relative to Full Scale) – это то же число, что и LUFS: та же шкала, тот же алгоритм. Они взаимозаменяемы; североамериканские документы вещания (и закон США CALM Act) пишут LKFS, а европейские пишут LUFS. Если один стандарт говорит −24 LKFS, а другой −24 LUFS, они означают одно и то же.
LU (Loudness Unit) – это относительный родственник LUFS. Один LU равен одному dB разницы громкости. LUFS используют для абсолютного измерения («этот трек −16 LUFS»), а LU – для разницы или допуска («убавь на 3 LU», «допуск ±1 LU»). Шкала та же, но LUFS привязан к полной шкале, а LU – это разрыв между двумя громкостями.
Последние три – это временны́е окна, которые показывает стандартный измеритель, и все три вы читаете на реальном loudness-метре. Momentary (M), моментальная громкость, измеряется за последние 400 мс – мгновенное ощущение. Short-term (S), краткосрочная, измеряется за последние 3 секунды – полезно ловить участок, уплывающий в громкость или тишину. Integrated (I), интегральная, – это единственное усреднённое с гейтингом значение по всей программе: число, под которое вы сдаёте, то, что платформа проверяет на соответствие.
| Термин | Полное имя | Что измеряет | Когда применять |
|---|---|---|---|
| LUFS | Loudness Units rel. to Full Scale | Абсолютная воспринимаемая громкость | Цели, доставка («−14 LUFS») |
| LKFS | Loudness, K-weighted, rel. to FS | То же, что LUFS | Спеки США / вещания («−24 LKFS») |
| LU | Loudness Unit | Разница громкости (1 LU = 1 dB) | Допуски, правки («±1 LU») |
| Momentary (M) | – | Громкость за последние 400 мс | Живой мониторинг, мгновенно |
| Short-term (S) | – | Громкость за последние 3 с | Отлов перепадов между сценами |
| Integrated (I) | – | Усреднение с гейтом по всей программе | Соответствие, сдаваемое число |
Loudness Range (LRA): насколько громкость гуляет
Интегральная громкость даёт одно число на всю программу, но скрывает важное: насколько эта громкость постоянна. Ток-шоу на радио и фильм с шёпотом и взрывами могут иметь одинаковую интегральную LUFS и при этом ощущаться совершенно по-разному. Loudness Range, сокращённо LRA и измеряемый в LU, ловит этот разброс – он описывает, насколько громкость варьируется по программе, от тихих мест до громких.
LRA задан в EBU Tech 3342, спутнике рекомендации EBU R128. Метод измеряет краткосрочную громкость по всей программе, строит статистическое распределение этих значений и сообщает разброс между примерно 10-м и 95-м перцентилями (после собственного гейтинга). Малый LRA, скажем 3–5 LU, означает плотно контролируемую, постоянную громкость – типично для поп-мастера или подкаста. Большой LRA, 15 LU и выше, означает широкое динамическое путешествие – типично для киномузыки или классической записи.
Почему это важно: LRA говорит, переживёт ли звук громкую, отвлекающую обстановку. Фильм с диапазоном 20 LU великолепен в тихом кинозале и становится невыносимым в телефоне в едущем поезде, потому что тихий диалог тонет в шуме. Знание LRA до сдачи подсказывает, нужен ли отдельный, сильнее сжатый микс для мобильных. Это число для планирования, а не для соответствия.
True Peak и dBTP: выброс, который обычный peak-метр пропускает
Мы обещали вернуться к этому, и оно достаточно важно, чтобы заслужить свой раздел. Стандартный peak-метр показывает самое высокое сохранённое значение сэмпла. Но звук воспроизводится не как лесенка из дискретных сэмплов – цифро-аналоговый преобразователь восстанавливает плавную непрерывную волну, проходящую через эти точки. Между двумя сэмплами восстановленная кривая может подняться выше любого из них. Этот скрытый выброс – межсэмпловый пик (inter-sample peak), и сэмпловый peak-метр его не видит.
True Peak, измеряемый в dBTP (decibels True Peak), – это измерение, которое его ловит. Метод, тоже заданный в ITU-R BS.1770, – передискретизировать (oversample) сигнал, обычно в 4 раза, то есть математически вставить интерполированные точки между реальными сэмплами, чтобы оценить непрерывную волну, и затем прочитать истинный максимум этой более плотной кривой. Возвращаемое число часто на несколько десятых dB выше сэмплового peak, а иногда и более чем на целый dB.
Это не теория. Мастер, который читается ровно как 0,0 dBFS на сэмпловом peak-метре, может иметь true peak на +0,7 dBTP и выше. Когда такой файл декодируется – особенно после кодека с потерями вроде AAC, который добавляет собственный выброс, – эти межсэмпловые пики клиппируют аналоговый каскад телефона или наушников, и вы слышите треск. Поэтому стриминговые платформы ставят потолок True Peak ниже нуля: максимально допустимый уровень EBU R128 – это −1 dBTP, и большинство стриминговых сервисов тоже берут −1 dBTP, оставляя запас на выброс, который сэмпловый метр так и не показал. (Глубокий разбор межсэмпловых пиков и ограничения живёт в статье True Peak, dBTP и проблема межсэмплового пика.)
Соберём числа вместе: разбор одного показания
Пусть четыре измерения заговорят вместе на одной воображаемой сдаче. Допустим, ваш loudness-метр, прогнанный по готовому 30-секундному ролику, показывает:
Integrated loudness = −18.0 LUFS
Loudness Range (LRA) = 4.0 LU
True Peak (max) = −0.4 dBTP
Sample peak (max) = −1.1 dBFSПрочтите это как фразу. Общая воспринимаемая громкость ролика −18,0 LUFS – умеренная: громче нормы вещания −23 LUFS, тише цели музыкального стриминга −14 LUFS. Диапазон громкости 4,0 LU узок, значит, ролик ровно громкий на всём протяжении, без тихих мест, которые исчезнут в телефоне. Но посмотрите на пики: сэмпловый peak комфортный −1,1 dBFS, а True Peak −0,4 dBTP – межсэмпловый выброс добавил 0,7 dB, которые сэмпловый метр не показал. Если ваша спека требует −1 dBTP, этот файл не проходит по true peak, хотя на сэмпловом метре выглядит безопасным, и вы бы убавили его или применили true-peak лимитер перед сдачей.
Это одно показание – вся статья в миниатюре: peak защищает от клиппинга, True Peak защищает от скрытого клиппинга, LUFS описывает воспринимаемую громкость, а LRA описывает, насколько эта громкость гуляет.
Частая ошибка: «я нормализовал до 0 dB, значит, громче некуда»
Самая частая ошибка громкости, которую мы видим, – путать пиковую нормализацию с нормализацией громкости. Пиковая нормализация поднимает файл, пока самый громкий сэмпл не коснётся 0 dBFS (или какого-то потолка). Она гарантирует, что вы использовали весь цифровой диапазон, – и почти ничего не говорит о том, насколько громко это ощущается. Два файла, оба пиково-нормализованные до 0 dBFS, могут отличаться на 10 LUFS по воспринимаемой громкости, потому что один плотный и устойчивый, а другой разреженный с одним высоким всплеском.
Последствие вылезает в тот момент, когда ваш звук встречает современную платформу. Spotify, YouTube, Apple Music и тракты вещания не интересуются вашим peak – они измеряют вашу интегральную LUFS и поднимают или опускают весь трек под свою цель. Трек, который вы «максимизировали» до 0 dBFS, но который сидит на −9 LUFS, платформа просто убавит до цели −14 LUFS, и весь клиппинг, которым вы рисковали ради громкости, не даст ничего. Решение – сводить и мастерить под цель LUFS и потолок dBTP, а не под peak. Громкость – цель; peak – лишь страховочное ограждение.
Где здесь Фора Софт
В продуктах, которые мы строим с 2005 года – видеостриминг и OTT-платформы, e-learning, телемедицина, живая видеосвязь, – громкость редко бывает «приятным дополнением»; именно на ней пользователи замечают швы. В работе над стримингом и OTT мы измеряем интегральную LUFS и True Peak каждого ассета до того, как он попадёт в библиотеку, чтобы серия, реклама и трейлер не скакали по громкости при воспроизведении подряд. В живой видеосвязи и телемедицине тот же словарь управляет ступенями автоматической регулировки усиления и выравнивания, которые держат тихого пациента и громкого врача на комфортном, ровном уровне. Повторяющийся урок везде один – тот же, что учит эта статья: измеряйте воспринимаемую громкость через LUFS и стерегите потолок через dBTP, и тикеты «почему так громко / так тихо» по большей части исчезают.
Главное
- Децибел – это отношение, а не громкость; суффикс (FS, TP, LUFS) называет точку отсчёта.
- Peak показывает самый громкий одиночный сэмпл – полезно от клиппинга, бесполезно для громкости.
- RMS усредняет энергию, но считает все частоты равными, в отличие от уха.
- LUFS (ITU-R BS.1770) добавляет K-weighting и гейтинг, чтобы совпасть с воспринимаемой громкостью.
- LKFS = LUFS; LU – это разница громкости; M/S/I – окна 400 мс / 3 с / вся программа.
- True Peak (dBTP) ловит межсэмпловый выброс, который сэмпловый метр пропускает – держите ≤ −1 dBTP.