Битовая глубина и динамический диапазон: 16 бит, 24 бита, 32-bit float

Автор: Николай СапуновОбновлено: август 202625 мин чтения
Содержание статьи +

Опубликовано: 2026-06-04 · Время чтения: 17 мин · Автор: Николай Сапунов, CEO Фора Софт

Кратко

Битовая глубина определяет, насколько точно система измеряет громкость каждого отсчёта звука, и в первую очередь отвечает за один параметр – разницу между самым тихим и самым громким звуком, которые запись может зафиксировать. Эту разницу называют динамическим диапазоном, и он увеличивается примерно на 6 децибел с каждым дополнительным битом. Шестнадцать бит обеспечивают около 96 дБ диапазона – этого вполне достаточно для любого финального файла, который услышит слушатель, – а 24 бита дают около 144 дБ. Их реальная ценность не в улучшении звучания, а в запасе при записи, чтобы не приходилось идеально выравнивать уровни. Новейший формат – 32-битный float – хранит числа таким образом, что цифровой клиппинг становится практически невозможным, поэтому полевые рекордеры и современные редакторы используют его при записи, хотя итоговый файл по-прежнему остаётся 16- или 24-битным. В статье объясняется, откуда берётся правило «6 дБ на бит», в каких случаях оправдана та или иная глубина и какое самое распространённое заблуждение портит результат: будто больше бит делают готовый трек лучше.

Почему это важно

Если вы создаёте или ведёте видеопродукт – приложение для видеосвязи, OTT-сервис, образовательную или телемедицинскую платформу, – битовая глубина – одно из первых чисел, которое выбирают ваши инженеры. Неправильный выбор либо тратит хранилище впустую, либо, что хуже, навсегда закрепляет испорченную запись, которую уже не исправить. Быть инженером для этого не обязательно, но важно понимать, почему 24 бита полезны при записи, но не при доставке, и что на самом деле даёт 32-битный float. Статья написана для умного читателя без аудиофона; при этом каждый факт корректен и для старшего инженера и подкреплён стандартом или работой, которые его определяют. После прочтения вы сможете уверенно выбрать битовую глубину и объяснить свой выбор любому в команде.

Короткое напоминание: что такое отсчёт

Прежде чем понять, что такое битовая глубина, вспомните, как звук превращается в данные – об этом подробно рассказано в статье Что такое цифровой звук: от звуковой волны к битам. Микрофон преобразует колебания давления воздуха в плавно изменяющееся электрическое напряжение. Аналого-цифровой преобразователь (чип) измеряет уровень этого напряжения в регулярные, близкие по времени моменты и записывает каждое значение числом, которое называют отсчётом (sample). В соседней статье Частота дискретизации: 44.1, 48, 96, 192 kHz объясняется, как часто система делает такие измерения. А эта статья отвечает на другой вопрос: насколько точно она фиксирует каждое значение. Эта точность и есть битовая глубина.

Чем на самом деле управляет битовая глубина

Число, которое называют битовой глубиной, – это количество двоичных разрядов (бит), которое система использует для записи громкости каждого отсчёта. Представьте её как количество ступенек на лестнице: когда преобразователь измеряет напряжение, он не может зафиксировать точное значение – приходится округлять до ближайшей ступеньки. Чем больше ступенек, тем меньше погрешность округления, и тем ближе сохранённое значение к реальному.

Число ступенек удваивается с каждым битом, потому что каждый бит – это переключатель «да/нет». Один бит даёт 2 ступеньки, два бита – 4, восемь бит – 256. Общее правило – два в степени битовой глубины:

16 бит: 2^16 = 65 536 уровней громкости на отсчёт
24 бита: 2^24 = 16 777 216 уровней громкости на отсчёт

То есть 16-битный отсчёт может попасть на любую из 65 536 ступенек, а 24-битный – на любую из почти 16,8 миллиона. Целочисленные отсчёты хранятся как знаковые значения – от большого отрицательного до большого положительного, потому что звуковая волна колеблется как выше, так и ниже линии тишины. Для 16 бит этот диапазон – от −32 768 до +32 767.

Вот правило, на котором часто спотыкаются, и его стоит озвучить заранее: битовая глубина не влияет на то, какие частоты вы захватываете и насколько чистым остаётся звук при нормальной громкости. Это определяет частота дискретизации – отдельная характеристика. Битовая глубина отвечает только за одно: сколько тихих деталей сохраняется под громкими участками. Технически этот параметр называют динамическим диапазоном, и он – сердце статьи.

Единственное правило: примерно 6 дБ на бит

Динамический диапазон – это разница между самым громким звуком, который система может воспроизвести без искажений, и самым тихим, который ещё различим на фоне собственного шума системы. Эта величина измеряется в децибелах (dB) – логарифмической единице, при которой каждые 6 dB примерно соответствуют удвоению уровня сигнала. Тихий «пол» существует потому, что округление каждого отсчёта до ближайшей ступеньки вносит крошечную ошибку, а на миллионах отсчётов эти погрешности накапливаются, образуя слабый фоновый шум – шум квантования, цифровой аналог шипения плёнки.

Каждый добавленный бит вдвое уменьшает шаг квантования, вдвое снижает ошибку округления и понижает уровень шумового пола примерно на 6 дБ. Именно это и составляет знаменитое правило. Точная формулировка, выведенная У. Р. Беннеттом в Bell Labs в 1948 году и приведённая в стандартном инженерном справочнике (Analog Devices, MT-001), звучит так:

SNR = 6.02 × N + 1.76 dB

где N – число бит, а SNR – отношение сигнал/шум, то есть разница между самым громким сигналом и уровнем шумового пола. Для полноволнового сигнала это отношение равно динамическому диапазону. Подставим типичные значения глубины:

16 бит: 6.02 × 16 + 1.76 = 98,1 dB
24 бита: 6.02 × 24 + 1.76 = 146,3 dB

Чаще в обиходе используют округлённые значения – 96 дБ для 16 бит и 144 дБ для 24 бит. При этом отбрасывается слагаемое +1,76 дБ, и просто берётся 6 дБ на бит; обе формулировки корректны, но отвечают на немного разные вопросы (значение 1,76 дБ зависит от типа сигнала). В разговоре лучше использовать округлённые цифры, а формулу приводить только тогда, когда важна точность.

Рис. 1. Каждый бит увеличивает динамический диапазон примерно на 6 дБ, снижая уровень шума квантования. 16 бит (96 дБ) уже превышают порог чувствительности человеческого слуха (~120 дБ) после применения дизеринга и шумоподавления; 24 бита (144 дБ) обеспечивают запас, а не добавляют слышимые детали.

Достаточно ли 16 бит? Сравните со своими ушами

Полезнее всего оценить динамический диапазон, сравнив его с диапазоном человеческого слуха. Ваши уши воспринимают звуки от порога слышимости – самого тихого, который вы различаете в тихой комнате, – до порога боли, когда звук становится физически вредным. Этот диапазон составляет около 120 дБ.

Теперь сравните: 96 дБ у 16-битного файла на бумаге – это немного меньше, чем 120 дБ. Но два приёма закрывают этот разрыв. Первый – дизеринг (dither), подробно рассмотренный в следующем разделе, и дополнение к нему под названием noise-shaping, которое маскирует шум в частотных диапазонах, к которым человеческое ухо наименее чувствительно. Благодаря формованному дизеру воспринимаемый динамический диапазон 16-битного звука достигает примерно 120 дБ – как утверждает Крис Монтгомери из Xiph.Org, соавтор кодека Opus: «16 бит достаточно, чтобы сохранить всё, что мы способны услышать». Второй приём проще: ни одна среда прослушивания не является абсолютно бесшумной; шум помещения и вашей собственной техники находится заметно выше уровня шума 16-битного файла.

Поэтому для готового файла, который слушает человек, 16 бит – не компромисс, а достаточный навсегда формат для человеческих ушей. Аргумент в пользу большего числа битов никогда не касается слушателя. Он целиком связан с тем, что происходит до готового файла – на этапах записи и монтажа, о которых и пойдёт речь в следующих разделах.

Задача, которую решают 24 бита: уровни, не видимые заранее

Если 16 бит достаточно для слушателя, зачем профессиональные рекордеры записывают в 24 бита? Ответ – запас (headroom), свободное пространство сверху шкалы, которое оставляют намеренно.

Когда вы записываете, заранее неизвестно, насколько громким окажется самый громкий момент. Спикер наклоняется к микрофону, музыкант резко подчёркивает фразу, звуковой эффект резко возрастает. Максимальный уровень, который может принять цифровая система, – это жёсткий потолок под названием 0 dBFS (децибелы относительно полной шкалы). Перешагнёте его – и волна клиппируется: её вершины срезаются ровно, вызывая резкое искажение, которое уже невозможно исправить. Чтобы избежать этого, инженеры стараются, чтобы самый громкий ожидаемый пик был заметно ниже потолка. Стандартная цель – средний уровень около −18 dBFS, что оставляет примерно 18 дБ свободного пространства сверху на случай неожиданных всплесков; такая цифровая практика унаследована напрямую от аналоговой плёнки.

Здесь и вступает битовая глубина. Оставить 18 дБ запаса – значит не использовать верхние 3 бита шкалы. В 16 битах отказ от этих битов сдвигает полезный диапазон ближе к шумовому уровню, и тихие детали начинают теряться. В 24 битах у вас на 48 дБ больше динамического диапазона, поэтому можно оставить щедрый запас – даже 15–20 дБ, – и шумовой пол всё ещё будет настолько глубоким, что ни один слушатель его не услышит. Проверим арифметику:

диапазон 24 бит:              144 dB
запас сверху:                 −18 dB
оставшийся полезный диапазон: 126 dB   (всё ещё больше 120 dB слуха)

В этом и заключается смысл записи в 24 бита. Она не делает звук лучше – она делает работу с уровнями более прощающей. Можно небрежно обращаться с гейном и всё равно получить чистую запись, потому что шумовой пол 24-битного формата зарыт так глубоко, что даже тихая, плохо выверенная запись уверенно остаётся выше него.

Стоит знать о реальном потолке: 144 дБ, которые 24 бита теоретически способны закодировать, – это больше, чем может выдать любой микрофон или преобразователь. Лучшие аналого-цифровые преобразователи обеспечивают эффективное разрешение около 21 бита – примерно 123 дБ, – поскольку шум схемы «топит» младшие биты. Поэтому 24 бита дают комфортное рабочее пространство: реальный предел задают законы физики, а не формат. Именно поэтому чип «32-битного преобразователя» – это маркетинг: лишние биты ниже 21-го хранят лишь шум.

Дизеринг: превращаем искажение в мягкое шипение

Когда вы снижаете битовую глубину записи с высокой до меньшей – последний этап перед выдачей 16-битного файла – возникает тонкая проблема, и важно понять её решение, потому что неправильный выбор звучит плохо.

Понижение с 24 до 16 бит означает отбрасывание 8 младших бит каждого отсчёта. Простейший способ – усечение (truncation): просто обрезать их. Проблема в том, что оставшаяся ошибка округления не является случайной – она следует за музыкой, и ухо воспринимает систематическую ошибку как искажение: зернистый, грязноватый оттенок, особенно заметный в тихих затуханиях – например, в хвосте реверберации или в угасающей ноте рояля.

Лекарство – дизеринг: добавление крошечного, намеренного шума перед понижением. Звучит парадоксально – добавить шум, чтобы очистить звук, – но это работает: шум рандомизирует округление, ошибка перестаёт быть систематической, и уродливое искажение превращается в ровное, постоянное шипение, едва слышное на фоне. Стандартный рецепт – TPDF-дизер (triangular probability density function), особая форма шума, которая математически устраняет систематическое искажение. Добавьте необязательное уточнение noise-shaping – и это шипение уйдёт в частоты, которые ухо почти не замечает.

«Частая ошибка: усечение вместо дизеринга при экспорте 16-битного мастер-файла. На громком, насыщенном материале ущерб от этого минимален, но становится заметным на тихих, открытых фрагментах – именно тех, на которые слушатель обращает внимание. При финальном понижении глубины всегда применяйте дизеринг; дважды его применять не нужно. И помните: 24- и 32-битным файлам дизеринг не требуется, потому что их шумовой пол уже ниже любого уровня шума, который вы могли бы добавить.»

32-битный float: формат, который нельзя обрезать

Новейший вариант меняет правила игры. Там, где 16 и 24 бита хранят каждый отсчёт как обычное целое число – с фиксированным шагом, – 32-битный формат с плавающей запятой хранит его так, как научный калькулятор хранит очень большие и очень маленькие числа: как дробь, умноженную на масштабный множитель. Формат соответствует стандарту IEEE 754 и делит свои 32 бита на знак, 23-битную дробную часть (мантиссу) и 8-битный показатель степени (exponent), который сдвигает запятую.

Этот скользящий показатель – и есть магия. Поскольку масштаб может меняться, формат охватывает огромный диапазон – около 1528 дБ, далеко за пределами всего, что существует в физической реальности. Главное практическое следствие – запись в формате 32-битный float невозможно обрезать цифровым способом. Если звук выходит «за 0 дБФС», число просто сохраняется с большим показателем, а не упирается в потолок. Откроете файл позже, снизите уровень – и пик останется целым, будто никогда не был слишком громким.

Поэтому современные полевые рекордеры и большинство крупных программ монтажа теперь записывают или обрабатывают звук в формате 32-бит float. В таких рекордерах приёмная часть обычно состоит из двух параллельно работающих аналого-цифровых преобразователей: один настроен на тихие звуки, другой – на громкие, а устройство объединяет их выходы в единый поток 32-бит float. В результате получается рекордер, в котором вы больше не должны подбирать входные уровни: сначала запись, потом регулировка уровня в программе. Внутри цифровой рабочей станции это свойство означает, что микс, превысивший 0 dBFS, не будет испорчен – просто опустите мастер-фейдер, и визуально клиппированная волна снова станет пригодным для работы миксом.

Рис. 2. Целочисленный (fixed-point) звук жёстко клиппирует на 0 dBFS – верхушки срезаны и потеряны. 32-битный float хранит тот же зашкаленный сигнал целиком; понижение уровня после обработки восстанавливает исходную волну.

Две честные оговорки не превращают это в чудо. Во-первых, 32-битный float защищает только цифровой этап. Если капсюль микрофона или аналоговый предусилитель перед АЦП перегружены, искажения уже зафиксированы до того, как в системе появится хоть одно число, и никакой формат их не устранит. Во-вторых, приём с двумя преобразователями может вызвать кратковременный всплеск ультразвукового шума в момент переключения между тихим и громким преобразователем – он находится выше слышимого диапазона и редко имеет значение, но он существует. 32-битный float устраняет ошибку установки уровня, но не все возможные ошибки.

Когда что использовать: руководство

Выбор сводится к короткому набору правил. Читайте сверху вниз и останавливайтесь на первой строке, подходящей к вашей задаче.

Ваша ситуацияГлубинаПочему
Захват того, что нельзя переписать (интервью, поле, лайв)32-bit floatНевозможно клиппировать; без уровней; спасает горячие и тихие дубли
Студийная запись и сведение в DAWЗахват 24 бита, обработка 32-bit floatЩедрый запас на входе; нет клиппинга при монтаже
Доставка готового файла слушателям (стрим, скачивание)16 битХватает для слуха; вдвое меньше 24 бит
Архивный мастер незаменимого источника24 бита (или 32-bit float)Запас на будущее; хранилище для мастеров дёшево
Реальное время (WebRTC, видеосвязь)16 бит внутриКодеки (Opus) работают в 16-битном PCM; больше бит – лишний CPU
Телефония / узкая полоса (legacy)8 бит с компандированиемЗадаётся кодеком (G.711 μ-law/A-law), а не свободный выбор

Табл. 1. Выбор битовой глубины по задаче. Работайте с высокой глубиной (24 бита или 32-битный float), экспортируйте в 16 битах. Глубина записи и глубины экспорта – разные решения.

Рис. 3. Дерево решений сверху вниз: решения о захвате данных ведут к 32-бит float или 24 битам ради запаса; любой путь доставки приходит к 16 битам, поскольку они уже покрывают диапазон человеческого слуха.

Дорогое заблуждение: «больше бит – лучше звук»

Самое частое и затратное заблуждение о битовой глубине – будто большее число бит делает финальный трек лучше для слушателя. Это не так, и причина прямо вытекает из всего сказанного выше. Как только динамический диапазон файла превышает возможности человеческого слуха – а 16-битный файл с дизерингом уже обеспечивает такой диапазон, – дополнительные биты лишь снижают уровень шумового пола, который и так находится ниже порога слышимости и ниже фонового шума в комнате, где вы находитесь. Слушатель ничего не выигрывает; файл просто становится больше.

Практические провалы конкретны:

  • Отдача 24-битного звука потребителю удваивает объём хранилища и трафика ради деталей, которые никто не услышит, тогда как правильно дизеренный 16-битный файл в слепом тесте неотличим.
  • Запись приложения видеосвязи в 24 битах тратит ресурсы процессора и пропускную способность, которые лучше направить на эхоподавление и шумоподавление – ведь голосовой кодек всё равно работает в 16 битах.
  • Усечение вместо дизеринга при понижении до 16 бит добавляет слышимую зернистость именно в тех фрагментах – тихих затуханиях, – где ухо особенно чувствительно.

Подбирайте глубину под задачу. Правильный подход почти всегда один: работайте с высокой битовой глубиной ради надёжности, а отдавайте результат в 16 битах ради слушателя. Два конца конвейера решают разные задачи, и их смешение – там, где теряются и деньги, и качество.

Где здесь Фора Софт

Во всех видеопродуктах, которые мы создаём в Фора Софт – видеосвязь, телемедицина, OTT, образование, видеонаблюдение, AR/VR – выбор битовой глубины строго регламентирован на разных этапах, и правильное решение на старте – одно из самых дешёвых способов улучшить качество во всём конвейере. Для голосовой связи в реальном времени, используемой в видеосвязи и телемедицине, мы работаем с 16-битным PCM, поскольку кодек Opus и стек WebRTC изначально ориентированы на этот формат, а освободившиеся ресурсы CPU направляем на подавление эха и шума. Для записанного и сведённого контента – лекций в образовании, материалов OTT – мы записываем и монтируем с высокой битовой глубиной, оставляя запас, а затем применяем дизеринг перед снижением до 16 бит для доставки. Чаще всего в унаследованных системах мы исправляем конвейер, который отдаёт пользователям 24 бита без слышимой пользы, или усекает до 16 бит без дизера, что приводит к появлению зернистости в тихих фрагментах.

Главные выводы

  • Битовая глубина определяет динамический диапазон, а не чистоту сигнала; примерно 6 дБ на бит.
  • 16 бит обеспечивают около 96 дБ – этого достаточно для восприятия после добавления дизера.
  • 24 бита дают 144 дБ – это запас при записи, а не улучшение конечного звучания.
  • 32-битный float исключает цифровой клиппинг: сначала происходит захват сигнала, затем его уровень выравнивается.
  • При финальном понижении до 16 бит используется дизер, а не усечение.
  • Записывайте с высоким разрешением, но сдавайте в 16 битах: исходные и финальные форматы решают разные задачи.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.