Битовая глубина и динамический диапазон: 16 бит, 24 бита, 32-bit float

Автор: Николай СапуновОбновлено: август 202624 мин чтения
Содержание статьи +

Опубликовано: 2026-06-04 · Время чтения: 17 мин · Автор: Николай Сапунов, CEO Фора Софт

Кратко

Битовая глубина – это то, насколько точно система измеряет громкость каждого отсчёта звука, и она управляет прежде всего одним: разрывом между самым тихим звуком, который запись способна удержать, и самым громким. Этот разрыв называют динамическим диапазоном, и он растёт примерно на 6 децибел с каждым добавленным битом. Шестнадцать бит дают около 96 dB диапазона – этого хватает любому готовому файлу, который услышит слушатель, – а 24 бита дают около 144 dB, чья реальная ценность не в лучшем звуке, а в запасе при записи, чтобы вам не приходилось выставлять уровни идеально. Новейший формат, 32-bit float, хранит числа так, что цифровой клиппинг становится практически невозможным, поэтому полевые рекордеры и современные редакторы перешли на него при записи, хотя итоговый файл по-прежнему 16- или 24-битный. В статье разобрано, откуда берётся правило «6 dB на бит», когда какая глубина оправдана и какое самое частое заблуждение портит результат: будто больше бит делают готовый трек лучше.

Почему это важно

Если вы создаёте или ведёте видеопродукт – приложение для видеосвязи, OTT-сервис, образовательную или телемедицинскую платформу, – битовая глубина одно из первых чисел, которое выбирают ваши инженеры, и неверный выбор либо тратит хранилище впустую, либо, что хуже, навсегда закрепляет испорченную запись, которую уже не починить. Не обязательно быть инженером, чтобы решить верно, но нужно понимать, что это число регулирует, почему 24 бита помогают при записи, но не при доставке, и что на самом деле даёт 32-bit float. Статья написана для умного читателя без аудиобэкграунда; при этом каждый факт корректен и для старшего инженера и подкреплён стандартом или работой, которые его определяют. После прочтения вы сможете уверенно выбрать битовую глубину и объяснить выбор любому в команде.

Короткое напоминание: что такое отсчёт

Прежде чем битовая глубина обретёт смысл, вспомните, как звук становится данными – это подробно разобрано в статье Что такое цифровой звук: от звуковой волны к битам. Микрофон превращает перепады давления воздуха в плавно колеблющееся электрическое напряжение. Чип – аналого-цифровой преобразователь – измеряет высоту этого напряжения в регулярные, близко расположенные моменты и записывает каждое измерение числом, которое называют отсчётом (sample). Соседняя статья Частота дискретизации: 44.1, 48, 96, 192 kHz отвечает на вопрос, как часто система берёт эти измерения. Эта статья отвечает на другой вопрос: насколько точно она записывает каждое измерение. Эта точность и есть битовая глубина.

Чем на самом деле управляет битовая глубина

Число, которое называют битовой глубиной, – это сколько двоичных разрядов (бит) система использует, чтобы записать громкость каждого отсчёта. Думайте о ней как о числе ступенек на лестнице. Когда преобразователь измеряет напряжение, он не может сохранить точную высоту – приходится округлять до ближайшей ступеньки. Больше ступенек – мельче округление, и сохранённое число оказывается ближе к истинному.

Число ступенек удваивается с каждым битом, потому что каждый бит – это переключатель «да/нет». Один бит даёт 2 ступеньки, два бита – 4, восемь бит – 256. Общее правило – два в степени битовой глубины:

16 бит: 2^16 = 65 536 уровней громкости на отсчёт
24 бита: 2^24 = 16 777 216 уровней громкости на отсчёт

То есть 16-битный отсчёт может попасть на любую из 65 536 ступенек, а 24-битный – на любую из почти 16,8 миллиона. Целочисленные отсчёты хранятся как знаковые значения – от большого отрицательного числа до большого положительного, потому что звуковая волна качается и выше, и ниже линии тишины. Для 16 бит этот диапазон идёт от −32 768 до +32 767.

Вот правило, на котором спотыкаются, и его стоит проговорить заранее: битовая глубина не меняет, какие частоты вы захватываете и насколько чист звук на нормальной громкости. Это задаёт частота дискретизации – отдельное число. Битовая глубина управляет только одним – сколько тихих деталей выживает под громкими частями. Технически этот разрыв называют динамическим диапазоном, и он – сердце статьи.

Единственное правило: примерно 6 dB на бит

Динамический диапазон – это расстояние между самым громким звуком, который система может сохранить без искажений, и самым тихим, который она удерживает прежде, чем он растворится в собственном фоновом шипении системы. Это расстояние меряют в децибелах (dB) – логарифмической единице, где каждые 6 dB примерно соответствуют удвоению уровня сигнала. Тихий «пол» существует потому, что округление каждого отсчёта до ближайшей ступеньки оставляет крошечную ошибку, а на миллионах отсчётов эти ошибки складываются в слабый фоновый шум – шум квантования, цифровой аналог шипения плёнки.

Каждый добавленный бит вдвое уменьшает ступеньку, вдвое уменьшает ошибку округления и опускает этот шумовой пол примерно на 6 dB. Это и есть знаменитое правило. Точная версия, выведенная У. Р. Беннеттом в Bell Labs в 1948 году и приведённая в стандартном инженерном справочнике (Analog Devices, MT-001), такова:

SNR = 6.02 × N + 1.76 dB

где N – число бит, а SNR – отношение сигнал/шум, то есть разрыв между самым громким сигналом и шумовым полом, который для полношкального сигнала равен динамическому диапазону. Подставим обычные глубины:

16 бит: 6.02 × 16 + 1.76 = 98,1 dB
24 бита: 6.02 × 24 + 1.76 = 146,3 dB

Чаще в обиходе пишут округлённые числа – 96 dB для 16 бит и 144 dB для 24 бит. Они отбрасывают слагаемое +1,76 dB и просто считают 6 dB на бит; обе формулировки верны, они отвечают на чуть разные вопросы (слагаемое 1,76 dB зависит от типа сигнала). В разговоре используйте округлённые числа; формулу приводите, когда важна точность.

Рис. 1. Каждый бит добавляет около 6 dB диапазона, опуская шумовой пол квантования. 16 бит (96 dB) уже превосходят ~120 dB человеческого слуха после дизеринга и noise-shaping; 24 бита (144 dB) добавляют запас, а не слышимую деталь.

Достаточно ли 16 бит? Сравните со своими ушами

Полезнее всего судить о числе динамического диапазона, сравнив его с диапазоном человеческого слуха. Ваши уши работают от порога слышимости – самого тихого звука, который вы различаете в тихой комнате, – до порога боли, где звук становится физически вредным. Этот разрыв – около 120 dB.

Теперь сравните. 96 dB у 16-битного файла на бумаге чуть меньше этих 120 dB. Но два приёма закрывают разрыв. Первый – дизеринг (dither), разобранный в следующем разделе, плюс уточнение под названием noise-shaping, которое прячет шум в частотах, к которым ухо наименее чувствительно. С формованным дизером воспринимаемый динамический диапазон 16-битного звука достигает примерно 120 dB – Крис Монтгомери из Xiph.Org, соавтор кодека Opus, говорит прямо: 16 бит хватает, чтобы сохранить всё, что мы способны услышать. Второй приём прост: ни одна среда прослушивания не бесшумна; шум комнаты и вашей же техники сидит заметно выше шумового пола 16 бит.

Поэтому для готового файла, который слушает человек, 16 бит – не компромисс, а достаточный навсегда формат для человеческих ушей. Аргумент за большее число бит никогда не про слушателя. Он целиком про то, что происходит до готового файла – при записи и монтаже, к чему и переходят следующие разделы.

Задача, которую решают 24 бита: уровни, которых не видно заранее

Если 16 бит хватает слушателю, зачем профессиональные рекордеры пишут в 24 битах? Ответ – запас (headroom), пустое место сверху шкалы, которое оставляют намеренно.

Когда вы записываете, вы не знаете заранее, насколько громким будет самый громкий момент. Спикер наклонился к микрофону, музыкант резко акцентировал, звуковой эффект скакнул. Самый громкий уровень, который цифровая система может взять, – жёсткий потолок под названием 0 dBFS (децибелы относительно полной шкалы). Перейдёте его – и волна клиппируется: верхушки срезаются плоско, давая резкое искажение, которое уже не отменить. Чтобы перестраховаться, инженеры пишут так, чтобы самый громкий ожидаемый пик был заметно ниже потолка. Стандартная цель – около −18 dBFS среднего уровня, что оставляет примерно 18 dB пустого места сверху на неожиданности; цифровая привычка, унаследованная прямо от практики аналоговой плёнки.

Здесь и вступает битовая глубина. Оставить 18 dB запаса – значит не использовать верхние 3 бита шкалы. В 16 битах жертва этими битами сдвигает полезный диапазон к шумовому полу, и тихая деталь начинает страдать. В 24 битах у вас на 48 dB диапазона больше, поэтому можно оставить щедрый запас – даже 15–20 dB, – и шумовой пол всё ещё так глубоко, что ни один слушатель до него не дойдёт. Проверим арифметику:

диапазон 24 бит:              144 dB
запас сверху:                 −18 dB
оставшийся полезный диапазон: 126 dB   (всё ещё больше 120 dB слуха)

В этом весь смысл записи в 24 битах. Она не делает звук лучше; она делает выставление уровней прощающим. Можно небрежно обращаться с гейном и всё равно отдать чистую запись, потому что шумовой пол 24 бит зарыт так глубоко, что даже тихая, плохо выставленная запись комфортно стоит выше него.

Стоит знать о реальном потолке. 144 dB, которые 24 бита способны закодировать в теории, – больше, чем может выдать любой микрофон или преобразователь. Лучшие аналого-цифровые преобразователи дают эффективное разрешение около 21 бита – примерно 123 dB, – потому что шум схемы топит младшие биты. Так что 24 бита дают комфортное рабочее пространство; реальный пол задают законы физики, а не формат. Поэтому же чип «32-битного преобразователя» – это маркетинг: лишние биты ниже 21-го хранят только шум.

Дизеринг: меняем искажение на мягкое шипение

Когда вы понижаете запись с высокой битовой глубины до меньшей – последний шаг перед отдачей 16-битного файла, – возникает тонкая проблема, и стоит понять её решение, потому что неверный выбор звучит плохо.

Понижение с 24 бит до 16 означает выбросить 8 младших бит каждого отсчёта. Грубый способ сделать это – усечение (truncation): просто отрубить их. Беда в том, что оставшаяся ошибка округления не случайна – она следует за музыкой, а ухо слышит закономерную ошибку как искажение: зернистый, грязноватый край, заметнее всего в тихих затуханиях – в хвосте реверберации или в угасающей ноте рояля.

Лекарство – дизеринг: добавление крошечного, намеренного шипения случайного шума перед понижением. Звучит наоборот – добавить шум, чтобы очистить звук, – но это работает: шум рандомизирует округление, ошибка перестаёт быть закономерной, и уродливое искажение превращается в ровное, постоянное шипение далеко ниже всего слышимого. Стандартный рецепт – TPDF-дизер (triangular probability density function), особая форма шума, которая математически устраняет закономерное искажение. Добавьте необязательное уточнение noise-shaping – и это шипение уйдёт в частоты, которые ухо почти не замечает.

«Частая ошибка: усечение вместо дизеринга при экспорте 16-битного мастера. Урон мал на громком, плотном материале и очевиден на тихих, открытых фрагментах – именно тех моментах, на которые слушатель обращает внимание. Всегда применяйте дизер при финальном понижении глубины; никогда не дизерите дважды. И учтите: 24- и 32-битным файлам дизер не нужен, потому что их шумовой пол уже ниже любого дизера, который вы могли бы добавить.»

32-bit float: формат, который нельзя клиппировать

Новейший вариант меняет правила. Там, где 16 и 24 бита хранят каждый отсчёт как обычное целое – фиксированное число ступенек, – 32-bit floating point хранит его так, как научный калькулятор хранит очень большие и очень маленькие числа: как дробь, умноженную на масштабный множитель. Формат следует стандарту IEEE 754 и делит свои 32 бита на знак, 23-битную дробь (мантиссу) и 8-битный показатель степени (exponent), сдвигающий запятую.

Этот скользящий показатель – и есть магия. Поскольку масштаб может двигаться, формат покрывает огромный диапазон – около 1528 dB, далеко за пределами всего, что есть в физической реальности. Практическое следствие – главная особенность: запись 32-bit float нельзя клиппировать цифрово. Если звук уходит «за 0 dBFS», число просто хранится с бо́льшим показателем, а не упирается в потолок. Откроете файл позже, опустите уровень – и пик цел, словно никогда не был слишком громким.

Поэтому современные полевые рекордеры и каждая крупная программа монтажа теперь пишут или обрабатывают в 32-bit float. В рекордере приём обычно собран из двух аналого-цифровых преобразователей, работающих параллельно: один настроен на тихие звуки, другой на громкие, а устройство сшивает их выходы в единый поток 32-bit float. Получается рекордер, в котором вы вообще перестаёте выставлять входные уровни: сначала захват, потом установка уровня в программе. Внутри цифровой рабочей станции то же свойство означает, что микс, перескочивший 0 dBFS, не испорчен – опустите мастер-фейдер, и клиппированная на вид волна снова станет рабочим миксом.

Рис. 2. Целочисленный (fixed-point) звук жёстко клиппирует на 0 dBFS – верхушки срезаны и потеряны. 32-bit float хранит тот же зашкаленный сигнал целиком; понижение гейна после восстанавливает исходную волну.

Две честные оговорки не дают этому стать чудом. Во-первых, 32-bit float защищает только цифровой этап. Если капсюль микрофона или аналоговый предусилитель перед преобразователем перегружены, это искажение впечатано до того, как сохранено хоть какое-то число, и никакой формат его не уберёт. Во-вторых, приём с двумя преобразователями может впрыснуть короткую вспышку ультразвукового шума в момент переключения устройства между тихим и громким преобразователем; она лежит выше слышимого диапазона и редко важна, но она реальна. 32-bit float убирает ошибку выставления уровня, а не любую ошибку.

Когда что использовать: руководство

Выбор сводится к короткому набору правил. Читайте сверху вниз и остановитесь на первой строке, подходящей к вашей задаче.

Ваша ситуацияГлубинаПочему
Захват того, что нельзя переписать (интервью, поле, лайв)32-bit floatНевозможно клиппировать; без уровней; спасает горячие и тихие дубли
Студийная запись и сведение в DAWЗахват 24 бита, обработка 32-bit floatЩедрый запас на входе; нет клиппинга при монтаже
Доставка готового файла слушателям (стрим, скачивание)16 битХватает для слуха; вдвое меньше 24 бит
Архивный мастер незаменимого источника24 бита (или 32-bit float)Запас на будущее; хранилище для мастеров дёшево
Реальное время (WebRTC, видеосвязь)16 бит внутриКодеки (Opus) работают в 16-битном PCM; больше бит – лишний CPU
Телефония / узкая полоса (legacy)8 бит с компандированиемЗадаётся кодеком (G.711 μ-law/A-law), а не свободный выбор

Табл. 1. Выбор битовой глубины по задаче. Пишите высоко (24 бита или 32-bit float), отдавайте в 16 битах. Глубина записи и глубина отдачи – разные решения.

Рис. 3. Дерево решений сверху вниз: решения о захвате уходят к 32-bit float или 24 битам ради запаса; любой путь доставки приходит к 16 битам, потому что они уже покрывают человеческий слух.

Дорогое заблуждение: «больше бит – лучше звук»

Самое частое и затратное убеждение про битовую глубину – будто бо́льшее число делает готовый трек лучше для слушателя. Это не так, и причина прямо следует из всего выше. Как только у файла больше динамического диапазона, чем способно воспринять ухо – а дизеренный 16-битный это уже даёт, – добавление бит лишь опускает шумовой пол, который и так был ниже порога слышимости и ниже комнаты, в которой вы сидите. Слушатель не получает ничего; файл просто становится больше.

Практические провалы конкретны:

  • Отдача 24-битного звука потребителю удваивает хранилище и трафик ради детали, которую никто не услышит, тогда как правильно дизеренный 16-битный файл неотличим в слепом тесте.
  • Запись приложения видеосвязи в 24 битах тратит CPU и полосу, которые лучше пустить на эхоподавление и шумоподавление, ведь голосовой кодек всё равно работает в 16 битах.
  • Усечение вместо дизеринга при понижении до 16 бит добавляет слышимую зернистость именно в тех фрагментах – тихих затуханиях, – где ухо внимательнее всего.

Подбирайте глубину под задачу. Верный шаблон почти всегда таков: пишите с высокой битовой глубиной ради безопасности, отдавайте в 16 битах ради слушателя. Два конца конвейера отвечают на разные вопросы, и их смешение – там, где утекают деньги и качество.

Где здесь Фора Софт

Во всех видеопродуктах, которые мы делаем в Фора Софт, – видеосвязь, телемедицина, OTT, образование, видеонаблюдение, AR/VR – решение по битовой глубине чётко делится по этапам, и правильный выбор на старте – одно из самых дешёвых улучшений качества во всём конвейере. Для голоса реального времени в видеосвязи и телемедицине мы работаем внутри в 16-битном PCM, потому что кодек Opus и стек WebRTC построены вокруг него, а свободный CPU уходит на эхо- и шумоподавление. Для записанного и сведённого контента – лекций для образования, мастеров OTT – мы пишем и монтируем с высокой битовой глубиной ради запаса, затем дизерим до 16 бит для доставки. Чаще всего в унаследованных системах мы исправляем конвейер, который отдаёт 24 бита конечным пользователям без слышимой пользы, или усекает до 16 бит без дизера, добавляя зернистость в тихие фрагменты.

Главные выводы

  • Битовая глубина задаёт динамический диапазон, не чистоту; ~6 dB на бит.
  • 16 бит дают ~96 dB – достаточно для слуха после дизеринга.
  • 144 dB у 24 бит – это запас при записи, а не лучшая доставка.
  • 32-bit float делает цифровой клиппинг невозможным; сначала захват, потом уровень.
  • Дизер, а не усечение, при финальном понижении до 16 бит.
  • Пишите высоко, отдавайте в 16 битах: концы отвечают на разные вопросы.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.