Содержание статьи +
- Кратко
- Почему это важно
- Начнём с того, что записывают: звуковая волна
- Ответ: измерять волну по часам
- Настройка первая: частота дискретизации – как часто измерять
- Настройка вторая: битовая глубина – насколько точно измерять
- Соединяем обе настройки: размер «сырого» звука
- Lossless, lossy и где статья останавливается
- Где здесь Фора Софт
- Главное
- Что читать дальше
Опубликовано: 2026-06-04 · Время чтения: 14 мин · Автор: Николай Сапунов, CEO Фора Софт
Кратко
Цифровой звук – это звук, сохранённый в виде длинного списка чисел: высоту звуковой волны измеряют тысячи раз в секунду, и каждое измерение записывают в виде целого числа. Точность такой записи определяется двумя параметрами: частотой дискретизации (насколько часто производятся измерения) и битовой глубиной (насколько точно фиксируется каждое значение). Для видео стандартный формат – 48 000 измерений в секунду при 16 или 24 битах точности, и в статье объясняется, почему именно эти значения стали нормой. После прочтения вы сможете понимать любую другую статью из этого раздела без словаря под рукой.
Почему это важно
Если вы создаёте, покупаете или ведёте видеопродукт – приложение для видеосвязи, стриминговый сервис, телемедицинскую или образовательную платформу, – звук пользователи замечают и ругают в первую очередь. Замёрзший видеокадр простителен; роботизированный, искажённый или рассинхронизированный голос – нет. Чтобы принимать верные решения о звуке и задавать инженерам правильные вопросы, нужна одна ментальная модель: как звук превращается в числа и что именно регулируют две настройки этого преобразования. Статья написана для умного читателя без аудиобэкграунда; при этом каждый факт корректен и для старшего инженера. Все следующие статьи – о кодеках, громкости, конвейере WebRTC, синхронизации звука и видео – уже предполагают, что эта модель у вас есть.
Начнём с того, что записывают: звуковая волна
До любой «цифры» – физическое событие. Кто-то говорит, дрожит струна, хлопает дверь. Событие толкает воздух и создаёт волну крошечных перепадов давления, которая доходит до уха и до микрофона. Микрофон – устройство, превращающее перепады давления в изменяющееся электрическое напряжение: высокое давление – высокое напряжение, давление падает – напряжение падает. Получается плавно колеблющееся напряжение, точно повторяющее исходный звук. Всё, что меняется так плавно, инженеры называют аналоговым сигналом – «аналоговым», потому что напряжение является аналогом звука.
У плавной волны есть два важных свойства, которые стоит отметить сразу – на них опирается каждая последующая статья. Её амплитуда – это высота волны в каждый момент: чем выше, тем громче звук. Её частота – насколько быстро она колеблется вверх и вниз: чем быстрее, тем выше тон. Низкий гул колеблется примерно 50 раз в секунду, а высокий свист – 15 000 раз в секунду. Число колебаний в секунду измеряется в герцах (Hz). Диапазон слуха человека достигает примерно 20 000 Hz, что записывают как 20 kHz, где «k» означает тысячу.
Компьютер не может хранить плавное непрерывное колебание. Он работает с числами – отдельными, дискретными значениями. Поэтому главная задача цифрового звука состоит в том, чтобы преобразовать плавное бесконечное колебание в конечный список целых чисел настолько точно, чтобы человеческое ухо не смогло заметить разницу.
Ответ: измерять волну по часам
Приём в том, чтобы перестать ловить всю волну и вместо этого фиксировать её высоту в регулярные, близко расположенные моменты. Представьте часы, которые тикают десятки тысяч раз в секунду. На каждом тике небольшая микросхема – аналого-цифровой преобразователь, сокращённо ADC, – смотрит на напряжение микрофона и задаёт один вопрос: насколько высока волна прямо сейчас? Она записывает это число и ждёт следующего тика.
Каждое такое измерение называют отсчётом (или сэмплом). Отсчёт – это просто одно число: высота волны в определённый момент времени. Соберите сорок восемь тысяч таких чисел – и получите одну секунду цифрового звука. Весь этот метод – измерять волну с постоянной частотой и записывать каждое измерение в виде числа – называют импульсно-кодовой модуляцией, или PCM. PCM – самая «сырая», прямая форма цифрового звука. Любой кодек, о котором вы прочитаете дальше (AAC, Opus, MP3), в конечном счёте представляет собой лишь умный способ сжать PCM: сжимаются именно отсчёты PCM.
Помогает образ флипбука. Фильм – это не непрерывное движение, а стопка неподвижных кадров, показываемых так быстро, что глаз сам достраивает промежутки. Цифровой звук – та же идея, но для звуковой волны: это серия неподвижных «замеров высоты», сделанных с такой частотой, что ухо само достраивает промежутки. Чем чаще замеры, тем плавнее иллюзия.
Настройка первая: частота дискретизации – как часто измерять
Число тиков часов в секунду – это частота дискретизации, измеряемая в отсчётах в секунду и выражаемая в герцах. Частота 48 000 Гц, или 48 кГц, означает, что АЦП делает 48 000 замеров уровня сигнала каждую секунду. Это первая из двух настроек, определяющих качество звука.
Почему частота важна? Потому что быстро колеблющуюся волну нужно измерять часто – иначе её вообще не поймать. Если измерять быстрое колебание слишком редко, отсчёты пропускают пики и впадины между замерами, и при воспроизведении исходный высокий тон исчезает – или, что хуже, появляется ложный, более низкий тон, которого в комнате не было. Этот ложный тон называют элайзингом (наложением спектров) – он является характерным дефектом слишком редких измерений.
Для «насколько часто достаточно» существует точное правило – теорема отсчётов Найквиста – Шеннона. Простыми словами она звучит так: чтобы точно записать звук, нужно дискретизировать его с частотой, вдвое превышающей самую высокую частоту в этом звуке. Разберём арифметику. Человеческий слух охватывает примерно 20 кГц. Вдвое больше – это:
2 × 20 000 Hz = 40 000 HzЗначит, чтобы записать всё, что слышит человек, нужна частота не ниже 40 кГц. Поэтому обе распространённые частоты находятся чуть выше 40 кГц, а не ниже.
Почему же существует две частоты – 44,1 kHz и 48 kHz, – а не одна? Частота 44,1 kHz – это историческая случайность. Когда около 1980 года разрабатывали компакт-диск, звуковую информацию записывали на видеомагнитофоны, и число 44 100 удобно укладывалось в количество строк этих устройств. CD унаследовал эту частоту, и с тех пор музыка существует на 44,1 kHz. Видео же закрепилось на 48 kHz, поскольку эта частота делится без остатка на частоты обновления кадров, что обеспечивает синхронность звука и изображения. Audio Engineering Society официально закрепила это положение: рекомендованная практика AES5-2018 (подтверждена в 2023) называет 48 kHz предпочтительной частотой дискретизации для профессионального создания, обработки и обмена звуком, признавая при этом 44,1 kHz для потребительской музыки, 32 kHz – для части задач передачи и 96 kHz – для работы с расширенной полосой.
Для видеопродукта вывод прост: используйте 48 кГц, если конкретный источник не требует иного. Лишние отсчёты сверх минимума в 40 кГц не пропадают даром – они дают фильтру антиалиасинга, схеме, убирающей слишком высокие частоты перед дискретизацией, запас, чтобы работать, не повреждая слышимый диапазон.
Настройка вторая: битовая глубина – насколько точно измерять
Частота дискретизации определяет, как часто производится измерение. Вторая настройка – битовая глубина – отвечает за насколько точно фиксируется каждое измерение. АЦП считывает высоту волны и записывает соответствующее число. Битовая глубина – это количество разрядов, а точнее, двоичных разрядов, или битов, которые могут использоваться для представления этого числа.
Это важно, потому что истинная высота волны – плавное, бесконечно точное значение, а записанное число должно попасть на одну из фиксированных ступеней, как термометр, показывающий только целые градусы. Принуждение плавного значения к ближайшей ступени называют квантованием, а небольшую ошибку округления – ошибкой квантования; на слух, если она вообще слышна, это лёгкое шипение. Чем больше ступеней, тем меньше округление и тем тише шипение.
Сколько ступеней даёт та или иная битовая глубина? Каждый дополнительный бит удваивает их количество. Проговорим:
16 бит → 2^16 = 65 536 ступеней
24 бита → 2^24 = 16 777 216 ступенейТо есть 16-битный звук распределяет каждый отсчёт по одной из примерно 65 тысяч ступеней; 24-битный – по почти 17 миллионам. Практическое следствие – динамический диапазон: разница между самым тихим звуком, который система может записать, и самым громким, не вызывая искажений. Существует простая формула, связывающая количество бит с динамическим диапазоном в децибелах (dB) – стандартной единице измерения соотношения уровней звука:
Динамический диапазон (dB) ≈ 6,02 × (битовая глубина) + 1,76
16 бит: 6,02 × 16 + 1,76 ≈ 98 dB (обычно округляют до ~96 dB)
24 бита: 6,02 × 24 + 1,76 ≈ 146 dB (обычно округляют до ~144 dB)Каждый бит даёт примерно 6 дБ динамического диапазона. Шестнадцать бит уже покрывают разницу около 90 дБ между тихим шумом в комнате и болезненно громким звуком – поэтому аудио на CD звучит чисто. Двадцать четыре бита обеспечивают запас, важный при записи и редактировании: они позволяют инженеру аккуратно выстраивать уровни, не теряя деталей, – хотя итоговому файлу этот запас зачастую не нужен.
Третий вариант, с которым вы можете столкнуться, – 32-битный float. Вместо фиксированных ступеней он хранит каждый отсчёт в том же гибком числовом формате, что и таблицы для дробных чисел. Его преимущество не в дополнительной слышимой детализации, а в устойчивости к ошибкам: запись в формате 32-bit float можно вывести далеко за обычный максимум и затем вернуть обратно без клиппинга. Поэтому современные полевые рекордеры и программы редактирования используют его внутри. Это удобство обработки, а не улучшение звучания.
Частая ошибка: «чем больше число – тем лучше»
Самое дорогое заблуждение в звуке – что более высокая частота дискретизации и битовая глубина автоматически дают лучшее качество. Это не так. Превысив порог в 48 кГц и 16 бит, вы уже зафиксировали всё, что может различить человеческое ухо; файлы с параметрами 192 кГц и 24 бита в четыре раза больше по объёму, но в слепом прослушивании при готовом воспроизведении для большинства слушателей неотличимы. Высокие значения оправданы при записи и редактировании, где они служат запасом на случай ошибок, но не при доставке контента. Выбор частоты 96 кГц для приложения видеосвязи не улучшит качество звонка – он лишь напрасно расходует пропускную способность и ресурсы процессора. Настройки следует подбирать под конкретную задачу.
Соединяем обе настройки: размер «сырого» звука
Частота дискретизации, битовая глубина и количество каналов определяют, сколько битов в секунду требуется «сырому» потоку PCM – его битрейт. Формула – простое умножение:
Битрейт = частота дискретизации × битовая глубина × каналы
Звук CD: 44 100 × 16 × 2 = 1 411 200 бит/с ≈ 1 411 kbpsЭто качество звука на уровне CD в стерео: около 1,4 миллиона бит в секунду, или примерно 10 мегабайт в минуту. А телефонный звонок – совсем другая история. Классический телефонный звук, заданный рекомендацией ITU-T G.711, дискретизируется всего на 8 кГц, с 8 битами на отсчёт и одним каналом:
Телефон (G.711): 8 000 × 8 × 1 = 64 000 бит/с = 64 kbpsШестьдесят четыре килобита в секунду против 1,4 миллиона – разница в 22 раза, – и оба формата используют PCM. Именно этот разрыв и объясняет, зачем нужны кодеки. Отправлять «сырое» стерео на скорости 1 411 кбит/с каждому зрителю прямого эфира или каждому участнику видеозвонка – расточительно, поэтому кодеки сжимают его до доли исходного размера, почти не теряя качества звука. При этом они всегда сжимают именно отсчёты PCM. Поймите, что такое отсчёты – и весь раздел станет понятен.
| Сценарий | Частота | Битовая глубина | Каналы | «Сырой» битрейт |
|---|---|---|---|---|
| Телефон (G.711) | 8 kHz | 8 бит | 1 (моно) | 64 kbps |
| Голос/видеосвязь (wideband) | 16 kHz | 16 бит | 1 (моно) | 256 kbps |
| Стандарт видеопроизводства | 48 kHz | 24 бита | 2 (стерео) | 2 304 kbps |
| Музыка CD | 44,1 kHz | 16 бит | 2 (стерео) | 1 411 kbps |
| Hi-res мастер | 96 kHz | 24 бита | 2 (стерео) | 4 608 kbps |
Таблица 1. «Сырые» битрейты PCM для распространённых настроек. Все значения рассчитываются как частота × битовая глубина × количество каналов.
Lossless, lossy и где статья останавливается
Последняя пара слов снимает бесконечную путаницу. Lossless (без потерь) означает, что звук хранится или сжимается без потери отсчётов – исходный PCM восстанавливается бит в бит. «Сырой» PCM в файле WAV – lossless; таковыми же являются сжатые, но точные форматы вроде FLAC. Lossy (с потерями) означает, что формат навсегда отбрасывает детали, которые ухо вряд ли заметит, в обмен на значительно меньшие файлы – так поступают AAC, Opus и MP3. Ни один из них не «лучше» другого – они решают разные задачи. Архивируете мастер? Выбирайте lossless. Стримите музыку на телефон в поезде? Подойдёт lossy. О lossless-форматах подробно рассказано в статье PCM, WAV, AIFF, FLAC, ALAC: форматы без потерь, а о кодеках с потерями – во всём Блоке 2.
Эта статья намеренно останавливается на самих отсчётах. Как часто дискретизировать, сколько битов использовать, сколько каналов задействовать, как делить и передавать результат – каждому вопросу будет посвящена отдельная статья.
Где здесь Фора Софт
Каждый продукт, который мы создаём в Фора Софт, по сути преобразует звук в PCM-отсчёты – независимо от того, передаётся ли он в реальном времени через WebRTC или упаковывается для стриминга. В видеосвязи и телемедицине мы обычно используем моно-захват с частотой 16 кГц в формате wideband, поскольку главная цель – разборчивость речи, а не музыкальное качество, а более низкая частота позволяет сэкономить ресурсы CPU и полосу пропускания на обработку эха и шумов. В OTT и онлайн-обучении мы передаём стерео или surround-звук с частотой 48 кГц, синхронизированный с видео. Правильный выбор частоты дискретизации и битовой глубины на этапе записи – это самое простое и дешёвое решение для обеспечения качества на всём протяжении конвейера, при этом именно здесь команды чаще всего ошибаются, выбирая параметры выше, чем того требует задача.
Главное
- Цифровой звук – это звуковая волна, измеренная с высокой частотой и сохранённая в виде чисел (PCM).
- Частота дискретизации определяет, как часто производится измерение; для видео стандартом является 48 кГц.
- Битовая глубина задаёт точность записи: 16 бит обеспечивают динамический диапазон около 96 дБ, 24 бита – около 144 дБ.
- Правило Найквиста гласит: частота дискретизации должна быть не менее чем вдвое выше самой высокой частоты в сигнале.
- «Сырой» битрейт рассчитывается как произведение частоты дискретизации, битовой глубины и числа каналов; например, стерео-звук на CD имеет битрейт 1 411 кбит/с.
- Большие значения не всегда лучше – выбирайте параметры в соответствии с конкретной задачей.