Содержание статьи +
- Кратко
- Почему это важно
- Начнём с того, что записывают: звуковая волна
- Ответ: измерять волну по часам
- Настройка первая: частота дискретизации – как часто измерять
- Настройка вторая: битовая глубина – насколько точно измерять
- Соединяем обе настройки: размер «сырого» звука
- Lossless, lossy и где статья останавливается
- Где здесь Фора Софт
- Главное
- Что читать дальше
Опубликовано: 2026-06-04 · Время чтения: 14 мин · Автор: Николай Сапунов, CEO Фора Софт
Кратко
Цифровой звук – это звук, сохранённый в виде длинного списка чисел: высоту звуковой волны измеряют тысячи раз в секунду и каждое измерение записывают целым числом. За точность такой записи отвечают две настройки: частота дискретизации (как часто измеряют) и битовая глубина (насколько точно записывают каждое измерение). Для видео стандартный рецепт – 48 000 измерений в секунду при 16 или 24 битах точности, и в статье объясняется, почему именно эти числа. После прочтения вы сможете читать любую другую статью этого раздела без словаря под рукой.
Почему это важно
Если вы создаёте, покупаете или ведёте видеопродукт – приложение для видеосвязи, стриминговый сервис, телемедицинскую или образовательную платформу, – звук пользователи замечают и ругают в первую очередь. Замёрзший видеокадр простителен; роботизированный, искажённый или рассинхронизированный голос – нет. Чтобы принимать верные решения о звуке и задавать инженерам правильные вопросы, нужна одна ментальная модель: как звук превращается в числа и что именно регулируют две настройки этого преобразования. Статья написана для умного читателя без аудиобэкграунда; при этом каждый факт корректен и для старшего инженера. Все следующие статьи – о кодеках, громкости, конвейере WebRTC, синхронизации звука и видео – уже предполагают, что эта модель у вас есть.
Начнём с того, что записывают: звуковая волна
До всякой «цифры» есть физическое событие. Кто-то говорит, дрожит струна, хлопает дверь. Событие толкает воздух и создаёт волну крошечных перепадов давления, которая доходит до уха и до микрофона. Микрофон – это устройство, превращающее перепады давления в изменяющееся электрическое напряжение. Высокое давление – высокое напряжение; давление падает – напряжение падает. Получается плавно колеблющееся напряжение, повторяющее исходный звук. Всё, что меняется так плавно, инженеры называют аналоговым сигналом – «аналоговым», потому что напряжение является аналогом звука.
У плавной волны есть два свойства, которые стоит назвать сразу, потому что на них опирается каждая последующая статья. Её амплитуда – это высота волны в каждый момент: выше значит громче. Её частота – насколько быстро она колеблется вверх-вниз: быстрее значит выше по тону. Низкий гул колеблется примерно 50 раз в секунду; высокий свист – 15 000 раз в секунду. Число колебаний в секунду имеет единицу – герц (Hz). Слух человека достигает примерно 20 000 Hz, что записывают как 20 kHz, где «k» означает тысячу.
Компьютер не может хранить плавное непрерывное колебание. Компьютер хранит числа – отдельные, дискретные значения. Поэтому центральная задача цифрового звука такова: как превратить плавное бесконечное колебание в конечный список целых чисел настолько точно, чтобы ухо не заметило разницы?
Ответ: измерять волну по часам
Приём в том, чтобы перестать ловить всю волну и вместо этого фиксировать её высоту в регулярные, близко расположенные моменты. Представьте часы, которые тикают десятки тысяч раз в секунду. На каждом тике небольшая микросхема – аналого-цифровой преобразователь, сокращённо ADC, – смотрит на напряжение микрофона и задаёт один вопрос: насколько высока волна прямо сейчас? Она записывает это число и ждёт следующего тика.
Каждое такое измерение называют отсчётом (или сэмплом). Отсчёт – это просто одно число: высота волны в один момент. Соедините сорок восемь тысяч таких чисел – получите одну секунду цифрового звука. Весь этот метод – измерять волну на ровной частоте часов и хранить каждое измерение числом – называют импульсно-кодовой модуляцией, или PCM. PCM – самая «сырая», прямая форма цифрового звука. Любой кодек, о котором вы прочитаете дальше (AAC, Opus, MP3), в конечном счёте лишь умный способ сжать PCM; сжимаются именно отсчёты PCM.
Помогает образ флипбука. Фильм – это не непрерывное движение, а стопка неподвижных фотографий, показанных так быстро, что глаз достраивает промежутки. Цифровой звук – та же идея для звуковой волны: стопка неподвижных «замеров высоты», сделанных так часто, что ухо достраивает промежутки. Чем чаще замеры, тем глаже иллюзия.
Настройка первая: частота дискретизации – как часто измерять
Число тиков часов в секунду – это частота дискретизации, измеряемая в отсчётах в секунду, что мы тоже записываем в герцах. Частота 48 000 Hz, или 48 kHz, означает, что ADC берёт 48 000 замеров высоты каждую секунду. Это первая из двух настроек, определяющих качество звука.
Почему частота важна? Потому что быстро колеблющуюся волну нужно измерять часто, иначе её вообще не поймать. Если измерять быстрое колебание слишком редко, отсчёты пропускают пики и впадины между замерами, и при воспроизведении исходный высокий тон исчезает – или, хуже того, возвращается ложным, более низким тоном, которого в комнате не было. Этот ложный тон называют элайзингом (наложением спектров), и он – фирменный дефект слишком редких измерений.
Для «насколько часто достаточно» есть точное правило. Это теорема отсчётов Найквиста – Шеннона, и простыми словами она гласит: чтобы записать звук точно, нужно дискретизировать минимум вдвое чаще, чем самая высокая частота в этом звуке. Проговорим арифметику вслух. Слух человека достигает примерно 20 kHz. Вдвое больше – это:
2 × 20 000 Hz = 40 000 HzЗначит, чтобы записать всё, что слышит человек, нужна частота не ниже 40 kHz. Поэтому обе распространённые частоты лежат чуть выше 40 kHz, а не ниже.
Почему же частот две – 44,1 kHz и 48 kHz, – а не одна? Частота 44,1 kHz – историческая случайность. Когда около 1980 года проектировали компакт-диск, звук хранили на видеомагнитофонах, и число 44 100 удачно укладывалось в число пригодных строк этих машин. CD унаследовал её, и музыка с тех пор живёт на 44,1 kHz. Видео же остановилось на 48 kHz, потому что эта частота ровно делится на частоты видеокадров, что удерживает звук и картинку синхронными. Audio Engineering Society закрепляет это официально: рекомендованная практика AES5-2018 (подтверждена в 2023) называет 48 kHz предпочтительной частотой дискретизации для профессионального создания, обработки и обмена звуком, признавая при этом 44,1 kHz для потребительской музыки, 32 kHz для части задач передачи и 96 kHz для работы с расширенной полосой.
Для видеопродукта вывод прост: используйте 48 kHz, если конкретный источник не вынуждает иначе. Лишние отсчёты сверх минимума в 40 kHz не пропадают зря – они дают «фильтру антиэлайзинга», схеме, убирающей слишком высокие частоты перед дискретизацией, запас, чтобы работать, не повреждая слышимый диапазон.
Настройка вторая: битовая глубина – насколько точно измерять
Частота дискретизации решает, как часто измерять. Вторая настройка, битовая глубина, решает, насколько точно записывать каждое измерение. ADC считывает высоту волны и записывает число. Битовая глубина – это сколько разрядов, а именно двоичных разрядов, или битов, разрешено иметь этому числу.
Это важно, потому что истинная высота волны – плавное, бесконечно точное значение, а записанное число обязано попасть на одну из фиксированных ступеней, как термометр, который умеет показывать только целые градусы. Принуждение плавного значения к ближайшей ступени называют квантованием, а маленькую ошибку округления – ошибкой квантования; на слух, если её вообще слышно, это лёгкое шипение. Больше ступеней – меньше округление и меньше шипение.
Сколько ступеней даёт та или иная битовая глубина? Каждый лишний бит удваивает их число. Проговорим:
16 бит → 2^16 = 65 536 ступеней
24 бита → 2^24 = 16 777 216 ступенейТо есть 16-битный звук кладёт каждый отсчёт на одну из примерно 65 тысяч ступеней; 24-битный использует почти 17 миллионов. Практическое следствие – динамический диапазон: разрыв между самым тихим звуком, который система может записать, и самым громким до искажения. Есть чистая формула, связывающая биты с динамическим диапазоном в децибелах (dB), стандартной единице соотношения уровней звука:
Динамический диапазон (dB) ≈ 6,02 × (битовая глубина) + 1,76
16 бит: 6,02 × 16 + 1,76 ≈ 98 dB (обычно округляют до ~96 dB)
24 бита: 6,02 × 24 + 1,76 ≈ 146 dB (обычно округляют до ~144 dB)Каждый бит покупает примерно 6 dB диапазона. Шестнадцать битов уже перекрывают разрыв примерно в 90 dB между тихой комнатой и болезненно громким звуком – поэтому CD звучит чисто. Двадцать четыре бита добавляют запас, важный при записи и редактировании: он позволяет инженеру выставить уровни с осторожностью и всё равно сохранить детали, – хотя итоговому файлу весь этот запас редко нужен.
Третий вариант, который вам встретится, – 32-битный float. Вместо фиксированных ступеней он хранит каждый отсчёт в том же гибком числовом формате, в каком таблицы хранят дробные числа. Его польза не в дополнительной слышимой детализации, а в прощении ошибок: запись в 32-bit float можно увести далеко за обычный максимум и потом вернуть назад без клиппинга, поэтому современные полевые рекордеры и программы редактирования используют его внутри. Это удобство процесса, а не апгрейд звучания.
Частая ошибка: «чем больше числа, тем лучше»
Самое дорогое заблуждение в звуке – что бо́льшие частота дискретизации и битовая глубина автоматически означают лучший звук. Это не так. Перейдя порог 48 kHz и 16 бит, вы уже захватили всё, что способно различить ухо; файлы 192 kHz и 24 бита вчетверо больше и в слепом прослушивании неотличимы для слушателей при готовом воспроизведении. Высокие числа оправданы при записи и редактировании, где запас защищает от ошибок, а не при доставке. Выбор 96 kHz для приложения видеосвязи не улучшит качество звонка; он тратит впустую полосу и CPU. Подбирайте настройку под задачу.
Соединяем обе настройки: размер «сырого» звука
Частота дискретизации и битовая глубина вместе с числом каналов определяют, сколько битов в секунду нужно «сырому» потоку PCM, – его битрейт. Формула – простое умножение:
Битрейт = частота дискретизации × битовая глубина × каналы
Звук CD: 44 100 × 16 × 2 = 1 411 200 бит/с ≈ 1 411 kbpsЭто CD-качество в стерео: около 1,4 миллиона битов каждую секунду, или примерно 10 мегабайт в минуту. Телефонный звонок – на другом конце. Классический телефонный звук, заданный рекомендацией ITU-T G.711, дискретизируется всего на 8 kHz при 8 битах на отсчёт и одном канале:
Телефон (G.711): 8 000 × 8 × 1 = 64 000 бит/с = 64 kbpsШестьдесят четыре тысячи битов в секунду против 1,4 миллиона – разница в 22 раза, – и оба это PCM. Этот разрыв и есть вся причина, по которой существуют кодеки. Слать «сырое» стерео 1 411 kbps каждому зрителю прямого эфира или каждому участнику видеозвонка расточительно, поэтому кодеки сжимают его до доли размера, сохраняя почти идентичное звучание. Но сжимают они всегда именно эти отсчёты PCM. Поймите отсчёты – и остальной раздел сложится.
| Сценарий | Частота | Битовая глубина | Каналы | «Сырой» битрейт |
|---|---|---|---|---|
| Телефон (G.711) | 8 kHz | 8 бит | 1 (моно) | 64 kbps |
| Голос/видеосвязь (wideband) | 16 kHz | 16 бит | 1 (моно) | 256 kbps |
| Стандарт видеопроизводства | 48 kHz | 24 бита | 2 (стерео) | 2 304 kbps |
| Музыка CD | 44,1 kHz | 16 бит | 2 (стерео) | 1 411 kbps |
| Hi-res мастер | 96 kHz | 24 бита | 2 (стерео) | 4 608 kbps |
Таблица 1. «Сырые» битрейты PCM для распространённых настроек. Все значения – частота × битовая глубина × каналы.
Lossless, lossy и где статья останавливается
Последняя пара слов снимает бесконечную путаницу. Lossless (без потерь) означает, что звук хранится или сжимается без выбрасывания отсчётов – исходный PCM восстанавливается бит-в-бит. «Сырой» PCM в файле WAV – lossless; таковы и сжатые-но-точные форматы вроде FLAC. Lossy (с потерями) означает, что формат навсегда отбрасывает детали, которые ухо вряд ли заметит, в обмен на куда меньшие файлы – так делают AAC, Opus и MP3. Ни один не «лучше»; они отвечают на разные вопросы. Архивируете мастер? Lossless. Стримите на телефон в поезде? Lossy. Семейство lossless разбирается в статье PCM, WAV, AIFF, FLAC, ALAC: форматы без потерь, а кодеки с потерями – во всём Блоке 2.
Эта статья намеренно останавливается на самих отсчётах. Как часто дискретизировать, сколько битов, сколько каналов, как делить и переносить результат – каждое получит свою статью дальше.
Где здесь Фора Софт
Каждый продукт, который мы делаем в Фора Софт, в своей основе превращает звук в отсчёты PCM – независимо от того, идёт ли звук вживую через WebRTC или пакуется для стриминга. В видеосвязи и телемедицине мы обычно ведём wideband-захват 16 kHz моно, потому что цель – разборчивость голоса, а не музыкальная верность, и более низкая частота оставляет CPU и полосу для эхоподавления и шумоподавления. В OTT и онлайн-обучении мы доставляем 48 kHz стерео или surround под картинку. Правильные частота дискретизации и битовая глубина на захвате – самое дешёвое решение о качестве во всём конвейере и при этом то, в котором команды чаще всего ошибаются, тянясь к числам выше, чем требует задача.
Главное
- Цифровой звук – это звуковая волна, измеренная на быстрых часах и сохранённая числами (PCM).
- Частота дискретизации задаёт, как часто измерять; для видео стандарт – 48 kHz.
- Битовая глубина задаёт точность; 16 бит – диапазон ~96 dB, 24 бита – ~144 dB.
- Правило Найквиста: дискретизируйте минимум вдвое выше самой высокой нужной частоты.
- «Сырой» битрейт = частота × битовая глубина × каналы; стерео CD – 1 411 kbps.
- Большие числа не лучше автоматически – подбирайте настройку под задачу.