Частота дискретизации: 44.1, 48, 96, 192 kHz и почему видео выбрало 48 kHz

Автор: Николай СапуновОбновлено: август 202623 мин чтения
Содержание статьи +

Опубликовано: 2026-06-04 · Время чтения: 16 мин · Автор: Николай Сапунов, CEO Фора Софт

Кратко

Частота дискретизации – это сколько раз в секунду система измеряет звуковую волну, и единственное жёсткое правило, которое ею управляет, – теорема Найквиста: измерять нужно как минимум вдвое чаще самой высокой ноты, которую вы хотите сохранить, поэтому для потолка человеческого слуха в 20 kHz требуется не менее 40 000 измерений в секунду. Музыка остановилась на 44 100 из-за случайности 1970-х, когда цифровой звук записывали на видеоленту, а видео выбрало 48 000, потому что это число делится без остатка на кадровые частоты кино и телевидения и держит звук синхронным с картинкой. Более высокие значения – 96 000 и 192 000 – оправданы при записи и сведении, где они упрощают борьбу с искажениями и работу фильтров, но в слепых тестах никто не отличает их от 48 000 на готовом материале. В статье разобрано, откуда взялось каждое число, когда какое использовать и какую самую дорогую ошибку совершают команды: считать, что большее число всегда звучит лучше.

Почему это важно

Если вы создаёте или ведёте видеопродукт – приложение для видеосвязи, стриминговый сервис, образовательную или телемедицинскую платформу, – частота дискретизации одно из первых чисел, которое настраивают ваши инженеры, и неверный выбор тихо стоит вам трафика, CPU, а иногда и синхронности звука с картинкой. Не обязательно быть инженером, чтобы решить верно, но нужно понимать, что это число регулирует и почему «больше» не означает автоматически «лучше». Статья написана для умного читателя без аудиобэкграунда; при этом каждый факт корректен и для старшего инженера и подкреплён стандартом, который его определяет. После прочтения вы сможете уверенно выбрать частоту дискретизации и объяснить выбор любому в команде.

Короткое напоминание: что такое частота дискретизации

Прежде чем это число обретёт смысл, вспомните, как звук становится данными – это подробно разобрано в статье Что такое цифровой звук: от звуковой волны к битам. Микрофон превращает перепады давления воздуха в плавно колеблющееся электрическое напряжение. Затем чип – аналого-цифровой преобразователь – измеряет высоту этого напряжения в регулярные, близко расположенные моменты и записывает каждое измерение числом, которое называют отсчётом (sample). Число измерений в секунду и есть частота дискретизации. Думайте о ней как о тиканье очень быстрых часов: при частоте 48 000 герц – записывают 48 kHz, где «k» означает тысячу, а «герц» – раз в секунду – система спрашивает микрофон «насколько ты громкий прямо сейчас?» сорок восемь тысяч раз каждую секунду. Вся статья – о том, как выбрать, насколько быстро должны тикать эти часы.

Единственное правило, задающее минимум: Найквист

Есть ровно один закон физики, задающий жёсткий минимум для частоты дискретизации, и на нём стоит любая разумная частота. Это теорема отсчётов Найквиста – Шеннона, и простыми словами она гласит: чтобы достоверно записать звук, измерять надо более чем вдвое чаще самой высокой частоты в этом звуке. Частота – это насколько быстро колеблется волна: низкий гул колеблется медленно, высокий свист – быстро, и измеряется она тоже в герцах.

Проговорим арифметику вслух, потому что это весь фундамент. Слух человека в молодости достигает примерно 20 000 Hz, или 20 kHz. Вдвое больше – это:

2 × 20 000 Hz = 40 000 Hz = 40 kHz

Значит, любая частота ниже 40 kHz отбрасывает часть того, что человек способен услышать. Именно это число, 40 kHz, объясняет, почему любая полноценная частота – 44.1, 48, 96, 192 – находится на этом уровне или выше, но никогда ниже. Различаются они тем, насколько выше порога стоят и почему.

Что будет, если нарушить правило и измерять слишком редко? Быстрые колебания, которые вы не успели измерить, не исчезают. При воспроизведении они возвращаются как неправильный, более низкий тон, которого в комнате никогда не было, – ложная нота, придуманная системой из пробелов в её собственных измерениях. Этот артефакт называют алиасингом (aliasing), и это фирменный дефект записи с недостаточной частотой. Чтобы его не допустить, каждый тракт записи сначала пропускает звук через антиалиасинговый фильтр – схему, которая удаляет частоты, слишком высокие для корректной оцифровки, ещё до начала измерений.

Рисунок 1. Слух человека упирается в 20 kHz, поэтому Найквист требует не менее 40 kHz дискретизации. Ниже этого порога неизмеренный высокий тон возвращается как ложный низкий тон-алиас.

Этот же фильтр – причина, по которой обычные частоты стоят чуть выше 40 kHz, а не ровно на нём. Ни один реальный фильтр не может обрезать идеально на 20 kHz, оставив всё ниже нетронутым; любому фильтру нужна переходная полоса – небольшой диапазон частот, на котором он плавно переходит от «пропускать» к «блокировать». Частота 44.1 kHz способна захватить до 22,05 kHz (половина частоты, её называют частотой Найквиста), оставляя около 2 kHz запаса между слышимым потолком в 20 kHz и стеной в 22,05 kHz для работы фильтра. Частота 48 kHz захватывает до 24 kHz, давая фильтру ещё больше места и позволяя ему спадать мягче, не вредя слышимому диапазону. Этот запас – одна из двух настоящих причин, по которым видео выбрало большее число; вторая – про синхронность с картинкой, и она в центре статьи.

Откуда взялось 44.1 kHz: случайность видеоленты

Самый удивительный факт о частоте, которую использует вся записанная музыка, в том, что её никогда не выбирали по звучанию. Её выбрали из-за того, как цифровой звук хранили в конце 1970-х, до того как жёсткие диски стали достаточно большими и дешёвыми для этой задачи.

Тогда единственным доступным способом записать огромный поток чисел, который порождает цифровой звук, было замаскировать эти числа под видеосигнал и записать на видеокассету через PCM-адаптер – коробку между аудиотехникой и видеомагнитофоном. Sony PCM-1600, выпущенный в 1979 году, делал ровно это, и его наследники стали профессиональными цифровыми магнитофонами той эпохи. Когда вскоре проектировали компакт-диск, он унаследовал ту частоту, которую эти машины уже использовали, чтобы записи переходили на CD без передискретизации.

Почему именно 44 100? Потому что это число вытекало из структуры видеокадра. Видеосигнал собирается из горизонтальных линий, рисуемых пачками-полями фиксированное число раз в секунду. PCM-адаптер упаковывал звуковые отсчёты в пригодные линии каждого поля. Две телесистемы той эпохи давали два почти одинаковых ответа:

NTSC (США/Япония): 245 линий × 60 полей/с × 3 отсчёта/линию ≈ 44 056 отсчётов/с
PAL  (Европа):     294 линии × 50 полей/с × 3 отсчёта/линию  =  44 100 отсчётов/с

Цифра PAL, 44 100, победила как круглое число, и CD закрепил её в стандарте Red Book в 1980 году. Никакой акустической магии в ней нет. Это отпечаток хранилищного трюка 1970-х, и каждая песня, которую вы когда-либо слушали в стриминге, всё ещё несёт этот отпечаток, потому что весь музыкальный каталог построен на нём.

Откуда взялось 48 kHz: создано под картинку

Пока звук CD наследовал 44.1 kHz от старой видеоленты, индустрия в целом понимала, что нужна одна согласованная частота для профессиональной и вещательной работы, и начала выбирать осознанно в 1981 году. Кандидаты группировались между 45 и 60 kHz. Шестьдесят kHz были бы идеальны для синхронизации с кино и видео, но сочтены расточительно высокими для звука, которому никогда не нужно дотягивать до 30 kHz. Сузив поле до частот, чисто синхронизирующихся с кино и телевидением – 45, 48, 50, 52,5 и 54 kHz, – индустрия остановилась на 48 kHz.

Решающим фактором стала синхронизация с картинкой, и сводится она к простому делению. Кино и значительная часть телевидения идут со скоростью 24 кадра в секунду. Чтобы звук аккуратно совпадал с каждым видеокадром – чтобы можно было резать, монтировать и упаковывать звук и картинку вместе без дробных остатков – число звуковых отсчётов в секунду должно делиться нацело на число кадров в секунду. Проверим обоих кандидатов:

48 000 отсчётов/с ÷ 24 кадра/с = 2 000 отсчётов на кадр    (целое — чисто)
44 100 отсчётов/с ÷ 24 кадра/с = 1 837,5 отсчёта на кадр   (дробное — грязно)

Сорок восемь тысяч делится на 24 нацело; сорок четыре тысячи сто – нет. Эта половина лишнего отсчёта, повторяясь кадр за кадром, и есть тот самый дрейф, из-за которого звук и видео расходятся на длинной программе – проблемы синхронизации, разобранные в статье Синхронизация звука и видео: ITU-R BT.1359 и окна допуска. У Европы была вторая причина любить 48 kHz: она уже вещала в 32 kHz, а 48 относится к 32 как чистые 3:2, что делало конвертацию между ними безболезненной.

Audio Engineering Society сделало этот выбор официальным и до сих пор его поддерживает. Рекомендованная практика AES5-2018 (подтверждена в 2023) называет 48 kHz предпочтительной частотой дискретизации для профессионального создания, обработки и обмена звуком, признавая 44.1 kHz для потребительской музыки, 32 kHz для части вещания и 96 kHz для работы с расширенной полосой. Когда орган стандартизации говорит «предпочтительная», это значит: используйте её, если у вас нет конкретной причины поступить иначе.

Рисунок 2. Как выбирали две частоты: 44.1 kHz вытекло из хранения на видеоленте в 1970-х; 48 kHz выбрали ради чистого деления на кадровые частоты и подтвердили в AES5.

Почему 48 kHz побеждает и сегодня: на нём говорит весь конвейер

Выбор, сделанный в 1981 году, мог бы померкнуть, но вместо этого затвердел в дефолт, проходящий через весь современный стек, – и это практическая причина выбрать его сейчас. Три слоя усиливают друг друга.

Первый – операционные системы. Аудиодвижок внутри Windows, Linux и Android использует 48 kHz как стандартную внутреннюю частоту для вывода. Когда ваше приложение проигрывает звук, ОС сводит всё на 48 kHz; подача звука в 48 kHz означает отсутствие передискретизации, а каждая передискретизация – это маленький шанс добавить шум и потратить CPU.

Второй – кодеки. Opus, кодек, который IETF сделал обязательным для WebRTC и который питает большинство голосовых и видеозвонков в реальном времени, работает своим ядром внутри на 48 kHz – спецификация IETF RFC 6716 фиксирует высококачественный (MDCT) слой кодека ровно на этой частоте, а декодер просто понижает частоту для меньших значений, потому что каждая поддерживаемая частота делит 48 kHz нацело. Конвейер WebRTC, разобранный в статье Конвейер аудио WebRTC целиком, предполагает 48 kHz от микрофона до динамика.

Третий – платформы. Рекомендации YouTube по кодированию советуют звук 48 kHz, и по состоянию на обновление спецификации 2025 года площадка принимает современные форматы, включая AAC-LC, Opus и свой новый иммерсивный формат Eclipsa, – все на 48 kHz. Загрузите музыку в 44.1 kHz, и YouTube всё равно передискретизирует её в 48 kHz при приёме.

Урок для видеопродукта прост: захватывайте, обрабатывайте и доставляйте на 48 kHz – и вся цепочка (ОС, кодек, платформа) согласна с вами и не делает лишней работы. Единственное частое исключение – чисто музыкальное приложение, чья исходная библиотека в 44.1 kHz; там сквозное сохранение 44.1 kHz избавляет от одной передискретизации. Смешивание двух частот внутри одного конвейера – худшее из обоих миров.

Когда высокие частоты оправданы: 88.2, 96, 192 kHz

Если 48 kHz уже захватывает всё, что способно услышать ухо, зачем профессиональные рекордеры и монтажные пакеты вообще предлагают 96 kHz и 192 kHz? Не потому, что они лучше звучат при воспроизведении – здесь всё решено, об этом ниже, – а из-за того, что происходит во время записи и обработки, до того как готовый файл существует.

Высокие частоты объясняют две настоящие выгоды. Первая – запас для фильтра. На 96 kHz частота Найквиста равна 48 kHz, поэтому у антиалиасингового фильтра огромная, плавная переходная полоса далеко выше всего слышимого; фильтр может быть проще и вносить меньше искажений в слышимый диапазон. Вторая, более важная, – нелинейная обработка. Эффекты вроде дисторшна, сатурации и клиппинга намеренно создают новые высокие частоты (гармоники), которых не было в исходном звуке. На 48 kHz гармоникам, попадающим выше 24 kHz, некуда деться, и они заворачиваются обратно как алиасинг – слышимая грязь. Запись или обработка на 96 kHz даёт этим гармоникам место выше слышимого диапазона, поэтому у программных синтезаторов и дисторшн-плагинов часто есть кнопка «oversampling», временно прогоняющая вычисления на повышенной частоте. Recording Academy и стандарт high-resolution audio от AES, CTA и JAS считают 24 бита / 96 kHz предпочтительным разрешением для записи, сведения и мастеринга именно по этим производственным причинам.

Цена механическая и реальная. Удвойте частоту дискретизации – и вы удвоите данные, хранилище и нагрузку на обработку:

96 kHz против 48 kHz:  в 2 раза больше отсчётов → в 2 раза больше файл и примерно в 2 раза CPU
192 kHz против 48 kHz: в 4 раза больше отсчётов → в 4 раза больше файл и примерно в 4 раза CPU

Для продукта реального времени это удвоение прямо конкурирует с бюджетом CPU, нужным для эхоподавления и шумоподавления. Для стриминга оно удваивает хранилище и исходящий трафик ради звука, который слушатели не отличат от 48 kHz. Высокие частоты – место в студии, а не в файле доставки.

Дорогая ошибка: «большее число всегда звучит лучше»

Самое частое и дорогое заблуждение в аудио – что большая частота дискретизации автоматически означает лучший звук для слушателя. Это не так, и наука здесь не двусмысленна. В корректно проведённых двойных слепых ABX-тестах – где слушатели, включая обученных профессионалов, должны определить, какой из двух клипов с большей частотой, не зная, какой есть какой, – люди не могут надёжно отличить 44.1 kHz или 48 kHz от 96 kHz или 192 kHz на одном и том же готовом материале. Даже сводка обсуждений эпохи стандартизации формулирует это прямо: человек не может легко услышать разницу между 48, 44.1 и другими близкими частотами.

С точки зрения Найквиста это логично. Стоит вам начать дискретизировать выше примерно 40 kHz, и вы уже захватили все частоты, которые человек способен услышать; всё, что добавляет файл 192 kHz, живёт выше диапазона человеческого слуха, где оно ничего не даёт слушателю, но в четыре раза увеличивает файл. Высокие частоты оправданы при захвате и монтаже, где запас защищает от ошибок, – но не при доставке, где лишние данные чистые накладные расходы.

Практические провалы вытекают напрямую:

  • Выбор 96 kHz для приложения видеосвязи не улучшает разборчивость звонка. Он тратит трафик и CPU, которые лучше потратить на эхоподавление, и большинство микрофонов и сетевых путей всё равно не выигрывают от него.
  • Стриминг звука 96 kHz потребителям удваивает хранилище и стоимость доставки ради разницы, которую ни один слушатель не услышит в слепом тесте.
  • Смешивание 44.1 kHz и 48 kHz внутри одного конвейера заставляет передискретизировать на каждой границе; каждое преобразование – маленькая потеря качества и расход CPU, и поскольку 48 ÷ 44.1 не целое число, математика передискретизации именно того грязного типа. Выберите одну частоту для всей цепочки.

Подбирайте частоту под задачу. Захватывайте и монтируйте высоко, если ваша работа включает тяжёлую нелинейную обработку; доставляйте всегда на 48 kHz (или 44.1 kHz для чисто музыкального каталога).

Руководство по выбору, которым можно пользоваться уже сегодня

Выбор сводится к короткому дереву решений. Читайте сверху вниз и остановитесь на первой строке, подходящей вашему продукту.

Ваша ситуацияИспользуйтеПочему
Голос/видео в реальном времени (WebRTC, видеосвязь, телемедицина)48 kHzOpus и аудиостек ОС нативно 48 kHz; без передискретизации
Стриминг видео / OTT / образование48 kHzСовпадает с кадровыми частотами и дефолтами платформ (YouTube)
Чисто музыкальный стриминг из каталога 44.1 kHz44.1 kHz сквозьИзбегает одной передискретизации исходной библиотеки
Студийная запись с тяжёлой обработкой96 kHz при захватеЗапас для нелинейных гармоник; доставка с понижением до 48 kHz
Архивный мастер незаменимого источника96 kHz, 24 битаСтандарт high-resolution для сохранения; хранилище для мастеров дёшево
Только голос в узкой полосе (легаси-телефония)8 или 16 kHzЗадаётся кодеком (G.711, Opus narrowband); разобрано в Блоке 2

Таблица 1. Выбор частоты дискретизации по типу продукта. Если сомневаетесь для любого видеопродукта, ответ – 48 kHz.

Рисунок 3. Дерево решений сверху вниз: большинство видеопродуктов приходят к 48 kHz; в сторону уходят только музыкальные каталоги и студийный захват.

Где здесь Фора Софт

Во всех видеопродуктах, которые мы строим в Фора Софт, – видеосвязь, телемедицина, OTT, онлайн-образование, видеонаблюдение, AR/VR – решение о частоте дискретизации мы принимаем рано и редко пересматриваем, потому что верный выбор при захвате – самое дешёвое решение о качестве во всём конвейере. Для голоса в реальном времени в видеосвязи и телемедицине мы используем 48 kHz, чтобы оставаться нативными с Opus и стеком WebRTC, либо опускаемся до 16 kHz wideband, когда цель – разборчивость голоса и нужен запас CPU для эхоподавления и шумоподавления. Для воспроизведения в OTT и онлайн-образовании мы доставляем 48 kHz, чтобы привязать звук к картинке. Чаще всего мы исправляем в унаследованном коде конвейер, который захватывает на одной частоте и передискретизирует на каждом этапе; стандартизация на сквозном 48 kHz убирает целый класс багов качества и синхронизации.

Главное

  • Частота дискретизации – как часто измеряют волну; Найквист задаёт пол в 40 kHz.
  • 44.1 kHz – случайность видеоленты 1970-х, которую музыка унаследовала через CD.
  • 48 kHz победило в видео: делится нацело на кадровые частоты и держит синхронность.
  • ОС, Opus/WebRTC и YouTube по умолчанию 48 kHz – и вам стоит так же.
  • 96 и 192 kHz помогают при записи и монтаже, но не при готовом воспроизведении.
  • Больше не значит лучше: слепые тесты не показывают слышимого выигрыша выше 48 kHz.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.