Содержание статьи +
- Кратко
- Почему это важно
- Короткое напоминание: что такое частота дискретизации
- Единственное правило, задающее минимум: Найквист
- Откуда взялось 44.1 kHz: случайность видеоленты
- Откуда взялось 48 kHz: создано под картинку
- Почему 48 kHz по-прежнему остаётся лидером: на нём работает весь конвейер
- Когда высокие частоты оправданы: 88.2, 96, 192 kHz
- Дорогая ошибка: «большее число всегда звучит лучше»
- Руководство по выбору, которое можно использовать уже сегодня
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Опубликовано: 2026-06-04 · Время чтения: 16 мин · Автор: Николай Сапунов, CEO Фора Софт
Кратко
Частота дискретизации – это количество измерений звуковой волны в секунду, и единственное жёсткое правило, которому она подчиняется, – теорема Найквиста: частота дискретизации должна быть не менее чем вдвое выше самой высокой частоты, которую вы хотите сохранить. Поэтому для верхнего предела человеческого слуха в 20 кГц требуется как минимум 40 000 измерений в секунду. Музыка остановилась на 44 100 из-за случайности 1970-х годов, когда цифровой звук записывали на видеоленту, а видео выбрало 48 000 – потому что это число делится без остатка на кадровые частоты кино и телевидения, обеспечивая синхронность звука и изображения. Более высокие значения – 96 000 и 192 000 – оправданы при записи и сведении, где они упрощают борьбу с искажениями и работу фильтров, но в слепых тестах никто не различает их от 48 000 на готовом материале. В статье разобрано, откуда взялось каждое число, когда какое использовать и какую самую дорогую ошибку совершают команды: считать, что большее число всегда звучит лучше.
Почему это важно
Если вы создаёте или ведёте видеопродукт – приложение для видеосвязи, стриминговый сервис, образовательную или телемедицинскую платформу, – частота дискретизации – одно из первых чисел, которое настраивают ваши инженеры. Неправильный выбор может незаметно стоить вам трафика, нагрузки на CPU, а иногда и синхронности звука с изображением. Быть инженером для этого не обязательно, но важно понимать, что именно регулирует это число и почему «больше» не всегда означает «лучше».
Статья написана для осведомлённого читателя без аудиоопыта: каждый факт точен и применим даже для старшего инженера, а все утверждения подкреплены стандартами, их определяющими. После прочтения вы сможете уверенно выбрать частоту дискретизации и объяснить свой выбор любому в команде.
Короткое напоминание: что такое частота дискретизации
Прежде чем это число обретёт смысл, вспомните, как звук превращается в данные – об этом подробно рассказано в статье Что такое цифровой звук: от звуковой волны к битам. Микрофон преобразует перепады давления воздуха в плавно колеблющееся электрическое напряжение. Затем чип – аналого-цифровой преобразователь – измеряет величину этого напряжения в регулярные, близко расположенные моменты времени и записывает каждое измерение числом, которое называют отсчётом (sample). Количество таких измерений в секунду и есть частота дискретизации. Представьте её как тиканье очень быстрых часов: при частоте 48 000 герц – или 48 kHz, где «k» означает тысячу, а «герц» – раз в секунду – система каждые 48 тысяч раз в секунду спрашивает микрофон: «Насколько ты громкий прямо сейчас?» Вся статья – о том, как выбрать, насколько быстро должны тикать эти часы.
Единственное правило, задающее минимум: Найквист
Есть ровно один закон физики, задающий жёсткий минимум для частоты дискретизации, и на нём основана любая разумная частота. Это теорема отсчётов Найквиста – Шеннона, и простыми словами она гласит: чтобы достоверно записать звук, измерять нужно более чем вдвое чаще, чем самая высокая частота в этом звуке. Частота – это то, насколько быстро колеблется волна: низкий гул колеблется медленно, а высокий свист – быстро, и измеряется она в герцах.
Проговорим арифметику вслух – это весь фундамент. Слух человека в молодости достигает примерно 20 000 Гц, или 20 кГц. Вдвое больше – это:
2 × 20 000 Hz = 40 000 Hz = 40 kHzЗначит, любая частота ниже 40 кГц отбрасывает часть звуков, которые человек способен услышать. Именно это число – 40 кГц – объясняет, почему любая полноценная частота дискретизации – 44,1, 48, 96, 192 кГц – находится на этом уровне или выше, но никогда ниже. Они различаются тем, насколько выше порога стоят и почему.
Что будет, если нарушить правило и измерять слишком редко? Быстрые колебания, которые не успели зафиксировать, не исчезают. При воспроизведении они проявляются как неправильный, более низкий тон – такой, которого в комнате никогда не было. Это ложная нота, придуманная системой из-за пробелов в её измерениях. Такой артефакт называют алиасингом (aliasing) – фирменным дефектом записи с недостаточной частотой дискретизации. Чтобы избежать этого, каждый канал записи сначала пропускает звук через антиалиасинговый фильтр – схему, которая удаляет частоты, слишком высокие для корректной оцифровки, ещё до начала измерений.
Этот же фильтр – причина, по которой обычные частоты находятся чуть выше 40 кГц, а не ровно на этом значении. Ни один реальный фильтр не может идеально отсекать на 20 кГц, оставляя всё ниже без изменений: любому фильтру нужна переходная полоса – небольшой диапазон частот, в котором он плавно переходит от «пропуска» к «блокировке». Частота 44,1 кГц позволяет охватить до 22,05 кГц (половина частоты, которую называют частотой Найквиста), оставляя около 2 кГц запаса между верхним пределом слышимого диапазона – 20 кГц – и границей в 22,05 кГц для работы фильтра. Частота 48 кГц охватывает до 24 кГц, предоставляя фильтру ещё больше пространства и позволяя ему спадать мягче, не затрагивая слышимый диапазон. Этот запас – одна из двух настоящих причин, по которым для видео выбрали более высокую частоту; вторая – синхронность с изображением, и она лежит в центре статьи.
Откуда взялось 44.1 kHz: случайность видеоленты
Самый удивительный факт о частоте, используемой во всей записанной музыке, в том, что её никогда не выбирали по звучанию. Её выбрали из-за того, как цифровой звук хранили в конце 1970-х, до того как жёсткие диски стали достаточно большими и дешёвыми для этой задачи.
Тогда единственным доступным способом записать огромный поток чисел, который порождает цифровой звук, было замаскировать эти числа под видеосигнал и записать на видеокассету с помощью PCM-адаптера – устройства между аудиотехникой и видеомагнитофоном. Sony PCM-1600, выпущенный в 1979 году, делал именно это, и его преемники стали профессиональными цифровыми магнитофонами той эпохи. Когда вскоре разрабатывали компакт-диск, он унаследовал ту же частоту дискретизации, которую уже использовали эти устройства, чтобы записи можно было переносить на CD без передискретизации.
Почему именно 44 100? Потому что это число вытекало из структуры видеокадра. Видеосигнал формируется из горизонтальных линий, которые рисуются пачками – полями – с фиксированной частотой в секунду. PCM-адаптер упаковывал звуковые отсчёты в подходящие линии каждого поля. Две телесистемы той эпохи давали два почти одинаковых результата:
NTSC (США/Япония): 245 линий × 60 полей/с × 3 отсчёта/линию ≈ 44 056 отсчётов/с
PAL (Европа): 294 линии × 50 полей/с × 3 отсчёта/линию = 44 100 отсчётов/сЦифра PAL – 44 100 – победила благодаря своей округлости, и CD закрепил её в стандарте Red Book в 1980 году. В ней нет никакой акустической магии. Это след хранилищного трюка 1970-х, и каждая песня, которую вы когда-либо слушали в стриминге, до сих пор несёт этот след, потому что весь музыкальный каталог построен на нём.
Откуда взялось 48 kHz: создано под картинку
Пока звук CD унаследовал частоту 44,1 кГц от старой видеоленты, индустрия в целом понимала необходимость единой согласованной частоты для профессиональной и вещательной работы и начала осознанно выбирать её с 1981 года. Кандидаты группировались в диапазоне от 45 до 60 кГц. Хотя 60 кГц идеально подходили бы для синхронизации с кино и видео, их сочли избыточно высокими для звука, которому не требуется достигать 30 кГц. Ограничившись частотами, полностью совместимыми с кино и телевидением – 45, 48, 50, 52,5 и 54 кГц, – индустрия остановилась на 48 кГц.
Решающим фактором стала синхронизация со звуком, и она сводится к простому делению. Кино и значительная часть телевидения работают со скоростью 24 кадра в секунду. Чтобы звук точно совпадал с каждым видеокадром – чтобы его можно было резать, монтировать и упаковывать вместе с изображением без дробных остатков – число звуковых отсчётов в секунду должно делиться нацело на количество кадров в секунду. Проверим обоих кандидатов:
48 000 отсчётов/с ÷ 24 кадра/с = 2 000 отсчётов на кадр (целое — чисто)
44 100 отсчётов/с ÷ 24 кадра/с = 1 837,5 отсчёта на кадр (дробное — грязно)Сорок восемь тысяч делится на 24 нацело, а сорок четыре тысячи сто – нет. Эта половина лишнего отсчёта, повторяющаяся кадр за кадром, и есть тот самый дрейф, из-за которого звук и видео расходятся на длинной программе – проблема синхронизации, подробно рассмотренная в статье Синхронизация звука и видео: ITU-R BT.1359 и окна допуска. У Европы была ещё одна причина выбирать 48 кГц: она уже использовала вещание на частоте 32 кГц, а 48 кГц относится к 32 кГц как 3:2 – чистая математическая пропорция, что делало конвертацию между ними простой и безболезненной.
Audio Engineering Society официально утвердила этот выбор и продолжает его поддерживать. Рекомендованная практика AES5-2018 (подтверждена в 2023) называет 48 kHz предпочтительной частотой дискретизации для профессионального создания, обработки и обмена звуком, при этом признавая 44,1 kHz – для потребительской музыки, 32 kHz – для части вещания и 96 kHz – для работы с расширенной полосой. Когда орган стандартизации говорит «предпочтительная», это означает: используйте её, если у вас нет веской причины поступить иначе.
Почему 48 kHz по-прежнему остаётся лидером: на нём работает весь конвейер
Выбор, сделанный в 1981 году, мог бы со временем утратить актуальность, но вместо этого превратился в стандарт, пронизывающий весь современный стек – и именно это делает его практичным решением и сегодня. Три слоя усиливают друг друга.
Первый – операционные системы. Аудиодвижок в Windows, Linux и Android использует 48 кГц как стандартную внутреннюю частоту вывода. Когда ваше приложение воспроизводит звук, ОС автоматически конвертирует его в 48 кГц. Подача звука с частотой 48 кГц означает отсутствие пересемплирования, а каждое пересемплирование – это небольшой риск добавления шума и лишней нагрузки на CPU.
Второй – кодеки. Opus, кодек, который IETF сделал обязательным для WebRTC и который используется в большинстве голосовых и видеозвонков в реальном времени, работает на частоте 48 кГц в своём ядре – спецификация IETF RFC 6716 фиксирует высококачественный (MDCT) слой кодека именно на этой частоте, а декодер просто понижает частоту для меньших значений, поскольку каждая поддерживаемая частота делит 48 кГц нацело. Конвейер WebRTC, описанный в статье Конвейер аудио WebRTC целиком, предполагает использование 48 кГц – от микрофона до динамика.
Третий – платформы. Рекомендации YouTube по кодированию предполагают использование звука с частотой дискретизации 48 кГц. По состоянию на обновление спецификации 2025 года платформа поддерживает современные форматы, включая AAC-LC, Opus и собственный новый иммерсивный формат Eclipsa – все на 48 кГц. Если вы загрузите музыку с частотой 44,1 кГц, YouTube всё равно передискретизирует её до 48 кГц при приёме.
Урок для видеопродукта прост: захватывайте, обрабатывайте и доставляйте на частоте 48 кГц – и вся цепочка (ОС, кодек, платформа) будет с вами согласна, не выполняя лишней работы. Единственное частое исключение – чисто музыкальное приложение, чья исходная библиотека записана на частоте 44,1 кГц; в этом случае сквозное сохранение 44,1 кГц позволяет избежать одной передискретизации. Смешивание двух частот внутри одного конвейера – худшее из двух миров.
Когда высокие частоты оправданы: 88.2, 96, 192 kHz
Если 48 кГц уже охватывает весь диапазон, слышимый человеческим ухом, зачем профессиональные рекордеры и монтажные пакеты вообще предлагают частоты 96 и 192 кГц? Не потому, что они звучат лучше при воспроизведении – этот вопрос уже решён, об этом будет ниже, – а из-за того, что происходит во время записи и обработки, до появления готового файла.
Высокие частоты обеспечивают две реальные выгоды. Первая – запас для фильтра. При частоте дискретизации 96 кГц частота Найквиста составляет 48 кГц, поэтому у антиалиасингового фильтра остаётся широкая и плавная переходная полоса далеко за пределами слышимого диапазона. Это позволяет сделать фильтр проще и снизить искажения в области, воспринимаемой ухом. Вторая, и более важная, – нелинейная обработка. Эффекты вроде дисторшна, сатурации и клиппинга намеренно генерируют новые высокие частоты (гармоники), которых не было в исходном сигнале. На частоте 48 кГц гармоники, попадающие выше 24 кГц, не могут быть корректно записаны и превращаются в алиасинг – слышимый шум. Запись или обработка на 96 кГц даёт этим гармоникам пространство выше слышимого диапазона, поэтому у многих программных синтезаторов и дисторшн-плагинов есть функция «oversampling», временно повышающая частоту дискретизации для вычислений. Recording Academy и стандарт high-resolution audio от AES, CTA и JAS считают разрешение 24 бита / 96 кГц предпочтительным для записи, сведения и мастеринга именно по этим производственным причинам.
Цена механическая и реальная. Удвойте частоту дискретизации – и вы удвоите объём данных, объём хранилища и нагрузку на обработку:
96 kHz против 48 kHz: в 2 раза больше отсчётов → в 2 раза больше файл и примерно в 2 раза CPU
192 kHz против 48 kHz: в 4 раза больше отсчётов → в 4 раза больше файл и примерно в 4 раза CPUДля продукта в реальном времени удвоение частоты дискретизации напрямую конкурирует с бюджетом CPU, необходимым для подавления эха и шума. При стриминге это удваивает объём хранилища и исходящий трафик ради звука, который слушатели не отличат от 48 кГц. Высокие частоты – удел студии, а не файла для доставки.
Дорогая ошибка: «большее число всегда звучит лучше»
Самое частое и дорогое заблуждение в аудио – что высокая частота дискретизации автоматически даёт лучший звук для слушателя. Это не так, и наука однозначна. В правильно проведённых двойных слепых ABX-тестах – где слушатели, включая опытных профессионалов, должны определить, какой из двух фрагментов записан с более высокой частотой, не зная, какой перед ними, – люди не могут надёжно различить 44.1 kHz или 48 kHz от 96 kHz или 192 kHz на одном и том же материале. Даже сводка обсуждений эпохи стандартизации прямо утверждает: человек не способен легко услышать разницу между 48, 44.1 и другими близкими частотами дискретизации.
С точки зрения Найквиста это логично. Как только вы начинаете дискретизировать выше примерно 40 кГц, вы уже охватываете все частоты, которые способен услышать человек; всё, что добавляет файл с частотой 192 кГц, находится выше диапазона человеческого слуха – там оно не приносит пользы слушателю, но в четыре раза увеличивает размер файла. Высокие частоты оправданы при записи и монтаже, где запас защищает от ошибок, – но не при распространении, где лишние данные становятся чистыми накладными расходами.
Практические провалы напрямую вытекают из этого:
- Выбор 96 kHz для приложения видеосвязи не улучшает разборчивость речи. Он тратит трафик и ресурсы CPU, которые лучше направить на эхоподавление, а большинство микрофонов и сетевых каналов и так не способны раскрыть преимущества такой частоты.
- Стриминг звука 96 kHz потребителям удваивает объём хранилища и стоимость доставки ради разницы, которую ни один слушатель не сможет заметить в слепом тесте.
- Смешивание 44.1 kHz и 48 kHz внутри одного конвейера требует передискретизации на каждом переходе; каждое преобразование – это небольшая потеря качества и нагрузка на CPU. Поскольку 48 ÷ 44.1 не является целым числом, математика передискретизации становится именно той «грязной» – неточной и ресурсоёмкой. Выберите одну частоту для всей цепочки.
Подбирайте частоту дискретизации под задачу. Записывайте и монтируйте с высокой частотой – например, 48 кГц (или 44,1 кГц для чисто музыкального контента), если требуется тяжёлая нелинейная обработка; финальный материал всегда сдавайте на 48 кГц (или 44,1 кГц для чисто музыкального каталога).
Руководство по выбору, которое можно использовать уже сегодня
Выбор сводится к короткому дереву решений. Читайте сверху вниз и останавливайтесь на первой строке, подходящей вашему продукту.
| Ваша ситуация | Используйте | Почему |
|---|---|---|
| Голос/видео в реальном времени (WebRTC, видеосвязь, телемедицина) | 48 kHz | Opus и аудиостек ОС нативно 48 kHz; без передискретизации |
| Стриминг видео / OTT / образование | 48 kHz | Совпадает с кадровыми частотами и дефолтами платформ (YouTube) |
| Чисто музыкальный стриминг из каталога 44.1 kHz | 44.1 kHz сквозь | Избегает одной передискретизации исходной библиотеки |
| Студийная запись с тяжёлой обработкой | 96 kHz при захвате | Запас для нелинейных гармоник; доставка с понижением до 48 kHz |
| Архивный мастер незаменимого источника | 96 kHz, 24 бита | Стандарт high-resolution для сохранения; хранилище для мастеров дёшево |
| Только голос в узкой полосе (легаси-телефония) | 8 или 16 kHz | Задаётся кодеком (G.711, Opus narrowband); разобрано в Блоке 2 |
Таблица 1. Выбор частоты дискретизации по типу продукта. Если сомневаетесь в выборе для любого видеопродукта – ответ: 48 кГц.
Где здесь Фора Софт
Во всех видеопродуктах, которые мы создаём в Фора Софт – видеосвязь, телемедицина, OTT, онлайн-образование, видеонаблюдение, AR/VR – решение о частоте дискретизации мы принимаем заранее и редко пересматриваем, потому что правильный выбор на этапе захвата – самое дешёвое решение по качеству во всём конвейере. Для голосовой связи в реальном времени в видеосвязи и телемедицине мы используем 48 кГц, чтобы оставаться нативными с Opus и стеком WebRTC, либо снижаем частоту до 16 кГц wideband, если приоритет – разборчивость речи и нужен запас CPU для эхоподавления и шумоподавления. В OTT и онлайн-образовании мы доставляем звук с частотой 48 кГц, чтобы синхронизировать его с видео. Чаще всего в унаследованном коде мы исправляем конвейер, который захватывает аудио на одной частоте, а затем пересэмплирует его на каждом этапе; стандартизация на сквозной частоте 48 кГц устраняет целый класс багов, связанных с качеством и синхронизацией.
Главное
- Частота дискретизации – это частота измерений звуковой волны; по теореме Найквиста она должна быть не ниже 40 кГц.
- 44,1 кГц – случайность, возникшая из технических ограничений видеоленты 1970-х, которую музыка унаследовала через CD.
- 48 кГц стало стандартом в видео: оно делится нацело на кадровые частоты и обеспечивает синхронизацию.
- ОС, кодеки Opus и WebRTC, а также YouTube по умолчанию используют 48 кГц – и вам стоит придерживаться этого стандарта.
- Частоты 96 и 192 кГц полезны при записи и монтаже, но не дают преимущества при окончательном воспроизведении.
- Больше – не всегда лучше: слепые тесты не выявляют слышимых улучшений выше 48 кГц.