Учебный курс · обновлён в августе 2026

Аудио для видео: от звуковой волны до синхронной дорожки

Половина впечатления от видео приходится на звук, и ломается он тише, чем картинка. Практический курс инженеров Фора Софт: громкость и задержки считаются в цифрах, стандарты цитируются по номерам документов.

6 глав68 статей~154 термина~24 ч чтения
Николай Сапунов, директор Фора СофтАвтор – Николай Сапунов, директор Фора Софт

Программа

Все главы курса

6 глав · 68 статей · ~24 ч чтения
01Основы звука для видеоинженераДискретизация, битовая глубина, каналы и громкость – четыре величины, из которых собран любой цифровой звук, плюс контейнеры и нарезка потока на фреймы. Глава разбирает их до кодеков, чтобы дальше выбор битрейта читался как арифметика, а не как вкусовое решение.базовый8 статей · ~3 ч02Аудиокодеки: современный раскладТридцать лет аудиокодеков – от MP2 до LC3. Что каждое семейство делает со звуком: AAC, Opus, Dolby, речевые и без потерь, чем за это платят в лицензиях и совместимости, и по какому дереву решений кодек выбирают под сервис.средний13 статей · ~5 ч03Звук в стриминге: громкость, дорожки, ABRКак звук доезжает до зрителя: дорожки в HLS, DASH и CMAF, лестницы битрейта, нормализация по EBU R128 и целевые LUFS площадок. Здесь же многоязычие, тифлокомментарий, Atmos, низкая задержка и цена мультидорожек в хранении и трафике.средний12 статей · ~4 ч04Звук в реальном времени: конвейер WebRTCКонвейер WebRTC поимённо: эхоподавление, регулировка усиления, шумоподавление, детектор речи, буфер джиттера, маскировка потерь и избыточность FEC. Каждый узел разобран по тому, что он делает с задержкой и разборчивостью, а заканчивается глава плейбуком диагностики.продвинутый14 статей · ~5 ч05Синхронизация звука и видео, метки времениРассинхрон губ измеряется в миллисекундах и допусках ITU-R BT.1359, а держится на метках времени: PTS и DTS, PCR в MPEG-TS, RTP и отчёты отправителя RTCP. Отдельно – дрейф часов, ресемплинг и методика проверки хлопушкой.продвинутый9 статей · ~2 ч06Пространственный звук, измерение качества и будущееОт стерео к объектному и сценному звуку: Atmos, MPEG-H, Ambisonics и бинауральный рендеринг для VR и конференций. Рядом – как качество звука измеряют объективно и на слушателях, и что уже умеют нейросетевые кодеки и ИИ-дубляж.продвинутый12 статей · ~4 ч

Результат

Чему вы научитесь

Приводить громкость к норме площадок

Что узнаете: как ITU-R BS.1770 считает LUFS, чем −23 вещания отличается от −14 Spotify и зачем нужен запас по истинному пику. Почему важно: площадка всё равно нормализует дорожку, и пережатый мастер она сделает тише, а не громче.

Выбирать аудиокодек под задачу

Что узнаете: чем Opus отличается от AAC, AC-4 и LC3 по битрейту, задержке, каналам и лицензиям. Почему важно: кодек определяет, на каком железе дорожка вообще декодируется, и декодируемость важнее верности.

Собирать звук реального времени

Что узнаете: из чего состоит аудиоконвейер WebRTC – эхоподавление, шумоподавление, детектор речи, буфер джиттера, маскировка потерь. Где применяется: видеосвязь, интерактивные эфиры, голосовые ИИ-агенты.

Держать звук в синхроне с картинкой

Что узнаете: как метки времени PTS, PCR и RTP связывают дорожки и почему окно допуска асимметрично. Почему важно: рассинхрон зритель чувствует раньше, чем формулирует, и жалуется на «плохое видео».

Работать с пространственным звуком

Что узнаете: чем канальный звук отличается от объектного и сценного и как Atmos, MPEG-H и Ambisonics доезжают до наушников. Где применяется: стриминг премиум-контента, VR, конференции с расстановкой голосов.

Измерять качество звука

Что узнаете: что показывают PESQ, POLQA и ViSQOL и когда их не заменить слушателями по MUSHRA и MOS. Почему важно: без общей шкалы спор о качестве звука остаётся спором вкусов.

Как читать

Сколько у вас времени?

три пути через одни и те же 6 глав

Кому подходит

Для менеджера продукта: понять словарь звука и не потеряться на встрече с инженерами.

Начать путь A
  1. 1Что такое цифровой звук
  2. 2Громкость: Peak, RMS и LUFS
  3. 3Как выбрать аудиокодек: дерево решений

Строите такую систему?

Поможем выбрать кодек, собрать пайплайн кодирования и посчитать инфраструктуру до старта разработки.

С чего начать

Первая статья курса

или сразу к своей теме

Справочник

Глоссарий курса

AAC-LC

AAC Low Complexity

Базовый профиль AAC – Low Complexity. Именно он звучит в большинстве MP4-видео, ~128-256 кбит/с стерео. Когда говорят просто «AAC», обычно имеют в виду его.

AAC

advanced audio coding, MPEG-4 audio

Advanced Audio Coding – стандартный аудиокодек для видео на YouTube, Netflix, Apple и большинстве OTT-платформ. Несколько профилей: AAC-LC, HE-AAC v1/v2, xHE-AAC.

AC-3 (Dolby Digital)

Dolby-кодек 1991 года, принёсший 5.1 в DVD и эфирное вещание ATSC. В стриминге заменён на E-AC-3, но всё ещё повсеместен в наследии.

AC-4 IMS

AC-4 Immersive Stereo

AC-4 Immersive Stereo – компактный режим доставки Dolby Atmos для низкобитрейтного стриминга и вещания, рендерящий иммерсивный звук из эффективного потока AC-4.

AC-4

Следующее поколение Dolby для вещания. Object-based, immersive, со встроенным усилением диалога. Принят в ATSC 3.0 и DVB.

Доступность аудио

a11y, accessible audio

Набор средств, делающих аудио доступным каждому – тифлокомментарий, дорожки с чистым и усиленным диалогом, сурдо-дорожки – во многом обязательный по закону.

Все ~154 термина

Автор

Кто написал курс

Николай Сапунов, директор Фора Софт

Николай Сапунов

директор Фора Софт

Автор курса – директор Фора Софт. Компания двадцать лет собирает системы, где звук идёт вживую: видеоконференции, трансляции, платформы обучения и вещания. Настройки эхоподавления, буферов и целевой громкости в главах взяты из систем, которые работают у заказчиков, а не из обзоров.

Вопросы

Частые вопросы о курсе

Курс бесплатный? +

Да. Это открытая база знаний: читайте без регистрации и оплат.

Нужно ли разбираться в звукорежиссуре? +

Нет. Курс написан для тех, кто делает видеосистемы, а не сводит музыку: речь о дорожках, кодеках, задержках и синхроне, а не о вкусе микса.

Для кого он написан? +

Для инженеров, продактов и технических руководителей, у которых в продукте есть звук: видеосвязь, стриминг, вещание, обучение. Пути чтения выше помогают выбрать глубину.

Сколько времени займёт чтение? +

Полный курс – около 24 часов. Быстрый путь для менеджера – примерно 2 часа, инженерный минимум – 8.

Как курс связан с курсами о кодировании и стриминге? +

Он про ту же цепочку, но со стороны звука: где видеокурсы говорят о кадрах и битрейт-лестницах, этот говорит о дорожках, громкости и синхроне. Читать их по порядку не обязательно.

Можно ли ссылаться на материалы курса? +

Да, со ссылкой на первоисточник. Для перепечатки целых глав напишите нам на info@fora-soft.ru.

Готовы начать?

Глава 1 «Основы звука для видеоинженера» – 8 статей, около 3 часов. Дальше станет сложнее.