Справочник
Глоссарий аудио для видео
Короткие определения с синонимами и ссылками на статьи, где термин разобран подробно. Все термины на одной странице – ищите поиском или прыгайте по алфавиту.
С чего начать
Ключевые термины
Если читать словарь целиком некогда – это тот минимум, на котором держатся остальные 142 термина.
А
Алиасинг
Артефакты, возникающие, когда в сигнале присутствуют частоты выше половины частоты дискретизации. Их устраняет антиалиасинговый фильтр перед АЦП.
Подробнее →Аудио-рендишн
Один конкретный аудио-вариант в манифесте адаптивного стриминга – это язык, кодек, битрейт или раскладка каналов. В HLS он называется rendition group, в DASH – AdaptationSet.
Подробнее →Аудиокадр
Фиксированный блок сэмплов, который кодек обрабатывает как единое целое – 1024 сэмпла для AAC, 20 мс для Opus. Атомы размера, задержки и перемотки в сжатом аудио.
Подробнее →Аудиокодек
Coder-Decoder – алгоритм, который сжимает аудиоданные до меньшего объёма бит и восстанавливает их при воспроизведении.
Подробнее →Аудиообъект
Один звук вместе с его позиционными метаданными (координаты x, y, z и размер) в объектном аудио. Рендерер размещает его по доступным колонкам или наушникам при воспроизведении.
Подробнее →АЦП (аналого-цифровой преобразователь)
analog-to-digital converter, A/D
Микросхема, преобразующая непрерывное напряжение с микрофона в дискретные PCM-отсчёты: она измеряет сигнал с заданной частотой дискретизации и округляет его до разрешающей способности, определяемой битовой глубиной.
Подробнее →Б
Битовая глубина
Сколько бит описывает один аудио-сэмпл? Каждый бит даёт около 6 дБ динамического диапазона; 24 бита – это 144 дБ запаса.
Подробнее →Битрейт
kbps
Сколько бит в секунду занимает сжатый поток, в кбит/с. Главная «ручка» «качество против размера»: 128 кбит/с AAC стерео, 24 кбит/с Opus голос, 768 кбит/с E-AC-3 5.1.
Подробнее →Г
Гранула
Подразделение из эпохи MP3: каждый MP3-кадр содержит две гранулы по 576 сэмплов. Сегодня оно чаще всего проявляется при точной обрезке аудио по сэмплам.
Подробнее →Громкость
Ощущаемая интенсивность звука – не путать с пиковым уровнем. Измеряется в LUFS по стандарту ITU-R BS.1770. Каждая вещательная и стриминговая платформа устанавливает свою целевую метрику.
Подробнее →Д
Даунмикс
upmix
Сведение большего числа каналов в меньшее – например, 5.1 в стерео или стерео в моно – по заданным коэффициентам (Lo/Ro, Lt/Rt), чтобы surround-звук корректно воспроизводился и на двух колонках.
Подробнее →Децибел (дБ)
dB
Логарифмическая шкала, а не абсолютная величина. Каждые +6 дБ примерно удваивают амплитуду; смысл значения определяется точкой отсчёта (dBFS, dBTP, дБ SPL).
Подробнее →Дизеринг
Небольшой шум, добавляемый перед уменьшением битовой глубины, превращает резкое коррелированное искажение квантования в тихое равномерное шипение.
Подробнее →Динамический диапазон
Разница между самым тихим и самым громким звуком, который может передать система. Каждый бит добавляет около 6 дБ: 16 бит – 96 дБ, 24 бита – около 144 дБ.
Подробнее →Доступность аудио
a11y, accessible audio
Набор средств, делающих аудио доступным для всех – тифлокомментарий, дорожки с чистым и усиленным диалогом, сурдодорожки – во многом является обязательным по закону.
Подробнее →Дрейф часов
sample clock drift
Медленное расхождение между частотой записи и воспроизведения – рассинхрон 48,000 против 48,001 кГц. Без коррекции аудио и видео расходятся уже за несколько минут.
Подробнее →И
К
Канал
Один независимый поток аудиосэмплов. В стерео – два канала, в 5.1 – шесть, в 7.1.4 – двенадцать.
Подробнее →Канальное аудио
Классическая модель: каждая дорожка привязана к определённой колонке – L, R, C, Ls, Rs. Просто и универсально, но микс остаётся зафиксированным под одну раскладку.
Подробнее →Квантование
Округление каждого непрерывного сэмпла до ближайшего значения, доступного при заданной битовой глубине. Ошибка округления – шум квантования, который подавляют с помощью дизеринга.
Подробнее →Клиппинг
Жёсткое искажение возникает, когда сигнал превышает максимальный уровень (0 dBFS) и его пики обрезаются. После записи в файл это становится необратимым.
Подробнее →Контрибуционный кодек
contribution audio
Высококачественный кодек с минимальными потерями для передачи звука между платформами до финального кодирования устойчив к многократному перекодированию – в отличие от дистрибуционного.
Подробнее →М
Маскирование
frequency masking, temporal masking
Эффект, при котором громкий звук заглушает тихий, близкий по частоте или времени. Кодеки с потерями используют этот эффект: замаскированные детали можно удалять незаметно.
Подробнее →Микширование аудио
Суммирование звука нескольких участников в один поток с регулированием уровня и ограничением для предотвращения клиппинга. Это основная задача MCU и серверной записи.
Подробнее →Многоязычное аудио
multi-track audio, dubs
Доставка нескольких языковых дорожек (оригинал и дубляж) в виде параллельных рендишенов в одном манифесте позволяет зрителю выбирать язык без необходимости загружать отдельный файл или поток.
Подробнее →Моно
Один канал звука. На наушниках он звучит одинаково в обоих ушах. Это стандарт для голосовой связи в телекоме и видеоконференциях.
Подробнее →Н
О
Объектное аудио
Звук, хранящийся как источники с позиционными метаданными и рендерящийся под любые колонки при воспроизведении. Модель, лежащая в основе Dolby Atmos и MPEG-H.
Подробнее →Остаточное эхо
residual echo suppression, RES
Эхо, которое линейный подавитель не может смоделировать – из-за нелинейных динамиков или дрейфа часов. Остаточное эхо удаляет подавитель остаточного эха (часто стадия NS).
Подробнее →П
Пайплайн транскрипции
Путь обработки аудио в текст и записи: ответвление от основного микса, нарезка по VAD, передача через ASR, затем сохранение субтитров, краткого содержания и самой записи.
Подробнее →Пик (sample peak)
Максимальное значение сэмпла в файле или окне, измеряемое в dBFS. Отличается от true peak – не учитывает межсэмпловые пики.
Подробнее →Подавление шума
NS, noise reduction
Стадия обработки, подавляющая фоновые шумы – клавиатуру, вентилятор, машины – и сохраняющая речь. Современные системы используют глубокое обучение (RNNoise, Krisp, NVIDIA RTX Voice).
Подробнее →Психоакустическая модель
psychoacoustics
Модель человеческого слуха, на основе которой кодек с потерями решает, какие детали отбросить – тратя биты только там, где ухо заметит их отсутствие.
Подробнее →Р
Раскладка каналов
Именованный набор и порядок каналов в потоке – mono, stereo, 5.1, 7.1.4. Плеер должен знать его, чтобы направить каждый канал в нужную колонку.
Подробнее →Ресемплинг
sample rate conversion, SRC
Преобразование аудио из одной частоты дискретизации в другую – например, с 44,1 кГц на 48 кГц или небольшие подстройки для компенсации дрейфа часов без заметных пропусков.
Подробнее →С
Сброс / вставка кадров
drop/dup, frame skipping
Грубая коррекция дрейфа: иногда пропускают или повторяют кадр, чтобы синхронизировать аудио и видео. Дешевле ресемплинга, но резкий сброс слышен как щелчок.
Подробнее →Сжатие без потерь
Сжатие, восстанавливающее исходные сэмплы бит в бит: FLAC, ALAC, WavPack. Меньше, чем WAV, – идеальное качество; подходит для мастеринга и архивов.
Подробнее →Сжатие с потерями
lossy compression
Сжатие, безвозвратно отбрасывающее детали, которые ухо вряд ли заметит, по психоакустической модели – AAC, Opus, MP3. Оно занимает намного меньше места, чем lossless, но не обеспечивает бит-в-битное совпадение.
Подробнее →Стерео
Два канала – левый и правый – создают ощущение горизонтальной ширины. Это стандарт для музыки и большинства видео.
Подробнее →Сценовое аудио
Целое звуковое поле, закодированное независимо от колонок – обычно в формате Ambisonics, – свободно вращается под трекинг головы и является естественным выбором для VR и 360-видео.
Подробнее →Т
Теорема Найквиста – Шеннона
Nyquist-Shannon, sampling theorem
Чтобы записать частоту, нужно дискретизировать сигнал с частотой минимум вдвое выше. 48 кГц позволяют захватывать частоты до 24 кГц – с запасом выше пределов человеческого слуха.
Подробнее →Тифлокомментарий
descriptive audio, DVS, described video service
Дополнительная аудиодорожка с закадровым описанием визуальных действий для незрячих и слабовидящих. Требуется законодательством США, ЕС и Канады.
Подробнее →Трекинг головы
Отслеживание поворота головы слушателя и синхронный поворот звукового поля позволяют источникам звука оставаться на своих местах в комнате. Именно это «закрепляет» пространственный звук в AirPods.
Подробнее →У
Ц
Ч
A
AAC
advanced audio coding, MPEG-4 audio
Advanced Audio Coding – стандартный аудиокодек, используемый на YouTube, Netflix, Apple и большинстве OTT-платформ. Поддерживаются несколько профилей: AAC-LC, HE-AAC v1/v2, xHE-AAC.
Подробнее →AAC-LC
AAC Low Complexity
Базовый профиль AAC – Low Complexity. Именно он используется в большинстве MP4-видео со скоростью кодирования 128–256 кбит/с в стерео. Когда говорят просто «AAC», обычно имеют в виду именно его.
Подробнее →AC-3 (Dolby Digital)
Dolby-кодек 1991 года, внедривший формат 5.1 в DVD и эфирное вещание ATSC. В стриминге его заменил E-AC-3, однако он по-прежнему широко используется в наследии.
Подробнее →AC-4
Следующее поколение Dolby для вещания: объектно-ориентированное, объёмное, с встроенным усилением диалога. Поддерживается в стандартах ATSC 3.0 и DVB.
Подробнее →AC-4 IMS
AC-4 Immersive Stereo
AC-4 Immersive Stereo – компактный режим доставки Dolby Atmos для низкобитрейтного стриминга и вещания, рендерящий иммерсивный звук из эффективного потока AC-4.
Подробнее →AdaptationSet (DASH)
Группа в манифесте DASH, содержащая взаимозаменяемые версии одного компонента – например, все битрейты английской аудиодорожки. Аналог *rendition group* в HLS.
Подробнее →AEC (эхоподавление)
acoustic echo cancellation, echo cancellation, AEC3
Алгоритм, удаляющий из микрофонного сигнала звук, воспроизводимый динамиком собеседника. Без него любой звонок превращается в петлю обратной связи.
Подробнее →AEC3
WebRTC AEC3
Эхоподавитель третьего поколения в libWebRTC – стандартное решение для звонков на базе Chrome, настроенное на работу с дешёвым оборудованием ноутбуков.
Подробнее →AES67
Стандарт совместимости audio-over-IP, позволяющий Dante, Ravenna и Livewire обмениваться несжатым PCM-аудио по сети с синхронизацией по PTP.
Подробнее →AGC (автоматическая регулировка усиления)
automatic gain control, AGC2
Контур, регулирующий усиление микрофона так, чтобы голос воспроизводился с постоянной громкостью независимо от расстояния до микрофона.
Подробнее →AGC2
WebRTC AGC2
Новая автоматическая регулировка усиления в WebRTC – адаптивная цифровая схема, заменившая аналоговый контур AGC1 для обеспечения стабильного уровня голоса на разных устройствах.
Подробнее →AIFF
Audio Interchange File Format
Несжатый PCM-формат от Apple, аналог WAV для Mac. Тот же уровень качества звука, big-endian, широко используется в macOS и профессиональном аудио.
Подробнее →ALAC
apple lossless
Apple Lossless Audio Codec – это формат без потерь от Apple, по качеству эквивалентный FLAC. Он нативно поддерживается в iOS и macOS, а также используется на уровне Hi-Res в Apple Music.
Подробнее →Ambisonics
Формат пространственного звука на основе сцены, фиксирующий всё звуковое поле вокруг точки с помощью небольшого числа каналов. Стандарт для 360°-видео и VR.
Подробнее →AMR (AMR-NB / AMR-WB)
Adaptive Multi-Rate, AMR-NB, AMR-WB
Семейство Adaptive Multi-Rate из 2G/3G: AMR-NB (узкополосный) и AMR-WB (широкополосный, он же G.722.2) до сих пор используются в VoLTE и старых записях.
Подробнее →ASR (распознавание речи)
speech-to-text, STT
Автоматическое распознавание речи – это преобразование аудиопотока в текст для живых субтитров, транскриптов и поиска. Система работает на основе очищенного звука, разделённого по VAD, из телефонного звонка.
Подробнее →ATSC A/85 (CALM Act)
Американская рекомендация по громкости вещания, установленная законом CALM Act, предполагает уровень −24 LKFS как для рекламы, так и для программ. Поэтому реклама больше не звучит громче основного контента.
Подробнее →Audio level (RFC 6464)
client-to-mixer audio level, RFC 6464/6465
Расширение заголовка RTP с информацией о громкости каждого пакета позволяет SFU определять активных говорящих и отображать, кто говорит, без необходимости декодировать аудиоданные.
Подробнее →B
C
CBR (постоянный битрейт)
constant bitrate
Кодирование с фиксированной битрейтом независимо от контента. Предсказуемо для стриминга и планирования пропускной способности, чуть менее эффективно, чем VBR.
Подробнее →CELT
Музыкальный слой Opus с низкой задержкой, основанный на MDCT. Opus комбинирует его с SILK или использует отдельно для музыки и минимальной задержки.
Подробнее →CMAF
Common Media Application Format, fMP4
Common Media Application Format – единый формат, основанный на фрагментированных MP4-сегментах, который используют как HLS, так и DASH: аудиодорожка хранится один раз, а не дважды.
Подробнее →Comfort noise
CNG, comfort noise generation
Тихий синтетический шум, заполняющий паузу после прекращения передачи DTX, не даёт слушателю подумать, что связь оборвалась.
Подробнее →D
DASH (MPEG-DASH)
MPEG-DASH, Dynamic Adaptive Streaming over HTTP
ISO-стандарт адаптивного стриминга. Его XML-манифест (MPD) описывает аудио через AdaptationSet и Representation – между ними плеер переключается в зависимости от полосы пропускания.
Подробнее →dBFS
Децибелы относительно полной шкалы – 0 dBFS – это максимальное значение, которое может выразить цифровая система. Все остальные значения отрицательны.
Подробнее →dBTP
true peak, dB true peak
Decibels True Peak – шкала, учитывающая межсэмпловые пики, возникающие при работе аналогового реконструктора. В стриминге обычно применяется лимит −1 dBTP.
Подробнее →dialnorm
Поле метаданных в AC-3 / E-AC-3 / AC-4, указывающее декодеру уровень громкости диалога, чтобы тот автоматически понизил общую громкость воспроизведения до комфортного уровня для слушателя. Это вещательный предшественник современной нормализации громкости.
Подробнее →Dolby Atmos
Объектно-ориентированная иммерсивная аудиосистема от Dolby. Добавляет к 10-канальной подложке (7.1.2) до 118 динамических объектов с позиционными метаданными. Передаётся в форматах DD+ JOC, AC-4 IMS или в родном MP4 для кинотеатров.
Подробнее →Double-talk (двойной разговор)
Сложный случай для эхоподавления: оба говорят одновременно, и подавитель должен убрать дальнее эхо, не повредив ближний голос.
Подробнее →DTS (Decode Timestamp)
decode timestamp
Метка времени, указывающая, когда нужно декодировать кадр, может отличаться от времени его отображения (PTS) – особенно в видео с B-кадрами. Не путать с аудиокодеком DTS.
Подробнее →DTX (прерывистая передача)
discontinuous transmission
Функция экономии полосы пропускания: прекращает передачу пакетов в периоды молчания. В обычном разговоре экономит 40–70% трафика.
Подробнее →E
E-AC-3 (Dolby Digital Plus)
DD+, EAC-3, enhanced AC-3
Преемник AC-3, используется в Netflix, Disney+, Apple TV+, Amazon Prime и ATSC 3.0. Поддерживает Dolby Atmos через технологию Joint Object Coding (JOC).
Подробнее →EBU R128
Рекомендация Европейского вещательного союза по громкости: цель – −23 LUFS (интегрированный уровень), допуск ±1 LU, true peak ≤ −1 dBTP, LRA ≤ 20 LU. Европейский вещательный стандарт.
Подробнее →EnCodec
Meta EnCodec
Открытый нейросетевой аудиокодек от Meta. Архитектура «энкодер – квантизатор – декодер», обученная end-to-end с использованием остаточной векторной квантизации; поддерживает речь и музыку в диапазоне битрейтов от ~1.5 до 24 кбит/с.
Подробнее →ERLE
Echo Return Loss Enhancement
Echo Return Loss Enhancement – мера в децибелах, показывающая, насколько эффективно подавитель эха уменьшает его уровень. Это главный показатель при настройке и сравнении различных реализаций AEC.
Подробнее →EVS (Enhanced Voice Services)
Enhanced Voice Services, VoLTE codec
Голосовой кодек 4G/5G 2014 года: сверхширокополосная и полнодиапазонная речь, поддержка музыки, высокая устойчивость к потерям пакетов. Современный стандарт – VoLTE/VoNR.
Подробнее →F
FEC (упреждающая коррекция ошибок)
forward error correction, in-band FEC
Схема избыточности, добавляющая в поток дополнительную информацию, чтобы получатель мог восстановить потерянные пакеты без повторной передачи. In-band FEC в Opus передаёт низкобитрейтную копию предыдущего кадра.
Подробнее →FLAC
free lossless audio codec
Free Lossless Audio Codec – открытый формат сжатия без потерь, обычно вдвое компактнее WAV. Широко используется в архивах, при участии в контрибьюшене и в музыке высокого разрешения.
Подробнее →G
G.711
u-law, A-law, PCMU, PCMA
Телефонный кодек 1972 года: 8 кГц, 64 кбит/с – компандированный PCM (μ-law/A-law). До сих пор используется как резервный вариант в VoIP и WebRTC – его понимает любой узел.
Подробнее →G.722
Широкополосный (7 кГц) речевой кодек 1988 года со скоростью 48–64 кбит/с. Первый «HD Voice» в SIP- и DECT-телефонах, заметно чище узкополосного G.711.
Подробнее →H
HE-AAC
HE-AAC v1, AAC+, aacPlus
AAC-LC в сочетании с технологией Spectral Band Replication (SBR), восстанавливающей верхние частоты на основе низкобитрейтного ядра. Эффективен при битрейтах 32–64 кбит/с – часто используется в радиовещании и при низких битрейтах.
Подробнее →HE-AAC v2
eAAC+, AAC++
HE-AAC плюс Parametric Stereo: стереокартину кодируют несколькими параметрами. Обеспечивает качественное стерео для речи и музыки при скорости ~24–32 кбит/с.
Подробнее →Headroom (запас по уровню)
Запас между обычным уровнем сигнала и 0 dBFS. Headroom не позволяет транзиентам и интерсэмпловым пикам выйти в клиппинг.
Подробнее →HLS
HTTP Live Streaming, EXT-X-MEDIA
HTTP Live Streaming от Apple. Аудиодорожки объявляются тегами EXT-X-MEDIA в плейлисте; плеер сам выбирает дорожку и битрейт по своим правилам.
Подробнее →HRTF
head-related transfer function
Head-Related Transfer Function – фильтр, предназначенный для конкретного слушателя, описывающий, как звук из заданного направления изменяется под воздействием головы и ушей. Математика бинаурального рендеринга в наушниках.
Подробнее →I
J
Jitter buffer
Небольшая очередь на приёме удерживает аудиопакеты ровно столько, чтобы сгладить нерегулярное поступление из сети – и воспроизведение шло ровно.
Подробнее →JOC (Joint Object Coding)
Dolby Atmos JOC, E-AC-3 JOC
Joint Object Coding – метаданные в формате E-AC-3, которые передают объекты Dolby Atmos поверх базового канала 5.1. Именно так Atmos сегодня работает на Netflix и Disney+.
Подробнее →Joint stereo
mid-side, M/S, intensity stereo
Совместное кодирование двух каналов вместо раздельного – обычно в формате mid/side – применяется потому, что левый и правый каналы во многом совпадают. Это стандартный подход в MP3, AAC и Opus.
Подробнее →K
K-взвешивание
Частотная кривая внутри ITU-R BS.1770, приближающая то, как человеческое ухо воспринимает громкость. Это «K» в LKFS и основа любого измерения LUFS.
Подробнее →Krisp
Коммерческий SDK подавления шума на основе глубокого обучения, встроенный во многие приложения для видеоконференций; устраняет фоновый шум, а в новых версиях – ещё и эхо с реверберацией.
Подробнее →L
LC3
low complexity communications codec
Обязательный кодек Bluetooth LE Audio (2020). Заменяет SBC в беспроводных наушниках – обеспечивает лучшее качество при 64 кбит/с стерео, чем SBC при 200+ кбит/с.
Подробнее →LC3plus
Расширенный LC3 (ETSI TS 103 634) для профессионального и проводного применения: более высокая частота дискретизации, меньшая задержка и дополнительные средства защиты от потерь по сравнению с базовым LE Audio.
Подробнее →LFE (канал низкочастотных эффектов)
low-frequency effects, the .1
Та самая «.1» в 5.1 и 7.1 – это полосно-ограниченный (~20–120 Гц) канал для сабвуфера. Он передаёт гул и удары, но не полнодиапазонный звук.
Подробнее →Lip-sync
AV-sync, audio-video synchronization
Согласование звука и видео, чтобы движения губ на экране совпадали с голосом в ушах. ITU-R BT.1359 определяет допустимые отклонения: от −60 мс до +40 мс.
Подробнее →LKFS
Loudness, K-weighted, relative to Full Scale
Loudness, K-weighted, relative to Full Scale – название ATSC/ITU для той же единицы, что EBU называет LUFS. 1 LKFS = 1 LUFS, отличается только обозначение.
Подробнее →LL-HLS
Low-Latency HLS, partial segments
Low-Latency HLS – расширение Apple, использующее частичные сегменты и блокирующую перезагрузку плейлиста, которое снижает задержку с ~20 до 2–5 секунд, включая аудио.
Подробнее →LRA (диапазон громкости)
loudness range
Одно число в LU, описывающее разброс громкости в программе – от тихого диалога до громкого экшена – ограничено стандартом EBU R128 значением 20 LU для вещания.
Подробнее →LUFS
loudness units relative to full scale, LKFS
Loudness Units relative to Full Scale – перцептивная мера громкости по стандарту ITU-R BS.1770, применяемая во всех современных стандартах вещания и стриминга.
Подробнее →Lyra
Нейросетевой речевой кодек Google обеспечивает разборчивый голос при скорости около 3 кбит/с – значительно ниже порога, где классические кодеки перестают работать. Он построен на идеях SoundStream.
Подробнее →M
MCU (Multipoint Control Unit)
Multipoint Control Unit
Сервер, который декодирует звук от всех участников, микширует его в один поток и кодирует заново. Дёшев по нагрузке на полосу пропускания и CPU клиента, но дорог по ресурсам сервера и уровню задержки.
Подробнее →MDCT
Modified Discrete Cosine Transform
Modified Discrete Cosine Transform – перекрывающееся частотное преобразование, лежащее в основе MP3, AAC, Opus (CELT), AC-3 и почти всех кодеков с потерями.
Подробнее →Mesh / P2P аудио
full mesh, peer-to-peer
Топология, в которой каждый участник передаёт аудио напрямую всем остальным. Минимальная задержка и отсутствие медиасервера, но нагрузка на отдачу резко возрастает уже после ~4 человек.
Подробнее →Mid/Side кодирование
M/S stereo
Хранение суммы (mid) и разности (side) вместо L и R. Когда side мало – как в большинстве музыки – это сжимается заметно лучше.
Подробнее →MOS (Mean Opinion Score)
mean opinion score, ACR
Средняя оценка от 1 до 5, которую слушатели выставляют качеству звука. Это эталон, к которому стремятся приблизиться все объективные метрики – PESQ, POLQA, ViSQOL.
Подробнее →MP2
MPEG-1 Audio Layer II, MUSICAM
MPEG-1 Audio Layer II – вещательная «рабочая лошадка» 1991 года, до сих пор используемая в DVB и контрибуции. Устойчивее MP3 к многократному перекодированию, хотя именно MP3 вытеснил его на потребительском рынке.
Подробнее →MP3
MPEG-1 Audio Layer III, MPEG-2 Audio Layer III
Кодек 1993 года, определивший стандарты потребительского цифрового звука. Был заменён на AAC в видео, но до сих пор широко используется в подкастах и музыкальных библиотеках.
Подробнее →MPEG-H 3D Audio
MPEG-H, MPEG-H Audio
Открытый ISO-стандарт иммерсивного звука, альтернатива AC-4. Объединяет object-based, channel-based и scene-based подходы в одном потоке. Принят в ATSC 3.0 в Южной Корее и некоторых регионах США.
Подробнее →MPEG-TS
MPEG transport stream, .ts
Транспортный поток из 188-байтных пакетов в вещании и HLS. Мультиплексирует аудио, видео и временные метки (PCR), создан для надёжной доставки в реальном времени по ненадёжным каналам.
Подробнее →MUSHRA
MUlti Stimulus with Hidden Reference and Anchor, ITU-R BS.1534
ITU-R BS.1534 – слушательский тест, в котором несколько версий оцениваются относительно скрытого эталона и якорей. Это основной метод сравнения кодеков на пороге прозрачности.
Подробнее →N
NetEQ
Адаптивный jitter-буфер, лежащий в основе WebRTC-аудио и изначально разработанный в GIPS / Google Duo, растягивает, ускоряет, маскирует и вставляет комфортный шум, чтобы обеспечить плавное звучание при сетевых сбоях.
Подробнее →NTP (Network Time Protocol)
Network Time Protocol
Формат временной метки, который RTCP sender report использует в качестве общей точки отсчёта для независимых RTP-потоков, чтобы аудио и видео можно было синхронизировать в реальном времени.
Подробнее →NVIDIA RTX Voice / Broadcast
RTX Voice, NVIDIA Broadcast, Maxine
Подавление шума от NVIDIA с ускорением на GPU (сейчас входит в состав Broadcast/Maxine). Модели тяжелее, чем CPU-версии, но GPU позволяет добиться очень агрессивной очистки.
Подробнее →O
P
Parametric Stereo (PS)
PS
Техника, передающая моно-ядро и несколько пространственных параметров (разницу уровней и фаз), чтобы восстановить стерео на очень низком битрейте.
Подробнее →PCM
pulse code modulation
Pulse-Code Modulation – это не сжатый цифровой звук в виде потока значений. Все остальные форматы являются производными от PCM.
Подробнее →PCR (Program Clock Reference)
program clock reference
Отсчёт мастер-часов 27 МГц передаётся в потоке MPEG-TS. Декодер синхронизирует свои часы по PCR, чтобы значения PTS имели одинаковый смысл на приёмной и передающей сторонах.
Подробнее →PESQ
Perceptual Evaluation of Speech Quality, ITU-T P.862
ITU-T P.862 – эталонный алгоритм, предсказывающий речевой MOS путём сравнения искажённого звука с оригиналом. Долгое время оставался стандартом для тестирования узкополосного VoIP.
Подробнее →PLC (сокрытие потерь пакетов)
packet loss concealment
Алгоритм восстанавливает потерянный кадр с помощью правдоподобной реконструкции, чтобы слушатель воспринял лишь кратковременное растяжение звука, а не резкий щелчок или паузу.
Подробнее →POLQA
Perceptual Objective Listening Quality Analysis, ITU-T P.863
ITU-T P.863 – преемник PESQ, предназначенный для оценки качества голоса в сверхширокополосных системах и с использованием современных кодеков. На сегодняшний день это основная эталонная метрика объективной оценки качества голоса.
Подробнее →PTP (IEEE 1588)
Precision Time Protocol, IEEE 1588
Протокол точного времени (Precision Time Protocol) обеспечивает синхронизацию сетевых часов с точностью до микросекунд. Общая временная шкала поддерживает выравнивание потоков AES67 и SMPTE 2110 по сэмплам.
Подробнее →PTS (Presentation Timestamp)
presentation timestamp
Метка времени, указывающая момент, когда декодированный аудио- или видеокадр должен быть показан зрителю. Используется во всех современных контейнерах и elementary stream.
Подробнее →R
RED (избыточное аудио)
RFC 2198, redundant coding
Избыточность по RFC 2198: каждый RTP-пакет содержит копию одного или двух предыдущих, поэтому одиночная потеря восстанавливается без ретрансмиссии.
Подробнее →REMB
Receiver Estimated Maximum Bitrate
Receiver Estimated Maximum Bitrate – устаревший сигнал контроля перегрузки в WebRTC: получатель сообщает отправителю, сколько пропускной способности, по его оценке, доступно.
Подробнее →ReplayGain
Нормализация на основе тегов: измерить громкость трека один раз, записать поправку усиления в метаданные и применить её при воспроизведении в плеере.
Подробнее →RMS
root mean square
Root Mean Square – это усреднённая по времени амплитуда. Она ближе к ощущаемой громкости, чем пик, но в современных стандартах её вытеснили LUFS.
Подробнее →RNNoise
Небольшая открытая рекуррентная нейросеть для подавления шума в реальном времени. Достаточно лёгкая, чтобы работать покадрово на CPU – частая основа в открытых стеках.
Подробнее →RTCP
RTP Control Protocol
Управляющий канал рядом с RTP. Отчёты отправителя и получателя содержат статистику потерь, джиттера и времени – они обеспечивают синхронизацию губ (lip-sync) через отчёт отправителя и контроль перегрузки.
Подробнее →RTCP Sender Report
RTCP SR
Пакет RTCP, связывающий метку потока RTP с абсолютным временем NTP, позволяет приёмнику синхронизировать отдельные аудио- и видеопотоки.
Подробнее →RTP
Real-time Transport Protocol, RFC 3550
Real-time Transport Protocol – это тонкий формат пакетов поверх UDP, в котором каждый аудио- и видеокадр в WebRTC и SIP передаётся с порядковым номером и меткой времени.
Подробнее →RTP timestamp
Метка времени в заголовке каждого RTP-пакета. Аудио и видео используют независимые RTP-таймеры; отчёт RTCP sender report синхронизирует их с NTP-временем для синхронизации губ (lip-sync).
Подробнее →S
SBC (Bluetooth)
Low Complexity Subband Coding
Low Complexity Subband Coding – обязательный кодек классического Bluetooth (A2DP) с 2003 года. Приемлемый, но устаревший; в LE Audio его заменяет LC3.
Подробнее →SBR (репликация спектра)
spectral band replication
Инструмент расширения полосы в HE-AAC: кодируется только нижняя часть спектра, верхние октавы восстанавливаются по компактным метаданным. Это обеспечивает большую экономию битрейта, однако иногда возникают «водянистые» артефакты.
Подробнее →SFU (Selective Forwarding Unit)
Selective Forwarding Unit
Медиасервер, пересылающий аудиопотоки каждого участника остальным без декодирования и микширования. Обеспечивает масштабирование конференций, сохраняя потоки раздельными и зашифрованными.
Подробнее →SILK
Речевой слой Opus (из Skype) кодирует голос с низким битрейтом с использованием линейного предсказания. Opus автоматически переключается на него во время разговора.
Подробнее →SMPTE ST 2110–30
SMPTE 2110, ST 2110-30
Аудиочасть набора SMPTE ST 2110 для профессионального IP-производства. Передаёт несжатый PCM (совместим с AES67) параллельно с отдельными потоками видео и данных.
Подробнее →SoundStream
Google SoundStream
Пионерский end-to-end нейрокодек Google и основа Lyra v2. Ввёл «узкое горло» с остаточной векторной квантизацией, которое теперь используется большинством нейрокодеков.
Подробнее →SRTP
Secure RTP
Secure RTP – это слой шифрования и аутентификации поверх протокола RTP. Он является обязательным в WebRTC, поэтому всё аудио в реальном времени по умолчанию шифруется в канале.
Подробнее →T
Transport-CC
Transport-wide congestion control, TWCC
Transport-wide Congestion Control – современная схема в WebRTC. Получатель сообщает время прибытия каждого пакета, а отправитель самостоятельно вычисляет доступную полосу пропускания.
Подробнее →True peak
Наивысшее значение, которое выдаст аналоговый реконструктор, – обычно немного выше самого громкого сэмпла в файле. Измеряется в dBTP.
Подробнее →U
V
VAD (детектирование речи)
voice activity detection
Компонент определяет наличие речи в текущем кадре. Запускает DTX, активирует транскрипцию и множество других UX-функций.
Подробнее →VBR (переменный битрейт)
variable bitrate
Кодирование, при котором на сложные участки выделяется больше бит, а на простые – меньше, обеспечивает лучшее качество на один бит. Такой режим включён по умолчанию в Opus и AAC.
Подробнее →ViSQOL
Virtual Speech Quality Objective Listener
Открытая метрика качества от Google с эталонным сравнением – для речи и аудио в целом. Популярный бесплатный способ оценить кодеки без использования слушательской панели.
Подробнее →W
WAV
Контейнер, в котором обычно хранится несжатый PCM. Без потерь, используется в продакшене и для мастеринга.
Подробнее →WavPack
Открытый кодек без потерь с необычным гибридным режимом: лоссовый ядро плюс файл-коррекция, которые вместе восстанавливают оригинал бит в бит.
Подробнее →WebRTC-аудио
WebRTC voice, getUserMedia audio
Браузерный стек голоса в реальном времени: захват, цепочка 3A (AEC, AGC, NS), кодек Opus, транспорт SRTP и воспроизведение через NetEQ – стандартизирован и бесплатен.
Подробнее →X
Нужен не словарь, а команда?
Разрабатываем видеопродукты с 2005 года: стриминг, ВКС, ИИ на видео. 250+ проектов.