Справочник
Глоссарий аудио для видео
Короткие определения с синонимами и ссылками на статьи, где термин разобран подробно. Все термины на одной странице – ищите поиском или прыгайте по алфавиту.
С чего начать
Ключевые термины
Если читать словарь целиком некогда – это тот минимум, на котором держатся остальные 142 термина.
А
Алиасинг
Артефакты, возникающие, когда в сигнале есть частоты выше половины частоты дискретизации. Их убирает антиалиасинговый фильтр перед АЦП.
Подробнее →Аудио-рендишн
Один конкретный аудио-вариант в манифесте адаптивного стриминга – язык, кодек, битрейт или раскладка каналов. В HLS – rendition group, в DASH – AdaptationSet.
Подробнее →Аудиокадр
Фиксированный блок сэмплов, который кодек кодирует как единое целое – 1024 сэмпла для AAC, 20 мс для Opus. Атом размера, задержки и перемотки в сжатом аудио.
Подробнее →Аудиокодек
Coder-Decoder – алгоритм, который сжимает аудио до меньшего числа бит и восстанавливает его при воспроизведении.
Подробнее →Аудиообъект
Один звук плюс его позиционные метаданные (x, y, z и размер) в объектном аудио. Рендерер размещает его по доступным колонкам или наушникам при воспроизведении.
Подробнее →АЦП (аналого-цифровой преобразователь)
analog-to-digital converter, A/D
Микросхема, превращающая непрерывное напряжение микрофона в дискретные PCM-сэмплы: измеряет его с частотой дискретизации и округляет до битовой глубины.
Подробнее →Б
Битовая глубина
Сколько бит описывает один аудио-сэмпл. Каждый бит даёт около 6 дБ динамического диапазона; 24 бита – это 144 дБ запаса.
Подробнее →Битрейт
kbps
Сколько бит в секунду занимает сжатый поток, в кбит/с. Главная ручка «качество против размера»: 128 кбит/с AAC стерео, 24 кбит/с Opus голос, 768 кбит/с E-AC-3 5.1.
Подробнее →Г
Гранула
Подразделение из эпохи MP3: каждый MP3-кадр содержит две гранулы по 576 сэмплов. Сегодня всплывает в основном при точной по сэмплам обрезке MP3.
Подробнее →Громкость
Ощущаемая интенсивность звука, не путать с пиком. Измеряется в LUFS по ITU-R BS.1770. Каждая вещательная и стриминговая платформа задаёт цель.
Подробнее →Д
Даунмикс
upmix
Сведение большего числа каналов в меньшее – 5.1 в стерео, стерео в моно – по заданным коэффициентам (Lo/Ro, Lt/Rt), чтобы surround играл и на двух колонках.
Подробнее →Децибел (дБ)
dB
Логарифмическое отношение, а не абсолютная единица. Каждые +6 дБ примерно удваивают амплитуду; смысл придаёт точка отсчёта (dBFS, dBTP, дБ SPL).
Подробнее →Дизеринг
Небольшой шум, добавляемый перед понижением битовой глубины. Меняет резкое коррелированное искажение квантования на тихое равномерное шипение.
Подробнее →Динамический диапазон
Разница между самым тихим и самым громким звуком, который может передать система. Каждый бит даёт около 6 дБ: 16 бит – 96 дБ, 24 бита – около 144 дБ.
Подробнее →Доступность аудио
a11y, accessible audio
Набор средств, делающих аудио доступным каждому – тифлокомментарий, дорожки с чистым и усиленным диалогом, сурдо-дорожки – во многом обязательный по закону.
Подробнее →Дрейф часов
sample clock drift
Медленное расхождение часов записи и воспроизведения – рассинхрон 48.000 против 48.001 кГц. Без коррекции аудио и видео расходятся за минуты.
Подробнее →И
К
Канал
Один независимый поток аудио-сэмплов. В стерео два канала, в 5.1 – шесть, в 7.1.4 – двенадцать.
Подробнее →Канальное аудио
Классическая модель: каждая дорожка привязана к конкретной колонке – L, R, C, Ls, Rs. Просто и универсально, но микс зафиксирован под одну раскладку.
Подробнее →Квантование
Округление каждого непрерывного сэмпла до ближайшего значения, доступного при данной битовой глубине. Ошибка округления – шум квантования, который снижают дизерингом.
Подробнее →Клиппинг
Жёсткое искажение, когда сигнал превышает максимум (0 dBFS) и вершины срезаются. После записи в файл – необратимо.
Подробнее →Контрибуционный кодек
contribution audio
Высококачественный кодек с малыми потерями для передачи звука между площадками до финального кодирования – устойчив к многократному перекодированию, в отличие от дистрибуционного.
Подробнее →М
Маскирование
frequency masking, temporal masking
Эффект, когда громкий звук скрывает тихий, близкий по частоте или времени. Кодеки с потерями этим пользуются: замаскированную деталь можно убрать незаметно.
Подробнее →Микширование аудио
Суммирование звука нескольких участников в один поток с управлением уровнем и лимитированием против клиппинга. Главная задача MCU и серверной записи.
Подробнее →Многоязычное аудио
multi-track audio, dubs
Доставка нескольких языковых дорожек (оригинал и дубляж) как параллельных рендишенов в одном манифесте – зритель выбирает язык без отдельного файла или потока.
Подробнее →Моно
Один канал звука. На наушниках слышен одинаково в обоих ушах. Стандарт для голоса в телекоме и видеоконференциях.
Подробнее →Н
О
Объектное аудио
Звук, хранимый как источники плюс позиционные метаданные и рендерящийся под любые колонки при воспроизведении. Модель в основе Dolby Atmos и MPEG-H.
Подробнее →Остаточное эхо
residual echo suppression, RES
Эхо, которое линейный подавитель не может смоделировать – из-за нелинейных динамиков или дрейфа часов. Остаток убирает подавитель остаточного эха (часто стадия NS).
Подробнее →П
Пайплайн транскрипции
Путь аудио к тексту и записям: ответвление от микса, нарезка по VAD, прогон через ASR, затем хранение субтитров, саммари и самой записи.
Подробнее →Пик (sample peak)
Максимальное значение сэмпла в файле или окне, измеряемое в dBFS. Отличается от true peak – не учитывает межсэмпловые пики.
Подробнее →Подавление шума
NS, noise reduction
Стадия обработки, подавляющая фоновые шумы – клавиатуру, вентилятор, машины – сохраняя речь. Современные системы используют глубокое обучение (RNNoise, Krisp, NVIDIA RTX Voice).
Подробнее →Психоакустическая модель
psychoacoustics
Модель человеческого слуха, по которой кодек с потерями решает, какие детали выбросить – тратя биты только там, где ухо заметит их отсутствие.
Подробнее →Р
Раскладка каналов
Именованный набор и порядок каналов в потоке – mono, stereo, 5.1, 7.1.4. Плеер должен знать его, чтобы направить каждый канал в нужную колонку.
Подробнее →Ресемплинг
sample rate conversion, SRC
Преобразование аудио из одной частоты дискретизации в другую – 44.1 в 48 кГц или крошечные подстройки, чтобы скомпенсировать дрейф часов без слышимых пропусков.
Подробнее →С
Сброс / вставка кадров
drop/dup, frame skipping
Грубая коррекция дрейфа: иногда выбросить или повторить кадр, чтобы удержать аудио и видео вместе. Дешевле ресемплинга, но неаккуратный сброс слышен как щелчок.
Подробнее →Сжатие без потерь
Сжатие, восстанавливающее исходные сэмплы бит-в-бит – FLAC, ALAC, WavPack. Меньше WAV, идеальное качество; для мастеров и архивов.
Подробнее →Сжатие с потерями
lossy compression
Сжатие, безвозвратно отбрасывающее детали, которые ухо вряд ли заметит, по психоакустической модели – AAC, Opus, MP3. Намного меньше lossless, но не бит-в-бит.
Подробнее →Стерео
Два канала – левый и правый – создают ощущение горизонтальной ширины. Стандарт для музыки и большинства видео.
Подробнее →Сценовое аудио
Целое звуковое поле, закодированное независимо от колонок, обычно как Ambisonics. Свободно вращается под трекинг головы – естественный выбор для VR и 360-видео.
Подробнее →Т
Теорема Найквиста – Шеннона
Nyquist-Shannon, sampling theorem
Чтобы записать частоту, нужно дискретизировать минимум вдвое чаще. 48 кГц захватывают до 24 кГц – с запасом выше человеческого слуха.
Подробнее →Тифлокомментарий
descriptive audio, DVS, described video service
Дополнительная аудио-дорожка с закадровым описанием визуального действия для незрячих и слабовидящих. Требуется законодательством США, ЕС и Канады.
Подробнее →Трекинг головы
Отслеживание поворота головы слушателя и встречный поворот звукового поля, чтобы источники оставались на месте в комнате. Именно это «закрепляет» пространственный звук в AirPods.
Подробнее →У
Ц
Ч
A
AAC
advanced audio coding, MPEG-4 audio
Advanced Audio Coding – стандартный аудиокодек для видео на YouTube, Netflix, Apple и большинстве OTT-платформ. Несколько профилей: AAC-LC, HE-AAC v1/v2, xHE-AAC.
Подробнее →AAC-LC
AAC Low Complexity
Базовый профиль AAC – Low Complexity. Именно он звучит в большинстве MP4-видео, ~128-256 кбит/с стерео. Когда говорят просто «AAC», обычно имеют в виду его.
Подробнее →AC-3 (Dolby Digital)
Dolby-кодек 1991 года, принёсший 5.1 в DVD и эфирное вещание ATSC. В стриминге заменён на E-AC-3, но всё ещё повсеместен в наследии.
Подробнее →AC-4
Следующее поколение Dolby для вещания. Object-based, immersive, со встроенным усилением диалога. Принят в ATSC 3.0 и DVB.
Подробнее →AC-4 IMS
AC-4 Immersive Stereo
AC-4 Immersive Stereo – компактный режим доставки Dolby Atmos для низкобитрейтного стриминга и вещания, рендерящий иммерсивный звук из эффективного потока AC-4.
Подробнее →AdaptationSet (DASH)
Группа в манифесте DASH, хранящая взаимозаменяемые версии одного компонента – например, все битрейты английской дорожки. Аналог rendition group в HLS.
Подробнее →AEC (эхоподавление)
acoustic echo cancellation, echo cancellation, AEC3
Алгоритм, удаляющий из микрофонного сигнала то, что играет в динамике собеседника. Без него любой звонок превращается в петлю обратной связи.
Подробнее →AEC3
WebRTC AEC3
Эхоподавитель третьего поколения в libWebRTC – стандартный в звонках на основе Chrome, настроенный на устойчивость к дешёвому железу ноутбуков.
Подробнее →AES67
Стандарт совместимости audio-over-IP, позволяющий Dante, Ravenna и Livewire обмениваться несжатым PCM по сети с синхронизацией по PTP.
Подробнее →AGC (автоматическая регулировка усиления)
automatic gain control, AGC2
Контур, регулирующий усиление микрофона так, чтобы голос приходил с постоянной громкостью независимо от того, как близко человек сидит к микрофону.
Подробнее →AGC2
WebRTC AGC2
Новая автоматическая регулировка усиления в WebRTC: адаптивная цифровая схема, заменившая аналоговый контур AGC1 ради стабильного уровня голоса на разных устройствах.
Подробнее →AIFF
Audio Interchange File Format
Несжатый PCM-контейнер от Apple, аналог WAV для Mac. Тот же звук, big-endian, распространён в macOS и профессиональном аудио.
Подробнее →ALAC
apple lossless
Apple Lossless Audio Codec – формат Apple без потерь, эквивалентный FLAC по качеству. Нативен в iOS/macOS и в hi-res-уровне Apple Music.
Подробнее →Ambisonics
Scene-based формат пространственного звука, фиксирующий всё звуковое поле вокруг точки малым числом каналов. Стандарт для 360°-видео и VR.
Подробнее →AMR (AMR-NB / AMR-WB)
Adaptive Multi-Rate, AMR-NB, AMR-WB
Семейство Adaptive Multi-Rate из 2G/3G. AMR-NB (узкополосный) и AMR-WB (широкополосный, он же G.722.2) до сих пор встречаются в VoLTE и старых записях.
Подробнее →ASR (распознавание речи)
speech-to-text, STT
Автоматическое распознавание речи – превращение аудиопотока в текст для живых субтитров, транскриптов и поиска. Питается очищенным, нарезанным по VAD звуком из звонка.
Подробнее →ATSC A/85 (CALM Act)
Американская рекомендация по громкости вещания, обеспеченная CALM Act. Цель −24 LKFS для рекламы и программ. Поэтому реклама больше не громче передачи.
Подробнее →Audio level (RFC 6464)
client-to-mixer audio level, RFC 6464/6465
Расширение заголовка RTP с громкостью каждого пакета. SFU читает его, чтобы пересылать только активных говорящих и показывать «кто говорит» без декодирования звука.
Подробнее →B
C
CBR (постоянный битрейт)
constant bitrate
Кодирование с фиксированным числом бит в секунду независимо от контента. Предсказуемо для стриминга и планирования полосы, чуть менее эффективно, чем VBR.
Подробнее →CELT
Музыкальный слой Opus с низкой задержкой, построенный на MDCT. Opus смешивает его с SILK или применяет отдельно для музыки и минимальной задержки.
Подробнее →CMAF
Common Media Application Format, fMP4
Common Media Application Format – единый набор фрагментированных MP4-сегментов, на который ссылаются и HLS, и DASH: аудио хранится один раз, а не дважды.
Подробнее →Comfort noise
CNG, comfort noise generation
Тихий синтетический шум, заполняющий молчание, когда DTX прекратил передачу. Не даёт слушателю подумать, что связь оборвалась.
Подробнее →D
DASH (MPEG-DASH)
MPEG-DASH, Dynamic Adaptive Streaming over HTTP
ISO-стандарт адаптивного стриминга. Его XML-манифест (MPD) описывает аудио как AdaptationSet и Representation, между которыми плеер переключается по полосе.
Подробнее →dBFS
Децибелы относительно полной шкалы – 0 dBFS – максимум, который может выразить цифровая система. Все значения отрицательные.
Подробнее →dBTP
true peak, dB true peak
Decibels True Peak – шкала, учитывающая межсэмпловые пики, которые создаёт аналоговый реконструктор. На стриминге обычно лимит −1 dBTP.
Подробнее →dialnorm
Поле метаданных в AC-3 / E-AC-3 / AC-4, сообщающее декодеру громкость диалога – чтобы тот понизил воспроизведение до цели слушателя. Вещательный предшественник современной нормализации.
Подробнее →Dolby Atmos
Объектно-ориентированная иммерсивная аудиосистема от Dolby. Добавляет к 10-канальной подложке (7.1.2) до 118 динамических объектов с позиционными метаданными. Несётся в DD+ JOC, AC-4 IMS или родном MP4 для кинотеатров.
Подробнее →Double-talk (двойной разговор)
Сложный случай для эхоподавления: оба говорят одновременно, и подавитель должен убрать дальнее эхо, не повредив ближний голос.
Подробнее →DTS (Decode Timestamp)
decode timestamp
Метка времени, указывающая, когда декодировать кадр – это может отличаться от момента показа (PTS) для видео с B-кадрами. Не путать с аудиокодеком DTS.
Подробнее →DTX (прерывистая передача)
discontinuous transmission
Функция экономии полосы: прекращает отправку пакетов в моменты молчания. На обычном разговоре экономит 40–70% трафика.
Подробнее →E
E-AC-3 (Dolby Digital Plus)
DD+, EAC-3, enhanced AC-3
Преемник AC-3, используется Netflix, Disney+, Apple TV+, Amazon Prime, ATSC 3.0. Несёт Dolby Atmos через Joint Object Coding (JOC).
Подробнее →EBU R128
Рекомендация Европейского вещательного союза по громкости. Цель −23 LUFS integrated, ±1 LU допуск, true peak ≤ −1 dBTP, LRA ≤ 20 LU. Европейский вещательный стандарт.
Подробнее →EnCodec
Meta EnCodec
Открытый нейросетевой аудиокодек от Meta. Связка энкодер-квантизатор-декодер, обученная end-to-end с остаточной векторной квантизацией; речь и музыка от ~1.5 до 24 кбит/с.
Подробнее →ERLE
Echo Return Loss Enhancement
Echo Return Loss Enhancement – мера в децибелах того, сколько эха убирает подавитель. Главный показатель при настройке и сравнении реализаций AEC.
Подробнее →EVS (Enhanced Voice Services)
Enhanced Voice Services, VoLTE codec
Голосовой кодек 4G/5G 2014 года: сверхширокополосная и полнодиапазонная речь, поддержка музыки, высокая устойчивость к потерям. Современный стандарт VoLTE/VoNR.
Подробнее →F
FEC (упреждающая коррекция ошибок)
forward error correction, in-band FEC
Схема избыточности, добавляющая в поток дополнительную информацию, чтобы получатель восстановил потерянные пакеты без ретрансмиссии. In-band FEC Opus несёт низкобитрейтную копию предыдущего кадра.
Подробнее →FLAC
free lossless audio codec
Free Lossless Audio Codec – открытое сжатие без потерь, обычно вдвое меньше WAV. Часто в архивах, контрибьюшене и hi-res музыке.
Подробнее →G
G.711
u-law, A-law, PCMU, PCMA
Телефонный кодек 1972 года: 8 кГц, 64 кбит/с компандированный PCM (u-law/A-law). До сих пор запасной вариант в VoIP и WebRTC – его понимает любой узел.
Подробнее →G.722
Широкополосный (7 кГц) речевой кодек 1988 года на 48-64 кбит/с. Первый «HD Voice» в SIP и DECT-телефонах, заметно чище узкополосного G.711.
Подробнее →H
HE-AAC
HE-AAC v1, AAC+, aacPlus
AAC-LC плюс Spectral Band Replication (SBR), достраивающий верхние частоты из низкобитрейтного ядра. Эффективен на 32-64 кбит/с – частый выбор для радио и низких битрейтов.
Подробнее →HE-AAC v2
eAAC+, AAC++
HE-AAC плюс Parametric Stereo: стереокартина кодируется несколькими параметрами. Даёт пригодное стерео речи и музыки на ~24-32 кбит/с.
Подробнее →Headroom (запас по уровню)
Запас между обычным уровнем сигнала и 0 dBFS. Headroom не даёт транзиентам и интерсэмпловым пикам уйти в клиппинг.
Подробнее →HLS
HTTP Live Streaming, EXT-X-MEDIA
HTTP Live Streaming от Apple. Аудио-рендишены объявляются тегами EXT-X-MEDIA в плейлисте; плеер сам выбирает дорожку и битрейт по своим правилам.
Подробнее →HRTF
head-related transfer function
Head-Related Transfer Function – фильтр для конкретного слушателя, описывающий, как звук из заданного направления преобразуется головой и ушами. Математика бинаурального рендеринга в наушниках.
Подробнее →I
J
Jitter buffer
Небольшая очередь на приёме, удерживающая аудио-пакеты ровно столько, чтобы сгладить нерегулярное поступление из сети – и воспроизведение шло по ровному такту.
Подробнее →JOC (Joint Object Coding)
Dolby Atmos JOC, E-AC-3 JOC
Joint Object Coding – метаданные внутри E-AC-3, несущие объекты Dolby Atmos поверх ядра 5.1. Так Atmos попадает на Netflix и Disney+ сегодня.
Подробнее →Joint stereo
mid-side, M/S, intensity stereo
Совместное кодирование двух каналов вместо раздельного – обычно как mid/side – потому что левый и правый во многом совпадают. Стандарт в MP3, AAC и Opus.
Подробнее →K
K-взвешивание
Частотная кривая внутри ITU-R BS.1770, приближающая то, как ухо оценивает громкость. Это «K» в LKFS и основа любого измерения LUFS.
Подробнее →Krisp
Коммерческий SDK подавления шума на глубоком обучении, встроенный во многие приложения для встреч; убирает фоновый шум, а в новых версиях – эхо и реверберацию.
Подробнее →L
LC3
low complexity communications codec
Обязательный кодек Bluetooth LE Audio (2020). Заменяет SBC в беспроводных наушниках – лучшее качество на 64 кбит/с стерео, чем SBC на 200+ кбит/с.
Подробнее →LC3plus
Расширенный LC3 (ETSI TS 103 634) для профессионального и проводного применения: выше частоты дискретизации, ниже задержка и средства против потерь сверх базового LE Audio.
Подробнее →LFE (канал низкочастотных эффектов)
low-frequency effects, the .1
Та самая «.1» в 5.1 и 7.1 – полосно-ограниченный (~20-120 Гц) канал для сабвуфера. Несёт гул и удар, а не полнодиапазонный сигнал.
Подробнее →Lip-sync
AV-sync, audio-video synchronization
Согласование звука и видео, чтобы движения губ на экране совпадали с голосом в ухе. ITU-R BT.1359 определяет допуски: примерно от −60 мс до +40 мс.
Подробнее →LKFS
Loudness, K-weighted, relative to Full Scale
Loudness, K-weighted, relative to Full Scale – название ATSC/ITU для той же единицы, что EBU зовёт LUFS. 1 LKFS = 1 LUFS, отличается только обозначение.
Подробнее →LL-HLS
Low-Latency HLS, partial segments
Low-Latency HLS – расширение Apple с частичными сегментами и блокирующей перезагрузкой плейлиста, снижающее задержку с ~20 с до 2-5 с, вместе с аудио.
Подробнее →LRA (диапазон громкости)
loudness range
Одно число в LU, описывающее разброс громкости в программе – тихий диалог против громкого экшена. EBU R128 ограничивает его 20 LU для вещания.
Подробнее →LUFS
loudness units relative to full scale, LKFS
Loudness Units relative to Full Scale – перцептивная мера громкости из ITU-R BS.1770, используется во всех современных стандартах вещания и стриминга.
Подробнее →Lyra
Нейросетевой речевой кодек Google, дающий разборчивый голос около 3 кбит/с – много ниже порога, где классические кодеки разваливаются. Построен на идеях SoundStream.
Подробнее →M
MCU (Multipoint Control Unit)
Multipoint Control Unit
Сервер, декодирующий звук всех, микширующий его в один поток и кодирующий заново. Дёшев по полосе и CPU клиента, дорог по серверу и задержке.
Подробнее →MDCT
Modified Discrete Cosine Transform
Modified Discrete Cosine Transform – перекрывающееся частотное преобразование в основе MP3, AAC, Opus (CELT), AC-3 и почти каждого кодека с потерями.
Подробнее →Mesh / P2P аудио
full mesh, peer-to-peer
Топология, где каждый участник шлёт аудио напрямую всем остальным. Минимальная задержка и без медиасервера, но нагрузка на отдачу взрывается уже после ~4 человек.
Подробнее →Mid/Side кодирование
M/S stereo
Хранение суммы (mid) и разности (side) вместо L и R. Когда side мал – как в большинстве музыки – это сжимается заметно лучше.
Подробнее →MOS (Mean Opinion Score)
mean opinion score, ACR
Средняя оценка 1-5, которую слушатели ставят качеству звука. Эталон, который стремятся предсказать все объективные метрики (PESQ, POLQA, ViSQOL).
Подробнее →MP2
MPEG-1 Audio Layer II, MUSICAM
MPEG-1 Audio Layer II – вещательная рабочая лошадка 1991 года, до сих пор в DVB и контрибуции. Устойчивее MP3 к многократному перекодированию, хотя у потребителей его вытеснил MP3.
Подробнее →MP3
MPEG-1 Audio Layer III, MPEG-2 Audio Layer III
Кодек 1993 года, определивший потребительский цифровой звук. Заменён на AAC для видео, но всё ещё распространён в подкастах и музыкальных библиотеках.
Подробнее →MPEG-H 3D Audio
MPEG-H, MPEG-H Audio
Открытый ISO-стандарт иммерсивного звука, альтернатива AC-4. Object + channel + scene-based в одном потоке. Принят в ATSC 3.0 в Южной Корее и части США.
Подробнее →MPEG-TS
MPEG transport stream, .ts
Транспортный поток из 188-байтных пакетов в вещании и HLS. Мультиплексирует аудио, видео и тайминг (PCR), создан для устойчивой доставки в реальном времени по ненадёжным каналам.
Подробнее →MUSHRA
MUlti Stimulus with Hidden Reference and Anchor, ITU-R BS.1534
ITU-R BS.1534 – слушательский тест, оценивающий сразу несколько версий относительно скрытого эталона и якорей. Основной метод сравнения кодеков у порога прозрачности.
Подробнее →N
NetEQ
Адаптивный jitter-буфер в основе WebRTC-аудио, изначально из GIPS / Google Duo. Растягивает, ускоряет, маскирует и вставляет комфортный шум, чтобы звук шёл гладко при сетевых проблемах.
Подробнее →NTP (Network Time Protocol)
Network Time Protocol
Формат метки реального времени, который RTCP sender report использует как общий ориентир для независимых RTP-потоков, чтобы аудио и видео можно было выровнять на лету.
Подробнее →NVIDIA RTX Voice / Broadcast
RTX Voice, NVIDIA Broadcast, Maxine
Подавление шума от NVIDIA с ускорением на GPU (теперь часть Broadcast/Maxine). Модели тяжелее CPU-вариантов, но GPU позволяет очень агрессивную очистку.
Подробнее →O
P
Parametric Stereo (PS)
PS
Техника, передающая моно-ядро плюс несколько пространственных параметров (разницы уровня и фазы), чтобы восстановить стерео на очень низком битрейте.
Подробнее →PCM
pulse code modulation
Pulse-Code Modulation – сырой несжатый цифровой звук в виде потока значений. Все остальные форматы – производные от PCM.
Подробнее →PCR (Program Clock Reference)
program clock reference
Отсчёт мастер-часов 27 МГц, передаваемый в потоке MPEG-TS. Декодер синхронизирует свои часы по PCR, чтобы значения PTS означали одно и то же на обоих концах.
Подробнее →PESQ
Perceptual Evaluation of Speech Quality, ITU-T P.862
ITU-T P.862 – алгоритм с эталоном, предсказывающий речевой MOS сравнением искажённого звука с оригиналом. Долгое время стандарт для тестов узкополосного VoIP.
Подробнее →PLC (сокрытие потерь пакетов)
packet loss concealment
Алгоритм, заполняющий потерянный кадр правдоподобной реконструкцией, чтобы слушатель услышал короткое растягивание, а не щелчок или тишину.
Подробнее →POLQA
Perceptual Objective Listening Quality Analysis, ITU-T P.863
ITU-T P.863 – преемник PESQ, охватывающий сверхширокую полосу и современные кодеки. Текущая эталонная метрика объективной оценки качества голоса.
Подробнее →PTP (IEEE 1588)
Precision Time Protocol, IEEE 1588
Precision Time Protocol – синхронизация сетевых часов с точностью до микросекунд. Общая шкала времени, удерживающая потоки AES67 и SMPTE 2110 выровненными по сэмплам.
Подробнее →PTS (Presentation Timestamp)
presentation timestamp
Метка времени, указывающая, когда декодированный аудио- или видеокадр должен быть показан зрителю. Используется в каждом современном контейнере и elementary stream.
Подробнее →R
RED (избыточное аудио)
RFC 2198, redundant coding
Избыточность по RFC 2198: каждый RTP-пакет несёт ещё и копию одного-двух предыдущих, поэтому одиночная потеря восстанавливается без ретрансмиссии.
Подробнее →REMB
Receiver Estimated Maximum Bitrate
Receiver Estimated Maximum Bitrate – старый сигнал контроля перегрузки в WebRTC: получатель сообщает отправителю, сколько полосы, по его оценке, доступно.
Подробнее →ReplayGain
Нормализация на основе тегов: один раз измерить громкость трека, записать поправку усиления в метаданные и применить её при воспроизведении в плеере.
Подробнее →RMS
root mean square
Root Mean Square – усреднённая по времени амплитуда. Ближе к ощущаемой громкости, чем peak, но в современных стандартах вытеснена LUFS.
Подробнее →RNNoise
Небольшая открытая рекуррентная нейросеть для подавления шума в реальном времени. Достаточно лёгкая, чтобы работать покадрово на CPU; частая база в открытых стеках.
Подробнее →RTCP
RTP Control Protocol
Управляющий канал рядом с RTP. Отчёты отправителя и получателя несут статистику потерь, джиттера и времени – питают lip-sync (через sender report) и контроль перегрузки.
Подробнее →RTCP Sender Report
RTCP SR
Пакет RTCP, связывающий RTP-метку потока с абсолютным NTP-временем. Именно он позволяет приёмнику свести по губам отдельные потоки аудио и видео.
Подробнее →RTP
Real-time Transport Protocol, RFC 3550
Real-time Transport Protocol – тонкий формат пакетов поверх UDP, несущий каждый аудио- и видеокадр в WebRTC и SIP, с порядковым номером и меткой времени.
Подробнее →RTP timestamp
Метка времени в заголовке каждого RTP-пакета. Аудио и видео имеют независимые RTP-часы; RTCP sender report связывает их с NTP-временем для lip-sync.
Подробнее →S
SBC (Bluetooth)
Low Complexity Subband Coding
Low Complexity Subband Coding – обязательный кодек классического Bluetooth (A2DP) с 2003 года. Приемлемый, но устаревший; в LE Audio его заменяет LC3.
Подробнее →SBR (репликация спектра)
spectral band replication
Инструмент расширения полосы в HE-AAC: кодируется только нижняя часть, верхние октавы достраиваются по компактным метаданным. Большая экономия, иногда «водянистые» артефакты.
Подробнее →SFU (Selective Forwarding Unit)
Selective Forwarding Unit
Медиасервер, пересылающий аудио каждого участника остальным без декодирования и микширования. Масштабирует конференции, сохраняя потоки раздельными и шифрованными.
Подробнее →SILK
Речевой слой Opus (из Skype). Кодирует голос на низком битрейте линейным предсказанием. Opus переключается на него автоматически для разговора.
Подробнее →SMPTE ST 2110–30
SMPTE 2110, ST 2110-30
Аудиочасть набора SMPTE ST 2110 для профессионального IP-производства. Несёт несжатый PCM (совместима с AES67) рядом с отдельными потоками видео и данных.
Подробнее →SoundStream
Google SoundStream
Пионерский end-to-end нейрокодек Google и основа Lyra v2. Ввёл «узкое горло» с остаточной векторной квантизацией, которое теперь используют большинство нейрокодеков.
Подробнее →SRTP
Secure RTP
Secure RTP – слой шифрования и аутентификации поверх RTP. Обязателен в WebRTC, поэтому всё аудио реального времени по умолчанию зашифровано в канале.
Подробнее →T
Transport-CC
Transport-wide congestion control, TWCC
Transport-wide Congestion Control – современная схема WebRTC. Получатель сообщает время прихода каждого пакета, а отправитель сам вычисляет доступную полосу.
Подробнее →True peak
Наивысшее значение, которое выдаст аналоговый реконструктор – обычно чуть громче самого громкого сэмпла в файле. Измеряется в dBTP.
Подробнее →U
V
VAD (детектирование речи)
voice activity detection
Компонент, определяющий, есть ли в текущем кадре речь. Запускает DTX, триггерит транскрипцию и десяток других UX-функций.
Подробнее →VBR (переменный битрейт)
variable bitrate
Кодирование, тратящее больше бит на сложные участки и меньше на простые – лучше качество на средний бит. У Opus и AAC включён по умолчанию.
Подробнее →ViSQOL
Virtual Speech Quality Objective Listener
Открытая метрика качества с эталоном от Google – для речи и для аудио вообще. Популярный бесплатный способ оценить кодеки без слушательской панели.
Подробнее →W
WAV
Контейнер, в котором обычно лежит несжатый PCM. Без потерь, используется в продакшене и для мастеров.
Подробнее →WavPack
Открытый кодек без потерь с необычным гибридным режимом: лоссёвое ядро плюс файл-коррекция, которые вместе восстанавливают оригинал бит-в-бит.
Подробнее →WebRTC-аудио
WebRTC voice, getUserMedia audio
Браузерный стек голоса в реальном времени: захват, цепочка 3A (AEC, AGC, NS), Opus, транспорт SRTP и воспроизведение через NetEQ – стандартизировано и бесплатно.
Подробнее →X
Нужен не словарь, а команда?
Разрабатываем видеопродукты с 2005 года: стриминг, ВКС, ИИ на видео. 250+ проектов.