Справочник

Глоссарий аудио для видео

Короткие определения с синонимами и ссылками на статьи, где термин разобран подробно. Все термины на одной странице – ищите поиском или прыгайте по алфавиту.

С чего начать

Ключевые термины

Если читать словарь целиком некогда – это тот минимум, на котором держатся остальные 142 термина.

А

Алиасинг

Артефакты, возникающие, когда в сигнале присутствуют частоты выше половины частоты дискретизации. Их устраняет антиалиасинговый фильтр перед АЦП.

Подробнее

Аудио-рендишн

Один конкретный аудио-вариант в манифесте адаптивного стриминга – это язык, кодек, битрейт или раскладка каналов. В HLS он называется rendition group, в DASH – AdaptationSet.

Подробнее

Аудиокадр

Фиксированный блок сэмплов, который кодек обрабатывает как единое целое – 1024 сэмпла для AAC, 20 мс для Opus. Атомы размера, задержки и перемотки в сжатом аудио.

Подробнее

Аудиокодек

Coder-Decoder – алгоритм, который сжимает аудиоданные до меньшего объёма бит и восстанавливает их при воспроизведении.

Подробнее

Аудиообъект

Один звук вместе с его позиционными метаданными (координаты x, y, z и размер) в объектном аудио. Рендерер размещает его по доступным колонкам или наушникам при воспроизведении.

Подробнее

АЦП (аналого-цифровой преобразователь)

analog-to-digital converter, A/D

Микросхема, преобразующая непрерывное напряжение с микрофона в дискретные PCM-отсчёты: она измеряет сигнал с заданной частотой дискретизации и округляет его до разрешающей способности, определяемой битовой глубиной.

Подробнее

Б

Г

Д

Даунмикс

upmix

Сведение большего числа каналов в меньшее – например, 5.1 в стерео или стерео в моно – по заданным коэффициентам (Lo/Ro, Lt/Rt), чтобы surround-звук корректно воспроизводился и на двух колонках.

Подробнее

Децибел (дБ)

dB

Логарифмическая шкала, а не абсолютная величина. Каждые +6 дБ примерно удваивают амплитуду; смысл значения определяется точкой отсчёта (dBFS, dBTP, дБ SPL).

Подробнее

Дизеринг

Небольшой шум, добавляемый перед уменьшением битовой глубины, превращает резкое коррелированное искажение квантования в тихое равномерное шипение.

Подробнее

Динамический диапазон

Разница между самым тихим и самым громким звуком, который может передать система. Каждый бит добавляет около 6 дБ: 16 бит – 96 дБ, 24 бита – около 144 дБ.

Подробнее

Доступность аудио

a11y, accessible audio

Набор средств, делающих аудио доступным для всех – тифлокомментарий, дорожки с чистым и усиленным диалогом, сурдодорожки – во многом является обязательным по закону.

Подробнее

Дрейф часов

sample clock drift

Медленное расхождение между частотой записи и воспроизведения – рассинхрон 48,000 против 48,001 кГц. Без коррекции аудио и видео расходятся уже за несколько минут.

Подробнее

И

К

Канал

Один независимый поток аудиосэмплов. В стерео – два канала, в 5.1 – шесть, в 7.1.4 – двенадцать.

Подробнее

Канальное аудио

Классическая модель: каждая дорожка привязана к определённой колонке – L, R, C, Ls, Rs. Просто и универсально, но микс остаётся зафиксированным под одну раскладку.

Подробнее

Квантование

Округление каждого непрерывного сэмпла до ближайшего значения, доступного при заданной битовой глубине. Ошибка округления – шум квантования, который подавляют с помощью дизеринга.

Подробнее

Клиппинг

Жёсткое искажение возникает, когда сигнал превышает максимальный уровень (0 dBFS) и его пики обрезаются. После записи в файл это становится необратимым.

Подробнее

Контрибуционный кодек

contribution audio

Высококачественный кодек с минимальными потерями для передачи звука между платформами до финального кодирования устойчив к многократному перекодированию – в отличие от дистрибуционного.

Подробнее

М

Н

О

П

Р

С

Сброс / вставка кадров

drop/dup, frame skipping

Грубая коррекция дрейфа: иногда пропускают или повторяют кадр, чтобы синхронизировать аудио и видео. Дешевле ресемплинга, но резкий сброс слышен как щелчок.

Подробнее

Сжатие без потерь

Сжатие, восстанавливающее исходные сэмплы бит в бит: FLAC, ALAC, WavPack. Меньше, чем WAV, – идеальное качество; подходит для мастеринга и архивов.

Подробнее

Сжатие с потерями

lossy compression

Сжатие, безвозвратно отбрасывающее детали, которые ухо вряд ли заметит, по психоакустической модели – AAC, Opus, MP3. Оно занимает намного меньше места, чем lossless, но не обеспечивает бит-в-битное совпадение.

Подробнее

Стерео

Два канала – левый и правый – создают ощущение горизонтальной ширины. Это стандарт для музыки и большинства видео.

Подробнее

Сценовое аудио

Целое звуковое поле, закодированное независимо от колонок – обычно в формате Ambisonics, – свободно вращается под трекинг головы и является естественным выбором для VR и 360-видео.

Подробнее

Т

У

Ц

Ч

A

AAC

advanced audio coding, MPEG-4 audio

Advanced Audio Coding – стандартный аудиокодек, используемый на YouTube, Netflix, Apple и большинстве OTT-платформ. Поддерживаются несколько профилей: AAC-LC, HE-AAC v1/v2, xHE-AAC.

Подробнее

AAC-LC

AAC Low Complexity

Базовый профиль AAC – Low Complexity. Именно он используется в большинстве MP4-видео со скоростью кодирования 128–256 кбит/с в стерео. Когда говорят просто «AAC», обычно имеют в виду именно его.

Подробнее

AC-3 (Dolby Digital)

Dolby-кодек 1991 года, внедривший формат 5.1 в DVD и эфирное вещание ATSC. В стриминге его заменил E-AC-3, однако он по-прежнему широко используется в наследии.

Подробнее

AC-4

Следующее поколение Dolby для вещания: объектно-ориентированное, объёмное, с встроенным усилением диалога. Поддерживается в стандартах ATSC 3.0 и DVB.

Подробнее

AC-4 IMS

AC-4 Immersive Stereo

AC-4 Immersive Stereo – компактный режим доставки Dolby Atmos для низкобитрейтного стриминга и вещания, рендерящий иммерсивный звук из эффективного потока AC-4.

Подробнее

AdaptationSet (DASH)

Группа в манифесте DASH, содержащая взаимозаменяемые версии одного компонента – например, все битрейты английской аудиодорожки. Аналог *rendition group* в HLS.

Подробнее

AEC (эхоподавление)

acoustic echo cancellation, echo cancellation, AEC3

Алгоритм, удаляющий из микрофонного сигнала звук, воспроизводимый динамиком собеседника. Без него любой звонок превращается в петлю обратной связи.

Подробнее

AEC3

WebRTC AEC3

Эхоподавитель третьего поколения в libWebRTC – стандартное решение для звонков на базе Chrome, настроенное на работу с дешёвым оборудованием ноутбуков.

Подробнее

AES67

Стандарт совместимости audio-over-IP, позволяющий Dante, Ravenna и Livewire обмениваться несжатым PCM-аудио по сети с синхронизацией по PTP.

Подробнее

AGC (автоматическая регулировка усиления)

automatic gain control, AGC2

Контур, регулирующий усиление микрофона так, чтобы голос воспроизводился с постоянной громкостью независимо от расстояния до микрофона.

Подробнее

AGC2

WebRTC AGC2

Новая автоматическая регулировка усиления в WebRTC – адаптивная цифровая схема, заменившая аналоговый контур AGC1 для обеспечения стабильного уровня голоса на разных устройствах.

Подробнее

AIFF

Audio Interchange File Format

Несжатый PCM-формат от Apple, аналог WAV для Mac. Тот же уровень качества звука, big-endian, широко используется в macOS и профессиональном аудио.

Подробнее

ALAC

apple lossless

Apple Lossless Audio Codec – это формат без потерь от Apple, по качеству эквивалентный FLAC. Он нативно поддерживается в iOS и macOS, а также используется на уровне Hi-Res в Apple Music.

Подробнее

Ambisonics

Формат пространственного звука на основе сцены, фиксирующий всё звуковое поле вокруг точки с помощью небольшого числа каналов. Стандарт для 360°-видео и VR.

Подробнее

AMR (AMR-NB / AMR-WB)

Adaptive Multi-Rate, AMR-NB, AMR-WB

Семейство Adaptive Multi-Rate из 2G/3G: AMR-NB (узкополосный) и AMR-WB (широкополосный, он же G.722.2) до сих пор используются в VoLTE и старых записях.

Подробнее

ASR (распознавание речи)

speech-to-text, STT

Автоматическое распознавание речи – это преобразование аудиопотока в текст для живых субтитров, транскриптов и поиска. Система работает на основе очищенного звука, разделённого по VAD, из телефонного звонка.

Подробнее

ATSC A/85 (CALM Act)

Американская рекомендация по громкости вещания, установленная законом CALM Act, предполагает уровень −24 LKFS как для рекламы, так и для программ. Поэтому реклама больше не звучит громче основного контента.

Подробнее

Audio level (RFC 6464)

client-to-mixer audio level, RFC 6464/6465

Расширение заголовка RTP с информацией о громкости каждого пакета позволяет SFU определять активных говорящих и отображать, кто говорит, без необходимости декодировать аудиоданные.

Подробнее

B

C

D

DASH (MPEG-DASH)

MPEG-DASH, Dynamic Adaptive Streaming over HTTP

ISO-стандарт адаптивного стриминга. Его XML-манифест (MPD) описывает аудио через AdaptationSet и Representation – между ними плеер переключается в зависимости от полосы пропускания.

Подробнее

dBFS

Децибелы относительно полной шкалы – 0 dBFS – это максимальное значение, которое может выразить цифровая система. Все остальные значения отрицательны.

Подробнее

dBTP

true peak, dB true peak

Decibels True Peak – шкала, учитывающая межсэмпловые пики, возникающие при работе аналогового реконструктора. В стриминге обычно применяется лимит −1 dBTP.

Подробнее

dialnorm

Поле метаданных в AC-3 / E-AC-3 / AC-4, указывающее декодеру уровень громкости диалога, чтобы тот автоматически понизил общую громкость воспроизведения до комфортного уровня для слушателя. Это вещательный предшественник современной нормализации громкости.

Подробнее

Dolby Atmos

Объектно-ориентированная иммерсивная аудиосистема от Dolby. Добавляет к 10-канальной подложке (7.1.2) до 118 динамических объектов с позиционными метаданными. Передаётся в форматах DD+ JOC, AC-4 IMS или в родном MP4 для кинотеатров.

Подробнее

Double-talk (двойной разговор)

Сложный случай для эхоподавления: оба говорят одновременно, и подавитель должен убрать дальнее эхо, не повредив ближний голос.

Подробнее

DTS (Decode Timestamp)

decode timestamp

Метка времени, указывающая, когда нужно декодировать кадр, может отличаться от времени его отображения (PTS) – особенно в видео с B-кадрами. Не путать с аудиокодеком DTS.

Подробнее

DTX (прерывистая передача)

discontinuous transmission

Функция экономии полосы пропускания: прекращает передачу пакетов в периоды молчания. В обычном разговоре экономит 40–70% трафика.

Подробнее

E

E-AC-3 (Dolby Digital Plus)

DD+, EAC-3, enhanced AC-3

Преемник AC-3, используется в Netflix, Disney+, Apple TV+, Amazon Prime и ATSC 3.0. Поддерживает Dolby Atmos через технологию Joint Object Coding (JOC).

Подробнее

EBU R128

Рекомендация Европейского вещательного союза по громкости: цель – −23 LUFS (интегрированный уровень), допуск ±1 LU, true peak ≤ −1 dBTP, LRA ≤ 20 LU. Европейский вещательный стандарт.

Подробнее

EnCodec

Meta EnCodec

Открытый нейросетевой аудиокодек от Meta. Архитектура «энкодер – квантизатор – декодер», обученная end-to-end с использованием остаточной векторной квантизации; поддерживает речь и музыку в диапазоне битрейтов от ~1.5 до 24 кбит/с.

Подробнее

ERLE

Echo Return Loss Enhancement

Echo Return Loss Enhancement – мера в децибелах, показывающая, насколько эффективно подавитель эха уменьшает его уровень. Это главный показатель при настройке и сравнении различных реализаций AEC.

Подробнее

EVS (Enhanced Voice Services)

Enhanced Voice Services, VoLTE codec

Голосовой кодек 4G/5G 2014 года: сверхширокополосная и полнодиапазонная речь, поддержка музыки, высокая устойчивость к потерям пакетов. Современный стандарт – VoLTE/VoNR.

Подробнее

F

G

H

HE-AAC

HE-AAC v1, AAC+, aacPlus

AAC-LC в сочетании с технологией Spectral Band Replication (SBR), восстанавливающей верхние частоты на основе низкобитрейтного ядра. Эффективен при битрейтах 32–64 кбит/с – часто используется в радиовещании и при низких битрейтах.

Подробнее

HE-AAC v2

eAAC+, AAC++

HE-AAC плюс Parametric Stereo: стереокартину кодируют несколькими параметрами. Обеспечивает качественное стерео для речи и музыки при скорости ~24–32 кбит/с.

Подробнее

Headroom (запас по уровню)

Запас между обычным уровнем сигнала и 0 dBFS. Headroom не позволяет транзиентам и интерсэмпловым пикам выйти в клиппинг.

Подробнее

HLS

HTTP Live Streaming, EXT-X-MEDIA

HTTP Live Streaming от Apple. Аудиодорожки объявляются тегами EXT-X-MEDIA в плейлисте; плеер сам выбирает дорожку и битрейт по своим правилам.

Подробнее

HRTF

head-related transfer function

Head-Related Transfer Function – фильтр, предназначенный для конкретного слушателя, описывающий, как звук из заданного направления изменяется под воздействием головы и ушей. Математика бинаурального рендеринга в наушниках.

Подробнее

I

J

K

L

LC3

low complexity communications codec

Обязательный кодек Bluetooth LE Audio (2020). Заменяет SBC в беспроводных наушниках – обеспечивает лучшее качество при 64 кбит/с стерео, чем SBC при 200+ кбит/с.

Подробнее

LC3plus

Расширенный LC3 (ETSI TS 103 634) для профессионального и проводного применения: более высокая частота дискретизации, меньшая задержка и дополнительные средства защиты от потерь по сравнению с базовым LE Audio.

Подробнее

LFE (канал низкочастотных эффектов)

low-frequency effects, the .1

Та самая «.1» в 5.1 и 7.1 – это полосно-ограниченный (~20–120 Гц) канал для сабвуфера. Он передаёт гул и удары, но не полнодиапазонный звук.

Подробнее

Lip-sync

AV-sync, audio-video synchronization

Согласование звука и видео, чтобы движения губ на экране совпадали с голосом в ушах. ITU-R BT.1359 определяет допустимые отклонения: от −60 мс до +40 мс.

Подробнее

LKFS

Loudness, K-weighted, relative to Full Scale

Loudness, K-weighted, relative to Full Scale – название ATSC/ITU для той же единицы, что EBU называет LUFS. 1 LKFS = 1 LUFS, отличается только обозначение.

Подробнее

LL-HLS

Low-Latency HLS, partial segments

Low-Latency HLS – расширение Apple, использующее частичные сегменты и блокирующую перезагрузку плейлиста, которое снижает задержку с ~20 до 2–5 секунд, включая аудио.

Подробнее

LRA (диапазон громкости)

loudness range

Одно число в LU, описывающее разброс громкости в программе – от тихого диалога до громкого экшена – ограничено стандартом EBU R128 значением 20 LU для вещания.

Подробнее

LUFS

loudness units relative to full scale, LKFS

Loudness Units relative to Full Scale – перцептивная мера громкости по стандарту ITU-R BS.1770, применяемая во всех современных стандартах вещания и стриминга.

Подробнее

Lyra

Нейросетевой речевой кодек Google обеспечивает разборчивый голос при скорости около 3 кбит/с – значительно ниже порога, где классические кодеки перестают работать. Он построен на идеях SoundStream.

Подробнее

M

MCU (Multipoint Control Unit)

Multipoint Control Unit

Сервер, который декодирует звук от всех участников, микширует его в один поток и кодирует заново. Дёшев по нагрузке на полосу пропускания и CPU клиента, но дорог по ресурсам сервера и уровню задержки.

Подробнее

MDCT

Modified Discrete Cosine Transform

Modified Discrete Cosine Transform – перекрывающееся частотное преобразование, лежащее в основе MP3, AAC, Opus (CELT), AC-3 и почти всех кодеков с потерями.

Подробнее

Mesh / P2P аудио

full mesh, peer-to-peer

Топология, в которой каждый участник передаёт аудио напрямую всем остальным. Минимальная задержка и отсутствие медиасервера, но нагрузка на отдачу резко возрастает уже после ~4 человек.

Подробнее

Mid/Side кодирование

M/S stereo

Хранение суммы (mid) и разности (side) вместо L и R. Когда side мало – как в большинстве музыки – это сжимается заметно лучше.

Подробнее

MOS (Mean Opinion Score)

mean opinion score, ACR

Средняя оценка от 1 до 5, которую слушатели выставляют качеству звука. Это эталон, к которому стремятся приблизиться все объективные метрики – PESQ, POLQA, ViSQOL.

Подробнее

MP2

MPEG-1 Audio Layer II, MUSICAM

MPEG-1 Audio Layer II – вещательная «рабочая лошадка» 1991 года, до сих пор используемая в DVB и контрибуции. Устойчивее MP3 к многократному перекодированию, хотя именно MP3 вытеснил его на потребительском рынке.

Подробнее

MP3

MPEG-1 Audio Layer III, MPEG-2 Audio Layer III

Кодек 1993 года, определивший стандарты потребительского цифрового звука. Был заменён на AAC в видео, но до сих пор широко используется в подкастах и музыкальных библиотеках.

Подробнее

MPEG-H 3D Audio

MPEG-H, MPEG-H Audio

Открытый ISO-стандарт иммерсивного звука, альтернатива AC-4. Объединяет object-based, channel-based и scene-based подходы в одном потоке. Принят в ATSC 3.0 в Южной Корее и некоторых регионах США.

Подробнее

MPEG-TS

MPEG transport stream, .ts

Транспортный поток из 188-байтных пакетов в вещании и HLS. Мультиплексирует аудио, видео и временные метки (PCR), создан для надёжной доставки в реальном времени по ненадёжным каналам.

Подробнее

MUSHRA

MUlti Stimulus with Hidden Reference and Anchor, ITU-R BS.1534

ITU-R BS.1534 – слушательский тест, в котором несколько версий оцениваются относительно скрытого эталона и якорей. Это основной метод сравнения кодеков на пороге прозрачности.

Подробнее

N

O

P

Parametric Stereo (PS)

PS

Техника, передающая моно-ядро и несколько пространственных параметров (разницу уровней и фаз), чтобы восстановить стерео на очень низком битрейте.

Подробнее

PCM

pulse code modulation

Pulse-Code Modulation – это не сжатый цифровой звук в виде потока значений. Все остальные форматы являются производными от PCM.

Подробнее

PCR (Program Clock Reference)

program clock reference

Отсчёт мастер-часов 27 МГц передаётся в потоке MPEG-TS. Декодер синхронизирует свои часы по PCR, чтобы значения PTS имели одинаковый смысл на приёмной и передающей сторонах.

Подробнее

PESQ

Perceptual Evaluation of Speech Quality, ITU-T P.862

ITU-T P.862 – эталонный алгоритм, предсказывающий речевой MOS путём сравнения искажённого звука с оригиналом. Долгое время оставался стандартом для тестирования узкополосного VoIP.

Подробнее

PLC (сокрытие потерь пакетов)

packet loss concealment

Алгоритм восстанавливает потерянный кадр с помощью правдоподобной реконструкции, чтобы слушатель воспринял лишь кратковременное растяжение звука, а не резкий щелчок или паузу.

Подробнее

POLQA

Perceptual Objective Listening Quality Analysis, ITU-T P.863

ITU-T P.863 – преемник PESQ, предназначенный для оценки качества голоса в сверхширокополосных системах и с использованием современных кодеков. На сегодняшний день это основная эталонная метрика объективной оценки качества голоса.

Подробнее

PTP (IEEE 1588)

Precision Time Protocol, IEEE 1588

Протокол точного времени (Precision Time Protocol) обеспечивает синхронизацию сетевых часов с точностью до микросекунд. Общая временная шкала поддерживает выравнивание потоков AES67 и SMPTE 2110 по сэмплам.

Подробнее

PTS (Presentation Timestamp)

presentation timestamp

Метка времени, указывающая момент, когда декодированный аудио- или видеокадр должен быть показан зрителю. Используется во всех современных контейнерах и elementary stream.

Подробнее

R

RED (избыточное аудио)

RFC 2198, redundant coding

Избыточность по RFC 2198: каждый RTP-пакет содержит копию одного или двух предыдущих, поэтому одиночная потеря восстанавливается без ретрансмиссии.

Подробнее

REMB

Receiver Estimated Maximum Bitrate

Receiver Estimated Maximum Bitrate – устаревший сигнал контроля перегрузки в WebRTC: получатель сообщает отправителю, сколько пропускной способности, по его оценке, доступно.

Подробнее

ReplayGain

Нормализация на основе тегов: измерить громкость трека один раз, записать поправку усиления в метаданные и применить её при воспроизведении в плеере.

Подробнее

RMS

root mean square

Root Mean Square – это усреднённая по времени амплитуда. Она ближе к ощущаемой громкости, чем пик, но в современных стандартах её вытеснили LUFS.

Подробнее

RNNoise

Небольшая открытая рекуррентная нейросеть для подавления шума в реальном времени. Достаточно лёгкая, чтобы работать покадрово на CPU – частая основа в открытых стеках.

Подробнее

RTCP

RTP Control Protocol

Управляющий канал рядом с RTP. Отчёты отправителя и получателя содержат статистику потерь, джиттера и времени – они обеспечивают синхронизацию губ (lip-sync) через отчёт отправителя и контроль перегрузки.

Подробнее

RTCP Sender Report

RTCP SR

Пакет RTCP, связывающий метку потока RTP с абсолютным временем NTP, позволяет приёмнику синхронизировать отдельные аудио- и видеопотоки.

Подробнее

RTP

Real-time Transport Protocol, RFC 3550

Real-time Transport Protocol – это тонкий формат пакетов поверх UDP, в котором каждый аудио- и видеокадр в WebRTC и SIP передаётся с порядковым номером и меткой времени.

Подробнее

RTP timestamp

Метка времени в заголовке каждого RTP-пакета. Аудио и видео используют независимые RTP-таймеры; отчёт RTCP sender report синхронизирует их с NTP-временем для синхронизации губ (lip-sync).

Подробнее

S

SBC (Bluetooth)

Low Complexity Subband Coding

Low Complexity Subband Coding – обязательный кодек классического Bluetooth (A2DP) с 2003 года. Приемлемый, но устаревший; в LE Audio его заменяет LC3.

Подробнее

SBR (репликация спектра)

spectral band replication

Инструмент расширения полосы в HE-AAC: кодируется только нижняя часть спектра, верхние октавы восстанавливаются по компактным метаданным. Это обеспечивает большую экономию битрейта, однако иногда возникают «водянистые» артефакты.

Подробнее

SFU (Selective Forwarding Unit)

Selective Forwarding Unit

Медиасервер, пересылающий аудиопотоки каждого участника остальным без декодирования и микширования. Обеспечивает масштабирование конференций, сохраняя потоки раздельными и зашифрованными.

Подробнее

SILK

Речевой слой Opus (из Skype) кодирует голос с низким битрейтом с использованием линейного предсказания. Opus автоматически переключается на него во время разговора.

Подробнее

SMPTE ST 2110–30

SMPTE 2110, ST 2110-30

Аудиочасть набора SMPTE ST 2110 для профессионального IP-производства. Передаёт несжатый PCM (совместим с AES67) параллельно с отдельными потоками видео и данных.

Подробнее

SoundStream

Google SoundStream

Пионерский end-to-end нейрокодек Google и основа Lyra v2. Ввёл «узкое горло» с остаточной векторной квантизацией, которое теперь используется большинством нейрокодеков.

Подробнее

SRTP

Secure RTP

Secure RTP – это слой шифрования и аутентификации поверх протокола RTP. Он является обязательным в WebRTC, поэтому всё аудио в реальном времени по умолчанию шифруется в канале.

Подробнее

T

U

V

W

X

Термин встретился в статье без определения? Напишите нам – добавим в глоссарий.

Нужен не словарь, а команда?

Разрабатываем видеопродукты с 2005 года: стриминг, ВКС, ИИ на видео. 250+ проектов.