Справочник

Глоссарий аудио для видео

Короткие определения с синонимами и ссылками на статьи, где термин разобран подробно. Все термины на одной странице – ищите поиском или прыгайте по алфавиту.

154 терминов опубликованоиз ~154 запланированных

С чего начать

Ключевые термины

Если читать словарь целиком некогда – это тот минимум, на котором держатся остальные 142 термина.

А

Алиасинг

Артефакты, возникающие, когда в сигнале есть частоты выше половины частоты дискретизации. Их убирает антиалиасинговый фильтр перед АЦП.

Подробнее

Аудио-рендишн

Один конкретный аудио-вариант в манифесте адаптивного стриминга – язык, кодек, битрейт или раскладка каналов. В HLS – rendition group, в DASH – AdaptationSet.

Подробнее

Аудиокадр

Фиксированный блок сэмплов, который кодек кодирует как единое целое – 1024 сэмпла для AAC, 20 мс для Opus. Атом размера, задержки и перемотки в сжатом аудио.

Подробнее

Аудиокодек

Coder-Decoder – алгоритм, который сжимает аудио до меньшего числа бит и восстанавливает его при воспроизведении.

Подробнее

Аудиообъект

Один звук плюс его позиционные метаданные (x, y, z и размер) в объектном аудио. Рендерер размещает его по доступным колонкам или наушникам при воспроизведении.

Подробнее

АЦП (аналого-цифровой преобразователь)

analog-to-digital converter, A/D

Микросхема, превращающая непрерывное напряжение микрофона в дискретные PCM-сэмплы: измеряет его с частотой дискретизации и округляет до битовой глубины.

Подробнее

Б

Г

Д

Даунмикс

upmix

Сведение большего числа каналов в меньшее – 5.1 в стерео, стерео в моно – по заданным коэффициентам (Lo/Ro, Lt/Rt), чтобы surround играл и на двух колонках.

Подробнее

Децибел (дБ)

dB

Логарифмическое отношение, а не абсолютная единица. Каждые +6 дБ примерно удваивают амплитуду; смысл придаёт точка отсчёта (dBFS, dBTP, дБ SPL).

Подробнее

Дизеринг

Небольшой шум, добавляемый перед понижением битовой глубины. Меняет резкое коррелированное искажение квантования на тихое равномерное шипение.

Подробнее

Динамический диапазон

Разница между самым тихим и самым громким звуком, который может передать система. Каждый бит даёт около 6 дБ: 16 бит – 96 дБ, 24 бита – около 144 дБ.

Подробнее

Доступность аудио

a11y, accessible audio

Набор средств, делающих аудио доступным каждому – тифлокомментарий, дорожки с чистым и усиленным диалогом, сурдо-дорожки – во многом обязательный по закону.

Подробнее

Дрейф часов

sample clock drift

Медленное расхождение часов записи и воспроизведения – рассинхрон 48.000 против 48.001 кГц. Без коррекции аудио и видео расходятся за минуты.

Подробнее

И

К

Канал

Один независимый поток аудио-сэмплов. В стерео два канала, в 5.1 – шесть, в 7.1.4 – двенадцать.

Подробнее

Канальное аудио

Классическая модель: каждая дорожка привязана к конкретной колонке – L, R, C, Ls, Rs. Просто и универсально, но микс зафиксирован под одну раскладку.

Подробнее

Квантование

Округление каждого непрерывного сэмпла до ближайшего значения, доступного при данной битовой глубине. Ошибка округления – шум квантования, который снижают дизерингом.

Подробнее

Клиппинг

Жёсткое искажение, когда сигнал превышает максимум (0 dBFS) и вершины срезаются. После записи в файл – необратимо.

Подробнее

Контрибуционный кодек

contribution audio

Высококачественный кодек с малыми потерями для передачи звука между площадками до финального кодирования – устойчив к многократному перекодированию, в отличие от дистрибуционного.

Подробнее

М

Н

О

П

Р

С

Сброс / вставка кадров

drop/dup, frame skipping

Грубая коррекция дрейфа: иногда выбросить или повторить кадр, чтобы удержать аудио и видео вместе. Дешевле ресемплинга, но неаккуратный сброс слышен как щелчок.

Подробнее

Сжатие без потерь

Сжатие, восстанавливающее исходные сэмплы бит-в-бит – FLAC, ALAC, WavPack. Меньше WAV, идеальное качество; для мастеров и архивов.

Подробнее

Сжатие с потерями

lossy compression

Сжатие, безвозвратно отбрасывающее детали, которые ухо вряд ли заметит, по психоакустической модели – AAC, Opus, MP3. Намного меньше lossless, но не бит-в-бит.

Подробнее

Стерео

Два канала – левый и правый – создают ощущение горизонтальной ширины. Стандарт для музыки и большинства видео.

Подробнее

Сценовое аудио

Целое звуковое поле, закодированное независимо от колонок, обычно как Ambisonics. Свободно вращается под трекинг головы – естественный выбор для VR и 360-видео.

Подробнее

Т

У

Ц

Ч

A

AAC

advanced audio coding, MPEG-4 audio

Advanced Audio Coding – стандартный аудиокодек для видео на YouTube, Netflix, Apple и большинстве OTT-платформ. Несколько профилей: AAC-LC, HE-AAC v1/v2, xHE-AAC.

Подробнее

AAC-LC

AAC Low Complexity

Базовый профиль AAC – Low Complexity. Именно он звучит в большинстве MP4-видео, ~128-256 кбит/с стерео. Когда говорят просто «AAC», обычно имеют в виду его.

Подробнее

AC-3 (Dolby Digital)

Dolby-кодек 1991 года, принёсший 5.1 в DVD и эфирное вещание ATSC. В стриминге заменён на E-AC-3, но всё ещё повсеместен в наследии.

Подробнее

AC-4

Следующее поколение Dolby для вещания. Object-based, immersive, со встроенным усилением диалога. Принят в ATSC 3.0 и DVB.

Подробнее

AC-4 IMS

AC-4 Immersive Stereo

AC-4 Immersive Stereo – компактный режим доставки Dolby Atmos для низкобитрейтного стриминга и вещания, рендерящий иммерсивный звук из эффективного потока AC-4.

Подробнее

AdaptationSet (DASH)

Группа в манифесте DASH, хранящая взаимозаменяемые версии одного компонента – например, все битрейты английской дорожки. Аналог rendition group в HLS.

Подробнее

AEC (эхоподавление)

acoustic echo cancellation, echo cancellation, AEC3

Алгоритм, удаляющий из микрофонного сигнала то, что играет в динамике собеседника. Без него любой звонок превращается в петлю обратной связи.

Подробнее

AEC3

WebRTC AEC3

Эхоподавитель третьего поколения в libWebRTC – стандартный в звонках на основе Chrome, настроенный на устойчивость к дешёвому железу ноутбуков.

Подробнее

AES67

Стандарт совместимости audio-over-IP, позволяющий Dante, Ravenna и Livewire обмениваться несжатым PCM по сети с синхронизацией по PTP.

Подробнее

AGC (автоматическая регулировка усиления)

automatic gain control, AGC2

Контур, регулирующий усиление микрофона так, чтобы голос приходил с постоянной громкостью независимо от того, как близко человек сидит к микрофону.

Подробнее

AGC2

WebRTC AGC2

Новая автоматическая регулировка усиления в WebRTC: адаптивная цифровая схема, заменившая аналоговый контур AGC1 ради стабильного уровня голоса на разных устройствах.

Подробнее

AIFF

Audio Interchange File Format

Несжатый PCM-контейнер от Apple, аналог WAV для Mac. Тот же звук, big-endian, распространён в macOS и профессиональном аудио.

Подробнее

ALAC

apple lossless

Apple Lossless Audio Codec – формат Apple без потерь, эквивалентный FLAC по качеству. Нативен в iOS/macOS и в hi-res-уровне Apple Music.

Подробнее

Ambisonics

Scene-based формат пространственного звука, фиксирующий всё звуковое поле вокруг точки малым числом каналов. Стандарт для 360°-видео и VR.

Подробнее

AMR (AMR-NB / AMR-WB)

Adaptive Multi-Rate, AMR-NB, AMR-WB

Семейство Adaptive Multi-Rate из 2G/3G. AMR-NB (узкополосный) и AMR-WB (широкополосный, он же G.722.2) до сих пор встречаются в VoLTE и старых записях.

Подробнее

ASR (распознавание речи)

speech-to-text, STT

Автоматическое распознавание речи – превращение аудиопотока в текст для живых субтитров, транскриптов и поиска. Питается очищенным, нарезанным по VAD звуком из звонка.

Подробнее

ATSC A/85 (CALM Act)

Американская рекомендация по громкости вещания, обеспеченная CALM Act. Цель −24 LKFS для рекламы и программ. Поэтому реклама больше не громче передачи.

Подробнее

Audio level (RFC 6464)

client-to-mixer audio level, RFC 6464/6465

Расширение заголовка RTP с громкостью каждого пакета. SFU читает его, чтобы пересылать только активных говорящих и показывать «кто говорит» без декодирования звука.

Подробнее

B

C

D

DASH (MPEG-DASH)

MPEG-DASH, Dynamic Adaptive Streaming over HTTP

ISO-стандарт адаптивного стриминга. Его XML-манифест (MPD) описывает аудио как AdaptationSet и Representation, между которыми плеер переключается по полосе.

Подробнее

dBFS

Децибелы относительно полной шкалы – 0 dBFS – максимум, который может выразить цифровая система. Все значения отрицательные.

Подробнее

dBTP

true peak, dB true peak

Decibels True Peak – шкала, учитывающая межсэмпловые пики, которые создаёт аналоговый реконструктор. На стриминге обычно лимит −1 dBTP.

Подробнее

dialnorm

Поле метаданных в AC-3 / E-AC-3 / AC-4, сообщающее декодеру громкость диалога – чтобы тот понизил воспроизведение до цели слушателя. Вещательный предшественник современной нормализации.

Подробнее

Dolby Atmos

Объектно-ориентированная иммерсивная аудиосистема от Dolby. Добавляет к 10-канальной подложке (7.1.2) до 118 динамических объектов с позиционными метаданными. Несётся в DD+ JOC, AC-4 IMS или родном MP4 для кинотеатров.

Подробнее

Double-talk (двойной разговор)

Сложный случай для эхоподавления: оба говорят одновременно, и подавитель должен убрать дальнее эхо, не повредив ближний голос.

Подробнее

DTS (Decode Timestamp)

decode timestamp

Метка времени, указывающая, когда декодировать кадр – это может отличаться от момента показа (PTS) для видео с B-кадрами. Не путать с аудиокодеком DTS.

Подробнее

DTX (прерывистая передача)

discontinuous transmission

Функция экономии полосы: прекращает отправку пакетов в моменты молчания. На обычном разговоре экономит 40–70% трафика.

Подробнее

E

E-AC-3 (Dolby Digital Plus)

DD+, EAC-3, enhanced AC-3

Преемник AC-3, используется Netflix, Disney+, Apple TV+, Amazon Prime, ATSC 3.0. Несёт Dolby Atmos через Joint Object Coding (JOC).

Подробнее

EBU R128

Рекомендация Европейского вещательного союза по громкости. Цель −23 LUFS integrated, ±1 LU допуск, true peak ≤ −1 dBTP, LRA ≤ 20 LU. Европейский вещательный стандарт.

Подробнее

EnCodec

Meta EnCodec

Открытый нейросетевой аудиокодек от Meta. Связка энкодер-квантизатор-декодер, обученная end-to-end с остаточной векторной квантизацией; речь и музыка от ~1.5 до 24 кбит/с.

Подробнее

ERLE

Echo Return Loss Enhancement

Echo Return Loss Enhancement – мера в децибелах того, сколько эха убирает подавитель. Главный показатель при настройке и сравнении реализаций AEC.

Подробнее

EVS (Enhanced Voice Services)

Enhanced Voice Services, VoLTE codec

Голосовой кодек 4G/5G 2014 года: сверхширокополосная и полнодиапазонная речь, поддержка музыки, высокая устойчивость к потерям. Современный стандарт VoLTE/VoNR.

Подробнее

F

G

H

HE-AAC

HE-AAC v1, AAC+, aacPlus

AAC-LC плюс Spectral Band Replication (SBR), достраивающий верхние частоты из низкобитрейтного ядра. Эффективен на 32-64 кбит/с – частый выбор для радио и низких битрейтов.

Подробнее

HE-AAC v2

eAAC+, AAC++

HE-AAC плюс Parametric Stereo: стереокартина кодируется несколькими параметрами. Даёт пригодное стерео речи и музыки на ~24-32 кбит/с.

Подробнее

Headroom (запас по уровню)

Запас между обычным уровнем сигнала и 0 dBFS. Headroom не даёт транзиентам и интерсэмпловым пикам уйти в клиппинг.

Подробнее

HLS

HTTP Live Streaming, EXT-X-MEDIA

HTTP Live Streaming от Apple. Аудио-рендишены объявляются тегами EXT-X-MEDIA в плейлисте; плеер сам выбирает дорожку и битрейт по своим правилам.

Подробнее

HRTF

head-related transfer function

Head-Related Transfer Function – фильтр для конкретного слушателя, описывающий, как звук из заданного направления преобразуется головой и ушами. Математика бинаурального рендеринга в наушниках.

Подробнее

I

J

K

L

LC3

low complexity communications codec

Обязательный кодек Bluetooth LE Audio (2020). Заменяет SBC в беспроводных наушниках – лучшее качество на 64 кбит/с стерео, чем SBC на 200+ кбит/с.

Подробнее

LC3plus

Расширенный LC3 (ETSI TS 103 634) для профессионального и проводного применения: выше частоты дискретизации, ниже задержка и средства против потерь сверх базового LE Audio.

Подробнее

LFE (канал низкочастотных эффектов)

low-frequency effects, the .1

Та самая «.1» в 5.1 и 7.1 – полосно-ограниченный (~20-120 Гц) канал для сабвуфера. Несёт гул и удар, а не полнодиапазонный сигнал.

Подробнее

Lip-sync

AV-sync, audio-video synchronization

Согласование звука и видео, чтобы движения губ на экране совпадали с голосом в ухе. ITU-R BT.1359 определяет допуски: примерно от −60 мс до +40 мс.

Подробнее

LKFS

Loudness, K-weighted, relative to Full Scale

Loudness, K-weighted, relative to Full Scale – название ATSC/ITU для той же единицы, что EBU зовёт LUFS. 1 LKFS = 1 LUFS, отличается только обозначение.

Подробнее

LL-HLS

Low-Latency HLS, partial segments

Low-Latency HLS – расширение Apple с частичными сегментами и блокирующей перезагрузкой плейлиста, снижающее задержку с ~20 с до 2-5 с, вместе с аудио.

Подробнее

LRA (диапазон громкости)

loudness range

Одно число в LU, описывающее разброс громкости в программе – тихий диалог против громкого экшена. EBU R128 ограничивает его 20 LU для вещания.

Подробнее

LUFS

loudness units relative to full scale, LKFS

Loudness Units relative to Full Scale – перцептивная мера громкости из ITU-R BS.1770, используется во всех современных стандартах вещания и стриминга.

Подробнее

Lyra

Нейросетевой речевой кодек Google, дающий разборчивый голос около 3 кбит/с – много ниже порога, где классические кодеки разваливаются. Построен на идеях SoundStream.

Подробнее

M

MCU (Multipoint Control Unit)

Multipoint Control Unit

Сервер, декодирующий звук всех, микширующий его в один поток и кодирующий заново. Дёшев по полосе и CPU клиента, дорог по серверу и задержке.

Подробнее

MDCT

Modified Discrete Cosine Transform

Modified Discrete Cosine Transform – перекрывающееся частотное преобразование в основе MP3, AAC, Opus (CELT), AC-3 и почти каждого кодека с потерями.

Подробнее

Mesh / P2P аудио

full mesh, peer-to-peer

Топология, где каждый участник шлёт аудио напрямую всем остальным. Минимальная задержка и без медиасервера, но нагрузка на отдачу взрывается уже после ~4 человек.

Подробнее

Mid/Side кодирование

M/S stereo

Хранение суммы (mid) и разности (side) вместо L и R. Когда side мал – как в большинстве музыки – это сжимается заметно лучше.

Подробнее

MOS (Mean Opinion Score)

mean opinion score, ACR

Средняя оценка 1-5, которую слушатели ставят качеству звука. Эталон, который стремятся предсказать все объективные метрики (PESQ, POLQA, ViSQOL).

Подробнее

MP2

MPEG-1 Audio Layer II, MUSICAM

MPEG-1 Audio Layer II – вещательная рабочая лошадка 1991 года, до сих пор в DVB и контрибуции. Устойчивее MP3 к многократному перекодированию, хотя у потребителей его вытеснил MP3.

Подробнее

MP3

MPEG-1 Audio Layer III, MPEG-2 Audio Layer III

Кодек 1993 года, определивший потребительский цифровой звук. Заменён на AAC для видео, но всё ещё распространён в подкастах и музыкальных библиотеках.

Подробнее

MPEG-H 3D Audio

MPEG-H, MPEG-H Audio

Открытый ISO-стандарт иммерсивного звука, альтернатива AC-4. Object + channel + scene-based в одном потоке. Принят в ATSC 3.0 в Южной Корее и части США.

Подробнее

MPEG-TS

MPEG transport stream, .ts

Транспортный поток из 188-байтных пакетов в вещании и HLS. Мультиплексирует аудио, видео и тайминг (PCR), создан для устойчивой доставки в реальном времени по ненадёжным каналам.

Подробнее

MUSHRA

MUlti Stimulus with Hidden Reference and Anchor, ITU-R BS.1534

ITU-R BS.1534 – слушательский тест, оценивающий сразу несколько версий относительно скрытого эталона и якорей. Основной метод сравнения кодеков у порога прозрачности.

Подробнее

N

O

P

Parametric Stereo (PS)

PS

Техника, передающая моно-ядро плюс несколько пространственных параметров (разницы уровня и фазы), чтобы восстановить стерео на очень низком битрейте.

Подробнее

PCM

pulse code modulation

Pulse-Code Modulation – сырой несжатый цифровой звук в виде потока значений. Все остальные форматы – производные от PCM.

Подробнее

PCR (Program Clock Reference)

program clock reference

Отсчёт мастер-часов 27 МГц, передаваемый в потоке MPEG-TS. Декодер синхронизирует свои часы по PCR, чтобы значения PTS означали одно и то же на обоих концах.

Подробнее

PESQ

Perceptual Evaluation of Speech Quality, ITU-T P.862

ITU-T P.862 – алгоритм с эталоном, предсказывающий речевой MOS сравнением искажённого звука с оригиналом. Долгое время стандарт для тестов узкополосного VoIP.

Подробнее

PLC (сокрытие потерь пакетов)

packet loss concealment

Алгоритм, заполняющий потерянный кадр правдоподобной реконструкцией, чтобы слушатель услышал короткое растягивание, а не щелчок или тишину.

Подробнее

POLQA

Perceptual Objective Listening Quality Analysis, ITU-T P.863

ITU-T P.863 – преемник PESQ, охватывающий сверхширокую полосу и современные кодеки. Текущая эталонная метрика объективной оценки качества голоса.

Подробнее

PTP (IEEE 1588)

Precision Time Protocol, IEEE 1588

Precision Time Protocol – синхронизация сетевых часов с точностью до микросекунд. Общая шкала времени, удерживающая потоки AES67 и SMPTE 2110 выровненными по сэмплам.

Подробнее

PTS (Presentation Timestamp)

presentation timestamp

Метка времени, указывающая, когда декодированный аудио- или видеокадр должен быть показан зрителю. Используется в каждом современном контейнере и elementary stream.

Подробнее

R

RED (избыточное аудио)

RFC 2198, redundant coding

Избыточность по RFC 2198: каждый RTP-пакет несёт ещё и копию одного-двух предыдущих, поэтому одиночная потеря восстанавливается без ретрансмиссии.

Подробнее

REMB

Receiver Estimated Maximum Bitrate

Receiver Estimated Maximum Bitrate – старый сигнал контроля перегрузки в WebRTC: получатель сообщает отправителю, сколько полосы, по его оценке, доступно.

Подробнее

ReplayGain

Нормализация на основе тегов: один раз измерить громкость трека, записать поправку усиления в метаданные и применить её при воспроизведении в плеере.

Подробнее

RMS

root mean square

Root Mean Square – усреднённая по времени амплитуда. Ближе к ощущаемой громкости, чем peak, но в современных стандартах вытеснена LUFS.

Подробнее

RNNoise

Небольшая открытая рекуррентная нейросеть для подавления шума в реальном времени. Достаточно лёгкая, чтобы работать покадрово на CPU; частая база в открытых стеках.

Подробнее

RTCP

RTP Control Protocol

Управляющий канал рядом с RTP. Отчёты отправителя и получателя несут статистику потерь, джиттера и времени – питают lip-sync (через sender report) и контроль перегрузки.

Подробнее

RTCP Sender Report

RTCP SR

Пакет RTCP, связывающий RTP-метку потока с абсолютным NTP-временем. Именно он позволяет приёмнику свести по губам отдельные потоки аудио и видео.

Подробнее

RTP

Real-time Transport Protocol, RFC 3550

Real-time Transport Protocol – тонкий формат пакетов поверх UDP, несущий каждый аудио- и видеокадр в WebRTC и SIP, с порядковым номером и меткой времени.

Подробнее

RTP timestamp

Метка времени в заголовке каждого RTP-пакета. Аудио и видео имеют независимые RTP-часы; RTCP sender report связывает их с NTP-временем для lip-sync.

Подробнее

S

SBC (Bluetooth)

Low Complexity Subband Coding

Low Complexity Subband Coding – обязательный кодек классического Bluetooth (A2DP) с 2003 года. Приемлемый, но устаревший; в LE Audio его заменяет LC3.

Подробнее

SBR (репликация спектра)

spectral band replication

Инструмент расширения полосы в HE-AAC: кодируется только нижняя часть, верхние октавы достраиваются по компактным метаданным. Большая экономия, иногда «водянистые» артефакты.

Подробнее

SFU (Selective Forwarding Unit)

Selective Forwarding Unit

Медиасервер, пересылающий аудио каждого участника остальным без декодирования и микширования. Масштабирует конференции, сохраняя потоки раздельными и шифрованными.

Подробнее

SILK

Речевой слой Opus (из Skype). Кодирует голос на низком битрейте линейным предсказанием. Opus переключается на него автоматически для разговора.

Подробнее

SMPTE ST 2110–30

SMPTE 2110, ST 2110-30

Аудиочасть набора SMPTE ST 2110 для профессионального IP-производства. Несёт несжатый PCM (совместима с AES67) рядом с отдельными потоками видео и данных.

Подробнее

SoundStream

Google SoundStream

Пионерский end-to-end нейрокодек Google и основа Lyra v2. Ввёл «узкое горло» с остаточной векторной квантизацией, которое теперь используют большинство нейрокодеков.

Подробнее

SRTP

Secure RTP

Secure RTP – слой шифрования и аутентификации поверх RTP. Обязателен в WebRTC, поэтому всё аудио реального времени по умолчанию зашифровано в канале.

Подробнее

T

U

V

W

X

Термин встретился в статье без определения? Напишите нам – добавим в глоссарий.

Нужен не словарь, а команда?

Разрабатываем видеопродукты с 2005 года: стриминг, ВКС, ИИ на видео. 250+ проектов.