Содержание статьи +
- Кратко
- Почему это важно
- Вопрос, который решает всё
- Full-reference: у вас есть оригинал
- Reduced-reference: у вас есть отпечаток
- No-reference: у вас есть только искажённое видео
- Вторая ось: пиксели против битстрима
- Сколько точности вы отдаёте
- Как это проявляется в инструментах
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
Прежде чем выбрать метрику качества видео, нужно ответить на один вопрос: сколько от эталонного оригинала у вас есть в той точке, где вы хотите измерять? Ответ раскладывает все метрики на три схемы – full-reference (есть полный оригинал для сравнения), reduced-reference (есть компактный набор признаков, извлечённых из оригинала) и no-reference, она же слепая (есть только искажённое видео). Схема решает, какие метрики вообще законно запускать: PSNR, SSIM и VMAF – все full-reference и бесполезны на прямой трансляции без оригинала, тогда как no-reference-метрика – единственный вариант для live, видеонаблюдения и пользовательского контента. Статья объясняет, что «видит» каждая схема, где её применяют, насколько ей можно доверять и какие ошибки рождаются, когда метрику запускают не под ту опору, что есть на самом деле.
Почему это важно
Если вы измеряете качество видео, рано или поздно вы попробуете получить число там, где оно работать не может, – попросите VMAF на потоке с веб-камеры без мастера или сравните два клипа, незаметно сдвинутых на пару кадров. И то и другое выдаёт уверенные числа, которые ничего не значат. Эта статья даёт одну проверку, которая предотвращает большинство таких ошибок: называйте схему опоры до того, как называете метрику. Это фундамент для разборов метрик в Блоке 2 и для тяжёлого реального случая – no-reference качества для live и UGC, и это разница между измерением, которое можно отстоять, и скриншотом, о котором можно только спорить.
Вопрос, который решает всё
Любая метрика качества видео отвечает на «насколько хорошо это выглядит?». Но сначала они расходятся на более базовом вопросе: с чем вам сравнивать искажённое видео?
Назовём чистый, несжатый источник опорой (reference) – это эталонный оригинал до того, как его коснулись кодирование, масштабирование или передача. Искажённое видео – это то, что вышло на другом конце. Измерение качества – это по сути разрыв между ними. Загвоздка в том, что у вас не всегда есть опора в том месте и в тот момент, где вы хотите измерять. В лаборатории кодирования мастер лежит на диске; на телефоне, играющем прямой эфир, мастер никогда не покидал здание вещателя, и единственное видео, что существует на этом телефоне, – уже сжатое.
Сколько опоры вы можете достать, раскладывает все метрики на одно из трёх семейств. Full-reference-метрике нужен весь оригинал. Reduced-reference-метрике – лишь маленький «отпечаток» его. No-reference-метрике – ничего. Это не три вкуса одного инструмента, а три разные задачи: с разной точностью, разной ценой и разными местами, где они уместны. Ошибитесь с семейством – и самая точная метрика мира выдаст вам бессмыслицу.
Full-reference: у вас есть оригинал
Full-reference-метрика (часто пишут FR) сравнивает искажённое видео с полным эталонным оригиналом – кадр в кадр, пиксель в пиксель. Это удобный, точный случай, и именно здесь живут знаменитые метрики.
Думайте об этом как о вычитке копии по оригиналу, когда обе страницы лежат рядом. Вы можете указать на любое расхождение, потому что точно видите, как текст должен был выглядеть. PSNR (Peak Signal-to-Noise Ratio, «сырая» попиксельная ошибка в децибелах), SSIM (Structural Similarity Index, структурное сравнение по шкале 0–1), MS-SSIM (его многошкальное расширение) и VMAF (перцептивная метрика Netflix по шкале 0–100) – все full-reference. Таковы и более старые модели ITU: ITU-T J.144 (2004) и ITU-R BT.1683 (2004) задали full-reference-измерение для телевидения стандартной чёткости, а ITU-T J.247 (2008) – то же для мультимедиа. Каждой нужен мастер, чтобы вычислить оценку.
Поскольку full-reference-метрика точно видит, что было потеряно, это самое точное семейство – оно обычно лучше всего коррелирует с человеческими оценками. Поэтому оно владеет лабораторией. К full-reference тянутся всегда, когда мастер на диске: сравнение кодеров, подбор настроек, регрессионные наборы, контроль качества в CI/CD или оценка библиотеки video-on-demand перед выпуском.
Скрытая ловушка full-reference: выравнивание
Есть требование, которое новички пропускают, а потом полдня его отлаживают. Full-reference-метрика предполагает, что два видео выровнены: тот же кадр в каждом, в том же разрешении, с той же яркостной шкалой. Сравните кадр 100 искажённого видео с кадром 98 оригинала – крошечный временной сдвиг – и метрика сообщит об обвале качества, которого глаз бы никогда не увидел. То же происходит при сдвиге на один пиксель по горизонтали или при небольшом смещении яркости.
Поэтому те, кто строит эти инструменты, относятся к калибровке как к первоклассному шагу. Американское агентство NTIA, чья модель VQM стала ITU-T J.144, предупреждает, что именно PSNR «очень чувствителен к ошибкам калибровки», а ITU-T стандартизировал особый PSNR с полным перебором (ITU-T J.340) ровно для того, чтобы найти идеальный пространственный сдвиг, временной сдвиг и яркостное усиление до подсчёта. Правило для вас простое: full-reference-число валидно только после того, как два видео выровнены. Невыровненное full-reference-измерение – это не низкая оценка, а сломанная.
Reduced-reference: у вас есть отпечаток
Reduced-reference-метрика (RR) – это золотая середина. Она несёт не весь оригинал, а лишь компактный набор признаков, извлечённых из него, – несколько чисел, достаточно малых, чтобы ехать рядом с потоком по боковому каналу. На дальнем конце метрика извлекает те же признаки из искажённого видео и сравнивает два отпечатка.
Аналогия – пломба, выдающая вскрытие. Вы не отправляете получателю оригинал документа; вы отправляете короткую контрольную сумму его ключевых свойств, и получатель сверяет свою копию с ней. Вы теряете способность видеть каждое расхождение, но получаете способность измерять качество там, куда полный оригинал никогда бы не добрался.
У этой идеи серьёзная родословная. NTIA придумала reduced-reference-парадигму на основе низкобитрейтных перцептивных признаков – краёв и энергии движения, – которые можно передавать по вещательной сети. Это стандартизировали как Fast Low Bandwidth Model в ITU-T J.249 (2010); ITU-T J.246 (2008) задал reduced-reference-измерение для мультимедиа по кабелю, а ITU-T J.143 (2000) сформулировал требования к перцептивному измерению в эфире. Обещание было – мониторинг качества прямо в работе (in-service): на абонентской приставке или сетевом пробнике, где мастера у вас никогда не будет, но можно позволить себе принимать тонкий ручеёк опорных признаков.
Почему reduced-reference редок на практике
Звучит хитро – и всё же вы почти никогда им не воспользуетесь. Причина логистическая, и NTIA говорит прямо: «большинство компаний не могут соединить точку измерения с источником исходного видео», а именно это соединение нужно reduced-reference-развёртыванию, чтобы доставить опорные признаки на дальний конец. Строить и поддерживать такой боковой канал редко окупается. На практике команды используют full-reference в лаборатории, где мастер локален, и no-reference в проде, где его нет, – и середину выдавливает. Сама NTIA отмечает, что все текущие реализации её низкобитрейтной модели работают в full-reference-режиме, и она прекратила исследования reduced-reference. RR важен, чтобы понять таксономию и читать старую вещательную литературу; но не там вы будете проводить время.
No-reference: у вас есть только искажённое видео
No-reference-метрика (NR), она же слепая (blind), получает только искажённое видео и должна судить о его качестве, не имея ничего для сравнения. Это человеческая способность взглянуть на фото и сказать «выглядит пережатым», ни разу не видев оригинала, – превращённая в алгоритм.
Это тяжёлый случай – и одновременно самый частый в реальном мире. Прямой эфир, видеозвонок, камера наблюдения, только что загруженный пользователем клип – ни у одного нет эталонного мастера, потому что поток с камеры и есть единственная существующая версия. Если вы хотите измерять качество там, no-reference – не удобный вариант, а единственный. Поэтому no-reference качество для live и UGC и мониторинг качества в проде целиком опираются на него.
No-reference-метрики бывают трёх широких стилей, и различия важны при выборе.
Первый стиль – метрики естественной статистики сцен (natural scene statistics). Они моделируют, как статистически выглядят неискажённые изображения, и измеряют, насколько искажённое видео отдрейфовало от этой модели. NIQE (Natural Image Quality Evaluator) и BRISQUE (Blind/Referenceless Image Spatial Quality Evaluator) – классические примеры; они быстры, в некоторых конфигурациях обходятся вовсе без человеческих оценок и достаточно дёшевы для работы в реальном времени.
Второй стиль – обучаемые метрики: глубокие нейросети, обученные на больших наборах видео с человеческими оценками. Это активный фронтир: недавние работы включают no-reference-версию VMAF, которая свёрточной сетью предсказывает full-reference-оценку VMAF по одним пикселям, и Google UVQ для пользовательского контента. Они закрывают значительную часть разрыва точности с full-reference на том контенте, на котором обучались, ценой большей вычислительной нагрузки.
Третий стиль вообще не смотрит на пиксели. Битстримовые и параметрические метрики читают метаданные закодированного потока – битрейт, разрешение, кодек, типы кадров, квантование – и предсказывают качество по ним. ITU-T P.1203 (2017) так предсказывает качество стриминговой сессии, а ITU-T P.1204.3 (2020) – это битстримовая no-reference-модель для разрешений до 4K. Поскольку они пропускают декодирование, они достаточно лёгкие, чтобы крутиться на каждом потоке в сети доставки контента.
Честная оговорка – точность. Без оригинала-якоря no-reference-метрике труднее всего доверять: её точность сильно зависит от типа контента, а чистый на вид, но низкокачественный источник способен её обмануть. Относитесь к no-reference-оценке как к полезному сигналу для трендов и алертов, а не как к эталонной истине, – и никогда не сравнивайте no-reference-оценки на очень разном контенте или разных устройствах так, будто они на одной шкале.
Вторая ось: пиксели против битстрима
Деление full/reduced/no-reference – про то, сколько опоры у вас есть. Вторая, независимая ось – про то, что метрика читает: декодированные пиксели или закодированный битстрим. Большинство классических метрик (PSNR, SSIM, VMAF) пиксельные – они декодируют видео и смотрят на картинку. Битстримовые и параметрические модели вместо этого читают параметры сжатого файла, а гибридные делают и то и другое.
Семейство ITU-T P.1204 (2020) – самая чистая иллюстрация, потому что в нём есть все три точки: P.1204.3 – битстримовая no-reference-модель, P.1204.4 – пиксельная full-/reduced-reference-модель, а P.1204.5 – гибридная no-reference-модель, объединяющая метаданные и пиксели. Разделение двух осей убирает частую путаницу: «no-reference» не значит «примитивный». Гибридная no-reference-модель может быть изощрённой и точной; она просто делает работу без мастера.
Сколько точности вы отдаёте
Три схемы образуют лестницу. Имея всё для сравнения, full-reference-метрики обычно лучше всего отслеживают мнение людей; имея отпечаток, reduced-reference отдаёт часть точности за охват; не имея ничего, no-reference труднее всего сделать правильно. Обзоры по оценке качества стабильно сообщают такой порядок, а органы стандартизации измеряют его напрямую: объективную метрику оценивают по тому, насколько её оценки коррелируют с человеческими Mean Opinion Score, через коэффициент корреляции Пирсона (PCC) и ранговую корреляцию Спирмена, согласно ITU-T P.1401 (2020).
Помогает прикинуть числа – с одной твёрдой оговоркой: значения корреляции сопоставимы только на одной и той же тестовой базе, так что считайте их иллюстрацией порядка, а не фиксированными оценками. На современном стриминговом контенте хорошо проведённое full-reference-измерение VMAF часто достигает PCC около 0,95 относительно MOS. Сильные no-reference-модели отстают, но закрыли значительную часть разрыва – например, гибридная no-reference-модель ITU-T P.1204.5 показала корреляцию Пирсона около 0,93 в своей валидации. Урок не в турнирной таблице; он в том, что за недостающую опорную информацию вы платите точностью, и цена падает по мере улучшения обучаемых моделей.
| Схема | С чем может сравнивать | Примеры метрик и стандартов | Что измеряет хорошо | Где врёт (слепая зона) | Типичное применение |
|---|---|---|---|---|---|
| Full-reference (FR) | Полный эталонный оригинал | PSNR, SSIM, MS-SSIM, VMAF; ITU-T J.144, J.247 | Точную, перцептивно-коррелирующую потерю относительно мастера | Бесполезна без мастера; сломана при рассинхроне | Тесты кодеров, регрессии, QC для VOD, гейты в CI/CD |
| Reduced-reference (RR) | Компактный отпечаток признаков оригинала | NTIA Fast Low Bandwidth Model; ITU-T J.246, J.249 | Качество в эфире там, куда полный мастер не доедет | Нужен боковой канал к источнику; почти не внедряют | Мониторинг вещания/передачи (в основном историческое) |
| No-reference (NR / слепая) | Ничего – только искажённое видео | NIQE, BRISQUE, NR-VMAF, UVQ; ITU-T P.1203, P.1204.3 | Единственный вариант, когда оригинала нет | Труднее всего доверять; зависит от контента; обманывается | Live, UGC, видеонаблюдение, мониторинг в проде |
Таблица 1. Три схемы одним взглядом. Какую метрику можно применить, решает столбец опоры – выберите строку под то, что у вас реально есть, и прочтите её слепую зону.
«Частая ошибка: цитировать full-reference-метрику там, где опоры нет. «Наш прямой эфир набрал VMAF 92» – категориальная ошибка: VMAF full-reference, а у live-захвата нет мастера, на который ссылаться. Либо вы втайне считаете относительно локальной записи (это нормально, но скажите об этом), либо число бессмысленно. Прежде чем цитировать любую оценку, назовите схему: у вас есть оригинал, отпечаток или ничего? Затем берите метрику из этой строки.»
«Частая ошибка: невыровненная full-reference-оценка. Пространственный сдвиг, пара кадров временного смещения или изменение яркости заставят PSNR, SSIM или VMAF сообщить об обрыве качества, которого ни один зритель бы не заметил. Если full-reference-оценка выглядит шокирующе плохой, подозревайте выравнивание раньше, чем кодер. Сначала калибровка, потом подсчёт.»
Как это проявляется в инструментах
Для full-reference-работы инструмент, к которому вы потянетесь чаще всего, – FFmpeg, чьи фильтры libvmaf, ssim и psnr принимают по два входа – искажённое видео и опору, – потому что они full-reference по построению. Минимальный современный вызов выглядит так:
# Full-reference: нужны оба входа (сначала искажённое, затем опора).
# FFmpeg с включённым libvmaf; за один проход считает VMAF, а также SSIM и PSNR.
ffmpeg -i distorted.mp4 -i reference.mp4 \
-lavfi "[0:v][1:v]libvmaf=feature=name=psnr|name=float_ssim:log_fmt=json:log_path=out.json" \
-f null -Обратите внимание на форму команды: она не запустится без обоих файлов. Это full-reference-контракт, сделанный осязаемым. Глубокий разбор этого инструментария – выбор модели, пулинг и чтение JSON – в измерении качества с FFmpeg и libvmaf; короткую версию со стороны кодера см. в шпаргалке по FFmpeg раздела Video Encoding. Для no-reference-случая второго входа давать нечего: вы запускаете слепую метрику на одном искажённом файле – этот набор инструментов разбирается в открытых инструментах no-reference-метрик.
Чтобы выбор был быстрым прямо за рабочим столом, мы сделали одностраничную шпаргалку по схемам опоры: вопрос-решатель, три строки, метрики каждой и две ловушки выше. Скачайте шпаргалку по схемам опоры (PDF) и держите рядом с кодером.
Где здесь Фора Софт
Фора Софт делает видеософт с 2005 года – стриминг, WebRTC-конференции, OTT, онлайн-обучение, телемедицину и видеонаблюдение, – и эти продукты охватывают оба конца этой таксономии. Когда мы сравниваем кодеры или задаём целевое качество per-title, у нас есть мастер, и мы используем full-reference VMAF, выровненный и осознанно спулленный. Когда мы мониторим живой конференц- или наблюдательный поток, мастера нет, поэтому мы измеряем no-reference-сигналами и относимся к ним как к индикаторам тренда, а не абсолютной истине. Дисциплина, которую мы держим, – ровно та, за которую агитирует эта статья: сначала назови схему опоры, потом выбирай метрику – и не давай full-reference-числу выдавать себя за вердикт о контенте, у которого опоры не было. Наша методология бенчмарков документирует, какая именно схема дала каждое число.
Ключевые выводы
- Называйте схему опоры до метрики: полная, сокращённая или никакой.
- Full-reference (PSNR, SSIM, VMAF) нужен полный оригинал, и она самая точная.
- Full-reference-оценка валидна только после выравнивания по времени, пространству и яркости.
- Reduced-reference несёт малый отпечаток признаков; почти не внедряется – нужен боковой канал к источнику.
- No-reference – единственный вариант для live, UGC и видеонаблюдения, и доверять ей труднее всего.
- Точность падает с убыванием опорной информации, но обучаемые no-reference-модели сокращают разрыв.