Что метрика может и чего не может сказать

Автор: Николай СапуновОбновлено: август 202614 мин чтения
Содержание статьи +

Кратко

Любая объективная метрика качества видео – это обученный прокси для мнения человека, поэтому она даёт вам прогноз с доверительным интервалом, а не истину; и в ту секунду, когда вы об этом забываете, число начинает врать. Метрика надёжно ранжирует два энкода, ловит регрессию и отслеживает тренд – пока вы держите сравнение «яблоки к яблокам»; но она не скажет сама по себе, будет ли доволен зритель, не найдёт худшие несколько секунд, которые он на самом деле запомнит, и не оценит контент и артефакты, на которых её не учили. Самая дорогая ошибка в измерении – оптимизировать под число вместо зрителя, потому что любую метрику можно накрутить приёмами, которые поднимают оценку, не улучшая картинку. Эта статья показывает, где именно проходит граница между тем, что число заслужило, и тем, что оно лишь делает вид, будто знает – с показанной вслух арифметикой доверительного интервала.

Почему это важно

Если вы вот-вот примете реальное решение по оценке качества – выпустить этот энкод, выбрать тот кодек, снизить этот битрейт – вы доверяете числу заменить собой тысячи человеческих глаз, и вам нужно точно знать, насколько далеко это доверие тянется. Статья написана для стриминг- или энкодинг-лида, QA-инженера и технического продакт-оунера, который уже начал измерять качество и теперь должен защищать результаты, не обманываясь ими. Её задача – провести границу: назвать те немногие работы, которые метрика делает хорошо, слепые зоны, которые топили реальные проекты, и дисциплину, которая держит число честным. Это проверка реальностью, на которую опирается весь остальной раздел – каждая статья про отдельную метрику – и та статья, которую перечитывают перед тем, как назвать оценку человеку, готовому потратить на неё деньги.

Метрика – это прогноз, а не погода

Начнём с одной мысли, на которой держится всё остальное. Объективная метрика качества – любой алгоритм, который читает два видео и печатает число (PSNR, SSIM, VMAF) – это модель, обученная предсказывать, что сказали бы люди, если бы их спросили. Истина качества видео – это субъективный тест: реальные зрители, контролируемые условия, оценка реальных клипов. Метрика – быстрый и дешёвый заместитель этой медленной и дорогой панели.

Это делает метрику прогнозом. Прогноз погоды по-настоящему полезен – вы берёте зонт, когда он обещает 80% дождя, – но вы никогда не путаете прогноз с небом. Метрика качества – объект того же рода: построенное предсказание мнения людей, с послужным списком, который можно проверить, и с ошибкой, которую она несёт в каждом отдельном показании. Когда метрика говорит «VMAF 93», на самом деле она говорит: «обученная модель предсказывает, что зрители оценили бы это примерно на 93, плюс-минус». Это «плюс-минус» – не сноска. Это и есть тема всей статьи.

Поскольку метрика – это предсказание, её можно оценить, и процедура оценки сама по себе стандарт. Рекомендация ITU-T P.1401 (2020) определяет, как оценивать объективную метрику по субъективным данным четырьмя числами: коэффициент корреляции Пирсона (PCC) – насколько линейно метрика следует мнению; ранговая корреляция Спирмена (SROCC) – верно ли она упорядочивает клипы; среднеквадратичная ошибка (RMSE) – насколько далеко промахиваются её прогнозы; и доля выбросов – как часто она ошибается сильнее, чем объясняет неопределённость самих людей. Запомните эти четыре слова: так дисциплина публично признаёт, что идеальной метрики нет.

Рисунок 1. Объективная метрика предсказывает средний балл мнения людей (MOS). Соответствие хорошее, но никогда не идеальное – в кружках контент, где метрика и глаз расходятся, и четыре числа P.1401 оценивают именно это.

Что метрика может вам сказать

Внутри своих границ метрика отрабатывает четыре задачи, и делает их лучше, чем могла бы позволить себе любая человеческая панель.

Она может ранжировать два энкода одного контента. Если клип A набирает VMAF 95, а клип B – 88, измеренные одинаково, A почти наверняка выглядит лучше; ранжирование – это именно то, на что метрики проверяют (это и измеряет SROCC). Она может поймать регрессию: когда вчерашний пайплайн давал VMAF 94 на референсном клипе, а сегодняшний даёт 81, что-то сломалось – и число нашло это, пока вы спали. Она может отслеживать тренд в масштабе, наблюдая за десятью тысячами ассетов или живым каналом во времени и помечая те, что дрейфуют. И она может дать защитимую цифру для отчёта или договора, потому что метод записан, а результат воспроизводится.

Обратите внимание на общую нить: каждая из этих задач – относительная или сравнительная. Метрика блистает, когда сравнивает подобное с подобным: тот же контент, то же разрешение, ту же модель, ту же свёртку. Это зелёная зона. Большинство провалов случается, когда число выносят за её пределы.

Насколько велик «плюс-минус»? Разбор на числах

Вот арифметика, которая делает доверительный интервал осязаемым – увидев её однажды, вы больше не прочитаете отдельную оценку VMAF так же. Начиная с версии 1.3.7 (июнь 2018), VMAF может сообщать 95%-й доверительный интервал – диапазон, отражающий уверенность модели – обучая множество моделей на пересемплированных данных (приём, называемый бутстрэпом) и наблюдая, насколько расходятся их прогнозы. Инструмент выдаёт оценку и стандартное отклонение этих моделей, а интервал получается из формулы в одну строку:

95% ДИ  =  оценка  ±  1,96 × стандартное отклонение

Пример (из собственного вывода документации VMAF):
  оценка                 = 75,4
  стандартное отклонение = 1,31
  поле                   = 1,96 × 1,31 = 2,57
  95% ДИ                 = 75,4 − 2,57  до  75,4 + 2,57
                         = 72,9  до  77,4

Прочитайте, что это значит. VMAF 75,4 на этом клипе на самом деле – «где-то между примерно 73 и 77 с 95% уверенностью». Поэтому если энкод A набирает 75, а энкод B – 77, метрика не может их различить: их интервалы полностью перекрываются. Считать разницу в два пункта VMAF реальной победой – значит читать шум как сигнал. Документация VMAF даже отмечает, что низкие оценки несут более широкий интервал, чем высокие, потому что обучающих данных было плотнее на верхнем конце – то есть метрика наименее уверена ровно там, где качество хуже всего и решения важнее всего.

«Частая ошибка: ранжировать энкоды по разнице меньше доверительного интервала. «Мы выбрали кодировщик B, он набрал на 0,6 VMAF больше» – это решение, принятое по шуму. Прежде чем объявлять победителя, проверьте, что разрыв превышает доверительный интервал (или проведите полноценный субъективный тест, когда разрыв мал, а ставки высоки). Метрика без приложенного интервала ошибки – это метрика, которой вы переплачиваете доверием.»

Чего метрика вам сказать не может

Теперь другая сторона границы. У оценки качества пять слепых зон, которые повторяются в реальных проектах, и назвать их – главная цель этой статьи.

Рисунок 2. Пять вещей, которые одно число о качестве не скажет. Каждая – место, где уверенная на вид оценка тихо перестаёт значить то, что вы думаете.

1. Не скажет про худшие несколько секунд

Оценка на уровне клипа – это сводка сотен покадровых оценок, а сводка выбрасывает информацию. По умолчанию большинство инструментов, включая VMAF, сообщают среднее арифметическое покадровых оценок. Но сама документация VMAF предупреждает: люди взвешивают худшие моменты сильнее, чем простое среднее – один уродливый зависший кадр или замыленная сцена и есть то, что зритель запомнит, даже если все остальные кадры были безупречны. Среднее 92 может прятать пятисекундный отрезок на 60.

Вот почему свёртка – правило превращения покадровых оценок в одно число – важна не меньше самой метрики. Гармоническое среднее сильнее взвешивает низкие кадры; 5-й перцентиль прямо сообщает качество худших 5% кадров. Одно среднее число никогда добровольно не признается, что плохая сцена существует. О худшем кадре нужно спрашивать отдельно, а большинство команд не спрашивает.

Рисунок 3. Тот же клип, три честных числа. Среднее арифметическое сидит уютно высоко; 5-й перцентиль сообщает ту сцену, на которую зритель и пожалуется.

2. Не оценит контент, на котором её не учили

Обученная метрика вроде VMAF знает то, чему её научил обучающий набор, а училась она в основном на обычном кодированном кино и ТВ – на артефактах сжатия и масштабирования. Выведите её на контент за пределами этого опыта, и прогноз деградирует – тихо, без флага тревоги. Самый явный случай – бандинг, видимые ступеньки там, где должно быть гладкое небо или градиент. Бандинг сидит на редких контурах, пока бóльшая часть кадра выглядит нормально, поэтому полнокадровая метрика его почти не замечает: по человеческим оценкам ранговая корреляция VMAF v0 на бандинге всего около 0,34, где 1,0 – идеал. Киношное зерно, текст с экрана, анимация и сильные цветовые (chroma) артефакты – похожие слабые места: VMAF v0 читает только канал яркости (luma), поэтому структурно слеп к чисто цветовому повреждению.

«Частая ошибка: доверять full-reference оценке на контенте, которого она не видела. Если вы измеряете анимацию, скринкаст, зернистое кино или что-то с сильными цветовыми сдвигами, дефолтное число VMAF – в лучшем случае образованная догадка. Проверьте метрику на образце вашего контента против человеческих глаз, прежде чем доверять ей по каталогу – см. как метрики валидируют по оценкам людей.»

3. Не скажет того, что её не валидировали говорить

Каждая перцептивная метрика закладывает предположения об условиях просмотра – размере экрана и дистанции – и оценка значит только то, что модель обучили значить. Документация VMAF даёт самый острый пример: посчитайте дефолтную модель на родном клипе 480p, и оценка вернётся неожиданно высокой, потому что модель фактически предполагает, что вы сидите достаточно далеко, чтобы кадр 480p выглядел как небольшой участок экрана 1080p. Документация прямо называет сравнение родной-480p и родной-1080p оценки «сравнением яблок с апельсинами». Отдельные модели для экранов 4K и для просмотра на телефоне существуют именно потому, что одна модель не может говорить за все условия. Возьмёте не ту модель – и число уверенно неверно.

4. Не увидит артефакты вне своего охвата

VMAF спроектирован для адаптивного стриминга, поэтому моделирует два вида повреждений: артефакты сжатия и масштабирования. Документация прямо говорит, что другие искажения – потери пакетов, ошибки передачи и подобное – «могут предсказываться неточно». Временны́е проблемы – тоже известная слабость: мерцание, гостинг и дёрганье (judder) живут в том, как кадры меняются во времени, а временна́я фича VMAF – базовая мера движения, которая их плохо ловит. No-reference живой поток со сбоем из-за потери пакетов всё ещё может показать здоровую full-reference оценку, потому что метрика не ищет рану такого рода.

5. Не скажет «достаточно ли это хорошо» сама по себе

Ранжирование надёжно; абсолютный вердикт – нет. FAQ VMAF отмечает, что сравнение видео с самим собой не возвращает даже идеальную 100 – вы получаете что-то вроде 98,7, потому что у предсказателя на машинном обучении остаточная ошибка есть везде. Поэтому «VMAF 93 – это хорошо» осмысленно только после того, как вы привязали – на вашем контенте и ваших устройствах – какая оценка соответствует качеству, которое ваши зрители принимают. Число – это показание термометра; комфортно ли в комнате, по-прежнему решаете вы.

Самая глубокая ловушка: оптимизировать под метрику

Есть ошибка хуже, чем неверно прочитать оценку: сделать оценку своей целью. Закон Чарльза Гудхарта в известной формулировке Мэрилин Стратерн предупреждает: «когда мера становится целью, она перестаёт быть хорошей мерой». Качество видео – учебный случай. Поскольку любая метрика – несовершенный прокси, между числом и восприятием всегда есть зазор; и всё, что вы делаете, чтобы гнаться за числом через этот зазор, улучшает оценку, не улучшая картинку.

Это не теория. Приёмы улучшения изображения перед кодированием – повышение резкости, контраста, выравнивание гистограммы – надёжно поднимают оценку VMAF, и как минимум один широко используемый режим кодировщика (tune=vmaf в libaom) показал, что бóльшую часть измеренного выигрыша берёт повышением резкости кадра до сжатия, а не лучшим сжатием. Netflix построил вторую модель, VMAF-NEG (No Enhancement Gain), специально чтобы вычесть такую накрутку и сообщить более консервативную оценку; статья про VMAF-NEG разбирает её подробно. И честность идёт ещё на уровень глубже: исследование, поставившее цель «взломать» и VMAF, и VMAF-NEG, нашло препроцессинг, который обманывает даже модель без выигрыша от улучшений. Урок не в том, что VMAF сломан, – а в том, что любую цель можно накрутить, поэтому метрика должна оставаться измерением, а не задачей.

Рисунок 4. Повысьте резкость до кодирования – и VMAF растёт, а картинка нет. Когда мера становится целью, она перестаёт измерять – поэтому и существует консервативная модель VMAF-NEG.

Когда метрика и внимательный человеческий просмотр расходятся, побеждает человек. Метрика не вскрыла скрытую истину; она провалилась на этом контенте, и субъективный результат – это та истина, которую она всегда пыталась приблизить.

Четыре метрики рядом

Поскольку это раздел, честный к измерению, таблица называет не только то, что измеряет каждая метрика, но и где она врёт. «Лучшей» метрики нет; каждая – инструмент с задокументированной слепой зоной.

МетрикаЧто измеряетЧто может сказатьГде врёт (слепая зона)
PSNR (дБ)Попиксельную ошибку против оригинала, в децибелахБыстрая проверка точности; большие провалы – реальное повреждениеСлабая корреляция с глазом; все ошибки пикселей равны, структура игнорируется – высокий PSNR может выглядеть плохо
SSIM (0–1)Структурное сходство – яркость, контраст, структуруСледует восприятию гораздо лучше PSNRОдномасштабна; пропускает часть движения и цвета; не на перцептивной шкале 0–100
VMAF (0–100)Слитые фичи, обученные предсказывать мнение людейИндустриальный стандарт для ранжирования стриминговых энкодовБандинг, цвет, зерно, временно́е мерцание, потери пакетов; нужна верная модель; накручивается улучшением
No-reference (по-разному)Качество по испорченному видео без оригиналаЕдинственный вариант для live и UGC без референсаСигнал тренда, не абсолютная истина; корреляция слабее, чем у full-reference

Таблица 1. Правый столбец – тот, что большинство статей опускает. Выбрать хорошо – значит подобрать метрику под задачу и знать её слепую зону до того, как назвать оценку.

Как держать метрику честной

Дисциплина, вытекающая из всего этого, коротка, и именно она отличает измерение от театра измерения. Всегда называйте метрику вместе с её моделью и методом свёртки – «VMAF 93, дефолтная модель, свёртка по гармоническому среднему» – никогда голое число. Сообщайте статистику худшего кадра (5-й перцентиль или минимум) рядом со средним, чтобы плохая сцена не спряталась. Держите каждое сравнение «яблоки к яблокам»: то же разрешение, те же кадры, тот же референс, та же модель, та же свёртка. Прикладывайте доверительный интервал, когда разрыв между двумя энкодами мал. И выборочно сверяйтесь с человеческими глазами, особенно на контенте, на котором метрику не учили. Число, прошедшее все пять проверок, можно класть на стол владельцу бюджета; число, их пропустившее, – это мнение в белом халате.

Живое доказательство: метрики эволюционируют из-за своих слепых зон

Лучшее свидетельство того, что эти ограничения реальны, – что отрасль чинит их публично. В июне 2026 Netflix выпустил VMAF v1, новое поколение моделей, построенное, чтобы закрыть ровно названные выше пробелы: оно интегрирует Contrast-Aware Multiscale Banding Index (CAMBI), чтобы наконец ловить бандинг, добавляет фичи цветовых каналов, чтобы метрика видела цветовые артефакты, к которым раньше была слепа, и убирает тяжёлую фичу VIF ради скорости. Это система, работающая как должно: слепые зоны задокументированы, затем устранены инженерно, а новое поколение наследует новый набор ограничений, о которых нужно быть честным. Метрика никогда не закончена – и это самое важное, чего она не может сказать о себе сама.

Где здесь Фора Софт

Фора Софт делает видеософт с 2005 года – стриминг, OTT и интернет-ТВ, видеоконференции, e-learning, телемедицину и видеонаблюдение – и привычка, которая держит наши заявления о качестве надёжными, ровно та, за которую ратует эта статья: мы относимся к каждой метрике как к прокси и называем её ограничения вслух. Когда мастер-файл есть, мы измеряем full-reference VMAF при заявленной модели и свёртке и сообщаем перцентиль худшего кадра рядом со средним, чтобы одна плохая сцена не прошла ворота качества. Когда референса нет – живой конференц- или surveillance-поток – мы опираемся на no-reference сигналы и читаем их как тренды, а не вердикты. Наша методология бенчмарков документирует модель, свёртку и условия за каждым числом, чтобы клиент видел не только что мы измерили, но и чего измерение увидеть не смогло.

Чтобы идея худшего кадра оказалась в ваших руках, мы собрали небольшую проверку отчёта метрики – направьте её на покадровый лог VMAF или PSNR, и она напечатает среднее, гармоническое среднее, медиану, перцентили худших 5%/10% и минимум рядом, а затем покажет, насколько среднее сидит выше худших кадров, чтобы названное вами число было честным.

Ключевые выводы

  • Метрика – обученный прокси для мнения людей: прогноз с интервалом ошибки, а не истина.
  • Метрики надёжны для ранжирования, ловли регрессий и трендов, пока сравнения «яблоки к яблокам».
  • Одно число прячет худшие кадры; всегда сообщайте и перцентиль худшего кадра.
  • Метрики тихо проваливаются на необученном контенте: бандинг, цвет, зерно, временны́е артефакты.
  • У оценки VMAF нужно назвать модель и свёртку, а до малых разрывов – приложить интервал.
  • Оптимизируйте под зрителя, а не под метрику – накрутить можно любую цель.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.