Содержание статьи +
- Кратко
- Почему это важно
- Метрика – это прогноз, а не погода
- Что метрика может вам сказать
- Насколько велик «плюс-минус»? Разбор на числах
- Чего метрика вам сказать не может
- Самая глубокая ловушка: оптимизировать под метрику
- Четыре метрики рядом
- Как держать метрику честной
- Живое доказательство: метрики эволюционируют из-за своих слепых зон
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
Любая объективная метрика качества видео – это обученный прокси для мнения человека, поэтому она даёт вам прогноз с доверительным интервалом, а не истину; и в ту секунду, когда вы об этом забываете, число начинает врать. Метрика надёжно ранжирует два энкода, ловит регрессию и отслеживает тренд – пока вы держите сравнение «яблоки к яблокам»; но она не скажет сама по себе, будет ли доволен зритель, не найдёт худшие несколько секунд, которые он на самом деле запомнит, и не оценит контент и артефакты, на которых её не учили. Самая дорогая ошибка в измерении – оптимизировать под число вместо зрителя, потому что любую метрику можно накрутить приёмами, которые поднимают оценку, не улучшая картинку. Эта статья показывает, где именно проходит граница между тем, что число заслужило, и тем, что оно лишь делает вид, будто знает – с показанной вслух арифметикой доверительного интервала.
Почему это важно
Если вы вот-вот примете реальное решение по оценке качества – выпустить этот энкод, выбрать тот кодек, снизить этот битрейт – вы доверяете числу заменить собой тысячи человеческих глаз, и вам нужно точно знать, насколько далеко это доверие тянется. Статья написана для стриминг- или энкодинг-лида, QA-инженера и технического продакт-оунера, который уже начал измерять качество и теперь должен защищать результаты, не обманываясь ими. Её задача – провести границу: назвать те немногие работы, которые метрика делает хорошо, слепые зоны, которые топили реальные проекты, и дисциплину, которая держит число честным. Это проверка реальностью, на которую опирается весь остальной раздел – каждая статья про отдельную метрику – и та статья, которую перечитывают перед тем, как назвать оценку человеку, готовому потратить на неё деньги.
Метрика – это прогноз, а не погода
Начнём с одной мысли, на которой держится всё остальное. Объективная метрика качества – любой алгоритм, который читает два видео и печатает число (PSNR, SSIM, VMAF) – это модель, обученная предсказывать, что сказали бы люди, если бы их спросили. Истина качества видео – это субъективный тест: реальные зрители, контролируемые условия, оценка реальных клипов. Метрика – быстрый и дешёвый заместитель этой медленной и дорогой панели.
Это делает метрику прогнозом. Прогноз погоды по-настоящему полезен – вы берёте зонт, когда он обещает 80% дождя, – но вы никогда не путаете прогноз с небом. Метрика качества – объект того же рода: построенное предсказание мнения людей, с послужным списком, который можно проверить, и с ошибкой, которую она несёт в каждом отдельном показании. Когда метрика говорит «VMAF 93», на самом деле она говорит: «обученная модель предсказывает, что зрители оценили бы это примерно на 93, плюс-минус». Это «плюс-минус» – не сноска. Это и есть тема всей статьи.
Поскольку метрика – это предсказание, её можно оценить, и процедура оценки сама по себе стандарт. Рекомендация ITU-T P.1401 (2020) определяет, как оценивать объективную метрику по субъективным данным четырьмя числами: коэффициент корреляции Пирсона (PCC) – насколько линейно метрика следует мнению; ранговая корреляция Спирмена (SROCC) – верно ли она упорядочивает клипы; среднеквадратичная ошибка (RMSE) – насколько далеко промахиваются её прогнозы; и доля выбросов – как часто она ошибается сильнее, чем объясняет неопределённость самих людей. Запомните эти четыре слова: так дисциплина публично признаёт, что идеальной метрики нет.
Что метрика может вам сказать
Внутри своих границ метрика отрабатывает четыре задачи, и делает их лучше, чем могла бы позволить себе любая человеческая панель.
Она может ранжировать два энкода одного контента. Если клип A набирает VMAF 95, а клип B – 88, измеренные одинаково, A почти наверняка выглядит лучше; ранжирование – это именно то, на что метрики проверяют (это и измеряет SROCC). Она может поймать регрессию: когда вчерашний пайплайн давал VMAF 94 на референсном клипе, а сегодняшний даёт 81, что-то сломалось – и число нашло это, пока вы спали. Она может отслеживать тренд в масштабе, наблюдая за десятью тысячами ассетов или живым каналом во времени и помечая те, что дрейфуют. И она может дать защитимую цифру для отчёта или договора, потому что метод записан, а результат воспроизводится.
Обратите внимание на общую нить: каждая из этих задач – относительная или сравнительная. Метрика блистает, когда сравнивает подобное с подобным: тот же контент, то же разрешение, ту же модель, ту же свёртку. Это зелёная зона. Большинство провалов случается, когда число выносят за её пределы.
Насколько велик «плюс-минус»? Разбор на числах
Вот арифметика, которая делает доверительный интервал осязаемым – увидев её однажды, вы больше не прочитаете отдельную оценку VMAF так же. Начиная с версии 1.3.7 (июнь 2018), VMAF может сообщать 95%-й доверительный интервал – диапазон, отражающий уверенность модели – обучая множество моделей на пересемплированных данных (приём, называемый бутстрэпом) и наблюдая, насколько расходятся их прогнозы. Инструмент выдаёт оценку и стандартное отклонение этих моделей, а интервал получается из формулы в одну строку:
95% ДИ = оценка ± 1,96 × стандартное отклонение
Пример (из собственного вывода документации VMAF):
оценка = 75,4
стандартное отклонение = 1,31
поле = 1,96 × 1,31 = 2,57
95% ДИ = 75,4 − 2,57 до 75,4 + 2,57
= 72,9 до 77,4Прочитайте, что это значит. VMAF 75,4 на этом клипе на самом деле – «где-то между примерно 73 и 77 с 95% уверенностью». Поэтому если энкод A набирает 75, а энкод B – 77, метрика не может их различить: их интервалы полностью перекрываются. Считать разницу в два пункта VMAF реальной победой – значит читать шум как сигнал. Документация VMAF даже отмечает, что низкие оценки несут более широкий интервал, чем высокие, потому что обучающих данных было плотнее на верхнем конце – то есть метрика наименее уверена ровно там, где качество хуже всего и решения важнее всего.
«Частая ошибка: ранжировать энкоды по разнице меньше доверительного интервала. «Мы выбрали кодировщик B, он набрал на 0,6 VMAF больше» – это решение, принятое по шуму. Прежде чем объявлять победителя, проверьте, что разрыв превышает доверительный интервал (или проведите полноценный субъективный тест, когда разрыв мал, а ставки высоки). Метрика без приложенного интервала ошибки – это метрика, которой вы переплачиваете доверием.»
Чего метрика вам сказать не может
Теперь другая сторона границы. У оценки качества пять слепых зон, которые повторяются в реальных проектах, и назвать их – главная цель этой статьи.
1. Не скажет про худшие несколько секунд
Оценка на уровне клипа – это сводка сотен покадровых оценок, а сводка выбрасывает информацию. По умолчанию большинство инструментов, включая VMAF, сообщают среднее арифметическое покадровых оценок. Но сама документация VMAF предупреждает: люди взвешивают худшие моменты сильнее, чем простое среднее – один уродливый зависший кадр или замыленная сцена и есть то, что зритель запомнит, даже если все остальные кадры были безупречны. Среднее 92 может прятать пятисекундный отрезок на 60.
Вот почему свёртка – правило превращения покадровых оценок в одно число – важна не меньше самой метрики. Гармоническое среднее сильнее взвешивает низкие кадры; 5-й перцентиль прямо сообщает качество худших 5% кадров. Одно среднее число никогда добровольно не признается, что плохая сцена существует. О худшем кадре нужно спрашивать отдельно, а большинство команд не спрашивает.
2. Не оценит контент, на котором её не учили
Обученная метрика вроде VMAF знает то, чему её научил обучающий набор, а училась она в основном на обычном кодированном кино и ТВ – на артефактах сжатия и масштабирования. Выведите её на контент за пределами этого опыта, и прогноз деградирует – тихо, без флага тревоги. Самый явный случай – бандинг, видимые ступеньки там, где должно быть гладкое небо или градиент. Бандинг сидит на редких контурах, пока бóльшая часть кадра выглядит нормально, поэтому полнокадровая метрика его почти не замечает: по человеческим оценкам ранговая корреляция VMAF v0 на бандинге всего около 0,34, где 1,0 – идеал. Киношное зерно, текст с экрана, анимация и сильные цветовые (chroma) артефакты – похожие слабые места: VMAF v0 читает только канал яркости (luma), поэтому структурно слеп к чисто цветовому повреждению.
«Частая ошибка: доверять full-reference оценке на контенте, которого она не видела. Если вы измеряете анимацию, скринкаст, зернистое кино или что-то с сильными цветовыми сдвигами, дефолтное число VMAF – в лучшем случае образованная догадка. Проверьте метрику на образце вашего контента против человеческих глаз, прежде чем доверять ей по каталогу – см. как метрики валидируют по оценкам людей.»
3. Не скажет того, что её не валидировали говорить
Каждая перцептивная метрика закладывает предположения об условиях просмотра – размере экрана и дистанции – и оценка значит только то, что модель обучили значить. Документация VMAF даёт самый острый пример: посчитайте дефолтную модель на родном клипе 480p, и оценка вернётся неожиданно высокой, потому что модель фактически предполагает, что вы сидите достаточно далеко, чтобы кадр 480p выглядел как небольшой участок экрана 1080p. Документация прямо называет сравнение родной-480p и родной-1080p оценки «сравнением яблок с апельсинами». Отдельные модели для экранов 4K и для просмотра на телефоне существуют именно потому, что одна модель не может говорить за все условия. Возьмёте не ту модель – и число уверенно неверно.
4. Не увидит артефакты вне своего охвата
VMAF спроектирован для адаптивного стриминга, поэтому моделирует два вида повреждений: артефакты сжатия и масштабирования. Документация прямо говорит, что другие искажения – потери пакетов, ошибки передачи и подобное – «могут предсказываться неточно». Временны́е проблемы – тоже известная слабость: мерцание, гостинг и дёрганье (judder) живут в том, как кадры меняются во времени, а временна́я фича VMAF – базовая мера движения, которая их плохо ловит. No-reference живой поток со сбоем из-за потери пакетов всё ещё может показать здоровую full-reference оценку, потому что метрика не ищет рану такого рода.
5. Не скажет «достаточно ли это хорошо» сама по себе
Ранжирование надёжно; абсолютный вердикт – нет. FAQ VMAF отмечает, что сравнение видео с самим собой не возвращает даже идеальную 100 – вы получаете что-то вроде 98,7, потому что у предсказателя на машинном обучении остаточная ошибка есть везде. Поэтому «VMAF 93 – это хорошо» осмысленно только после того, как вы привязали – на вашем контенте и ваших устройствах – какая оценка соответствует качеству, которое ваши зрители принимают. Число – это показание термометра; комфортно ли в комнате, по-прежнему решаете вы.
Самая глубокая ловушка: оптимизировать под метрику
Есть ошибка хуже, чем неверно прочитать оценку: сделать оценку своей целью. Закон Чарльза Гудхарта в известной формулировке Мэрилин Стратерн предупреждает: «когда мера становится целью, она перестаёт быть хорошей мерой». Качество видео – учебный случай. Поскольку любая метрика – несовершенный прокси, между числом и восприятием всегда есть зазор; и всё, что вы делаете, чтобы гнаться за числом через этот зазор, улучшает оценку, не улучшая картинку.
Это не теория. Приёмы улучшения изображения перед кодированием – повышение резкости, контраста, выравнивание гистограммы – надёжно поднимают оценку VMAF, и как минимум один широко используемый режим кодировщика (tune=vmaf в libaom) показал, что бóльшую часть измеренного выигрыша берёт повышением резкости кадра до сжатия, а не лучшим сжатием. Netflix построил вторую модель, VMAF-NEG (No Enhancement Gain), специально чтобы вычесть такую накрутку и сообщить более консервативную оценку; статья про VMAF-NEG разбирает её подробно. И честность идёт ещё на уровень глубже: исследование, поставившее цель «взломать» и VMAF, и VMAF-NEG, нашло препроцессинг, который обманывает даже модель без выигрыша от улучшений. Урок не в том, что VMAF сломан, – а в том, что любую цель можно накрутить, поэтому метрика должна оставаться измерением, а не задачей.
Когда метрика и внимательный человеческий просмотр расходятся, побеждает человек. Метрика не вскрыла скрытую истину; она провалилась на этом контенте, и субъективный результат – это та истина, которую она всегда пыталась приблизить.
Четыре метрики рядом
Поскольку это раздел, честный к измерению, таблица называет не только то, что измеряет каждая метрика, но и где она врёт. «Лучшей» метрики нет; каждая – инструмент с задокументированной слепой зоной.
| Метрика | Что измеряет | Что может сказать | Где врёт (слепая зона) |
|---|---|---|---|
| PSNR (дБ) | Попиксельную ошибку против оригинала, в децибелах | Быстрая проверка точности; большие провалы – реальное повреждение | Слабая корреляция с глазом; все ошибки пикселей равны, структура игнорируется – высокий PSNR может выглядеть плохо |
| SSIM (0–1) | Структурное сходство – яркость, контраст, структуру | Следует восприятию гораздо лучше PSNR | Одномасштабна; пропускает часть движения и цвета; не на перцептивной шкале 0–100 |
| VMAF (0–100) | Слитые фичи, обученные предсказывать мнение людей | Индустриальный стандарт для ранжирования стриминговых энкодов | Бандинг, цвет, зерно, временно́е мерцание, потери пакетов; нужна верная модель; накручивается улучшением |
| No-reference (по-разному) | Качество по испорченному видео без оригинала | Единственный вариант для live и UGC без референса | Сигнал тренда, не абсолютная истина; корреляция слабее, чем у full-reference |
Таблица 1. Правый столбец – тот, что большинство статей опускает. Выбрать хорошо – значит подобрать метрику под задачу и знать её слепую зону до того, как назвать оценку.
Как держать метрику честной
Дисциплина, вытекающая из всего этого, коротка, и именно она отличает измерение от театра измерения. Всегда называйте метрику вместе с её моделью и методом свёртки – «VMAF 93, дефолтная модель, свёртка по гармоническому среднему» – никогда голое число. Сообщайте статистику худшего кадра (5-й перцентиль или минимум) рядом со средним, чтобы плохая сцена не спряталась. Держите каждое сравнение «яблоки к яблокам»: то же разрешение, те же кадры, тот же референс, та же модель, та же свёртка. Прикладывайте доверительный интервал, когда разрыв между двумя энкодами мал. И выборочно сверяйтесь с человеческими глазами, особенно на контенте, на котором метрику не учили. Число, прошедшее все пять проверок, можно класть на стол владельцу бюджета; число, их пропустившее, – это мнение в белом халате.
Живое доказательство: метрики эволюционируют из-за своих слепых зон
Лучшее свидетельство того, что эти ограничения реальны, – что отрасль чинит их публично. В июне 2026 Netflix выпустил VMAF v1, новое поколение моделей, построенное, чтобы закрыть ровно названные выше пробелы: оно интегрирует Contrast-Aware Multiscale Banding Index (CAMBI), чтобы наконец ловить бандинг, добавляет фичи цветовых каналов, чтобы метрика видела цветовые артефакты, к которым раньше была слепа, и убирает тяжёлую фичу VIF ради скорости. Это система, работающая как должно: слепые зоны задокументированы, затем устранены инженерно, а новое поколение наследует новый набор ограничений, о которых нужно быть честным. Метрика никогда не закончена – и это самое важное, чего она не может сказать о себе сама.
Где здесь Фора Софт
Фора Софт делает видеософт с 2005 года – стриминг, OTT и интернет-ТВ, видеоконференции, e-learning, телемедицину и видеонаблюдение – и привычка, которая держит наши заявления о качестве надёжными, ровно та, за которую ратует эта статья: мы относимся к каждой метрике как к прокси и называем её ограничения вслух. Когда мастер-файл есть, мы измеряем full-reference VMAF при заявленной модели и свёртке и сообщаем перцентиль худшего кадра рядом со средним, чтобы одна плохая сцена не прошла ворота качества. Когда референса нет – живой конференц- или surveillance-поток – мы опираемся на no-reference сигналы и читаем их как тренды, а не вердикты. Наша методология бенчмарков документирует модель, свёртку и условия за каждым числом, чтобы клиент видел не только что мы измерили, но и чего измерение увидеть не смогло.
Чтобы идея худшего кадра оказалась в ваших руках, мы собрали небольшую проверку отчёта метрики – направьте её на покадровый лог VMAF или PSNR, и она напечатает среднее, гармоническое среднее, медиану, перцентили худших 5%/10% и минимум рядом, а затем покажет, насколько среднее сидит выше худших кадров, чтобы названное вами число было честным.
Ключевые выводы
- Метрика – обученный прокси для мнения людей: прогноз с интервалом ошибки, а не истина.
- Метрики надёжны для ранжирования, ловли регрессий и трендов, пока сравнения «яблоки к яблокам».
- Одно число прячет худшие кадры; всегда сообщайте и перцентиль худшего кадра.
- Метрики тихо проваливаются на необученном контенте: бандинг, цвет, зерно, временны́е артефакты.
- У оценки VMAF нужно назвать модель и свёртку, а до малых разрывов – приложить интервал.
- Оптимизируйте под зрителя, а не под метрику – накрутить можно любую цель.