Содержание статьи +
- Кратко
- Почему это важно
- Эталон истины – это панель людей
- Поучительная история: год, когда никто не обыграл PSNR
- Три вопроса, которые задаёт любая валидация
- Шаг, о котором все забывают: кривая подгонки
- Считаем согласие вручную
- Стандартные тестовые базы
- Почему громкая корреляция не переносится на ваш контент
- Статистики валидации одним взглядом
- Как читать заявление о валидации метрики
- При чём здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
Любая объективная метрика качества видео – PSNR, SSIM, VMAF – это прогноз того, что сказала бы комната живых людей, и единственный способ узнать, хорош ли прогноз, – сравнить его с реальными оценками людей на базе тестовых клипов. Это сравнение делают тремя семействами статистик: ранговая корреляция (SROCC Спирмена) показывает, упорядочивает ли метрика клипы так же, как люди; линейная корреляция (PCC Пирсона) плюс среднеквадратичная ошибка (RMSE) – насколько близко она попадает в сами оценки после шага подгонки; а доля выбросов – насколько часто метрика расходится с людьми сильнее, чем люди расходились между собой. Эта процедура стандартизирована в ITU-T P.1401. Подвох, о котором забывает каждая команда: громкое число вроде «VMAF коррелирует с мнением людей на 0,94» измерено на чужом контенте и не переносится автоматически на ваш. Статья объясняет каждую статистику простыми словами, проводит расчёт корреляции вручную и показывает, почему метрика, провалидированная на стриминговом сжатии, может тихо вводить вас в заблуждение на вашем собственном материале.
Почему это важно
Если вы читаете громкую корреляцию метрики и считаете, что она верна для вашего контента, вы доверяете числу, которое никогда не проверяли ни на чём похожем на то, что вы отдаёте в продакшн. Метрика «точна» только относительно конкретного набора клипов, искажений, экранов и зрителей – поменяйте любое из этого, и согласие с мнением людей может резко упасть. Статья – для видеоинженера, лида по кодированию или QA-инженера, кто докладывает числа VMAF или SSIM и хочет знать, насколько им верить, как создатели метрики доказали, что она работает, и как проверить это доказательство на своём кейсе. Она предполагает, что с самими метриками вы уже знакомы; короткий обзор на стороне кодировщика – в обзоре метрик качества раздела Video Encoding, а эта статья – глубокая проработка валидации за каждым таким числом.
Эталон истины – это панель людей
Начнём с того, что любая метрика пытается имитировать. Единственная прямая мера качества видео – показать клипы людям и попросить оценить каждый, затем усреднить оценки в одно число – Mean Opinion Score, или MOS, среднюю оценку панели зрителей, обычно по шкале 1–5, где 5 – отлично. Близкий родственник, Differential MOS (DMOS), оценивает, насколько хуже сжатый клип выглядел по сравнению с исходным оригиналом. Оба берутся из аккуратно проведённого субъективного теста – темы статей почему субъективное тестирование – это эталон истины и MOS, DMOS и шкалы оценки.
Объективная метрика – это программа, которая пытается предсказать тот самый MOS без панели. В этом вся её работа. PSNR – Peak Signal-to-Noise Ratio, децибельная мера пиксельной ошибки из статьи PSNR простыми словами – предсказывает его плохо. VMAF – Video Multimethod Assessment Fusion, обученная Netflix оценка из VMAF простыми словами – предсказывает хорошо, потому что её этому обучили. Разница между «плохо» и «хорошо» – не мнение. Это измерение, и измерить его – и значит провалидировать.
Так что вопрос «хороша ли метрика?» на самом деле и есть вопрос, на который отвечает вся статья: насколько близко числа метрики повторяют оценки, которые живые люди поставили тем же клипам? Думайте об этом как об оценке синоптика. Вы не судите прогноз по тому, как уверенно он звучит; вы ждёте реальной погоды и проверяете, как часто прогноз совпал. Метрика – это синоптик, человеческий MOS – реальная погода, а валидация – это ведение счёта.
Поучительная история: год, когда никто не обыграл PSNR
Перед статистиками – история, объясняющая, почему отрасль так серьёзно относится к валидации. В 1999 году Video Quality Experts Group (VQEG) – сообщество исследователей и инженеров индустрии, проводящее формальные валидации метрик – собрала лучшие full-reference модели качества того времени и проверила их на свежих оценках людей для телевизионного контента. Финальный отчёт, утверждённый в июне 2000 года, дал отрезвляющий результат: из девяти представленных моделей семь или восемь работали примерно одинаково, и все они работали примерно как обычный PSNR (VQEG FRTV Phase I Final Report, 2000).
Вдумайтесь. Самые изощрённые перцептивные алгоритмы эпохи статистически предсказывали мнение людей не лучше формулы, которая просто считает пиксельные ошибки. Международный союз электросвязи заключил, что точности недостаточно, чтобы стандартизировать хоть одну из них.
В том отчёте спрятан и второй урок, и он важнее первого. VQEG позже установила, почему тест не смог разделить модели: тестовые клипы охватывали слишком узкий диапазон качества, так что разброса в оценках людей не хватало, чтобы отличить хорошую метрику от плохой (VQEG FRTV Phase I, описание проекта). Валидация различает ровно настолько, насколько различим контент, на котором вы валидируете, – мысль, которая жёстко вернётся, когда мы спросим, переносится ли корреляция на ваш материал. Дисциплина валидации метрик и современные метрики, наконец обыгравшие PSNR, выросли прямо из умения провести тот тест правильно.
Три вопроса, которые задаёт любая валидация
Хорошая валидация оценивает метрику по трём отдельным вопросам. Фреймворк VQEG и контролирующий стандарт ITU-T P.1401 (2020) – «Methods, metrics and procedures for statistical evaluation, qualification and comparison of objective quality prediction models» – называют их монотонностью, точностью и согласованностью. Держите их раздельно: метрика может пройти один и провалить другой.
Монотонность – ставит ли клипы в правильном порядке? Самый снисходительный вопрос. Забудьте точные числа; просто спросите, действительно ли клип, которому метрика поставила выше, понравился людям больше. Если метрика ранжирует десять клипов в том же порядке, что и люди, она идеально монотонна – даже если её числа в совершенно другой шкале. Статистика здесь – Spearman Rank-Order Correlation Coefficient (SROCC), корреляция, вычисленная по рангам оценок, а не по самим оценкам. SROCC лежит в диапазоне от −1 до 1; 1 означает идентичный порядок.
Точность – насколько близки числа? Вопрос построже. Здесь важно, попадает ли оценка метрики, скажем 80, туда, где должен быть MOS 4,0, а не только то, что «больше значит лучше». Эту работу делят две статистики. Pearson Linear Correlation Coefficient (PCC) – обычная корреляция, измеряющая, насколько хорошо точки жмутся к прямой – лежит от −1 до 1, где 1 – идеальная линейная связь. RMSE (Root-Mean-Square Error) – типичный размер зазора между предсказанной и реальной оценкой, в собственных единицах оценки – равен 0 при идеальном прогнозе и растёт с ростом ошибок.
Согласованность – насколько часто она сильно расходится? Самый практичный вопрос. У метрики может быть приличная средняя ошибка, и при этом она запорет один клип из двадцати настолько, что ошибка станет опасной. Это ловит Outlier Ratio (OR), доля выбросов: доля клипов, где ошибка метрики оказалась больше собственной неопределённости людей на этом клипе – а именно больше 95-процентного доверительного интервала MOS (ITU-T P.1401, 2020). Низкая доля выбросов означает, что метрика редко вас удивляет.
Шаг, о котором все забывают: кривая подгонки
Вот тонкость, отделяющая аккуратную валидацию от небрежной. Нельзя считать корреляцию Пирсона или RMSE напрямую между оценкой VMAF (0–100) и MOS (1–5) – шкалы не совпадают, и метрика может предсказывать мнение людей идеально, живя при этом на совсем другой числовой прямой. Поэтому перед расчётом статистик точности сначала растягивают и изгибают оценки метрики на шкалу MOS гладкой, сохраняющей порядок кривой.
Эта кривая – монотонное отображение, и стандартный выбор – пятипараметрическая логистическая функция, рекомендованная литературой по валидации и стандартом ITU-R BT.500 (субъективная оценка). Выглядит так:
Q(s) = γ1 · logistic(γ2 · (s − γ3)) + γ4 · s + γ5Вы подбираете пять параметров γ так, чтобы отображённые оценки метрики Q(s) сидели как можно ближе к человеческому MOS, затем считаете PCC и RMSE по отображённым значениям. Подгонка лишь растягивает шкалу; она никогда не меняет порядок клипов. Поэтому SROCC вообще не требует подгонки – ранги переживают любое монотонное растяжение, – а PCC и RMSE требуют всегда. Если вы видите число Пирсона, доложенное без упоминания подгонки, отнеситесь к нему с подозрением: автор мог скоррелировать сырой VMAF с сырым MOS и получить обманчиво низкий результат или пропустил шаг, который прячет реальный.
Практическое следствие: SROCC и PCC отвечают на по-настоящему разные вопросы, и метрика может набрать высоко по одной и ниже по другой. Высокий SROCC при более низком PCC означает «порядок верный, но расстановка сбита» – частое явление и обычно нормальное для ранжирования кодеков. Расчёт ниже показывает ровно этот узор.
Считаем согласие вручную
Числа всё проясняют. Пусть вы измерили пять сжатых клипов, у каждого – оценка VMAF и человеческий MOS от панели:
| Клип | VMAF (0–100) | Человеческий MOS (1–5) |
|---|---|---|
| A | 60 | 2,0 |
| B | 70 | 2,8 |
| C | 80 | 3,3 |
| D | 88 | 4,0 |
| E | 95 | 4,6 |
Пирсон PCC. Формула – ковариация двух столбцов, делённая на произведение их стандартных отклонений:
PCC = Σ(xᵢ − x̄)(yᵢ − ȳ) / √[ Σ(xᵢ − x̄)² · Σ(yᵢ − ȳ)² ]Сначала средние: x̄ = (60+70+80+88+95) / 5 = 78,6, и ȳ = (2,0+2,8+3,3+4,0+4,6) / 5 = 3,34. Теперь отклонения каждого клипа и их произведения:
Клип dx=x−78,6 dy=y−3,34 dx·dy dx² dy²
A −18,6 −1,34 24,92 345,96 1,796
B −8,6 −0,54 4,64 73,96 0,292
C 1,4 −0,04 −0,06 1,96 0,002
D 9,4 0,66 6,20 88,36 0,436
E 16,4 1,26 20,66 268,96 1,588
сумма 56,38 779,20 4,112Подставляем три суммы:
PCC = 56,38 / √(779,20 × 4,112)
= 56,38 / √3204,07
= 56,38 / 56,60
≈ 0,996PCC 0,996 – почти 1 – говорит, что метрика и панель движутся вместе почти линейно.
Спирмен SROCC. Замените каждое значение его рангом. Ранги VMAF для A–E – 1, 2, 3, 4, 5; ранги MOS – тоже 1, 2, 3, 4, 5, потому что клип, которому метрика поставила выше всех, – тот же, которому выше всех поставили люди, и так до конца. Ранжирования идентичны, значит SROCC = 1,0 ровно.
Прочтите два результата вместе. SROCC – идеальная 1,0: метрика упорядочила каждый клип так же, как люди, – а PCC = 0,996, чуть меньше 1, потому что связь не идеально прямая (скачок MOS от клипа A к B больше, чем подсказывает зазор VMAF). Этот разрыв между идеальной ранговой корреляцией и почти идеальной линейной – повседневная подпись того, что монотонность проходит, а линейность чуть несовершенна. На пяти аккуратных точках разница крошечная; на реальной базе из сотен клипов именно здесь живут интересные расхождения.
Стандартные тестовые базы
Нельзя провалидировать метрику на пяти выдуманных клипах. Нужна база: большой набор исходных видео, каждое испорчено многими контролируемыми способами, каждый испорченный клип несёт MOS из реального субъективного теста. Несколько публичных баз – общие эталоны отрасли.
LIVE Video Quality Database, построенная в Техасском университете в Остине, – классический референс: десять исходных сцен, 150 искажённых видео, каждое оценили около 29 зрителей, а DMOS вычислили после отсева ненадёжных оценщиков (Seshadrinathan, Soundararajan, Bovik, Cormack, IEEE Transactions on Image Processing, 2010). Netflix публикует датасет NFLX, на котором разрабатывали VMAF, а другие лаборатории ведут CSIQ, серию TID и набор 4K AVT-VQDB-UHD-1, использованный для валидации битстрим-моделей в за пределами VMAF. Каждая связывает человеческие оценки с клипами, которые их заслужили, – ровно то, что нужно валидации.
На своих домашних базах VMAF показывает сильные числа. Netflix сообщил о корреляции Пирсона 0,963 на собственном наборе NFLX-TEST и 0,939 на наборе VQEGHD3 (приведено в Rassool, RealNetworks, 2017). Независимое воспроизведение от RealNetworks – кодирование отдельного 4K-набора другим кодеком и сбор свежих субъективных оценок по двойному стимулу ITU-R BT.500 – измерило корреляцию Пирсона 0,948 между VMAF и DMOS, подтвердив со стороны, что метрика хорошо повторяет мнение людей (Rassool, RealNetworks, 2017). Это и есть числа, которые приводят как «точность» метрики.
Одно правило управляет всеми: метрику нужно валидировать на контенте, на котором её не обучали. VMAF, P.1204.3 и любая обучаемая метрика настраивают параметры на каких-то клипах; проверка на тех же клипах раздувает результат. VQEG сделала это формальным условием – модели, обученные на датасете, нельзя сравнивать с моделями, которые на нём не обучались, потому что сравнение бессмысленно (VQEG FRTV Phase I, описание проекта). Читая корреляцию, первым делом спросите, какие клипы её дали и видела ли их метрика раньше.
Почему громкая корреляция не переносится на ваш контент
Теперь честная часть и причина, по которой эта статья существует. «VMAF коррелирует с мнением людей на 0,95» – это правда, условная и часто употребляемая неправильно. Те 0,95 измерены на конкретной базе – конкретные сцены, конкретные искажения, конкретные условия просмотра, конкретный пул зрителей. Ваш контент – ничто из этого. Корреляция – это свойство метрики и тестового набора вместе, а не метрики самой по себе.
Несколько сил тянут согласие вниз на незнакомом контенте. Самая ясная – тип контента: метрика, обученная на профессионально снятом, испорченном сжатием стриминговом видео, никогда не училась артефактам записи экрана, анимации, тяжёлого киношного зерна или трясущегося пользовательского видео, и её прогнозы на них уплывают. Каталог слепых зон в где объективные метрики врут – это длинная версия данного абзаца.
Вторая сила – сужение диапазона, та же ловушка, что победила первый тест VQEG. Корреляции нужен разброс. Если каждый ваш клип сидит между MOS 4,0 и 4,6, оценки людей почти не меняются, и даже отличная метрика покажет слабую корреляцию просто потому, что отслеживать почти нечего. Низкая корреляция на наборе с узким качеством – не всегда вина метрики; это может быть устройство вашего теста.
Третья – сами условия просмотра и панель. Корреляция, измеренная на калиброванном референсном мониторе с фиксированной дистанцией и отобранными опытными зрителями, может не пережить телевизор в гостиной, телефон в электричке или краудсорсинговую панель, оценивающую клипы на том устройстве, что у неё есть. А воспроизведение RealNetworks вскрыло направленное смещение, которое стоит помнить: на их 4K-наборе VMAF завышал субъективное качество примерно в 85% случаев, при RMSE 12,7 пункта VMAF (Rassool, RealNetworks, 2017) – метрика обычно была оптимистична, а не симметрична. Единственное число корреляции полностью прячет такой крен; доверительные интервалы из VMAF в деталях – это то, как вернуть его на место.
«Частая ошибка: приводить одну корреляцию как вердикт метрики повсюду. Строка вроде «мы используем VMAF, потому что он коррелирует с MOS на 0,95» – половина фразы. Корреляция с какой базой, при какой подгонке, против каких зрителей, на каком диапазоне качества – и значима ли вообще разница между 0,95 и 0,93 у соперника? ITU-T P.1401 задаёт тест значимости (преобразование Фишера z над корреляциями) именно потому, что две близкие корреляции при данном размере выборки часто неразличимы. Доложите базу, подгонку и доверительный интервал – или не докладывайте ничего.»
Статистики валидации одним взглядом
Соберём четыре основные статистики в одном месте. Важнее всего два последних столбца: что каждая на самом деле измеряет и где она может ввести в заблуждение, если читать её в одиночку.
| Статистика | Диапазон | Что измеряет | Где врёт / слепая зона |
|---|---|---|---|
| SROCC (ранг Спирмена) | −1…1 | Монотонность – порядок клипов как у людей? | Игнорирует расстановку; ранг верен, но шкала сбита; нечувствительна к постоянному смещению |
| PCC (линейный Пирсон) | −1…1 | Точность линейной подгонки после монотонного отображения | Требует шага подгонки; чувствительна к выбросам; узкий диапазон занижает её |
| RMSE | от 0 вверх (единицы MOS) | Типичный размер ошибки прогноза | Усредняет редкие крупные промахи; зависит от шкалы, поэтому несравнима между метриками |
| Outlier Ratio | 0…1 | Согласованность – доля ошибок за 95% CI людей | Зависит от того, насколько узки доверительные интервалы субъективного теста |
Читайте это как коллегию судей, а не один вердикт. Заслуживающая доверия валидация докладывает несколько таких вместе, с названной базой и методом подгонки, потому что у каждой по отдельности есть способ незаслуженно польстить метрике или наказать её.
Как читать заявление о валидации метрики
Собирая всё вместе, вот чек-лист скептика для любого заявления «эта метрика коррелирует с мнением людей на X». Первое: какая база дала число и похож ли тот контент на ваш? Второе: обучали ли метрику на нём – если да, число раздуто. Третье: какая это статистика – ранговая корреляция прощает ошибки шкалы, которые обнажила бы Пирсон. Четвёртое: применяли ли подгонку перед числом Пирсона или RMSE. Пятое: каков был диапазон качества – высокая корреляция на широком диапазоне куда убедительнее того же числа на узком. Шестое: значима ли разница с соперником или это шум. Заявление, пережившее эти шесть вопросов, заслуживает доверия; то, что от них уклоняется, – маркетинг. Решение, какую метрику взять, когда числам уже веришь, – тема статьи выбор правильной метрики под задачу.
При чём здесь Фора Софт
Фора Софт строит видеософт с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицина и видеонаблюдение, – и причина, по которой мы относимся к валидации как к первоклассному шагу, в том, что наш контент редко совпадает с базами, на которых настраивали публичные метрики. Видеонаблюдение, конференц-видео и пользовательские e-learning клипы несут артефакты и диапазоны качества, против которых стриминг-обученную метрику никогда не валидировали, так что заимствованная корреляция говорит нам мало. Когда число важно, мы подтверждаем метрику небольшой субъективной панелью на собственном контенте клиента, прежде чем доверить ей гейт релиза, и записываем базу, метод подгонки и доверительный интервал за каждой цифрой в нашей методологии бенчмарков. Так число качества остаётся измерением, а не обнадёживающей догадкой.
Ключевые выводы
- Любая объективная метрика – прогноз человеческого MOS; валидация измеряет, насколько прогноз хорош.
- Три вопроса: монотонность (SROCC), точность (PCC и RMSE), согласованность (доля выбросов) – по ITU-T P.1401.
- PCC и RMSE требуют сначала монотонной кривой подгонки; SROCC, работая по рангам, – нет.
- В 2000 году VQEG не нашла модели, обыгравшей PSNR, – строгая валидация родилась из этого провала.
- Громкая корреляция принадлежит метрике и её базе; на ваш контент она переноситься не обязана.
- Всегда спрашивайте: какая база, обучали или нет, какая статистика, какой диапазон и значима ли разница.