Содержание статьи +
- Кратко
- Почему это важно
- Любая метрика – это догадка о людях
- Что значит «качество», когда вы измеряете его правильно
- Почему любая метрика в итоге склоняется перед панелью
- Что делает это тестом, а не «прогоном на глазок»
- Арифметика: почему пять зрителей не решат вопрос
- Когда тест действительно нужен
- Стандарты, которые делают результат защищённым
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Кратко
Любая объективная метрика качества видео – PSNR, SSIM, VMAF – это машинный прогноз того, что сказали бы люди, и единственный способ узнать настоящий ответ – показать видео людям и спросить их в контролируемых условиях, а затем усреднить оценки в Mean Opinion Score (MOS). Это аккуратно проведённое измерение и есть субъективный тест, и именно он – эталонная истина, против которой обучают и валидируют каждую метрику; когда метрика и правильно проведённая панель расходятся, права панель. Подвох в том, что «я показал команде, и им понравилось» – это не субъективный тест: слишком мало зрителей, не те зрители, нет контролируемой среды, нет шкалы оценки и нет статистики, поэтому он не может сказать, действительно ли один энкод лучше другого. Эта статья объясняет, что такое субъективный тест на самом деле, почему он стоит выше любой метрики, когда он вам действительно нужен, и показывает – с арифметикой – почему пять коллег никогда не решат вопрос, который решают двадцать четыре отобранных зрителя.
Почему это важно
Если вы отдаёте видео в продакшн, рано или поздно какое-то число что-то решает: какой энкодер купить, стал ли новый ladder выглядеть хуже, реальна ли регрессия качества. Чаще всего это число вы читаете с объективной метрики, и чаще всего это нормально – но метрике можно доверять только потому, что кто-то когда-то сверил её с мнением людей на контенте вроде вашего. Статья – для видеоинженера, лида по кодированию, QA-инженера или продакт-оунера, кому нужно понимать, откуда берётся эталонная истина, когда метрика стоит на прочной валидации, а когда гадает, и как провести тест с людьми, который решает вопрос, неподвластный метрике. Это вводная статья нашего блока о субъективном тестировании; короткая версия для оператора энкодера – в обзоре субъективного тестирования раздела Video Encoding, а всё здесь – глубокая проработка за ней.
Любая метрика – это догадка о людях
Начнём с того, что легко забыть, глядя на оценку VMAF. Качество видео – не физическое свойство файла, как его битрейт или разрешение. Качество – это суждение, которое возникает в голове человека: выглядит ли картинка хорошо для того, кто её смотрит. Нет прибора, измеряющего «выглядит хорошо» напрямую, как термометр измеряет температуру. Единственное прямое показание – спросить людей.
Поэтому отрасль построила прокси. PSNR – Peak Signal-to-Noise Ratio, децибельная мера того, насколько сжатый кадр отличается от оригинала попиксельно, из статьи PSNR простыми словами – это прокси. SSIM – индекс структурного сходства (Structural Similarity), сравнивающий структуру двух кадров, из SSIM простыми словами – прокси получше. VMAF – Video Multimethod Assessment Fusion, обученная Netflix оценка из VMAF простыми словами – прокси, обученный прямо имитировать оценки людей. Каждый из них – программа, чья единственная задача – предсказать, что сказала бы комната людей, без самой комнаты.
Это делает комнату эталонной истиной. «Эталонная истина» (ground truth) – заимствованный из геодезии термин для реального измерения, с которым сверяют всё остальное: показание, которому верят, когда оценки расходятся. В качестве видео эталонная истина – это аккуратно проведённая панель зрителей-людей, и каждую метрику судят по тому, насколько точно она воспроизводит то, что сказала панель. Думайте об объективной метрике как о синоптике, а о панели людей – как о реальной погоде: вы не оцениваете прогноз по тому, как уверенно он звучит, вы ждёте реального неба и ведёте счёт.
Что значит «качество», когда вы измеряете его правильно
Прежде чем идти дальше, зафиксируем число, которое выдаёт панель. Когда зрители оценивают клип, вы собираете по одной оценке с каждого и усредняете их. Это среднее – Mean Opinion Score, или MOS: средняя оценка панели зрителей за клип, обычно по пятибалльной шкале, где 5 – отлично, а 1 – плохо. MOS 4,3 означает, что средний зритель поставил клип между «хорошо» и «отлично». Это центральный результат почти любого субъективного теста и тема отдельной статьи MOS, DMOS и шкалы оценки.
MOS никогда не сообщают в одиночку. Люди расходятся во мнениях, поэтому оценки разбросаны, и этот разброс говорит, насколько доверять среднему. MOS 4,3 от зрителей, поставивших все 4 или 5, надёжен; MOS 4,3 от зрителей, разделившихся между 2 и 5, почти бессмыслен. Разброс выражают доверительным интервалом – небольшим диапазоном ±, прикреплённым к каждому MOS, – и его арифметика, разобранная ниже, отличает реальное измерение от поднятия рук.
Почему любая метрика в итоге склоняется перед панелью
Вот отношение, которое определяет весь этот раздел. У объективной метрики нет самостоятельного авторитета. Она зарабатывает доверие ровно одним способом: её показывают согласующейся с оценками людей на базе клипов – процесс, который называют валидацией и подробно разбирают в как объективные метрики валидируют против человеческих оценок. VMAF хорошо коррелирует с людьми, потому что Netflix обучил его на субъективных оценках, а затем сверил на отложенных. PSNR коррелирует плохо, потому что его вообще не строили под совпадение с восприятием. Разница между «хорошо» и «плохо» – не мнение, она измеряется против панелей людей.
У этого есть резкое следствие, удивляющее инженеров, новых в измерении: когда метрика и правильно проведённый субъективный тест расходятся, прав тест, а метрика ошибается. Не «по-своему права» – ошибается, на этом контенте. Метрика – это модель, и у каждой модели есть входы, на которых она проваливается. Классический случай – гладкое небо, которое сжатие ломает на видимые ступеньки (бандинг): зрители видят это мгновенно и снижают оценку, тогда как PSNR и даже VMAF едва это замечают, потому что попиксельное изменение крошечное. Метрика не нашла второе мнение – она пропустила артефакт. Панель – это апелляционный суд, над которым нет суда выше. Какие метрики на каком контенте проваливаются, каталогизировано в где врут объективные метрики, а более глубокое различие двух типов вопроса – в субъективное и объективное качество.
Что делает это тестом, а не «прогоном на глазок»
Если спросить людей – это эталонная истина, почему просто не спросить свою команду? Потому что ценность субъективного теста не в самом вопросе – она в контролях, которые делают ответ устойчивым. Уберите контроли – и останется анекдот. Шесть вещей превращают поднятие рук в измерение, и международные стандарты задают каждую. Видео регулируют два: ITU-T P.910 (10/2023), «Subjective video quality assessment methods for multimedia applications», и ITU-R BT.500-15 (05/2023), «Methodologies for the subjective assessment of the quality of television images».
Первый контроль – правильные зрители. Субъективный тест использует наблюдателей-неэкспертов: людей, которые не работают над качеством видео и не станут по привычке выискивать артефакты сжатия. Ваша команда кодирования – наихудшая возможная панель: они знают, что искать, знают, какой энкод новый, и хотят, чтобы он выиграл. ITU-T P.910 §10 требует наивных субъектов, отобранных по нормальному зрению, именно чтобы держать натренированный глаз и личную заинтересованность подальше от данных.
Второй – их достаточное число. У мнения одного человека нет погрешности. Стандарты ставят рабочий диапазон примерно в 4–40 наблюдателей, с практическим полом около 15 для устойчивого результата (ITU-T P.910, 2023; ITU-R BT.500-15). Пять коллег – ниже пола по построению, и арифметика ниже показывает, чего именно это стоит.
Третий – контролируемая среда. Дистанция просмотра, калибровка дисплея и освещение комнаты – всё это меняет то, что люди видят; BT.500-15 задаёт их так, чтобы оценка значила одно и то же от сессии к сессии. Четвёртый – заданный метод и шкала: фиксированная процедура показа клипов и подписанная шкала оценки (пятибалльная шкала Absolute Category Rating или шкала деградации), чтобы каждый зритель отвечал на один и тот же вопрос одинаково. Пятый – рандомизация: порядок клипов перемешивают для каждого зрителя, чтобы усталость и научение не наваливались на тот энкод, что оказался последним. Шестой – отбор и статистика: вы удаляете зрителей, чьи оценки внутренне противоречивы, а затем сообщаете каждый MOS с его доверительным интервалом. Пропустите любую из этих вещей – и результат перестаёт быть измерением.
«Частая ошибка: «я показал команде, и им понравилось». Это самый распространённый поддельный субъективный тест. Он проваливает минимум четыре из шести контролей разом – эксперты вместо наивных зрителей, их слишком мало, нет контролируемой среды и нет шкалы или статистики – и вдобавок команда обычно знает, какой клип новый энкод, что искажает ответ ещё до того, как кто-то посмотрит. Как смоук-тест на «не сломалось ли что-то очевидное» – годится. Как доказательство, что энкод B лучше энкода A, – бесполезно, потому что, как показывает следующий раздел числами, пять предвзятых зрителей не могут разделить два по-настоящему близких условия.»
Арифметика: почему пять зрителей не решат вопрос
Числа делают мысль неоспоримой. Допустим, вы выбираете между двумя настройками энкодера, A и B, и хотите знать, действительно ли B выглядит лучше. Вы проводите нормальный тест Absolute Category Rating: каждый зритель смотрит каждый клип и оценивает его от 1 до 5, а вы усредняете в MOS. Скажем, результаты вышли такими:
| Условие | MOS (1–5) | Станд. откл. оценок | Зрители (N) |
|---|---|---|---|
| Энкод A | 3,40 | 0,90 | 24 |
| Энкод B | 3,80 | 0,90 | 24 |
Средние различаются на 0,4, но одни средние ничего не доказывают – нужен доверительный интервал. ITU-R BT.500 даёт 95-процентный доверительный интервал для MOS как среднее плюс-минус допуск:
ε = 1,96 × ( S / √N )где S – стандартное отклонение оценок, а N – число зрителей. 1,96 – множитель, охватывающий 95% нормального распределения. Подставим числа энкода B:
ε = 1,96 × ( 0,90 / √24 )
= 1,96 × ( 0,90 / 4,899 )
= 1,96 × 0,1837
= 0,36Значит, энкод B получает 3,80 ± 0,36 – 95-процентный интервал [3,44, 4,16]. Энкод A с тем же разбросом и числом даёт ε = 0,36 тоже, интервал [3,04, 3,76]. Два интервала – [3,04, 3,76] для A и [3,44, 4,16] для B – перекрываются лишь в тонкой полосе от 3,44 до 3,76. Они соприкасаются, и перекрывающиеся доверительные интервалы сами по себе не доказывают, что энкоды равны; они означают, что средние оценены достаточно точно, и теперь настоящий вопрос разрешим. Поскольку одни и те же зрители оценили оба энкода, парный тест значимости – который сравнивает две оценки каждого зрителя и гасит его личную строгость – гораздо чувствительнее, чем подсказывают интервалы, и на разрыве в 0,4 балла, измеренном так точно, он почти наверняка подтвердит, что B лучше. Суть – в точности: ±0,36 – достаточно острая оценка, чтобы решить малую разницу.
Теперь проведём то же сравнение «способом команды» – с пятью зрителями вместо двадцати четырёх. Оставим всё остальное тем же:
ε = 1,96 × ( 0,90 / √5 )
= 1,96 × ( 0,90 / 2,236 )
= 1,96 × 0,4025
= 0,79Энкод B теперь 3,80 ± 0,79 – интервал [3,01, 4,59], а энкод A – 3,40 ± 0,79, интервал [2,61, 4,19]. Два интервала перекрываются почти полностью. Честный вывод из пяти зрителей – мы не можем отличить A от B, и не потому что энкоды одинаковы, а потому что тест был слишком мал, чтобы разрешить разницу. И это ещё оптимистичная версия: множитель 1,96 – это нормальное приближение, которое BT.500 использует по соглашению, но при всего пяти зрителях более строгий множитель для малой выборки – t-значение Стьюдента около 2,78, которое расширяет интервал энкода B до ±1,12 и растворяет сравнение целиком. Полная статистика этого – отсев выбросов, тест значимости и то, сколько зрителей вам реально нужно – тема статьи статистика субъективных данных.
Урок не в том, что «больше людей – приятнее». Он в том, что доверительный интервал масштабируется как 1/√N, поэтому сжатие панели расширяет неопределённость, пока два по-настоящему разных энкода не станут статистически неразличимы. Пять зрителей – это не маленький субъективный тест. Это не субъективный тест.
Когда тест действительно нужен
Проводить панель дорого по времени и координации, поэтому цель – не тестировать всё субъективно, а знать, когда метрики достаточно, а когда нет. Берите объективную метрику, а не панель, для повседневной работы, под которую метрику и валидировали: сравнение двух энкодов одного источника в одном разрешении, отслеживание регрессий в пайплайне или установка quality gate – всё в как выбрать правильную метрику. На масштабе метрика, которой вы доверяете, считается за миллисекунды на каждом ассете; панель – нет.
Берите субъективный тест в четырёх ситуациях. Первая – когда вы валидируете или калибруете метрику на своём контенте: если ваш материал не похож на стриминговые клипы, на которых обучали публичные метрики, единственный способ узнать, отслеживает ли VMAF ваших зрителей, – измерить оба и сравнить. Вторая – когда контент – известная слепая зона метрики: сильное зерно плёнки, склонные к бандингу градиенты, скринкасты, анимация или съёмка наблюдения в низком свете, где числу метрики верить меньше всего. Третья – когда решение дорогое или спорное: покупка кодека или энкодера, переделка ladder или спор о качестве с вендором, где ошибиться дороже, чем стоит тест. Четвёртая – когда нужен золотой эталон: небольшой, хорошо проведённый набор человеческих оценок, к которому можно привязать будущие автоматические проверки. Вне этого доверяйте провалидированной метрике и берегите панель для случаев, где метрика упирается в тупик.
Стандарты, которые делают результат защищённым
Контроли не нужно изобретать – они записаны, и ссылка на рекомендацию – это то, что делает результат защищённым перед придирчивым рецензентом. Вес для видео несут две рекомендации. ITU-T P.910 (10/2023) определяет методы тестов для мультимедийного видео: Absolute Category Rating (ACR), где зрители оценивают одиночные клипы по пятибалльной шкале; Degradation Category Rating (DCR), где они оценивают клип против его видимого оригинала; и Pair Comparison (PC), где выбирают лучший из двух. ITU-R BT.500-15 (05/2023) – давний компаньон со стороны вещания, задающий условия просмотра, шкалы оценки и арифметику доверительного интервала, которую вы только что видели. Какой метод под какую задачу – тема статьи методики тестирования: ACR, DCR, PC.
Две заметки о свежести важны, потому что стандарты двигаются, а метрика вашего уровня доверия ссылается на текущую редакцию. ITU-T P.913, прежняя рекомендация для тестов «в любой среде», была удалена в феврале 2024 года и влита в редакцию P.910 2023 года – так что P.910 (10/2023) теперь покрывает и тесты вне формальной лаборатории. А у краудсорсингового тестирования, где вы набираете большую удалённую панель через интернет, своя дисциплина: механизмы надёжности идут из ITU-T P.808 (изначально написанной для краудсорсингового качества речи), адаптированной к видео, а компромисс между скоростью толпы и контролем лаборатории разобран в краудсорсинговое субъективное тестирование. Ссылайтесь на редакцию, а не только на номер, каждый раз.
Где здесь Фора Софт
Фора Софт строит видеософт с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицина и видеонаблюдение – и причина, по которой мы относимся к субъективному тестированию как к эталонной истине, в том, что контент наших клиентов редко совпадает со стриминговыми клипами, на которых настраивали публичные метрики. Съёмка наблюдения в низком свете, видео конференции по потерянному каналу и пользовательские клипы для e-learning несут артефакты, против которых стриминговую метрику никогда не валидировали, так что заимствованное число VMAF может тихо ввести в заблуждение. Когда решение о качестве важно, мы сверяем метрику с небольшой, правильно отобранной панелью на собственном контенте клиента, прежде чем позволить ей закрывать релиз, и записываем метод, размер панели и доверительный интервал за каждой цифрой – дисциплина, описанная в нашей методологии бенчмарков. Так число качества остаётся измерением, а не обнадёживающей догадкой.
Главное
- Качество живёт в голове человека; любая объективная метрика лишь предсказывает, что сказала бы панель.
- Аккуратно проведённая панель даёт MOS и является эталонной истиной, против которой валидируют метрики.
- Когда метрика и правильно проведённый субъективный тест расходятся, прав тест.
- Настоящему тесту нужны наивные зрители, их достаточное число, контролируемая среда, шкала, рандомизация и статистика.
- «Я показал команде» проваливает большинство этих контролей и не может разделить близкие энкоды.
- Метрики – для повседневной работы; панель – для валидации, контента из слепых зон и дорогих решений.