Субъективное и объективное качество видео

Автор: Николай СапуновОбновлено: август 202614 мин чтения
Содержание статьи +

Кратко

Субъективное качество – это то, что говорят реальные люди, когда смотрят видео; объективное качество – это число, которое алгоритм вычисляет из пикселей. Это два разных вопроса, и истина – только в первом: усреднённая оценка людей, Mean Opinion Score (MOS), и есть эталон, а каждая объективная метрика – PSNR, SSIM, VMAF – лишь быстрый суррогат, который строят и судят по тому, насколько хорошо он предсказывает этот эталон. Поэтому метрика и ваши глаза могут расходиться: когда это происходит, выигрывает корректно проведённый субъективный тест, а метрика просто наткнулась на свою слепую зону на этом контенте. Статья объясняет два вопроса, как на самом деле строится субъективная оценка, как метрики валидируют по ней и когда тянуться за каждой.

Почему это важно

Если вы делаете видео, вы будете жить по объективным метрикам – потому что только число масштабируется на тысячи кодировок, – но эти числа будут вас обманывать, пока вы не понимаете, что именно они замещают. Цифра на дашборде – это предсказание человеческого мнения, а не само мнение, и обучена она была на чужом контенте. Понимание разницы подсказывает, когда верить метрике, когда остановиться и провести настоящий субъективный тест и почему «поднять VMAF» – это не та же команда, что «сделать красивее». Это концептуальный шарнир, вокруг которого вращается весь раздел «Качество и измерение видео»: каждая метрика из блока объективных метрик и каждый метод из блока субъективного тестирования – одна из сторон этого разделения.

Два вопроса, а не два ответа на один

Когда кто-то спрашивает «а это видео хорошее?», он на самом деле спрашивает одно из двух, и эти вещи стоит держать порознь.

Первый вопрос – субъективный: сказали бы люди, которые это смотрят, что выглядит хорошо? Второй – объективный: когда формуле скармливают пиксели, выдаёт ли она высокое число? Это не два способа измерить одно и то же. Одно – факт о человеческом восприятии; другое – факт об алгоритме. Обычно они совпадают, в чём и весь смысл, – но это не одно и то же, и в зазоре между ними живут ошибки измерения.

Кухонная аналогия удерживает мысль на месте. Субъективный тест – это дегустационная панель: единственный способ узнать, вкусно ли блюдо, – аккуратно дать его людям и спросить. Объективная метрика – датчик, который за миллисекунды меряет сахар, соль и кислотность. Датчик быстрый, дешёвый и повторяемый, и он по-настоящему полезен – но лишь потому, что его настроили совпадать с дегустаторами. Дегустаторы – эталон; датчик – удобный заместитель. Забудьте об этом – и однажды оптимизируете рецепт, который датчик обожает, а гости отвергают.

Рис. 1. Одно видео, два вопроса. Ответ людей (MOS) – эталон; ответ алгоритма – суррогат, который заслуживает доверия лишь будучи провалидированным по нему.

Субъективное качество: эталон

Субъективное качество меряют единственным способом, которым восприятие вообще можно измерить напрямую, – спрашивая людей. В субъективном тесте люди смотрят клипы в контролируемых условиях и оценивают то, что видят, а оценки усредняют в одно число. Это число, Mean Opinion Score (MOS), – самое близкое к истине, что есть в области, потому что качество видео определяется теми, кто его смотрит.

Самый распространённый метод оценки – Absolute Category Rating (ACR), описанный в Рекомендации ITU-T P.910 (10/2023). Зритель видит один клип, затем оценивает его по пятибалльной шкале: 5 = отлично, 4 = хорошо, 3 = удовлетворительно, 2 = плохо, 1 = очень плохо. ACR популярен, потому что он быстрый – зритель успевает оценить много клипов за сессию, – хотя может пропускать мелкие искажения, которые поймал бы метод с прямым сравнением, поэтому существуют и другие методы (см. статью о методиках субъективных тестов).

Условия – не на коленке. Рекомендация ITU-R BT.500-15 (05/2023) фиксирует дисплей, дистанцию просмотра и освещение комнаты, чтобы оценка значила одно и то же от зрителя к зрителю. ITU-T P.910 рекомендует минимум 15 наблюдателей на тест, потому что мнение одного человека – это шум; сигнал проступает, только когда усредняешь достаточное их число. «Я показал команде, выглядело нормально» – это не субъективный тест, а анекдот с выборкой из трёх человек.

Поскольку отдельные мнения разбросаны, MOS идёт с доверительным интервалом, и сообщать этот интервал – не опция.

Рис. 2. Как строится субъективная оценка. Одно число 4.33 прячет, насколько зрители разошлись; 95% доверительный интервал делает этот разброс видимым.

Пройдём арифметику один раз. Пусть 15 зрителей оценивают один клип и их баллы в сумме дают 65. MOS – это среднее:

MOS = 65 ÷ 15 = 4.33

Но 4.33 – только половина ответа. Зрители не сказали все 4.33: кто-то сказал 5, кто-то 3, и этот разброс важен. Если взять стандартное отклонение 15 оценок (здесь около 0.62) и поделить на корень из размера выборки, получится стандартная ошибка примерно 0.16. Умножив на значение t-распределения Стьюдента для 14 степеней свободы (около 2.14), получаем 95% доверительный интервал около ±0.34:

95% CI = 2.14 × (0.62 ÷ √15) ≈ ±0.34   →   истинный MOS ≈ 3.99 … 4.67

Значит, честный результат – «MOS 4.33, 95% CI ±0.34», а не «MOS 4.33». Вторая кодировка с оценкой 4.5 не надёжно лучше этой, потому что их интервалы пересекаются. Доверительный интервал – то, что удерживает субъективный тест честным.

Стоит назвать одно уточнение. Когда под рукой есть нетронутый оригинал, можно провести ACR с скрытым эталоном (ACR-HR): зрители, не зная того, оценивают и оригинал, а вы вычитаете его балл из балла каждого клипа. Результат – Differential Mean Opinion Score (DMOS), который убирает то, что один исходник просто приятнее смотреть, и изолирует качество, потерянное в обработке. И MOS, и DMOS приходят от людей; DMOS лишь убирает смещение по контенту.

Загвоздка во всём этом – цена. Субъективному тесту нужны люди, контролируемая комната, аккуратный дизайн и статистика – он медленный и дорогой, и его нельзя запустить на каждую кодировку в пайплайне, который выдаёт тысячи в день. Эта цена и есть вся причина, по которой существует второй вид измерения.

Объективное качество: быстрый суррогат

Объективное качество меряет алгоритм, который читает пиксели и выдаёт число, без людей в цикле. Число, сравнивающее сжатый кадр с оригиналом пиксель за пикселем, называется PSNR (Peak Signal-to-Noise Ratio) и сообщает пиксельную ошибку в децибелах. Метрика, которая смотрит на структуру изображения, а не на сырые разницы пикселей, называется SSIM (Structural Similarity) и даёт оценку от 0 до 1. Слитная, обученная метрика от Netflix называется VMAF (Video Multimethod Assessment Fusion) и даёт оценку от 0 до 100. Каждой посвящён отдельный разбор – PSNR, SSIM и VMAF – в блоке объективных метрик.

Привлекательность очевидна. Объективная метрика быстрая, детерминированная и повторяемая: скормите ей те же два файла – и она вернёт то же число каждый раз, за секунды, на сколько кодировок ни замахнись. Именно это делает возможным автоматический контроль качества – гейты качества, регрессионные тесты, per-title-кодирование и live-мониторинг работают на объективных числах, потому что ничто другое не масштабируется.

Большинство этих метрик – full-reference: им нужен нетронутый оригинал для сравнения, как корректору нужен правильный текст, чтобы вычитать копию. У live-потоков и пользовательских клипов такого оригинала нет, поэтому существует целое отдельное семейство no-reference метрик. Но нужен ей эталон или нет, каждая объективная метрика делит одно определяющее свойство: это модель человеческого мнения, а не само мнение. Вся её ценность держится на том, насколько хорошо она совпадает с людьми, которых замещает.

Мост: каждая объективная метрика валидируется по субъективным оценкам

Вот мысль, связывающая два вопроса, и самый важный пункт статьи. Метрику никогда не объявляют хорошей за элегантность математики. Её объявляют хорошей потому, что на наборе клипов, которые люди уже оценили, её вывод следует за MOS. Люди идут первыми; метрику подгоняют под них и затем доверяют ей замещать их.

В области есть стандартный способ измерить это совпадение, изложенный в Рекомендации ITU-T P.1401 (01/2020) и применяемый Video Quality Experts Group (VQEG). Бóльшую часть работы делают три статистики. Коэффициент корреляции Пирсона (PCC) меряет точность – насколько линейно оценки метрики следуют за MOS. Ранговая корреляция Спирмена (SROCC) меряет монотонность – ранжирует ли метрика клипы в том же порядке, что и человек, даже если абсолютные числа расходятся. Среднеквадратичная ошибка (RMSE) меряет типичный размер ошибки предсказания в единицах MOS. Метрика с высокими PCC и SROCC и низкой RMSE против человеческих данных – хороший суррогат; та, что нет, отвергается, какой бы умной ни выглядела.

Рис. 3. Как оценивают метрику. Каждая точка – один клип; чем плотнее облако жмётся к диагонали, тем лучше метрика предсказывает мнение людей. Оранжевые точки – где метрика врёт: высокая оценка, низкая оценка человека.

Два конкретных примера делают это осязаемым. Когда SSIM представили Wang, Bovik, Sheikh и Simoncelli в 2004 году, статья не просто определила математику – она показала, что SSIM следует за человеческими оценками ближе, чем старые меры пиксельной ошибки, провалидировав новую метрику по субъективным данным. VMAF идёт ещё дальше и обучается на субъективных оценках напрямую: Netflix собрал большой набор человеческих оценок, принял их за эталон и машинным обучением (методом опорных векторов в регрессии) вывел функцию, которая их предсказывает, достигнув корреляции выше 0.9 с человеческим DMOS на своём тестовом контенте. В обоих случаях авторитет метрики целиком заимствован у людей, под которых её подгоняли. Убери субъективные данные – и не останется ничего, против чего звать метрику «хорошей».

Поэтому раздел устроен именно так: блок объективных метрик и блок субъективного тестирования – не соперники. Субъективные тесты дают истину; объективные метрики – её масштабируемые приближения, и они надёжны ровно настолько, насколько свежа их последняя валидация по ней.

Когда метрика и ваши глаза расходятся – кто прав

Поскольку объективная метрика – это подгонка под прошлые человеческие данные, она может ошибаться на контенте, непохожем на эти данные. Плёночное зерно, гладкие градиенты, ломающиеся в полосатость (banding), резкий экранный текст, очень тёмные сцены, сильное движение, анимация – каждое известная слабая зона, где число метрики уплывает от того, что люди реально видят. Каталог того, где врут объективные метрики – отдельная статья.

Так кто прав, когда метрика говорит 90, а полная комната зрителей говорит, что клип тянет на 70? Зрители. Корректно проведённый субъективный тест – эталон по определению, и расхождение значит, что метрика наткнулась на слепую зону на этом контенте, а не что аудитория ошибается. Число – суррогат, который провалился; люди – то самое, что оно пыталось предсказать. Это одно правило решает большинство споров о качестве: метрика подсказывает, люди решают.

«Частая ошибка: оптимизировать метрику вместо зрителя. В момент, когда оценка становится целью, её начинают накручивать – и многие трюки поднимают объективное число, не улучшая реальное качество. Лёгкая резкость и добавленный контраст поднимают VMAF, делая картинку хуже для человека, – ровно поэтому Netflix пришлось выпустить вариант «без выигрыша от улучшайзинга», VMAF-NEG. Урок – закон Гудхарта в применении к видео: мера, ставшая целью, перестаёт быть хорошей мерой. Считайте оценку сводкой, называйте стоящую за ней модель, сообщайте её доверительный интервал и держите субъективную проверку в цикле для всего, что важно.»

Субъективное и объективное с одного взгляда

Читайте таблицу как карту всего вопроса. Два подхода – не конкуренты, между которыми выбирают раз и навсегда; это два инструмента с разными задачами.

ПодходЧто измеряетЦена и скоростьГде врёт / пределыЛучше всего для
Субъективный (MOS / DMOS)Что люди реально воспринимают – эталонМедленно, дорого; нужны ≥15 человек и контролируемые условияТяжело масштабировать; результат с доверительным интервалом, зависит от панели и условийКалибровка метрик, разрешение споров, валидация нового пайплайна
Объективный (PSNR, SSIM, VMAF)Предсказание мнения людей по пикселямБыстро, дёшево, детерминированно; на каждую кодировкуХорош лишь до последней валидации; врёт на зерне, banding, тексте, тьме, сильном движении и трюкахГейты качества, регрессии, per-title, мониторинг в масштабе

Табл. 1. Два инструмента. Объективные метрики масштабируются; субъективные тесты говорят истину. Зрелая программа качества использует оба, и второй якорит первый.

Как они на деле работают вместе

Вы не выбираете один из них навсегда. Рабочая программа качества постоянно гоняет объективные метрики и осознанно проводит субъективные тесты, и связь между ними – всё мастерство.

Объективные метрики – ваш повседневный инструмент. Они следят за каждой кодировкой, валят сборку, когда регрессия роняет оценку ниже порога, управляют per-title-решениями по битрейту и мониторят live-качество – все задачи, требующие числа сейчас, автоматически, в масштабе. Субъективные тесты – ваш эталонный инструмент. Их проводят, когда ставки высоки или контент необычен: чтобы провалидировать новый пайплайн кодирования прежде, чем доверять его числам, чтобы разрешить спор «что из этого выглядит лучше», который метрика называет слишком близким, и – главное – чтобы переякорить метрики на ваш собственный контент, ведь метрика, провалидированная на чужих клипах, может не перенестись на ваши.

Рис. 4. Какой вопрос вы задаёте? Чем выше ставки и чем необычнее контент, тем больше субъективный тест отрабатывает свою цену – а ответ на практике почти всегда «оба».

Правило большого пальца простое: чем дороже решение и чем дальше ваш контент от того, на чём метрику обучали, тем больше субъективный тест стоит своих денег. Для рутинных кодировок обычного контента метрики достаточно. Для запуска, нового кодека или контента, который метрика упорно понимает неправильно, – спросите людей.

Где здесь Фора Софт

Фора Софт делает видеопродукты с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицину и видеонаблюдение – и во всех них мы относимся к объективным метрикам и субъективному суждению как к двум инструментам, а не одному. Объективные оценки мы используем, чтобы автоматически гонять гейты качества и ловить регрессии, потому что только это масштабируется на реальный пайплайн. Но мы якорим эти числа к человеческому восприятию на контенте, который действительно важен, чтобы проходной балл на дашборде значил, что картинка реально хороша, а не просто льстит метрике. Когда метрика и зритель расходятся на контенте клиента, мы верим зрителю и идём искать слепую зону – это и есть честный способ мерить качество и основа оригинальных данных в нашей методологии бенчмарков.

Главное

  • Субъективное качество (человеческий MOS) – эталон; объективные метрики – его быстрые суррогаты.
  • MOS требует ≥15 зрителей, контролируемых условий и сообщаемого доверительного интервала.
  • Каждую объективную метрику строят и судят по тому, как она предсказывает субъективные оценки.
  • VMAF обучен на мнении людей; SSIM провалидирован по нему – люди идут первыми.
  • Когда метрика и глаза расходятся, выигрывает субъективный тест: метрика в слепой зоне.
  • Метрики – чтобы масштабировать, субъективные тесты – чтобы калибровать и решать споры.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.