MOS, DMOS и шкалы оценки качества видео

Автор: Николай СапуновОбновлено: август 202616 мин чтения
Содержание статьи +

Кратко

Субъективный тест просит зрителей оценить клипы, и единственное число, которое он выдаёт, – это Mean Opinion Score (MOS), среднее этих оценок, почти всегда по пятибалльной шкале, где 5 – отлично, а 1 – очень плохо. Когда вы хотите измерить, насколько процесс ухудшил источник, а не насколько хорош результат сам по себе, вы переходите к Differential Mean Opinion Score (DMOS): он вычитает оценку эталонного (исходного) клипа, поставленную зрителем, из его оценки обработанного клипа, убирая личную строгость и то, насколько зрителю понравился контент. Подвох в том, что сырое среднее ещё не измерение: MOS или DMOS ничего не значат, пока вы не отсеяли ненадёжных зрителей, не приложили 95-процентный доверительный интервал и не указали, какая шкала, метод и направление дали это число. Эта статья показывает, что такое каждое из чисел, арифметику, превращающую сырые оценки в защитимый результат, и ловушки шкал – направление, порядковость и число делений, – которые тихо портят результаты.

Почему это важно

Любую объективную метрику, которой вы доверяете, – PSNR, SSIM, VMAF – обучали и валидировали против MOS или DMOS, поэтому, если вы не понимаете, что это за числа, вы не до конца понимаете, что предсказывает ваша метрика. Статья – для видеоинженера, лида по кодированию, QA-инженера или продакт-оунера, кому приходится проводить или заказывать субъективный тест, читать статью о качестве или защищать результат перед придирчивым рецензентом. Это вторая статья нашего блока о субъективном тестировании; первая, почему субъективное тестирование – эталонная истина, объясняет, почему панель людей стоит выше любой метрики, а эта объясняет числа, которые панель выдаёт. Короткая версия для оператора энкодера – в обзоре субъективного тестирования раздела Video Encoding; всё здесь – глубокая проработка за ней.

MOS: одно число, которое выдаёт тест

Начнём с числа, которое вы будете видеть чаще всего. Когда панель зрителей оценивает клип, вы собираете по одной оценке с каждого и усредняете их. Это среднее – Mean Opinion Score, или MOS: средняя оценка, которую группа зрителей поставила одному клипу. Термин пришёл из телефонии, где ITU-T P.800.1 определил его для качества голоса задолго до того, как видео его позаимствовало, и для картинки он означает то же самое – среднее арифметическое мнения людей.

Формула так же проста, как звучит. Если N зрителей ставят клипу оценки r₁, r₂, … rₙ, то MOS – это их сумма, делённая на их число:

MOS = (r₁ + r₂ + … + rₙ) / N

Скажем, восемь зрителей оценивают клип на 4, 5, 4, 3, 5, 4, 4, 5. Сумма – 34, поэтому MOS равен 34 ÷ 8 = 4,25. Средний зритель поставил этот клип на четверть пути между «хорошо» и «отлично». Это число – главный результат почти любого субъективного теста, и именно его пытается предсказать почти любая объективная метрика.

MOS читается как школьная оценка, и в этой привычности прячется первая ошибка – о ней в разделе про шкалу ниже. Пока держите простое определение: MOS – это среднее мнение панели по фиксированной шкале для одного клипа.

Шкала, на которой едет оценка: Absolute Category Rating

MOS осмыслен ровно настолько, насколько осмыслена шкала, которой пользовались зрители, поэтому зафиксируем шкалу раньше числа. Стандартная шкала для оценки качества видео – пятибалльная Absolute Category Rating, или ACR: метод, где каждый клип показывают отдельно и оценивают независимо, определён в ITU-T P.910 (10/2023), контролирующей рекомендации по субъективному тестированию видео. «Абсолютная» означает, что зритель судит клип по его собственным достоинствам, без эталона для сравнения, – так, как реальный зритель встречает видео в жизни.

Пять делений подписаны, а не просто пронумерованы (ITU-T P.910, §8.1):

ОценкаМетка
5Отлично
4Хорошо
3Удовлетворительно
2Плохо
1Очень плохо

Это шкала, стоящая за подавляющим большинством чисел MOS, что вы когда-либо прочитаете. Зритель видит клип, выбирает одно из пяти слов, и программа сохраняет соответствующее число. Усредните эти числа по панели – и получите MOS клипа.

Рисунок 1. Пятибалльная шкала ACR. Зрители выбирают подписанную категорию; числа за метками усредняются в MOS клипа.

Здесь есть тонкость, которую прячет аналогия со школьной оценкой, и она важна для того, как вам вообще разрешено считать. Пять делений – это порядковая шкала: категории упорядочены (отлично выше хорошо, хорошо выше удовлетворительно), но равенство промежутков между ними не гарантировано. Перцептивное расстояние от «очень плохо» до «плохо» может не равняться расстоянию от «хорошо» до «отлично». Трактовать метки как равноотстоящие числа – соглашение, которое вся отрасль принимает, чтобы вообще иметь возможность считать среднее, но это приближение, а не закон природы. Поэтому MOS 4,0 не «вдвое лучше» MOS 2,0, и поэтому MOS лучше читать как ранжирование с промежутками, а не как отношение. Подробнее об этой ловушке – ниже.

Два разных вопроса: абсолютное качество против деградации

Вот концептуальная развилка, на которой держится остаток статьи. Зрителю можно задать два по-настоящему разных вопроса, и они дают два разных числа.

Первый вопрос – «насколько хорош этот клип?» – абсолютное качество, оцениваемое само по себе. Это и измеряет ACR, а его среднее – MOS. Второй вопрос – «насколько этот клип хуже оригинала?» – деградация, оцениваемая против эталона, который зритель видит. Этот вопрос меняет и метод, и число.

Когда вы показываете сначала исходник, потом обработанный клип и просите зрителя оценить ухудшение второго относительно первого, вы проводите Degradation Category Rating, или DCR, – в вещательном стандарте ITU-R BT.500-15 известный как Double Stimulus Impairment Scale (DSIS). Шкала тоже меняется – с качественных слов на слова про ухудшение (ITU-T P.910, §8.2):

ОценкаМетка
5Незаметно
4Заметно, но не раздражает
3Слегка раздражает
2Раздражает
1Очень раздражает

Развилка не академическая. P.910 прямо отмечает, что ACR «может быть нечувствителен к некоторым ухудшениям, которые легко обнаруживает» DCR: лёгкое притупление цвета, например, может пройти незамеченным, когда сравнивать не с чем, но бросается в глаза в тот миг, когда зритель видит рядом оригинал. DCR – метод выбора «при оценке точности передачи относительно исходного сигнала», что «часто является важным фактором при оценке высококачественных систем» (ITU-T P.910, §8.2.1). Цена – пропускная способность: показ двух стимулов на одну оценку даёт примерно вдвое меньше оценок за то же время сессии.

Рисунок 2. Два вопроса, две шкалы. ACR оценивает качество одного клипа (Отлично–Очень плохо); DCR/DSIS оценивает ухудшение обработанного клипа против видимого эталона (Незаметно–Очень раздражает).

DMOS: оценка разницы, а не картинки

Когда вопрос – про деградацию, среднее этих оценок ухудшения и есть Differential Mean Opinion Score – DMOS: среднее того, сколько качества было потеряно, а не сколько осталось. DMOS существует, чтобы убрать упрямый конфаунд: в обычном ACR оценка зрителя смешивает его мнение об ухудшении с мнением о самом контенте и с личной привычкой быть строгим или щедрым. DMOS их сокращает, всегда измеряя против эталона, который оценил тот же зритель.

Отрасль вычисляет DMOS двумя способами, и их путаница – реальный источник ошибок.

Метод ACR-HR: удаление скрытого эталона

Самое чистое определение – из ACR with Hidden Reference (ACR-HR) в ITU-T P.910. Вы проводите обычный тест ACR, но тихо подмешиваете исходные клипы в набор как обычные тестовые элементы – зритель оценивает их, не зная, что это эталоны. Потом, на анализе, вычитаете. Для каждого зрителя и каждого обработанного видеофрагмента (processed video sequence, PVS) дифференциальная оценка зрителя (differential viewer score, DV) такова (ITU-T P.910, §8.6.2):

DV = V(PVS) − V(REF) + 5

где V(PVS) – оценка зрителя по ACR для обработанного клипа, V(REF) – оценка того же зрителя для соответствующего скрытого эталона, а + 5 возвращает результат на привычную шкалу от 1 до 5, где 5 значит «не хуже эталона».

Пройдём по шагам. Зритель оценивает скрытый эталон на 5 (Отлично), а обработанный клип на 3 (Удовлетворительно). Его DV равен 3 − 5 + 5 = 3: обработка стоила двух баллов. Теперь возьмём более строгого зрителя, который всё занижает, – он ставит тому же эталону 4, а тому же обработанному клипу 2. Его DV равен 2 − 4 + 5 = 3, ровно столько же. Два зрителя пользовались шкалой совершенно по-разному в абсолютных значениях, но удаление скрытого эталона восстанавливает одну и ту же деградацию, потому что измеряет каждого зрителя против его собственного прочтения источника. Это сокращение – и есть весь смысл DMOS.

Усредните DV каждого зрителя по клипу – и получите его DMOS. Один краевой случай стоит знать: зритель может оценить обработанный клип выше его эталона, дав DV больше 5 – скажем, эталон получил 4, а обработанный клип 5, и DV равен 6. P.910 считает такие значения валидными, но предлагает необязательную функцию «сжатия» (crushing), чтобы несколько щедрых оценок не задрали среднее:

crushed_DV = (7 × DV) / (2 + DV),  при DV > 5

DV, равный 6, сжимается в (7 × 6) ÷ (2 + 6) = 42 ÷ 8 = 5,25, мягко притянутый назад к верху шкалы, а не парящий свободно. Обратите внимание на направление: в ACR-HR больший DMOS значит лучшее качество, потому что + 5 держит его согласованным со шкалой ACR.

Метод баз данных: разностные оценки и Z-нормировка

Другой DMOS, который вам встретится, живёт в академических базах данных качества, на которых обучают метрики, – LIVE Video Quality Database и наборах за VMAF. Здесь разницу считают наоборот: разностная оценка по каждому субъекту вычитает оценку обработанного клипа из оценки эталона, так что большее число значит большее падение. Эти сырые разности затем стандартизуют в Z-оценки по каждому зрителю (вычесть среднее зрителя, поделить на его стандартное отклонение) и линейно перемасштабируют, обычно в диапазон 0–100. Эталонные клипы схлопываются в нулевую разность и выпадают.

Ключевое следствие: в этом соглашении больший DMOS обычно значит худшее качество – противоположно направлению ACR-HR. Те же три буквы, перевёрнутый смысл. Netflix обучал VMAF именно на таких субъективных оценках, поэтому фраза «балл VMAF предсказывает балл DMOS» осмысленна лишь после того, как вы знаете, какое соглашение DMOS и какое направление в игре. Контент, где обученная метрика и панель расходятся, каталогизирован в где врут объективные метрики.

От сырых оценок к защитимому числу

Получите вы MOS или DMOS – среднее это лёгкая часть. Голое среднее – это «ощущение» с десятичной точкой; измерением его делают шаги вокруг. Три из них важнее всего.

Сначала отсейте зрителей. Кто-то оценивает непоследовательно, не понял задачу или прокликивает не глядя. И P.910, и ITU-R BT.500-15 определяют послеэкспериментальный отбор – обычно корреляцию оценок каждого зрителя со средним панели и удаление тех, кто слишком выбивается, – чтобы ненадёжные не загрязняли среднее. MOS вы считаете после отбора, никогда до. Вся механика отбора и отбраковки выбросов – тема статьи статистика субъективных данных.

Приложите доверительный интервал. Люди расходятся во мнениях, и разброс их оценок говорит, насколько доверять среднему. Разброс выражают стандартным отклонением оценок, а ITU-R BT.500-15 превращает его в 95-процентный доверительный интервал – небольшой диапазон ±, который обязан нести каждый MOS:

ε = 1,96 × ( S / √N )

где S – стандартное отклонение оценок, N – число зрителей, а 1,96 – множитель, охватывающий 95 % нормального распределения. Для клипа, оценённого 24 зрителями с типичным разбросом S = 0,7, допуск равен ε = 1,96 × (0,7 ÷ √24) = 1,96 × 0,143 = 0,28, так что MOS 4,10 сообщают как 4,10 ± 0,28. Сообщите MOS без этого интервала – и вы спрятали ровно ту информацию, которая нужна читателю, чтобы понять, действительно ли два клипа различаются. (Почему панель должна быть достаточно большой, чтобы интервал был полезен, и почему пять коллег ею не являются, разобрано в почему субъективное тестирование – эталонная истина.)

Укажите условия. MOS бессмыслен в отрыве. Тот же клип может получить разные оценки на телефоне и на калиброванном мониторе, на 5-балльной и 11-балльной шкале, под ACR и под DCR. Защитимый результат называет метод (ACR, DCR, ACR-HR), шкалу, число отобранных зрителей и условия просмотра – рядом с самим числом.

Рисунок 3. Путь от сырых оценок к результату, который можно защитить: отсеять, усреднить, приложить доверительный интервал. Пропустите шаг – и число перестаёт быть измерением.

Насколько точным вообще может быть хорошо проведённый тест ACR? P.910 даёт эмпирический ответ, который стоит запомнить. Он определяет наименьший разрыв в MOS, который тест способен надёжно разрешить, и отмечает, что ACR «редко даёт» разрешимую разницу ниже 0,5 балла для 24 субъектов, 0,7 для 15, 1,1 для 9 и 1,5 для 6 (ITU-T P.910, §8.1.1). Читайте это как потолок амбиций: с двумя дюжинами зрителей не рассчитывайте защитить разницу MOS заметно меньше полубалла. Это самое конкретное указание по чувствительности, что даёт стандарт, и большинство статей о нём не упоминают.

MOS или DMOS – какое число и что оно прячет

Два числа отвечают на разные вопросы, едут на разных шкалах и даже идут в разных направлениях. Выбирайте осознанно.

MOS (через ACR)DMOS (через ACR-HR)DMOS (база данных / DSIS)
ВопросНасколько хорош клип?Насколько хуже эталона?Насколько хуже эталона?
МетодОдин стимул (ACR)Скрытый эталон, затем вычитаниеРазностная оценка, Z-нормировка
Шкала1–5 (Отлично–Очень плохо)~1–5, привязана к эталонучасто 0–100
НаправлениеБольше = лучшеБольше = лучшеБольше = хуже
Что измеряетАбсолютное качествоПотерю качества, без смещения зрителяПотерю качества, без смещения зрителя
Где врётСмешивает симпатию к контенту с ухудшениемШире интервалы, чем у ACR; нужен отличный эталонНаправление и масштаб зависят от набора

В колонке «где врёт» сидят две честные оговорки. Абсолютное число ACR загрязнено тем, насколько зрителю понравился контент, так что любимый клип может обогнать лучше закодированный, но более скучный. ACR-HR убирает это загрязнение, но, предупреждает P.910, «может давать более широкие доверительные интервалы, чем ACR» – удаление смещения вы покупаете ценой небольшой точности, и метод работает, только если скрытый эталон действительно отличного или хорошего качества, ведь дефектный эталон искажает каждую разность, вычисленную из него.

Частые ошибки

Ошибки шкал тихие – они дают числа, которые выглядят нормально и значат не то. Пять повторяются достаточно часто, чтобы их назвать.

«Ошибка 1 – трактовать MOS как отношение. MOS 4 не «вдвое лучше» 2, а скачок с 4,0 на 4,5 не равен перцептивно шагу с 2,0 на 2,5. Шкала порядковая; числа ранжируют с грубыми промежутками, они не умножаются. Сравнивайте MOS по разнице и значимости, никогда по отношению.»
«Ошибка 2 – сообщать MOS без доверительного интервала. MOS 4,10 сам по себе неопровержим. MOS 4,10 ± 0,28 можно сверить с другим клипом. Интервал – не украшение; это та часть, что делает число доказательством.»
«Ошибка 3 – смешивать MOS и DMOS или два направления DMOS. MOS 4,2 и ACR-HR DMOS 4,2 – разные величины, а «DMOS 80» может значить «отлично» (одни шкалы) или «ужасно» (соглашение баз данных). Всегда указывайте метод и направление перед сравнением.»
«Ошибка 4 – сравнивать оценки между разными шкалами или методами. MOS из 5-балльного теста ACR и MOS из теста на 11-балльной или непрерывной шкале невзаимозаменяемы, а MOS из ACR нельзя сравнивать с результатом DCR клип к клипу. Сравнивать сравнимое значит та же шкала, тот же метод, те же условия.»
«Ошибка 5 – слишком мало зрителей, чтобы разрешить разницу. По собственным числам P.910 шесть зрителей не могут защитить разрыв ниже примерно 1,5 балла. Если панель мала, ваш «победитель» может быть шумом – сверьте разрыв с разрешимым полом для вашего размера выборки.»

Сколько делений должно быть у шкалы

Естественный инстинкт – что больше делений значит больше точности, поэтому 11-балльный или непрерывный слайдер должен бить 5-балльную шкалу. Данные говорят иначе. P.910 обсуждает 9- и 11-балльные варианты, сохраняющие те же пять опорных слов (отлично, хорошо, удовлетворительно, плохо, очень плохо), а метод SAMVIQ использует непрерывный слайдер 0–100 – но рекомендация прямо говорит, что для непрерывных шкал «точность итогового MOS не улучшается», а «метод становится труднее для субъектов», которые всё равно якорятся к меткам и фактически пользуются горсткой делений (ITU-T P.910, §8.7.1). Стандарт приводит обоснование шкал в пять–девять делений. Практический вывод: привычная 5-балльная шкала ACR – не ограничение, которое надо обходить, а почти что золотая середина того, что зрители реально различают.

Где здесь Фора Софт

Фора Софт делает видеософт с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицину и видеонаблюдение, – и на проектах, где качество спорно, выбор между MOS и DMOS – наше первое решение, а не запоздалая мысль. Когда клиент спрашивает «новый энкодер лучше?», мы обычно берём DMOS со скрытым эталоном, потому что он снимает то, насколько каждому зрителю случайно понравился тестовый материал, и измеряет лишь то, что изменил энкодер. Когда вопрос «достаточно ли это хорошо, чтобы отдавать зрителям», честная мера – абсолютный MOS на целевом устройстве. В любом случае мы сообщаем метод, размер отобранной панели и доверительный интервал за каждым числом – дисциплина, описанная в нашей методологии бенчмарков, – чтобы число пережило совещание, на котором его цитируют.

Ключевые выводы

  • MOS – это среднее абсолютных оценок качества, почти всегда по 5-балльной шкале ACR (Отлично–Очень плохо).
  • DMOS измеряет деградацию против эталона, сокращая строгость зрителя и его симпатию к контенту.
  • Дифференциал ACR-HR – это DV = V(PVS) − V(REF) + 5, усреднённый в DMOS, где больше значит лучше.
  • DMOS баз данных идёт наоборот – больше часто значит хуже, – поэтому всегда проверяйте направление.
  • Среднее не станет измерением, пока вы не отсеяли зрителей и не приложили 95% интервал (ε = 1,96·S/√N).
  • 5-балльная шкала порядковая и близка к пределу различения зрителя; больше делений точности не добавляют.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.