Содержание статьи +
- TL;DR
- Почему это важно
- Что измеряет «субъективное качество»
- Шкала MOS и метки ACR
- DSCQS – двойной стимул, непрерывная оценка
- DSIS – метод двойных стимулов с оценкой искажений
- ACR и ACR-HR – методы с одним стимулом
- Сколько зрителей? Лаборатория и краудсорсинг
- Четыре ловушки, из-за которых проваливаются большинство тестов
- Числовой пример: метод под реального решения
- Где здесь Фора Софт
- Ключевые выводы
- Что читать дальше
- Источники
TL;DR
Субъективный тест качества видео – это контролируемое исследование, в котором реальные люди просматривают видеофрагменты и оценивают их визуальное качество. Среднее значение этих оценок – Mean Opinion Score, или MOS – служит эталоном, который пытается предсказать любая объективная метрика (PSNR, SSIM, VMAF). Две ключевые рекомендации, определяющие проведение таких тестов, – это ITU-R BT.500-14 (для традиционного вещания, десятилетний стандарт) и ITU-T P.910 (2023) вместе с дополнением P.913 (2021) – для мультимедиа, интернет-видео и домашних условий. В этих документах описаны четыре основных метода, которые встречаются во всех научных работах и технических спецификациях: DSCQS и DSIS из группы double-stimulus, при которых зритель видит и эталонный, и искажённый вариант, и ACR с ACR-HR из single-stimulus, где участник оценивает только искажённый клип по шкале от 1 до 5. Выбрать метод или условия неправильно – и значение MOS превращается в маркетинговую цифру; выбрать правильно – и вы получаете надёжный показатель качества, на основе которого можно принимать обоснованные решения по кодекам, битрейтовым лестницам и устройствам.
Почему это важно
Если ваша команда хоть раз спорила, «достаточно ли хорош» новый кодек, можно ли убрать нижнюю ступень битрейтной лестницы, чтобы сэкономить 20% egress, или насколько правдива красивая диаграмма от вендора энкодера – вы спорили о субъективном качестве, как бы вы это ни называли. Объективные метрики дают быстрый и дешёвый способ оценить человеческое восприятие, но каждая из них – PSNR, SSIM, MS-SSIM, VMAF, XPSNR – была обучена, проверена или отвергнута на основе человеческих оценок MOS, собранных одним из методов, описанных в этой статье. Продакт-менеджер, способный прочитать субъективное исследование и отличить лабораторный 24-зрительный DSCQS-тест от 100-юзерной краудсорс-сессии ACR, не поддастся на красивую вендорскую PDF.
Эта статья – для продакт-менеджера, видео-операционного лидера или основателя, которому нужно заказать, прочитать или оспорить субъективное исследование. Начнём с того, что вообще измеряет «субъективное качество», разберём четыре стандартных метода простым языком, приведём полную временную арифметику при первом упоминании каждого, рассмотрим современные рекомендации по краудсорсингу (ITU-T P.808 / P.913) и завершим практическими правилами выбора метода под задачу – а также четырьмя ловушками, на которых рушится большинство исследований в индустрии.
Что измеряет «субъективное качество»
Слово субъективное качество в этой статье означает ровно одно: мнение, которое реальный зритель формирует после просмотра клипа, выраженное числом на шкале. Речь не идёт о математической близости сжатой копии к оригиналу, о том, уложился ли битрейт в бюджет, или попал ли энкодер в целевой VMAF. Речь только о том: показалось ли зрителю это красивым, и если нет – насколько плохо.
Чтобы превратить это мнение в надёжное число, индустрия проводит субъективный тест. Сама процедура старше цифрового видео – её применяли ещё ранние телевизионные сети для сравнения кинескопов, – а современную версию определяют две рекомендации ITU, на которые опирается каждая серьёзная лаборатория.
ITU-R BT.500-14 (октябрь 2019 года, четырнадцатая редакция с 1974 года) – одна из двух основных. 1 Она разработана для вещания и предполагает, что зрителей можно разместить в контролируемой лаборатории: на откалиброванном CRT или LCD, на фиксированном расстоянии, в помещении с нейтрально-серыми стенами и регулируемым освещением. Документ включает три части: общие требования (Часть 1), семейство методов оценки (Часть 2), применение к конкретным форматам (Часть 3). BT.500 – это то, на что ссылаются, когда говорят: «мы провели стандартный тест».
ITU-T P.910 (октябрь 2023 года, третья крупная редакция) – более современный стандарт, на который опираются большинство современных исследований видео. 2 Он разработан с учётом мультимедийных устройств: интернет-видео, смартфонов, планшетов, ноутбуков и различных дисплеев – и намеренно смягчает строгие лабораторные условия BT.500. Его дополнение – ITU-T P.913 (июнь 2021) – идёт ещё дальше: позволяет проводить тесты в любых условиях, включая домашнюю обстановку зрителя, при условии, что все параметры среды подробно задокументированы для воспроизводимости. 3 Вместе P.910 и P.913 определяют, как в 2026 году в индустрии проводятся субъективные исследования стримингового видео.
Обе рекомендации в итоге дают одинаковый результат – MOS, Mean Opinion Score, – но используют разные методы оценки, разные объёмы выборки, разные помещения и разные способы демонстрации клипов. Выбор метода влияет на стоимость, продолжительность, чувствительность к мелким искажениям и тип искажений, которые вообще можно зафиксировать. Дальше – экскурсия по этим методам.
Шкала MOS и метки ACR
Прежде чем переходить к методам, нужна шкала. Любой стандартный тест ITU использует единую пятибалльную шкалу Absolute Category Rating – ACR, которая применяется как самостоятельный метод оценки и как набор меток во всех остальных методах.
Пять оценок: Excellent (5), Good (4), Fair (3), Poor (2), Bad (1). 4 Зритель смотрит клип и ставит одну из пяти оценок, экспериментатор усредняет все оценки по данному клипу – получается MOS для этого клипа. Клип, которому все поставили 5, получит 5,00; клип, который ровно половина зрителей оценила как Fair, а другая половина – как Good, получит 3,50. MOS всегда находится в диапазоне от 1,00 до 5,00 – ни выше, ни ниже – и публикуемое значение сопровождается доверительным интервалом, обычно 95%, который показывает, насколько может отличаться среднее при повторении исследования с новой выборкой.
Под этой аккуратной шкалой лежат две практические оговорки, и игнорирование любой из них ведёт к тому, что продакт-команды начинают спорить о бессмысленных цифрах.
Во-первых, метки не равноудалены в голове зрителя. 4 Воспринимаемое «расстояние» от Bad до Poor не равно расстоянию от Good до Excellent; повторяющиеся исследования на разных языках показывают, что промежуток между Fair и Good – самый широкий из четырёх. Это значит, что MOS 3.0 не середина шкалы – он ближе к «заметно хуже приемлемого». Когда вендор пишет «у нас средний MOS 3.4», помните: 3.4 намного дальше от «good», чем номинальная шкала вам подсказывает.
Во-вторых, MOS из разных исследований нельзя сравнивать напрямую. Один и тот же клип в двух разных комнатах, на двух разных панелях, на двух разных дисплеях может получить оценки, отличающиеся на полбалла MOS – просто из-за контекста: освещение, диапазон яркости остальных клипов в сессии, калибровка экрана. Серьёзное исследование указывает комнату, дисплей, дистанцию просмотра, состав панели, порядок клипов и длительность сессии – чтобы другая лаборатория могла его воспроизвести. Вендорский слайд, который приводит MOS без этого контекста, использует число как маркетинг, а не как науку.
С шкалой в руках можно применить один из четырёх методов.
DSCQS – двойной стимул, непрерывная оценка
DSCQS, или Double Stimulus Continuous Quality Scale, – историческая «рабочая лошадка» BT.500 и метод, который чаще всего называют золотым стандартом сравнения кодеков, когда важны мелкие различия. 1 5
Процедура основана на парах. Каждому тестовому условию соответствует пара клипов, которые зритель просматривает подряд: первый – неискажённый эталон, второй – искажённая версия, полученная с помощью вашего энкодера, канала передачи или другого оцениваемого компонента. Порядок клипов в паре случайный, и зритель не знает, какой из них эталонный. Он может многократно перепросматривать пару и оценивает каждый клип по непрерывной шкале от 0 до 100. На шкале нанесены пять меток ACR: Bad, Poor, Fair, Good, Excellent, – но при этом допускается любое промежуточное значение. Оценкой для тестового условия считается разница между оценкой эталона и оценкой искажённого клипа; среднее таких разниц по всей панели – это Differential MOS (DMOS) для данного условия. 6
Почему именно разница, а не абсолютная оценка? Потому что одни зрители систематически щедрые, другие – систематически строгие, но почти все внутренне последовательны: пусть конкретный зритель ставит эталону 85 вместо 95, он поставит искажённой копии 70 вместо 80 – примерно на ту же величину. Вычитание устраняет личную шкалу зрителя и выделяет именно искажение. Поэтому DSCQS – это метод, к которому индустрия и академия обращаются, когда нужно сравнить кодеки на грани прозрачности, где искажение мало, а разброс между зрителями иначе утопит сигнал.
Минус – время. Типичная сессия DSCQS сопоставляет каждый искажённый клип с эталоном, проигрывает пару дважды (зритель может попросить повторить) и даёт время на оценку обеих частей по непрерывной шкале. Сравнительное исследование NTIA / ITS 2003 года показало среднее время на одно условие: около 41 секунды для DSCQS против 12 секунд у самой простой ACR. 5 За 60 минут DSCQS успевает примерно 70 условий; ACR – 200. Для панели из 24 зрителей и 30 условий DSCQS требует полдня работы от каждого участника плюс время на скрининг; ACR – всего час. На сотнях условий разница в стоимости становится решающей: это уже не просто исследовательский проект, а полноценный продакшен-пайплайн.
Используйте DSCQS, когда искажения незначительны, когда нужно защитить почти прозрачный результат кодека перед проверяющим или когда абсолютный порядок двух очень близких конфигураций энкодера важнее пропускной способности. При множестве условий выбирайте что-то более быстрое.
DSIS – метод двойных стимулов с оценкой искажений
DSIS, или Double Stimulus Impairment Scale, – более быстрый вариант DSCQS, также входящий в стандарт BT.500. Оба метода основаны на принципе double-stimulus: в каждом раунде зритель видит как эталонный, так и искажённый клип. Однако DSIS упрощает процесс в трёх аспектах. 7
Во-первых, пара идёт в известном фиксированном порядке: эталон всегда первый, искажённый – второй. Зритель знает, где что. Во-вторых, пара играется один раз, без replay-цикла. В-третьих, зритель оценивает impairment – насколько второй клип выглядел хуже первого – по пятибалльной шкале impairment: Imperceptible (5), Perceptible but not annoying (4), Slightly annoying (3), Annoying (2), Very annoying (1).
По структуре это та же пятибалльная ACR с переименованными метками, поэтому среднее значение рассчитывается так же, а результат публикуют как MOS или DMOS – в зависимости от соглашения лаборатории. Преимущество заключается в том, что внимание зрителя сосредоточено именно на различии: его не просят оценивать абсолютное качество ни одного из клипов – только то, насколько ухудшился второй.
DSIS чувствительнее DSCQS к крупным и явным искажениям – ошибкам передачи, сильному блокингу, потере кадров – поскольку шкала оценки изначально ориентирована на повреждение сигнала, а не на субъективное восприятие «красиво / некрасиво». DSIS работает быстрее DSCQS, потому что пара видео оценивается один раз, а шкала дискретная, а не непрерывная. То же исследование NTIA / ITS 2003 года показало, что DSIS занимает около 20 с на условие – вдвое быстрее DSCQS. 5
Используйте DSIS для исследования качества передачи, тестов на устойчивость к ошибкам, моделирования потерь пакетов и в любых сценариях, где искажения достаточно значительны, чтобы вопрос «насколько сильно повреждён сигнал» был уместен. Этот метод также является основным, на котором базировались исследования BT.500 в области вещания и видеонаблюдения до 2010-х годов.
ACR и ACR-HR – методы с одним стимулом
ACR, или Absolute Category Rating, полностью исключает двойной стимул. Зритель видит только искажённый клип – без эталона, без возможности сравнения – и сразу после этого оценивает его качество по пятибалльной шкале ACR (Excellent, Good, Fair, Poor, Bad). 2 4
Выглядит как заведомо более слабый дизайн – как зритель может судить качество без эталона? – но на практике это работает по двум причинам. Во-первых, у зрителя в голове уже есть неявный эталон, сформированный тысячами часов просмотра телевидения и стриминга: он представляет, как должно выглядеть «good 1080p», и оценивает качество исходя из этого. Во-вторых, отказ от демонстрации эталонного клипа удваивает пропускную способность сессии. То же исследование NTIA / ITS зафиксировало самую быструю 5-ступенчатую ACR – 12 секунд на условие, что быстрее всех остальных методов в сравнении, включая DSCQS (41 с) и DSIS (20 с). 5
ACR – метод по умолчанию в ITU-T P.910 и тот, который используют большинство исследований в области мультимедиа. Редакция 2023 года расширила P.910: теперь разрешены альтернативные шкалы (в наличии 9- и 11-балльные непрерывные варианты, если требуется более тонкое разрешение), ослаблены лабораторные требования BT.500, а также признана реальность просмотра контента на смартфонах, планшетах и ноутбуках вне лабораторных условий. 2
ACR-HR («ACR with Hidden Reference») – это улучшение ACR в его самом слабом месте. В обычной ACR-сессии неискажённый эталонный клип смешивается с пулом искажённых и оценивается по той же шкале, что и остальные. Поскольку ни один зритель не бывает абсолютно последовательным, эталон редко получает ровно 5,00 – поэтому оценку конкретного условия корректируют, вычитая из оценки эталона оценку искажённого клипа. В результате получается DMOS – точно так же, как в DSCQS, но без штрафа за double-стимул, влияющего на пропускную способность. ACR-HR сохраняет пропускную способность обычной ACR и при этом обеспечивает корректировку смещения, поэтому P.910 рекомендует использовать именно ACR-HR всегда, когда доступен эталонный клип. 2
Слабая сторона семейства ACR – чувствительность при высоком качестве. Несколько публикаций показывают, что DSCQS чувствительнее ACR к очень мелким искажениям – именно те «один энкодер чуть лучше другого», которые интересуют исследовательские статьи по кодекам. 5 8 Для большинства решений в продакшене 2026 года – проектирование битрейтной лестницы, выбор кодека, оценка поставщика энкодера – по пропускной способности выигрывает ACR-HR.
Числовой пример иллюстрирует компромисс. Допустим, у вас 30 условий, по 24 зрителя на каждое, и лимит – 60 минут на сессию (после чего усталость начинает портить данные). Время по методам:
DSCQS: 30 условий × 41 с/условие = 1230 с = 20.5 мин чистой оценки
DSIS: 30 × 20 с = 600 с = 10 мин
ACR: 30 × 12 с = 360 с = 6 минДобавьте скрининг, тренировку, инструкции, перерывы и паузы между клипами – и 60-минутная сессия комфортно вмещает ACR, DSIS, но уже начинает поджимать DSCQS. Увеличьте число условий до 60 – и DSCQS уже не помещается в одну сессию: придётся либо делить панель, либо растягивать исследование на два дня, что удваивает стоимость рекрутинга.
Сколько зрителей? Лаборатория и краудсорсинг
Субъективный тест – это не столько упражнение в видео, сколько в статистике, и первый вопрос заказчика всегда: «Сколько зрителей мне нужно?»
Лабораторный ответ – из BT.500 и P.910. ITU рекомендует минимум 15 зрителей для получения валидного результата, 24 зрителя – стандартная цель для контролируемой среды, 35 зрителей – для публичной или расслабленной обстановки. 9 10 Ниже 4 – математическая обоснованность уже теряется; выше 40 – прирост точности не оправдывает рост затрат. Панель из 24 зрителей с правильным отбором и исключением выбросов обычно обеспечивает 95%-ный доверительный интервал около ±0,5–0,7 балла MOS на пятибалльной шкале, что достаточно, чтобы различить кодеки, отличающиеся на полступени качества. 9
Отсев выбросов – часть процедуры. В приложении 2 к BT.500 описан метод отбора по куртозису оценок: если разброс оценок конкретного зрителя слишком велик или слишком мал по сравнению с остальными участниками панели, он помечается как ненадёжный, и его данные исключаются из расчёта MOS 11. Редакция P.910 2023 года добавляет итеративный метод, основанный на корреляции Пирсона между каждым зрителем и текущим значением MOS – он более агрессивно отсекает тех, кто систематически не коррелирует с общей оценкой. В любом случае одно правило остаётся неизменным: необходимо описать, кого вы отсеяли и по какой причине.
Краудсорс-ответ – из другой рекомендации. ITU-T P.808 (июнь 2021) изначально разработан для speech-тестирования с использованием краудсорсинга – оплачиваемые онлайн-оценщики прослушивают аудиоклипы и выставляют оценки, – а ту же методологию адаптировали и для видео. 12 Краудсорсинг снижает стоимость одного оценщика в 10–100 раз по сравнению с лабораторными условиями, расширяет разнообразие устройств и окружений, приближая их к реальным условиям просмотра в домах зрителей, и обеспечивает доступ к сотням или тысячам оценщиков вместо десятков. Цена этого – шум: внимание, калибровка экрана, качество сети, расстояние до экрана – всё это невозможно контролировать, и каждый оценщик оказывается «шумнее», чем в лаборатории. Эмпирический ответ – масштаб: опубликованные исследования по P.808 для видео обычно требуют 60–100 валидных оценок на условие, чтобы достичь той же точности, что и тест с 24 участниками в лаборатории. 12 13
В 2026 году типовой продакшен-пайплайн стрим-сервиса при оценке нового кодека или цветовой лестницы – гибридный подход: небольшое лабораторное исследование по стандартам P.910 / BT.500 для получения ключевых показателей и обоснования валидности, а также масштабное краудсорс-исследование по P.808, охватывающее широкий спектр условий, типов контента и категорий устройств, которые невозможно протестировать в лаборатории.
Четыре ловушки, из-за которых проваливаются большинство тестов
В сотнях индустриальных и академических исследований одни и те же четыре ошибки встречаются настолько часто, что их стоит выделить отдельно. Если вы заказываете или читаете субъективные исследования – научитесь замечать эти четыре пункта.
Ловушка 1 – сравнение MOS между исследованиями. Два значения MOS из двух разных лабораторий, на разных дисплеях и с разными панелью экспертов – это не одно и то же, даже если оба равны 3,7. Контекстуальные факторы – яркость экрана, освещение помещения, возраст и опыт участников, порядок воспроизведения клипов, длительность сессии – могут сдвинуть абсолютную шкалу MOS на полбалла и больше. Слайд от вендора, сравнивающий свой 4,1 с конкурентским 3,7 из другого исследования, по сути сравнивает показания двух термометров, которые никогда не калибровались друг относительно друга.
Ловушка 2 – ACR на почти-прозрачных искажениях. ACR работает быстро и хорошо справляется со средними и крупными искажениями, но на верхнем пределе шкалы – при визуально прозрачных кодеках, отличающихся всего на 50 кбит/с (две ступени лестницы) – отсутствие side-by-side эталона делает неявный эталон зрителя слишком шумным. В результате вы измерите разницу, в которой преобладает шум восприятия, а не реальное качество кодека. Для таких экспериментов используйте DSCQS или DSIS.
Ловушка 3 – арифметика над MOS как над interval-шкалой. Поскольку метки ACR не равноудалены в восприятии зрителя, среднее значение по набору ACR-оценок формально представляет собой среднее по порядковой шкале, что с математической точки зрения сомнительно. 4 На практике индустрия приняла это приближение и продолжает публиковать MOS как среднее, однако интерпретировать MOS 4.2 как «ровно 60% пути от Fair до Excellent» – это уже переосмысление. Если распределение данных скошено, указывайте медиану параллельно; 95% доверительный интервал приводите всегда.
Ловушка 4 – недостаточный скрининг панели. В серьёзных субъективных исследованиях ненадёжных зрителей отсевают по куртозису из BT.500 или по итеративному LPCC из P.910. 11 Исследования, публикующие сырые MOS без упоминания скрининга, как правило, страдают от влияния одного-двух участников, искажающих среднее значение. Всегда проверяйте текст исследования на наличие описания метода скрининга: если его нет – надёжность результатов остаётся под вопросом.
Числовой пример: метод под реального решения
Допустим, ваша команда разрабатывает платформу e-learning и стоит перед выбором: установить нижнюю ступень H.264 на 1,2 Мбит/с или на 1,6 Мбит/с при разрешении 720p. Версия с битрейтом 1,2 Мбит/с экономит 25% трафика на самой медленной ступени; при этом есть основания полагать, что зрители не заметят разницы.
Полезное исследование выглядит так. Собираете панель из 24 зрителей, прошедших скрининг на нормальное зрение и отобранных из целевой аудитории – например, университетских студентов для e-learning. Подготавливаете 10 исходных клипов, репрезентативных для контента: «говорящая голова», screencast «слайды + голос», whiteboard, отдельные вставки в 24 fps. Для каждого клипа создаёте две ступени сжатия, а также скрытый эталон в исходном качестве – всего получается 30 условий.
Выбор метода: ACR-HR по ITU-T P.910 (2023), стандартная пятибалльная шкала, откалиброванный 1080p-монитор, дистанция 3H. Почему ACR-HR? Потому что разница в качестве, которую вы тестируете (1,2 против 1,6 Мбит/с в 720p H.264), умеренная – не на грани незаметности. Зрители, скорее всего, заметят артефакты на более низком уровне. ACR-HR обеспечивает достаточное время оценки (12 с × 30 условий = 6 минут чистого просмотра, что комфортно укладывается в 45-минутную сессию), позволяет корректировать смещение с помощью скрытого эталона и даёт возможность рассчитать MOS и DMOS по результатам анализа.
Объём выборки: 24 зрителя – лабораторный дефолт – обеспечивает 95% доверительный интервал около ±0,5 балла MOS в среднем. Скрининг: куртозис по BT.500 и итерация LPCC по P.910. В отчёте указываются размер панели до и после скрининга.
На выходе – MOS с доверительным интервалом. Если ступень 1,2 Мбит/с укладывается в пределах 0,3 MOS от 1,6 Мбит/с и интервалы пересекаются – снижайте нижний битрейт и экономьте 25 % трафика на этой ступени. Если разница больше 0,5 MOS и интервалы не пересекаются – оставляйте высокий битрейт и в следующем квартале пробуйте 1,4 Мбит/с.
Так субъективное исследование превращается в решение для продакшена, а не в спор.
Где здесь Фора Софт
Субъективное качество видео – задача, с которой мы сталкиваемся почти в каждом продукте Фора Софт: видеоконференции, OTT и Internet TV, e-learning, телемедицина, видеонаблюдение. В телемедицине важно убедить врача, что изображение с дерматоскопа достаточно чёткое для диагностики; в системе видеонаблюдения – что лицо остаётся узнаваемым на каждом этаже. Объективная метрика на дашборде – это инструмент для ежедневного контроля; субъективный тест – то, что мы проводим, когда метрика и экспертное мнение расходятся, когда заказчик говорит: «новая сборка выглядит хуже» – без конкретных цифр, или когда хотим сильнее сжать поток, чем позволяет одна лишь метрика. Мы проводили и небольшие in-product панели, и масштабные крауд-исследования – и везде действует одно и то же правило, которое изложено и в этой статье: максимально точно описывать метод, делать скриншот панели и ни в коем случае не сравнивать MOS из разных, не согласованных между собой исследований.
Ключевые выводы
- MOS – эталонная оценка качества; все объективные метрики (PSNR, SSIM, VMAF) предсказывают именно её.
- BT.500 – лабораторные вещательные тесты; P.910 (2023) и P.913 (2021) – современные стандарты для мультимедиа.
- DSCQS работает медленнее, но точнее на кодеках с минимальной заметной разницей; ACR-HR быстрее и лучше подходит для производственных решений.
- Минимум для надёжного MOS – 24 лабораторных зрителя или 60–100 голосов от крауд-панели на одно условие.
- MOS из разных исследований нельзя сравнивать напрямую – всегда обращайте внимание на условия тестирования, состав панели и метод отбора участников.
Что читать дальше
- Объективные метрики качества: PSNR, SSIM, MS-SSIM, VMAF – метрики, которые хорошо коррелируют с MOS.
- Как выбрать кодек для сервиса в 2026 году – как субъективные исследования влияют на выбор кодека.
- Per-title и per-scene encoding: умные битрейтные лестницы – пайплайн, в котором субъективные исследования являются входными данными.
Источники
- ITU-R Recommendation BT.500-14, Methodologies for the subjective assessment of the quality of television images, October 2019. https://www.itu.int/dms_pubrec/itu-r/rec/bt/R-REC-BT.500-14-201910-S!!PDF-E.pdf
- ITU-T Recommendation P.910, Subjective video quality assessment methods for multimedia applications, October 2023. https://www.itu.int/rec/T-REC-P.910-202310-I/en
- ITU-T Recommendation P.913, Methods for the subjective assessment of video quality, audio quality and audiovisual quality of Internet video and distribution quality television in any environment, June 2021. https://www.itu.int/rec/T-REC-P.913-202106-P/en
- "Mean opinion score", Wikipedia, accessed 2026-05-17. https://en.wikipedia.org/wiki/Mean_opinion_score
- M. H. Pinson and S. Wolf, Comparing subjective video quality testing methodologies, NTIA / ITS, SPIE 2003. https://its.ntia.gov/publications/download/spie03subj.pdf
- Elecard, "Video quality measurement metrics: SSIM, PSNR, MOS, DMOS, JND", accessed 2026-05-17. https://www.elecard.com/page/article_objective_video_quality_metrics
- ScienceDirect topic page, "Double Stimulus Impairment Scale", accessed 2026-05-17. https://www.sciencedirect.com/topics/engineering/double-stimulus-impairment-scale
- Anonymous authors, Comparative Study of Subjective Video Quality Assessment Test Methodologies, arXiv:2509.20118, 2025. https://arxiv.org/pdf/2509.20118
- "Subjective video quality", Wikipedia, accessed 2026-05-17. https://en.wikipedia.org/wiki/Subjective_video_quality
- TestDevLab, "TestDevLab's Approach to Subjective MOS Video Quality Evaluation", 2024. https://www.testdevlab.com/blog/testdevlab-approach-to-subjective-mos-video-quality-evaluation
- M. H. Pinson et al., The Influence of Subjects and Environment on Audiovisual Subjective Tests, IEEE Transactions on Multimedia, 2015. https://its.ntia.gov/publications/download/PinsonIEEE_TransMM_Dec2015.pdf
- ITU-T Recommendation P.808, Subjective evaluation of speech quality with a crowdsourcing approach, June 2021. https://www.itu.int/rec/T-REC-P.808-202106-I/en
- B. Naderi, R. Cutler et al., A crowdsourcing approach to video quality assessment, arXiv:2204.06784, 2022. https://arxiv.org/abs/2204.06784