Содержание статьи +
- TL;DR
- Почему это важно
- Что измеряет «субъективное качество»
- Шкала MOS и метки ACR
- DSCQS – double-stimulus continuous
- DSIS – double-stimulus impairment
- ACR и ACR-HR – single-stimulus методы
- Сколько зрителей? Лаборатория и краудсорс
- Четыре ловушки, на которых разваливается большинство тестов
- Числовой пример: метод под реальное решение
- Где здесь Фора Софт
- Ключевые выводы
- Что читать дальше
- Источники
TL;DR
Субъективный тест качества видео – это контролируемое исследование, в котором настоящие люди смотрят клипы и ставят им оценки за то, как они выглядят, а среднее этих оценок – Mean Opinion Score, или MOS – и есть эталон, который пытается предсказать любая объективная метрика (PSNR, SSIM, VMAF). Две рекомендации, которые определяют, как такие тесты проводятся, – это ITU-R BT.500-14 (для классического вещания, шестидесятилетний референс) и ITU-T P.910 (2023) вместе со спутником P.913 (2021) для мультимедиа, интернет-видео и домашних окружений. Внутри этих документов живут четыре метода, которые вы встретите во всех статьях и спецификациях: DSCQS и DSIS из лагеря double-stimulus, где зритель видит и эталон, и искажённую копию, и ACR с ACR-HR из single-stimulus, где зритель видит только искажённый клип и ставит ему оценку от 1 до 5. Ошибиться в выборе метода и условий – и цифра MOS превращается в маркетинговую обёртку; правильно их выбрать – и у вас появляется защищаемый бюджет качества для любого решения по кодекам, лестницам и устройствам.
Почему это важно
Если ваша команда хоть раз спорила, «достаточно ли хорошо» выглядит новый кодек, можно ли срезать нижнюю ступень битрейтной лестницы, чтобы сэкономить 20% egress, или насколько реальна красивая диаграмма от вендора энкодера – вы спорили о субъективном качестве, как бы вы это ни называли. Объективные метрики дают быстрый и дешёвый прокси к человеческим оценкам, но каждая из них – PSNR, SSIM, MS-SSIM, VMAF, XPSNR – обучалась, валидировалась или отвергалась на базе человеческих MOS, собранных одним из методов из этой статьи. Продакт-менеджер, который умеет читать субъективное исследование и отличить лабораторный 24-зрительный DSCQS-тест от 100-юзерной краудсорс-сессии ACR, – это тот, кого не получится взять «на пушку» красивой вендорской PDF.
Эта статья – для продакт-менеджера, video operations lead или фаундера, которому нужно заказать, прочитать или оспорить субъективное исследование. Начнём с того, что вообще измеряет «субъективное качество», пройдём четыре стандартных метода простым языком с временной арифметикой, выписанной целиком при первом упоминании, разберём современные краудсорс-рекомендации (ITU-T P.808 / P.913) и закончим практическими правилами, по которым выбирают метод под задачу, плюс четырьмя ловушками, на которых разваливается большинство исследований в индустрии.
Что измеряет «субъективное качество»
Слово субъективное качество в этой статье означает ровно одно: мнение, которое реальный зритель формирует, посмотрев клип, выраженное в виде числа на шкале. Не математическую близость сжатой копии к оригиналу, не уложился ли битрейт в бюджет, не попал ли энкодер в целевой VMAF. Только: показалось ли зрителю это красивым, и если нет – насколько плохо.
Чтобы превратить это мнение в число, на которое можно опираться, индустрия проводит субъективный тест. Сама процедура старше цифрового видео – её использовали ещё ранние телевизионные сети, чтобы сравнивать кинескопы, – а современную версию задают две рекомендации ITU, на которые ссылается каждая серьёзная лаборатория.
ITU-R BT.500-14 (октябрь 2019 года, четырнадцатая редакция начиная с 1974-го) – старшая из двух. 1 Она написана под вещание и предполагает, что зрителей можно посадить в контролируемую лабораторию, на откалиброванный CRT или LCD, на фиксированном расстоянии, в комнате с нейтрально-серыми стенами и контролируемым освещением. Документ состоит из трёх частей: общие требования (Часть 1), семейство методов оценки (Часть 2), применение к конкретным форматам (Часть 3). BT.500 – это то, на что показывают, когда говорят «мы прогнали стандартный тест».
ITU-T P.910 (октябрь 2023 года, третья крупная редакция) – более новая и та, на которую опирается большинство современных видеоисследований. 2 Она написана под мультимедиа: интернет-видео, смартфоны, планшеты, ноутбуки, разные дисплеи – и намеренно ослабляет лабораторные ограничения BT.500. Её спутник ITU-T P.913 (июнь 2021) идёт ещё дальше: позволяет проводить тесты в любом окружении, включая дом зрителя, при условии, что каждая деталь окружения описана для воспроизводимости. 3 Вместе P.910 и P.913 – это то, как индустрия в 2026 году ставит субъективные исследования стримингового видео.
Обе рекомендации в итоге выдают одно и то же число – MOS, Mean Opinion Score, – но описывают разные методы оценивания, разные объёмы выборки, разные комнаты и разные способы показа клипов. Выбор метода меняет стоимость, время, чувствительность к мелким искажениям и тип искажений, которые вы вообще способны зафиксировать. Дальше – экскурсия по этим методам.
Шкала MOS и метки ACR
Прежде чем разбирать методы, нужна шкала. Любой стандартный ITU-тест использует одну и ту же пятибалльную шкалу Absolute Category Rating – ACR, – которая фигурирует и как самостоятельный метод оценивания, и как набор меток во всех остальных методах.
Пять меток: Excellent (5), Good (4), Fair (3), Poor (2), Bad (1). 4 Зритель смотрит клип, отмечает одну из пяти позиций, экспериментатор усредняет все отметки по этому клипу по всем зрителям – получается MOS для этого клипа. Клип, которому все поставили 5, наберёт 5.00; клип, который ровно половина зрителей назвала Fair, а половина Good, наберёт 3.50. MOS лежит между 1.00 и 5.00 – ни выше, ни ниже – и публикуемое число всегда идёт с доверительным интервалом, обычно 95%, который показывает, насколько среднее может уйти, если повторить исследование с новой панелью.
Под этой аккуратной шкалой лежат две практические оговорки, и игнор любой из них – это как продакт-команды начинают спорить о бессмысленных цифрах.
Во-первых, метки не равноудалены в голове зрителя. 4 Воспринимаемое «расстояние» от Bad до Poor не равно расстоянию от Good до Excellent; повторяющиеся исследования на разных языках показывают, что промежуток между Fair и Good – самый широкий из четырёх. Это значит, что MOS 3.0 не середина шкалы – он ближе к «заметно хуже приемлемого». Когда вендор пишет «у нас средний MOS 3.4», помните: 3.4 намного дальше от «good», чем номинальная шкала вам подсказывает.
Во-вторых, MOS из разных исследований нельзя сравнивать напрямую. Один и тот же клип в двух разных комнатах, на двух разных панелях, на двух разных дисплеях может получить оценки, отличающиеся на полбалла MOS просто из-за контекста: освещение, диапазон яркости остальных клипов в сессии, калибровка экрана. Серьёзное исследование указывает комнату, дисплей, дистанцию просмотра, состав панели, порядок клипов и длительность сессии, чтобы другая лаборатория могла его воспроизвести. Вендорский слайд, который приводит MOS без этого контекста, использует число как маркетинг, а не как науку.
Со шкалой в руках можно идти по четырём методам.
DSCQS – double-stimulus continuous
DSCQS, или Double Stimulus Continuous Quality Scale, – историческая рабочая лошадка BT.500 и метод, который чаще всего называют золотым стандартом сравнения кодеков, когда важны мелкие различия. 1 5
Процедура построена на парах. На каждое тестовое условие зритель видит два клипа подряд: один – неискажённый эталон, второй – искажённая версия, которую выдал ваш энкодер, ваш канал передачи или то, что вы оцениваете. Порядок внутри пары рандомизируется, и зритель не знает, какой клип первый. Зритель может перепросматривать пару столько, сколько захочет, и оценивает оба клипа по непрерывной шкале 0-100, поверх которой нанесены пять меток ACR – Bad, Poor, Fair, Good, Excellent, – но позволяющей любое значение между. Оценкой для условия становится разница между оценкой эталона и оценкой искажённого клипа; среднее этих разниц по панели – это Differential MOS (DMOS) для условия. 6
Почему именно разница, а не абсолютная оценка? Потому что одни зрители систематически щедрые, другие – систематически строгие, но почти все внутренне последовательны: пусть конкретный зритель ставит эталону 85 вместо 95, он поставит искажённой копии 70 вместо 80 примерно на ту же величину. Вычитание убирает личную шкалу зрителя и выделяет именно искажение. Поэтому DSCQS – это метод, к которому индустрия и академия тянутся, когда нужно сравнить кодеки на грани прозрачности, где искажение мало, а разброс между зрителями иначе утопит сигнал.
Минус – время. Типичная DSCQS-сессия сводит каждый искажённый клип в пару с эталоном, проигрывает пару дважды (зритель может попросить ещё раз) и даёт время на оценку обеих половин по непрерывной шкале. Сравнительное исследование NTIA / ITS 2003 года замерило среднее время на условие: около 41 с для DSCQS против 12 с у самой простой ACR. 5 За 60 минут DSCQS успевает примерно 70 условий; ACR – 200. Для 24-зрительной панели и 30 условий DSCQS – это пол-дня обязательства на одного зрителя плюс время на скрининг; ACR – это час. На сотнях условий разница в стоимости – это разница между research-проектом и продакшен-пайплайном.
Берите DSCQS, когда искажения мелкие, когда нужно защитить почти-прозрачный результат кодека перед reviewer'ом или когда абсолютный порядок двух очень близких конфигураций энкодера важнее, чем пропускная способность. Если условий много – переходите на что-то быстрее.
DSIS – double-stimulus impairment
DSIS, или Double Stimulus Impairment Scale, – это более быстрый родственник DSCQS, тоже часть BT.500. Они разделяют идею double-stimulus – зритель в каждом раунде видит и эталон, и искажённый клип, – но DSIS упрощает остальное в трёх местах. 7
Во-первых, пара идёт в известном фиксированном порядке: эталон всегда первый, искажённый – второй. Зритель знает, где что. Во-вторых, пара играется один раз, без replay-цикла. В-третьих, зритель оценивает impairment – насколько второй клип выглядел хуже первого – по пятибалльной шкале impairment: Imperceptible (5), Perceptible but not annoying (4), Slightly annoying (3), Annoying (2), Very annoying (1).
По структуре это та же пятибалльная ACR с переименованными метками, поэтому среднее считают так же, а результат публикуют как MOS или DMOS в зависимости от соглашения лаборатории. Преимущество в том, что внимание зрителя сфокусировано именно на различии: его не просят судить абсолютное качество ни одного из клипов – только то, насколько второй пострадал.
DSIS острее DSCQS на крупных и очевидных искажениях – ошибках передачи, сильном блокинге, фрейм-дропах – потому что метки шкалы impairment изначально проектируются под повреждение, а не под «красиво / некрасиво». DSIS быстрее DSCQS, потому что пара играется один раз и шкала дискретная, а не непрерывная. То же исследование NTIA / ITS 2003 года замерило DSIS около 20 с на условие – половина DSCQS. 5
Используйте DSIS для исследований transmission quality, тестов на устойчивость к ошибкам, симуляций packet loss и в любых сценариях, где интересующие искажения достаточно крупные, чтобы вопрос «насколько сильно сломано» был корректным. Это также основной метод, под которым публиковались BT.500-исследования в вещании и surveillance до 2010-х.
ACR и ACR-HR – single-stimulus методы
ACR, или Absolute Category Rating, выкидывает double-stimulus совсем. Зритель видит только искажённый клип – без эталона, без сравнения – и сразу после оценивает его качество по пятибалльной шкале ACR (Excellent, Good, Fair, Poor, Bad). 2 4
Выглядит как заведомо более слабый дизайн – как зритель может судить качество без эталона? – но на практике это работает по двум причинам. Во-первых, у зрителя в голове сидит неявный эталон из тысяч часов просмотра ТВ и стриминга; он представляет, как должно выглядеть «good 1080p», и ставит оценку соответственно. Во-вторых, отказ от показа эталонного клипа удваивает пропускную способность сессии. То же исследование NTIA / ITS замерило самую простую 5-step ACR на 12 с на условие – быстрее всех остальных методов в сравнении, включая DSCQS (41 с) и DSIS (20 с). 5
ACR – метод по умолчанию в ITU-T P.910 и тот, который используют большинство мультимедиа-исследований. Редакция 2023 года расширила P.910: разрешены альтернативные шкалы (есть 9- и 11-балльные непрерывные варианты, если нужно более тонкое разрешение), ослаблены лабораторные требования BT.500, признана реальность, что зрители смотрят на смартфонах, планшетах и ноутбуках вне лаборатории. 2
ACR-HR («ACR with Hidden Reference») – это улучшение ACR в его самом слабом месте. В обычной ACR-сессии неискажённый эталон подмешивается в пул искажённых клипов и оценивается по той же шкале, что и остальное. Поскольку ни один зритель не идеально последователен, эталон не всегда получает ровно 5.00 – и оценку конкретного условия можно скорректировать, вычитая оценку искажённого клипа из оценки эталона. На выходе получается DMOS – ровно как в DSCQS, но без double-stimulus-штрафа на пропускную способность. ACR-HR держит пропускную способность обычной ACR и одновременно даёт корректировку смещения, поэтому P.910 рекомендует именно ACR-HR всегда, когда у вас есть эталонный клип. 2
Слабая сторона ACR-семейства – чувствительность на высоком качестве. Несколько публикаций сообщают, что DSCQS чувствительнее ACR на очень мелких искажениях – те самые «один энкодер чуть лучше другого», которые волнуют research-статьи по кодекам. 5 8 Для большинства продакшен-решений 2026 года – дизайн битрейтной лестницы, выбор кодека, оценка вендора энкодера – пропускная способность ACR-HR выигрывает.
Числовой пример закрепляет компромисс. Допустим, у вас 30 условий, 24 зрителя на условие, лимит 60 минут на сессию (после которого усталость портит данные). Время по методам:
DSCQS: 30 условий × 41 с/условие = 1230 с = 20.5 мин чистой оценки
DSIS: 30 × 20 с = 600 с = 10 мин
ACR: 30 × 12 с = 360 с = 6 минДобавьте скрининг, тренировку, инструкции, перерывы и паузы между клипами – и 60-минутная сессия комфортно вмещает ACR, вмещает DSIS, начинает поджимать на DSCQS. Поднимите число условий до 60, и DSCQS уже не помещается в одну сессию – приходится либо делить панель, либо растягивать на два дня, что удваивает стоимость рекрутинга.
Сколько зрителей? Лаборатория и краудсорс
Субъективный тест – это не меньше упражнение в статистике, чем в видео, и первый вопрос заказчика всегда «сколько зрителей мне нужно».
Лабораторный ответ – из BT.500 и P.910. ITU рекомендует минимум 15 зрителей для валидного результата, 24 зрителя – стандартная цель для контролируемого окружения, 35 зрителей – для публичного / расслабленного окружения. 9 10 Ниже 4 – математика уже не защищается; выше 40 – прирост точности не оправдывает стоимости. 24-зрительная панель с правильным скринингом и отсевом outlier-ов обычно даёт 95% доверительный интервал около ±0.5–0.7 балла MOS на пятибалльной шкале, что достаточно, чтобы развести кодеки, отличающиеся на половину «ступени» качества. 9
Отсев outlier-ов – часть процедуры. BT.500 Annex 2 описывает скрининг по куртозису оценок: если разброс конкретного зрителя слишком велик или слишком мал относительно остальной панели, процедура помечает его как ненадёжного и убирает его данные из расчёта MOS. 11 Редакция P.910 2023 года добавляет итеративный метод по корреляции Пирсона между каждым зрителем и текущим MOS – он агрессивнее снимает систематически некоррелирующих зрителей. В любом случае правило одно: описать, кого вы убрали и почему.
Краудсорс-ответ – из другой рекомендации. ITU-T P.808 (июнь 2021) изначально написан под speech-тестирование через краудсорс – оплачиваемые онлайн-rater'ы слушают клипы и ставят оценки, – и та же машинерия адаптирована под видео. 12 Краудсорс снижает стоимость на одного rater'а в 10-100 раз против лаборатории, расширяет mix устройств и окружений ближе к реальным домам зрителей и даёт доступ к сотням-тысячам rater'ов вместо десятков. Цена – шум: внимание, калибровка экрана, сеть, дистанция просмотра – всё неконтролируемо, и каждый rater шумнее лабораторного. Эмпирический ответ – объём: опубликованные исследования по P.808 для видео обычно требуют 60-100 валидных голосов на условие, чтобы выйти на ту же точность, что и 24-зрительный лабораторный тест. 12 13
В 2026 году типовой продакшен-пайплайн стрим-сервиса при оценке нового кодека или лестницы – гибрид: маленькое аккуратное лабораторное исследование под P.910 / BT.500 для заголовочных цифр и аргумента валидности, плюс крупное краудсорс-исследование под P.808 для длинного хвоста условий, типов контента и категорий устройств, которые лаборатория позволить себе не может.
Четыре ловушки, на которых разваливается большинство тестов
В сотнях индустриальных и академических исследований повторяются одни и те же четыре ошибки достаточно часто, чтобы выделить их отдельно. Если вы заказываете или читаете субъективные исследования – натренируйте глаз на эти четыре пункта.
Ловушка 1 – сравнение MOS между исследованиями. Два MOS-значения из двух разных лабораторий, на разных дисплеях, с разными панелями – это не одно и то же число, даже если оба равны 3.7. Контекстуальные факторы – яркость дисплея, освещение комнаты, возраст и опыт панели, порядок клипов, длительность сессии – сдвигают абсолютную шкалу MOS на полбалла и больше. Вендорский слайд, который сравнивает свой 4.1 с конкурентским 3.7 из другого исследования, сравнивает два термометра, никогда между собой не калиброванных.
Ловушка 2 – ACR на почти-прозрачных искажениях. ACR быстра и отлично работает на средних и крупных искажениях, но на верхнем конце шкалы (визуально прозрачные кодеки, две ступени лестницы, отличающиеся на 50 кбит/с) отсутствие side-by-side эталона делает неявный эталон зрителя слишком шумным. Вы измерите разницу, в которой доминирует шум зрителя, а не производительность кодека. Берите DSCQS или DSIS на этих экспериментах.
Ловушка 3 – арифметика над MOS как над interval-шкалой. Поскольку метки ACR не равноудалены в голове зрителя, среднее по набору ACR-оценок технически – это среднее по ordinal-шкале, что математически сомнительно. 4 На практике индустрия согласилась жить с этим приближением и публиковать MOS как среднее, но трактовать MOS 4.2 как «ровно 60% пути от Fair до Excellent» – это переинтерпретация. Если данные скошены, рапортуйте и медиану рядом; 95% CI цитируйте всегда.
Ловушка 4 – недостаточный скрининг панели. Серьёзные субъективные исследования отсеивают ненадёжных зрителей по куртозису из BT.500 или по итеративному LPCC из P.910. 11 Исследования, которые публикуют сырые MOS без слова об отсеве, обычно имеют одного-двух зрителей, тянущих среднее в свою сторону. Всегда смотрите в текст исследования на упоминание метода скрининга; если его нет – надёжность результата неизвестна.
Числовой пример: метод под реальное решение
Допустим, ваша команда строит платформу e-learning и нужно решить, ставить ли нижнюю ступень H.264 на 1.2 Мбит/с или на 1.6 Мбит/с в 720p. Версия на 1.2 экономит 25% трафика на самой медленной ступени; есть подозрение, что зрители разницы не заметят.
Полезное исследование выглядит так. Собираете панель 24 зрителя, прошедших скрининг на нормальное зрение и подобранных из целевой аудитории (университетские студенты для e-learning). Готовите 10 исходных клипов, репрезентативных для контента: говорящая голова, screencast «слайды + голос», whiteboard, отдельные вставки 24 fps. Делаете обе ступени для каждого клипа плюс скрытый эталон в исходном качестве – всего 30 условий.
Выбор метода: ACR-HR под ITU-T P.910 (2023), стандартная пятибалльная шкала, откалиброванный 1080p-монитор, дистанция 3H. Почему ACR-HR? Потому что разница, которую вы тестируете (1.2 vs 1.6 Мбит/с в 720p H.264), умеренная, не на грани прозрачности – зрители, скорее всего, увидят артефакты на нижней ступени. ACR-HR даёт пропускную способность (12 с × 30 условий = 6 минут чистой оценки, комфортно в 45-минутной сессии), коррекцию смещения через hidden reference и возможность вычислить MOS и DMOS на анализе.
Объём выборки: 24 зрителя – лабораторный дефолт – обеспечит 95% CI около ±0.5 балла MOS на средних. Скрининг: куртозис по BT.500 плюс LPCC-итерация по P.910. В отчёте – размер панели до и после скрининга.
На выходе – MOS на условие с доверительным интервалом. Если 1.2-Мбит/с ступень укладывается в пределах 0.3 MOS от 1.6-Мбит/с и интервалы пересекаются – катите нижний битрейт и экономите 25% egress на этой ступени. Если разрыв больше 0.5 MOS и интервалы не пересекаются – оставляете высокий битрейт и в следующем квартале пробуете 1.4 Мбит/с.
Так субъективное исследование превращается в продакшен-решение, а не в спор.
Где здесь Фора Софт
Субъективное качество видео – повторяющаяся задача почти в каждом продукте, который мы делаем в Фора Софт: видеоконференции, OTT и Internet TV, e-learning, телемедицина, surveillance. В телемедицине нужно убедить врача, что поток с дерматоскопа достаточно резкий для диагностики; в surveillance – что лицо распознаваемо на всех ступенях лестницы. Объективная метрика на дашборде – это инструмент ежедневного мониторинга; субъективный тест – это то, что мы запускаем, когда метрика и человек не сходятся, когда заказчик говорит «новая сборка выглядит хуже» без цифр или когда мы хотим сжать поток сильнее, чем оправдывает одна метрика. Мы прогоняли и маленькие in-product панели, и крупные крауд-исследования – и правило, которое держится во всех проектах, то же, что и в этой статье: предельно точно описать метод, скринить панель и никогда не сравнивать MOS из разных, не калиброванных между собой исследований.
Ключевые выводы
- MOS – эталонное число качества; все объективные метрики (PSNR, SSIM, VMAF) предсказывают именно его.
- BT.500 – это лабораторные вещательные тесты; P.910 (2023) и P.913 (2021) – современные мультимедиа.
- DSCQS медленнее и точнее на гранично-прозрачных кодеках; ACR-HR быстрее и подходит для продакшен-решений.
- 24 лабораторных зрителя или 60-100 крауд-голосов на условие – современный минимум для защищаемого MOS.
- MOS из разных исследований несравнимы – всегда читайте комнату, панель и метод скрининга.
Что читать дальше
- Объективные метрики качества: PSNR, SSIM, MS-SSIM, VMAF – метрики, которые масштабно приближают MOS.
- Как выбрать кодек для сервиса в 2026 году – как субъективные исследования встраиваются в выбор кодека.
- Per-title и per-scene encoding: умные битрейтные лестницы – пайплайн, в котором субъективные исследования – входные данные.
Источники
- ITU-R Recommendation BT.500-14, Methodologies for the subjective assessment of the quality of television images, October 2019. https://www.itu.int/dms_pubrec/itu-r/rec/bt/R-REC-BT.500-14-201910-S!!PDF-E.pdf
- ITU-T Recommendation P.910, Subjective video quality assessment methods for multimedia applications, October 2023. https://www.itu.int/rec/T-REC-P.910-202310-I/en
- ITU-T Recommendation P.913, Methods for the subjective assessment of video quality, audio quality and audiovisual quality of Internet video and distribution quality television in any environment, June 2021. https://www.itu.int/rec/T-REC-P.913-202106-P/en
- "Mean opinion score", Wikipedia, accessed 2026-05-17. https://en.wikipedia.org/wiki/Mean_opinion_score
- M. H. Pinson and S. Wolf, Comparing subjective video quality testing methodologies, NTIA / ITS, SPIE 2003. https://its.ntia.gov/publications/download/spie03subj.pdf
- Elecard, "Video quality measurement metrics: SSIM, PSNR, MOS, DMOS, JND", accessed 2026-05-17. https://www.elecard.com/page/article_objective_video_quality_metrics
- ScienceDirect topic page, "Double Stimulus Impairment Scale", accessed 2026-05-17. https://www.sciencedirect.com/topics/engineering/double-stimulus-impairment-scale
- Anonymous authors, Comparative Study of Subjective Video Quality Assessment Test Methodologies, arXiv:2509.20118, 2025. https://arxiv.org/pdf/2509.20118
- "Subjective video quality", Wikipedia, accessed 2026-05-17. https://en.wikipedia.org/wiki/Subjective_video_quality
- TestDevLab, "TestDevLab's Approach to Subjective MOS Video Quality Evaluation", 2024. https://www.testdevlab.com/blog/testdevlab-approach-to-subjective-mos-video-quality-evaluation
- M. H. Pinson et al., The Influence of Subjects and Environment on Audiovisual Subjective Tests, IEEE Transactions on Multimedia, 2015. https://its.ntia.gov/publications/download/PinsonIEEE_TransMM_Dec2015.pdf
- ITU-T Recommendation P.808, Subjective evaluation of speech quality with a crowdsourcing approach, June 2021. https://www.itu.int/rec/T-REC-P.808-202106-I/en
- B. Naderi, R. Cutler et al., A crowdsourcing approach to video quality assessment, arXiv:2204.06784, 2022. https://arxiv.org/abs/2204.06784