ACR, DCR, PC: методы субъективных тестов видео

Автор: Николай СапуновОбновлено: август 202623 мин чтения
Содержание статьи +

Кратко

Субъективный тест может задать зрителям четыре принципиально разных вопроса, и от выбора вопроса зависит, насколько тест будет чувствительным, быстрым и дорогим. Absolute Category Rating (ACR) показывает по одному клипу и спрашивает «насколько это хорошо?»; Degradation Category Rating (DCR) сначала показывает чистый оригинал и спрашивает «насколько копия испорчена?»; Comparison Category Rating (CCR) показывает два клипа и спрашивает «насколько второй лучше или хуже?»; а Pair Comparison (PC) показывает два клипа и спрашивает только «какой лучше?». Все четыре определены в ITU-T P.910 (10/2023) для мультимедийного видео, а их вещательные варианты – DSIS и непрерывная шкала DSCQS – в ITU-R BT.500-15 (05/2023). Эта статья разбирает каждый метод с азов, показывает арифметику, из-за которой Pair Comparison взрывается на больших тестах, и даёт правило выбора метода под задачу.

Почему это важно

Выбор не того метода – самая дорогая ошибка в субъективном тестировании, потому что обнаруживается она только после сбора данных: быстрый метод, не видящий нужную разницу, тратит всю панель впустую, а чувствительный метод на слишком большом числе условий никогда не доходит до конца. Статья – для видеоинженера, QA-лида или оценщика кодеков, кому нужно спроектировать или заказать тест – или прочитать чужую статью о качестве и понять, подходит ли метод заявленному выводу. Это статья о методах в нашем блоке субъективного тестирования: предыдущая, MOS, DMOS и шкалы оценки, объясняла числа, которые эти тесты выдают, а следующая, дизайн субъективного теста, выдерживающего проверку, – как построить выбранный тест. Короткая версия для оператора энкодера – в обзоре субъективного тестирования раздела Video Encoding, а всё здесь – глубокая проработка за ней.

Одно решение за каждым методом: один стимул или два

До акронимов есть одна развилка, организующая все методы. Субъективный тест либо показывает зрителю один клип и просит оценить его в одиночку, либо показывает два клипа и просит оценить один относительно другого. Всё остальное – шкала, анализ, стоимость – следует из этого выбора.

Метод, показывающий по одному клипу, – это одностимульный (single-stimulus) метод. Зритель встречает каждый клип так же, как встречает видео в реальной жизни: сам по себе, без эталона для сравнения. ACR – одностимульный метод.

Метод, показывающий два клипа на одну оценку, – это двухстимульный (double-stimulus) метод. У зрителя всегда есть второй клип – обычно чистый оригинал – перед глазами или в недавней памяти, и он оценивает отношение между двумя. DCR, CCR и PC – все двухстимульные, и различаются лишь тем, что просят сделать с парой.

Размен – суть этой статьи. Один клип быстро показать, и за сессию можно оценить много условий, но суждение зрителя загрязнено тем, насколько ему понравился контент, и его личной строгостью. Два клипа гасят эти смещения и вскрывают меньшие различия, но каждое суждение занимает примерно вдвое больше времени, поэтому условий охватишь куда меньше. Держите этот размен в голове; остальное – детали.

ACR: показать один клип, оценить сам по себе

Начнём с метода, который встречается чаще всего. Absolute Category Rating (ACR) – одностимульный метод из ITU-T P.910 §8.1: каждый клип показывают один раз, сам по себе, и сразу после зритель оценивает его по пятибалльной шкале качества. «Абсолютный» значит, что зритель судит клип по его собственным достоинствам, без эталона для сравнения.

Шкала – пять подписанных категорий, не голые цифры (ITU-T P.910 §8.1):

ОценкаМетка
5Excellent (отлично)
4Good (хорошо)
3Fair (удовлетворительно)
2Poor (плохо)
1Bad (очень плохо)

Усредните эти оценки по панели – получите Mean Opinion Score (MOS) клипа, число, подробно разобранное в MOS, DMOS и шкалы оценки. ACR – рабочая лошадка отрасли по одной причине: это самый быстрый метод на одну оценку, ведь одно суждение тратит один клип и один голос. Эта пропускная способность – причина того, что почти любая крупная база качества и почти любой краудсорсинговый тест строятся на ACR или его варианте со скрытым эталоном.

У ACR есть близкий родственник, который стоит назвать здесь, потому что на практике он самый частый. ACR with Hidden Reference (ACR-HR) из P.910 §8.6.2 проводит обычный ACR-тест, но тихо подмешивает чистые исходные клипы в набор как неподписанные элементы. В анализе из оценки обработанного клипа вычитают оценку скрытого эталона того же зрителя, что восстанавливает оценку деградации (DMOS), сохраняя одностимульную скорость ACR. Это, в каком-то смысле, мост между миром одного и двух стимулов: зритель не знает, что делает сравнение, но анализ всё равно – сравнение.

Слабость ACR – обратная сторона его скорости. Поскольку зритель не видит оригинал, ACR «может быть нечувствителен к некоторым искажениям, легко обнаруживаемым» при наличии эталона (ITU-T P.910 §8.2.1) – лёгкая потеря деталей или слабый сдвиг цвета проходят незамеченными, когда не с чем сравнить. P.910 также количественно задаёт разрешающую способность ACR: метод «редко даёт» надёжно различимую разницу MOS ниже 0,5 балла для 24 субъектов, 0,7 для 15, 1,1 для 9 и 1,5 для 6 (ITU-T P.910 §8.1.1). Если интересующая вас разница меньше этого порога, ACR – не тот инструмент, и вы берёте двухстимульный метод.

DCR / DSIS: показать оригинал, затем оценить ущерб

Когда вопрос меняется с «насколько это хорошо?» на «насколько клип верен оригиналу?», вы переходите к Degradation Category Rating (DCR) из ITU-T P.910 §8.2, известному в вещательном стандарте ITU-R BT.500-15 как Double Stimulus Impairment Scale (DSIS). Зрителю сначала показывают чистый источник – он знает, что это источник, – затем обработанный клип, и просят оценить, насколько испорчен второй относительно первого.

Шкала меняется со слов о качестве на слова об искажении (ITU-T P.910 §8.2):

ОценкаМетка
5Imperceptible (незаметно)
4Perceptible, but not annoying (заметно, но не раздражает)
3Slightly annoying (слегка раздражает)
2Annoying (раздражает)
1Very annoying (очень раздражает)

Сила DCR – ровно там, где ACR слеп. С оригиналом перед глазами зритель замечает мелкие потери верности, исчезающие в одностимульном тесте, поэтому P.910 рекомендует DCR «при оценке верности передачи относительно исходного сигнала», отмечая, что это «часто важный фактор при оценке высококачественных систем» (ITU-T P.910 §8.2.1). Эмпирически выигрыш реален: в контролируемом сравнении на контенте 1080p H.264 DCR/DSIS дал меньшие доверительные интервалы, чем ACR, особенно на низком качестве, тогда как ACR оставался самым быстрым (Kawano и др., 2014).

Цена – пропускная способность. Два клипа на оценку примерно вдвое уменьшают число условий за сессию той же длины. DCR также измеряет ущерб, а не улучшение: поскольку 5 значит «незаметно» (идентично источнику), шкала не может выразить клип, который вдруг выглядит лучше эталона – реальная ситуация при шарпинге или супер-разрешении. Для этого нужен следующий метод.

CCR / DSCS: оценить второй клип относительно первого, вверх или вниз

Comparison Category Rating (CCR) из ITU-T P.910 §8.3, также называемый Double Stimulus Comparison Scale (DSCS), показывает зрителю два клипа – обычно обработанный и эталон в случайном порядке – и просит оценить качество второго относительно первого по семибалльной шкале сравнения, работающей в обе стороны (ITU-T P.910 §8.3):

ОценкаМетка
+3Much better (намного лучше)
+2Better (лучше)
+1Slightly better (слегка лучше)
0The same (так же)
−1Slightly worse (слегка хуже)
−2Worse (хуже)
−3Much worse (намного хуже)

CCR отличают две вещи. Во-первых, шкала симметрична вокруг нуля, поэтому может зафиксировать, что второй клип выглядел лучше первого – случай, который DCR выразить не может. Это важно всякий раз, когда «обработка» может добавить видимого качества: пространственное масштабирование, шумоподавление или ИИ супер-разрешение способны поднять клип выше его источника в глазах зрителя, и только шкала сравнения это ловит. Во-вторых, поскольку порядок двух клипов рандомизирован и зритель оценивает отношение, CCR хорошо подходит для «сравнения искажений, почти равных по качеству» (ITU-T P.910 §8.3.1) – ситуации, когда два энкодера настолько близки, что абсолютная шкала их не разделяет.

Свежие краудсорсинговые данные конкретно показывают преимущество CCR в чувствительности. В P.910-совместимом исследовании 2024–2025 CCR был чувствительнее ACR-HR и «отражал улучшения качества за пределами эталона» при супер-разрешении, тогда как ACR-HR показывал сжатое использование шкалы – не растягивал оценки – особенно на контенте среднего качества (Naderi & Cutler, P.910-Crowd; сравнительное исследование, 2025). Цена, опять же, – стоимость: то же исследование нашло, что ACR-HR «примерно вдвое быстрее и дешевле» CCR.

PC: забудьте про шкалу, просто выберите лучший

Самый чувствительный метод просит зрителя сделать простейшее возможное. Pair Comparison (PC) из ITU-T P.910 §8.4, называемый stimulus-comparison в ITU-R BT.500-15, показывает два клипа и задаёт один вопрос: какой из них лучше? Шкалы оценки нет вовсе – только вынужденный выбор (иногда с опцией «без предпочтения»).

Убрав шкалу, вы убираете самую трудную часть любой задачи оценки. Зритель, который мучается, «тройка» это или «четвёрка», почти всегда скажет, какой из двух клипов он предпочитает, поэтому Pair Comparison – самый разделяющий метод, когда тестовые элементы очень близки по качеству. Это метод выбора, когда нужно разделить энкодеры, которые абсолютная шкала показывает как равные.

Чтобы превратить груду голосов «A лучше B» в шкалу качества, нужна модель. Два стандартных выбора – Закон сравнительных суждений Тёрстоуна (Thurstone), переводящий вероятности предпочтения в z-оценки на перцептивной шкале, и модель Брэдли–Терри (Bradley–Terry), логистическая модель, дающая оценки, часто в единицах just-objectionable-difference (JOD). Обе превращают счёт побед/поражений в одномерный рейтинг с реальным расстоянием, так что Pair Comparison даёт упорядоченную шкалу, хотя ни один зритель шкалой не пользовался.

У Pair Comparison есть одна жестокая слабость, и она арифметическая, а не перцептивная. Число различных пар растёт как квадрат числа условий – и на реальном тесте это число выходит из-под контроля очень быстро. Этот взрыв стоит разобрать целиком, потому что именно он решает, применим ли PC для вашего теста.

Рисунок 1. Одно решение за каждым методом. ACR – одностимульный (один клип, оценка в одиночку); DCR, CCR и PC – двухстимульные (два клипа, оценка отношения). Меняется именно задаваемый вопрос.

Четыре шкалы рядом

Метод и его шкала идут вместе, поэтому стоит увидеть все четыре сразу. ACR оценивает абсолютное качество пятью словами о качестве; DCR оценивает искажение пятью словами об искажении; CCR оценивает отношение по семибалльной шкале от «намного хуже» через «так же» до «намного лучше»; а у Pair Comparison шкалы нет, только выбор. Направление и форма шкалы не косметика – они решают, что тест может и не может обнаружить.

Рисунок 2. Четыре метода, четыре шкалы. Двунаправленная шкала CCR – единственная, что фиксирует улучшение выше эталона; PC отбрасывает шкалу полностью ради вынужденного выбора.

Родственники с непрерывной шкалой: DSCQS, SAMVIQ и SSCQE

Четыре категориальных метода выше покрывают большую часть мультимедийного тестирования, но вещательное ТВ добавило семейство методов с непрерывной шкалой, которые ITU-R BT.500-15 определяет до сих пор, и вы встретите их в статьях о кодеках. Они важны, когда различия столь малы, что даже пятибалльная категориальная шкала слишком груба.

Главный из них – Double Stimulus Continuous Quality Scale (DSCQS). Зритель видит эталон и тестовый клип (часто каждый показывают дважды) и оценивает оба по непрерывной линии, размеченной только прилагательными качества, причём идентичность эталона скрыта рандомизацией порядка. Оценка – разность между двумя оценками. Поскольку зритель оценивает по непрерывной линии, а не выбирает категорию, DSCQS не загоняет тонкие суждения в грубые корзины, что делает его классическим выбором «когда качества тестового материала и оригинала близки» – почти прозрачный, высококачественный случай (ITU-R BT.500-15). Это исторический золотой стандарт оценки кодеков на высоком качестве.

Ещё два дополняют семейство. SAMVIQ (Subjective Assessment of Multimedia Video Quality) из P.910 §8.5 позволяет зрителю проигрывать несколько клипов в любом порядке против явного эталона и оценивать каждый по непрерывной шкале 0–100 – полезно, когда нужны произвольный доступ и прямое многостороннее сравнение. SSCQE (Single Stimulus Continuous Quality Evaluation) из BT.500 заставляет зрителя непрерывно двигать слайдер во время просмотра длинного контента, фиксируя, как качество меняется во времени, а не одно число на клип, – метод, когда важна просадка качества в середине, а не среднее.

Эти непрерывные методы покупают тонкое различение ценой трудности для зрителя и медленного прохождения. P.910 прямо говорит, что простое добавление точек шкалы категориальному методу не помогает: для непрерывных и многоточечных шкал «точность итогового MOS не улучшается», тогда как «метод становится труднее для субъектов» (ITU-T P.910 §8.7.1). Непрерывные методы оправдывают себя своей структурой – скрытым эталоном в DSCQS, осью времени в SSCQE, – а не лишним разрешением шкалы.

Как две рекомендации делят работу

Эту территорию регулируют две рекомендации ITU, и люди ищут их по точному слагу, поэтому полезно знать, что чему принадлежит.

ITU-T P.910 (10/2023) – главная рекомендация для мультимедийного качества видео: мир стриминга, конференций, мобильного и пользовательского контента, в котором работает большинство инженеров. Издание 2023 года – консолидированное: оно вобрало прежние P.911 и P.913 (P.913 формально удалена 2 февраля 2024, её методы «для любой среды» влиты в P.910), поэтому сегодня P.910 – единственная актуальная ссылка для ACR, DCR, CCR, PC, ACR-HR и SAMVIQ. Цитируйте это издание, а не версии 1999 или 2008 годов, всё ещё гуляющие по сети.

ITU-R BT.500-15 (05/2023) – вещательный компаньон, организованный в три части: общие требования и когда какой метод применять, сами методологии и рекомендации под конкретные форматы. Это дом DSIS (вещательное имя DCR), DSCQS, одностимульных методов, stimulus-comparison (парного сравнения), SSCQE и SDSCE, а также канонических правил условий просмотра и отбора, которые мир мультимедиа заимствует. Когда статья цитирует «BT.500», это почти всегда ради установки просмотра или метода DSCQS/DSIS.

Практическое правило: если вы тестируете стриминг, конференции, мобильное или UGC, отталкивайтесь от P.910; если тестируете вещательное ТВ или нужен DSCQS на почти прозрачном качестве, берите BT.500-15. Две рекомендации сильно перекрываются и согласны в основах; имена методов в основном соответствуют (DCR ≈ DSIS, CCR ≈ DSCS).

Три вещи, которые реально различаются: чувствительность, пропускная способность и нагрузка

Сняв имена, четыре метода различаются по трём осям, решающим каждый реальный выбор дизайна.

Чувствительность – наименьшая разница качества, которую метод надёжно обнаруживает. Pair Comparison чувствительнее всех, потому что вынужденный выбор – простейшее суждение; CCR и DCR идут следом, потому что видимый эталон вскрывает мелкие потери верности; ACR наименее чувствителен, потому что зрителю не с чем сравнивать. Если условия далеки по качеству, низкая чувствительность ACR не важна и его скорость побеждает; если они почти равны, нужен метод сравнения, иначе тест выдаст бессмысленную ничью.

Пропускная способность – сколько условий можно оценить за единицу времени зрителя. ACR лидирует с большим отрывом – один клип, один голос, – поэтому он доминирует в крупных и краудсорсинговых тестах. DCR и CCR примерно вдвое снижают пропускную способность, показывая два клипа на суждение. Pair Comparison – в отдельной категории, потому что его стоимость растёт не линейно с числом условий, а как квадрат.

Нагрузка на участника – насколько задача трудна для зрителя и как быстро он устаёт. Вынужденный выбор – легчайшая когнитивная задача; оценка по абсолютной пятибалльной шкале тяжелее (зритель должен держать в голове модель «что значит тройка»); непрерывная шкала тяжелее всего. Нагрузка взаимодействует с длиной сессии: P.910 ограничивает сессии, чтобы контролировать усталость (ITU-T P.910 §11.1), поэтому более тяжёлая задача значит меньше оценок до того, как внимание зрителя деградирует.

Одна честная оговорка не даёт размену стать чистым рейтингом. Мета-эксперимент 2003 года нашёл, что одностимульный непрерывный тест может сравняться с двухстимульным по точности после правильной статистической пост-обработки – то есть двухстимульные методы не несут врождённого преимущества в точности, только размен чувствительности и пропускной способности (Pinson & Wolf, 2003). Глаз не становится правдивее, когда вы показываете ему два клипа; вы просто даёте ему более простое суждение. Выбирайте метод, делающий интересующую вас разницу лёгким суждением.

Рисунок 3. Главный размен. Движение от ACR к Pair Comparison покупает чувствительность и платит пропускной способностью. В правом верхнем углу метода нет – поэтому выбор метода и есть выбор.

Разбор примера: почему Pair Comparison взрывается

Вот арифметика, решающая, возможен ли Pair Comparison для вашего теста вообще. Положим, вы сравниваете 12 настроек энкодера на одном исходном клипе и хотите ранжировать каждую.

С ACR счёт прост: одна оценка на условие на зрителя. Для 12 условий и 15 зрителей это 12 × 15 = 180 оценок, каждая тратит один просмотр клипа.

С Pair Comparison нужно показать каждую различную пару. Число пар среди N условий – формула сочетаний:

пары = N × (N − 1) / 2

Для 12 условий это 12 × 11 / 2 = 66 пар. Если все 15 зрителей судят каждую пару, это 66 × 15 = 990 сравнений – а поскольку каждое сравнение показывает два клипа, зритель смотрит 990 × 2 = 1980 просмотров клипов против 180 у ACR. Pair Comparison стоит примерно в одиннадцать раз больше времени просмотра, чтобы ранжировать те же 12 элементов.

Теперь смотрите, как изгибается кривая. Число пар для нескольких размеров:

Условий (N)Оценок ACR на зрителяПар PC на зрителяОтношение
5510
1010454,5×
20201909,5×
404078019,5×

ACR растёт по прямой; Pair Comparison растёт как квадрат. Добавьте сверху ограничения сессии – и непрактичность становится конкретной: P.910 держит сессии короткими ради контроля усталости, так что при примерно 25 секундах на сравнение (просмотреть два 10-секундных клипа, затем выбрать) 990 сравнений выходят в ~412 минут просмотра на зрителя – далеко за рамки любого одного захода. Поэтому Pair Comparison берегут для малых наборов условий или проводят с активной выборкой (например, ASAP), показывающей только самые информативные пары вместо всех N(N−1)/2, что срезает их число на порядок, сохраняя рейтинг (Mikhailiuk и др., 2021).

Рисунок 4. Стоимость Pair Comparison растёт как N(N−1)/2 – квадрат числа условий, – тогда как ACR растёт линейно. Активная выборка – то, что держит PC применимым дальше горстки условий.

Выбор метода: правило решения

Сложите три оси – и выбор сводится к короткой цепочке вопросов.

Начните с эталона. Есть ли у вас чистый оригинал? Если нет – прямые трансляции, пользовательский контент, всё без чистого источника – вы не можете провести ни один двухстимульный метод, и no-reference подход – единственный вариант (разобран в no-reference качество для live и UGC). Если оригинал есть, продолжайте.

Дальше – разброс. Условия далеки или почти равны по качеству? Если они явно разные – сравнение хорошего энкода с плохим или выборка широкого ladder битрейтов – скорость ACR побеждает, а его меньшая чувствительность вам ничего не стоит. Если они почти равны – два сильных энкодера или тонкий шаг битрейта у насыщения – нужен метод сравнения.

Затем – направление. Может ли обработка сделать клип лучше источника? Шарпинг, шумоподавление и супер-разрешение все могут. Если да, используйте CCR (его двунаправленная шкала фиксирует улучшение), а не DCR (чья шкала упирается в «идентично источнику»). Если ожидаете только деградацию, DCR – более чистая мера верности.

Наконец – количество. Сколько условий и насколько они равны? Горстка почти идентичных условий – родная территория Pair Comparison: самый чувствительный метод, доступный потому, что N мало. Много условий исключают PC, если только вы не используете активную выборку. А когда нужно тончайшее различение на почти прозрачном качестве, DSCQS из BT.500 – исторический ответ.

Рисунок 5. Правило выбора метода. Наличие эталона определяет всё; затем разброс качества и число условий указывают на ACR, DCR, CCR или PC.

Методы в сравнении

Таблица ниже – справка, которую стоит держать под рукой. Колонку «в чём проигрывает» читайте так же внимательно, как остальные: каждый метод покупает силу конкретной слабостью.

МетодСтимулШкалаЛучше дляПропускная способностьВ чём проигрывает
ACR (P.910 §8.1)Один5-балльная качества (Excellent–Bad)Много условий, явно разное качество; крупные/краудсорсинговые тестыНаивысшаяНизкая чувствительность; пропускает мелкие потери; симпатия к контенту искажает оценку
ACR-HR (P.910 §8.6.2)Один + скрытый эталон5-балльная, через разность в DMOSСкорость ACR с устранением смещенияНаивысшаяСжатое использование шкалы на источниках среднего качества; не показывает улучшение выше эталона
DCR / DSIS (P.910 §8.2; BT.500)Два (эталон, затем тест)5-балльная искажения (Imperceptible–Very annoying)Верность источнику; высококачественные системы~Половина ACRИзмеряет только ущерб, не улучшение; медленнее ACR
CCR / DSCS (P.910 §8.3)Два (случайный порядок)7-балльная сравнения (−3…+3)Почти равные условия; обработка, способная улучшить качество~Половина ACRМедленнее и ~вдвое дороже ACR-HR; нужна аккуратная рандомизация порядка
PC (P.910 §8.4; BT.500)Два (вынужденный выбор)Нет (какой лучше?)Несколько почти идентичных условий; разделение равных энкодеровНизшая (растёт как N²)Число пар взрывается с условиями; нужна шкалировка Тёрстоуна/Брэдли–Терри
DSCQS (BT.500-15)Два, непрерывнаяНепрерывная линия качества, через разностьПочти прозрачное, высококачественное сравнение кодековНизкаяТяжёлая задача; эталон должен быть скрыт рандомизацией

Частые ошибки

Ошибки выбора метода тихие: тест проходит, числа выглядят нормально, а вывод неверен. Пять повторяются достаточно часто, чтобы их назвать.

«Ошибка 1 – использовать ACR, чтобы разделить почти равные энкодеры. Если два условия различаются меньше разрешимого порога ACR (около 0,5 MOS при 24 субъектах, P.910 §8.1.1), ACR покажет ничью, которая на деле – разница. Используйте CCR или Pair Comparison, когда условия близки.»
«Ошибка 2 – использовать DCR, когда обработка может улучшить качество. Шкала искажения DCR останавливается на «незаметно» (идентично источнику), поэтому не может зафиксировать результат супер-разрешения или шарпинга, выглядящий лучше эталона. Используйте двунаправленную шкалу CCR.»
«Ошибка 3 – проводить полный Pair Comparison на многих условиях. N(N−1)/2 пар быстро становятся тысячами сравнений; полный PC на 40 условиях – это 780 пар на зрителя. Сократите условия или используйте активную выборку, прежде чем задействовать панель.»
«Ошибка 4 – сравнивать оценки разных методов как одинаковые. MOS из ACR, оценка искажения DCR, среднее сравнения CCR и шкала PC по Брэдли–Терри – разные величины на разных шкалах. Никогда не кладите их на одну ось; сравнивайте внутри метода, а не между.»
«Ошибка 5 – цитировать не то издание рекомендации. Версии P.910 1999 и 2008 годов всё ещё в поисковой выдаче; актуальное издание – P.910 (10/2023), вобравшее P.911 и P.913. Цитируйте издание, которому вы реально следовали, и используйте актуальное.»

Чем тут полезен Фора Софт

Фора Софт создаёт видесофт с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицина и видеонаблюдение, – и описанный здесь выбор метода – первое решение, которое мы принимаем, когда вопрос о качестве действительно спорен. Когда клиент спрашивает «новый энкодер заметно лучше?», а два энкодера близки, мы запускаем метод сравнения (CCR или небольшой Pair Comparison), а не ACR, потому что абсолютная шкала показала бы ничью и преждевременно закрыла бы расследование. Когда вопрос «реально ли помогает этот шаг восстановления?», мы используем именно CCR, потому что только его двунаправленная шкала фиксирует улучшение выше источника. А публикуя числа, мы называем метод, издание рекомендации, размер отобранной панели и доверительный интервал за каждой цифрой – дисциплина, описанная в нашей методологии бенчмарков, – чтобы результат выдержал совещание, на котором его цитируют.

Ключевые выводы

  • Развилка за каждым методом – одностимульный (ACR) против двухстимульного (DCR, CCR, PC).
  • ACR быстрее всех, но наименее чувствителен; двухстимульные видят меньшие различия за половину пропускной способности.
  • DCR измеряет только ущерб; шкала CCR −3…+3 также фиксирует улучшение выше эталона.
  • Pair Comparison чувствительнее всех, но его пары растут как N(N−1)/2 – за горсткой условий нужна активная выборка.
  • P.910 (10/2023) регулирует мультимедийное видео; BT.500-15 регулирует вещательное ТВ и владеет DSCQS.
  • Выбирайте метод, делающий интересующую вас разницу лёгким суждением для зрителя.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.