Содержание статьи +
- Кратко
- Почему это важно
- Четыре задачи дня теста
- Набор панели: сколько людей и кто именно
- Пред-скрининг: проверьте глаза до теста
- Настройка среды: калибруйте комнату, а не только экран
- Проведение сессии: инструкции, «пустышки» и порядок
- Пост-скрининг: отбраковка ненадёжных наблюдателей
- Лаборатория против краудсорсинга: один тест, два способа провести
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
Субъективный тест качества видео можно безупречно спроектировать и всё равно провалить в день проведения – потому что именно на исполнении неконтролируемая комната, непроверенный зритель или уставшая панель тихо отравляют данные. Четыре задачи исполнения: набрать достаточно валидных зрителей, проверить их зрение до начала, выставить дисплей и комнату по измеримой спецификации и отбраковать ненадёжных наблюдателей после того, как голоса собраны. ITU-R BT.500-15 (05/2023) и ITU-T P.910 (10/2023) задают числа: минимум пятнадцать валидных наблюдателей, нормальная или скорректированная острота зрения по таблице Снеллена, нормальное цветовосприятие по тесту Ишихары, калиброванный дисплей, заданная дистанция просмотра и освещённость. Статья проходит день теста от начала до конца, с рабочим примером арифметики отбраковки наблюдателей по BT.500, чтобы вы увидели, кого именно защищаемый тест отсеивает и почему.
Почему это важно
Спроектировать субъективный тест и провести его – два разных навыка, и красивый дизайн быстро гибнет в плохо организованной комнате. Статья – для инженера, QA-лида или исследователя, у кого уже есть дизайн из предыдущей статьи и кому теперь нужно посадить живых людей перед реальными экранами и выйти с числами, которые выдержат проверку. Это вторая, исполнительная половина блока субъективного тестирования: решения по дизайну – в статье как спроектировать субъективный тест, который выдержит проверку; статистика, которая следует за тестом, – доверительные интервалы, значимость, отсеивание выбросов в деталях – в статье статистика субъективных данных; а короткая версия для оператора энкодера – в обзоре субъективного тестирования раздела Video Encoding. Здесь – само проведение.
Четыре задачи дня теста
Когда дизайн зафиксирован – набор источников, матрица искажений, метод, план сессий – хорошее проведение сводится к четырём задачам по порядку. Вы набираете панель достаточно большую, чтобы остаться выше пола после того, как часть зрителей отсеется. Вы проверяете зрение каждого зрителя до того, как он отдаст хоть один голос. Вы выставляете дисплей и комнату по измеримой спецификации, а не на глаз. И после сессии вы запускаете заданную процедуру отбраковки наблюдателей, чьи голоса оказались слишком хаотичными, чтобы им доверять. Пропустите любую – и Mean Opinion Score (средняя оценка, которую панель дала каждому клипу, подробно разобранная в MOS, DMOS и шкалы оценки) окажется загрязнён так, что никакая последующая арифметика его не очистит.
Набор панели: сколько людей и кто именно
Главное число небольшое и часто читается неверно: минимум пятнадцать валидных наблюдателей. ITU-R BT.500-15 §2.5.1 говорит, что, если метод не указывает иное, следует использовать минимум пятнадцать наблюдателей, а тест с меньшим числом обязан быть помечен как неформальный (ITU-R BT.500-15 §2.5.1). ITU-T P.910 §10.1 задаёт тот же пол в пятнадцать валидных субъектов для контролируемого теста.
Слово, которое здесь работает, – валидных. Пятнадцать – это пол для зрителей, прошедших и проверку зрения в начале, и проверку надёжности в конце. Поскольку пост-скрининг может отсеять одного-двух, вы набираете запас сверх пятнадцати – панель в восемнадцать–двадцать четыре человека обычна – чтобы пара отбраковок не опустила вас ниже пола. Запас – это не балласт; именно ради него пол сформулирован в валидных наблюдателях, а не в пришедших телах.
Больше наблюдателей покупают более узкий результат. Статья о методах показала, что наименьшая надёжно различимая разница в MOS сужается по мере роста панели, поэтому двадцать четыре – частая цель, когда различия в качестве малы. А когда комната не контролируется – публичная или краудсорсинговая среда – P.910 отмечает, что для той статистической чувствительности, которую дают пятнадцать в лаборатории, нужно около тридцати пяти субъектов, потому что лишний шум среды приходится усреднять.
Кто эти зрители – важно не меньше, чем сколько их. BT.500-15 различает экспертных наблюдателей, знающих артефакты, которые может породить система под тестом, и неэкспертных («наивных»), которые их не знают; большинству тестов качества нужны неэксперты, потому что они стоят за реальных зрителей (ITU-R BT.500-15 §2.5). Критично: наблюдатели не должны были участвовать в разработке системы под тестом, иначе они приносят знание, смещающее их оценки. BT.500 также просит сообщать состав панели – категорию занятости, пол и возрастной диапазон, – потому что панель из двадцати инженеров вещания и панель из двадцати офисных работников могут оценить одни и те же клипы по-разному, и читатель вашего результата должен знать, какую вы использовали.
Пред-скрининг: проверьте глаза до теста
Зритель, который не способен различить тестируемую деталь или не видит цветовую ошибку, которую вы измеряете, не регистрируется как плохая точка данных – он регистрируется как шум, рассеянный по каждой его оценке. Скрининг убирает этот шум до того, как он попадёт в данные, и занимает пять минут на человека.
Две проверки, обе стандартные. Острота зрения – насколько чётко зритель видит мелкую деталь – измеряется по таблице Снеллена или кольцам Ландольта: ряды уменьшающихся букв или разорванных колец, которые читают с фиксированной дистанции (ITU-R BT.500-15 §2.5.2). Порог P.910 конкретен: зритель не должен сделать ни одной ошибки на строке 20/30 стандартной таблицы, при разрешённых очках или линзах (ITU-T P.910). Двадцать-тридцать значит, что он читает с двадцати футов то, что нормальный глаз читает с тридцати, – мягкая планка, отсеивающая зрителей, которые упустили бы тонкие артефакты, ради вскрытия которых тест и построен.
Цветовосприятие проверяют тестом Ишихары – таблицами из цветных точек со спрятанным внутри числом, которое не может прочитать человек с дальтонизмом (ITU-R BT.500-15 §2.5.2). Примерно у одного мужчины из двенадцати есть та или иная аномалия цветовосприятия, так что на непроверенной панели из двадцати можно ожидать одного-двух зрителей, которые оценят артефакт растекания цвета как нормальный – просто потому что не видят его. Они не плохие зрители; они измеряют нечто иное, чем остальная панель, и это различие становится шумом в среднем.
Фиксируйте результат для каждого зрителя – прошёл или нет – и храните запись. Метод скрининга и его критерии – часть того, что BT.500 ожидает опубликовать вместе с результатами, потому что читатель не может судить о панели, которую не видит. «Мы проверили на нормальное зрение» – это не метод; «ни одной ошибки на строке 20/30 Снеллена и тест Ишихары из 24 таблиц, корректирующие линзы разрешены» – метод.
Настройка среды: калибруйте комнату, а не только экран
Если два зрителя смотрят в разных условиях, разница в их оценках частично измеряет условия, а не кодек. Лекарство – выставить дисплей и комнату по письменной спецификации и измерить, что вы в неё попали. BT.500-15 даёт две спецификации, и выбор правильной – первое решение.
Лабораторная среда – это критический просмотр: низкая освещённость комнаты, фон D65 (стандартная дневная белая точка) за экраном, пиковая яркость дисплея от 70 до 250 кд/м² и яркость этого фона, удерживаемая на уровне около 0,15 от пика экрана (ITU-R BT.500-15 §2.1.1). Домашняя среда меняет часть контроля на реализм: около 200 люкс света на экране, измеренного перпендикулярно к нему, и пик дисплея от 70 до 500 кд/м² (ITU-R BT.500-15 §2.1.2). Лаборатория отвечает «как хорошо это может выглядеть при идеальном просмотре»; домашняя установка – «как хорошо это там, где люди реально смотрят». Выберите одну осознанно и сообщите, какую.
В любом случае дисплей калиброван, а не заводской по умолчанию. Яркость и контраст выставляют сигналом PLUGE – паттерном Picture Line-Up Generation Equipment, набором эталонных чёрных и около-чёрных полос из ITU-R BT.814/BT.815, – настроенным под фактическую освещённость комнаты (ITU-R BT.500-15 §2.1.6). Некалиброванный экран искажает каждое суждение о контрасте и цвете, которое делает панель, так что две лаборатории, прогоняющие одни клипы на одной модели монитора – одна калиброванная, другая нет, – разойдутся; и BT.500 прямо предупреждает, что систематические различия между площадками реальны.
Последняя настройка – дистанция просмотра, фиксированная для всех и выраженная кратным высоты картинки, потому что именно она определяет, какие артефакты видны. BT.500 предлагает два варианта: предпочтительную дистанцию (PVD), где зрители естественно садятся, и проектную дистанцию (DVD), геометрическое расстояние, на котором два соседних пикселя только сливаются – где глаз на пределе разрешения дисплея (ITU-R BT.500-15 §2.1.3). Выбор следует за вопросом: PVD для реализма, DVD для самой жёсткой проверки разрешения. Для дисплея 4K (3840 × 2160) BT.500 помещает критичную к разрешению дистанцию в диапазон примерно 1,6–3,2 высоты картинки, с нижним концом, когда тест именно про разрешение. Отметьте дистанцию на полу и сажайте каждого зрителя туда; плавающая дистанция тихо добавляет шум в каждую оценку.
Проведение сессии: инструкции, «пустышки» и порядок
Со зрителями, прошедшими скрининг, и выставленной комнатой сама сессия следует фиксированной форме, и форма – это не только оцениваемые клипы.
Она открывается инструкциями и обучением. Зрителю объясняют метод, показывают шкалу оценки и тайминг и проводят через обучающие клипы, охватывающие весь диапазон качества – на другом контенте, чем тест, чтобы он не пришёл к реальным клипам уже знакомым с ними (ITU-R BT.500-15 §2.5.3). Затем идёт тихий приём, который застаёт многих новичков врасплох: около пяти «пустышек» (dummy presentations) в самом начале первой сессии, охватывающих диапазон, чьи голоса собирают для реализма и затем выбрасывают. Они впитывают последнюю «утряску» шкалы у зрителя, так что первый зачётный голос уже стабилен. Если тест идёт несколькими сессиями, в начале каждой следующей достаточно около трёх «пустышек» (ITU-R BT.500-15 §2.6).
Зачётный блок идёт в рандомизированном порядке. Стандартная практика – греко-латинский квадрат: структурированная рандомизация, которая равномерно распределяет каждое условие по позициям в ряду, так что ни одно условие не получает систематической форы от того, что всегда следует за лёгким или тяжёлым клипом, – с порядком условий, сбалансированным так, чтобы эффекты усталости и адаптации гасились от сессии к сессии (ITU-R BT.500-15 §2.6). Полезное дополнение: повторите несколько показов между сессиями, чтобы проверить, что зритель оценивает один и тот же клип согласованно, – дешёвая внутренняя проверка когерентности.
И всё это держится под примерно тридцатью минутами сессии. BT.500-15 §2.6 ограничивает одну сессию примерно получасом ради контроля усталости, а уставший зритель голосует с большим разбросом и со смещением вниз. Когда время голосования выходит за лимит – статья о дизайне показывает арифметику – вы делите на сбалансированные сессии с перерывами и переякориваете в начале каждой, потому что калибровка распадается за перерыв.
Пост-скрининг: отбраковка ненадёжных наблюдателей
Даже при хорошем пред-скрининге часть зрителей голосует хаотично – они неверно понимают шкалу, теряют внимание или просто оценивают непоследовательно. BT.500-15 даёт заданную процедуру их поиска и удаления после сессии, и её запуск – последняя задача исполнения. Это скрининг на надёжность, отличный от проверки зрения в начале, и именно ради него вы набирали запас.
Процедура (BT.500-15 Приложение 1, §A1-2.3.1) работает по одному показу за раз. Сначала решают, примерно ли колоколообразен разброс оценок на этом показе, вычисляя его эксцесс β2 – одно число, четвёртый статистический момент оценок, делённый на квадрат второго, измеряющий тяжесть хвостов распределения. Если β2 попадает между 2 и 4, оценки считают нормальными, и «ожидаемая» полоса – это среднее плюс-минус два стандартных отклонения. Если нет, полоса расширяется до среднего плюс-минус корень из двадцати (≈ 4,47) стандартных отклонений. Каждый раз, когда оценка зрителя падает выше полосы, вы отмечаете счётчик Pᵢ для этого зрителя; каждый раз, когда падает ниже, – счётчик Qᵢ.
После обработки всех показов судьбу каждого зрителя решают два отношения. Первое – как часто он вообще оказывался вне полосы: (Pᵢ + Qᵢ), делённое на общее число его оценок. Второе – насколько односторонними были эти промахи: модуль (Pᵢ − Qᵢ), делённый на (Pᵢ + Qᵢ). Зрителя отбраковывают, когда первое отношение превышает 0,05 и второе ниже 0,30 (ITU-R BT.500-15 §A1-2.3.1). Простыми словами: отбракуйте зрителя, который часто вне полосы и чьи промахи сбалансированы вверх и вниз – этот рисунок есть случайный шум, а не последовательное мнение.
Рабочий пример: кого отсеивают
Возьмём сессию из шестидесяти зачётных показов и посмотрим на двух зрителей.
Зритель A: Pᵢ = 4 (оценки выше полосы), Qᵢ = 3 (ниже), всего = 60
отношение 1 = (Pᵢ + Qᵢ) / всего = (4 + 3) / 60 = 7/60 = 0,117 → > 0,05 ✓
отношение 2 = |Pᵢ − Qᵢ| / (Pᵢ + Qᵢ) = |4 − 3| / 7 = 1/7 = 0,143 → < 0,30 ✓
Оба условия выполнены → ОТБРАКОВАТЬ зрителя AЗритель A вне полосы на 12% клипов, и эти промахи разделены почти поровну вверх и вниз – подпись того, кто голосует случайно. Его отсеивают. Теперь зритель, который вне полосы так же часто, но иначе:
Зритель B: Pᵢ = 6 (оценки выше полосы), Qᵢ = 0 (ниже), всего = 60
отношение 1 = (6 + 0) / 60 = 6/60 = 0,100 → > 0,05 ✓
отношение 2 = |6 − 0| / 6 = 6/6 = 1,000 → НЕ < 0,30 ✗
Второе условие не выполнено → ОСТАВИТЬ зрителя BЗритель B вне полосы так же часто, но всегда с верхней стороны. Это последовательное смещение шкалы – зритель, который просто оценивает щедро, а не случайно, – а последовательное смещение есть реальный сигнал, с которым анализ справляется, поэтому BT.500 его оставляет. Тест построен ловить случайного голосующего, а не систематически снисходительного. Это различие – весь смысл второго отношения.
С процедурой идут две оговорки. BT.500 говорит применять её только один раз к данному эксперименту – перезапуск до тех пор, пока результат не станет «чистым», – это ровно та рационализация, которую она призвана предотвратить, – и ограничить её тестами с относительно небольшим числом наблюдателей (меньше двадцати), все из которых неэксперты (ITU-R BT.500-15 §A1-2.3.1, Примечание). Более глубокие вопросы – доверительные интервалы по выжившему MOS, значимость между условиями, сколько субъектов вам действительно нужно – это предмет статьи статистика субъективных данных; здесь задача – лишь удалить зрителей, которых защищаемый тест обязан удалить, по правилу, зафиксированному до того, как вы увидели данные.
Лаборатория против краудсорсинга: один тест, два способа провести
Исполнение выше описывает контролируемую лабораторию. Тот же дизайн можно провести на краудсорсинговой платформе, где зрители оценивают клипы на своих устройствах дома, в рамках ITU-T P.808 (рекомендации по краудсорсингу качества речи, чей подход переняла видеообласть; разобрана в статье краудсорсинговое субъективное тестирование). Размен – контроль на масштаб и скорость, и он меняет каждую задачу исполнения.
| Задача исполнения | Контролируемая лаборатория | Краудсорсинг (по P.808) |
|---|---|---|
| Среда | Вы выставляете и измеряете свет, дисплей, дистанцию | Вы не контролируете ничего – лишь спрашиваете и выводите |
| Пред-скрининг | Снеллен + Ишихара лично | Удалённые прокси-тесты; слабее, легче обойти |
| Внимание | Оператор в комнате | «Золотые» клипы, скрытые ловушки, тайм-гейты |
| Надёжность | Отбраковка по эксцессу BT.500 на малой панели | Тяжёлая пост-фильтрация; доля отбраковки бывает огромной |
| Где течёт | Малая панель, одна комната, дороже | Неконтролируемые комнаты; вы меряете «дикое», не идеал |
Числа делают размен конкретным. Поскольку краудсреда неуправляема, краудсорсинговые исследования опираются на слоистую защиту – квалификационные отсевы, скрытые «золотые» клипы с известным ответом, ловушки внимания и поведенческие тайм-гейты – и затем жёстко отбраковывают; одно исследование 2025 года отбраковало около 92% краудсорсинговых участников после строгого скрининга согласованности. И всё же при таком строгом скрининге и очистке краудсорсинговый MOS может коррелировать с лабораторным на уровне около 0,95 – поэтому метод и заслуживает доверия для правильных вопросов. Правило большого пальца: лаборатория отвечает «какой энкодинг лучше при идеальном просмотре», крауд – «какой лучше в дикой природе», и вы обязаны сказать, какой вопрос задавали.
«Частая ошибка – набирать ровно пятнадцать. Пол в пятнадцать – это пятнадцать валидных наблюдателей, посчитанных после пост-сессионной отбраковки. Наберите ровно пятнадцать – и один отбракованный зритель опустит вас до четырнадцати и неформального результата (BT.500-15 §2.5.1). Наберите запас – восемнадцать–двадцать четыре, – чтобы скрининг по эксцессу мог сделать свою работу, не утопив тест.»
«Частая ошибка – калибровать экран, но не комнату. Дисплей, выставленный по PLUGE, в залитой солнцем комнате всё равно меряет комнату. Выставьте и измерьте и свет – низкий для лаборатории, ≈ 200 люкс на экране для домашней установки (BT.500-15 §2.1.1–2.1.2), – и зафиксируйте дистанцию просмотра для всех.»
Где здесь Фора Софт
Фора Софт строит видеопродукты с 2005 года – стриминг, конференции на WebRTC, OTT, e-learning, телемедицина и видеонаблюдение, – и дисциплина исполнения из этой статьи превращает мнение о качестве в число, которое мы кладём перед клиентом. Когда мы проверяем панель для оценки конференц- или OTT-продукта, мы прогоняем проверки зрения и отбраковку надёжности по BT.500 до того, как любая оценка дойдёт до решения, и набираем запас, чтобы пол в пятнадцать валидных наблюдателей держался. Когда вопрос – «как это выглядит в реальной диспетчерской или реальной гостиной», мы запускаем домашнюю установку на измеренных 200 люксах, а не идеализированную лабораторию, потому что именно там оценивают материал. А когда мы публикуем результат, мы сообщаем панель, скрининг и среду рядом с ним – ту же провенанс-цепочку, что прилагаем к нашей методологии бенчмарков, – чтобы число держалось после того, как панель разошлась.
Ключевые выводы
- Пол – пятнадцать валидных наблюдателей; набирайте запас (18–24), чтобы отбраковки его не утопили (BT.500-15 §2.5.1).
- Проверяйте каждого зрителя: острота по строке 20/30 Снеллена, цветовосприятие по тесту Ишихары.
- Калибруйте дисплей паттерном PLUGE и выставьте комнату – низкий свет (лаб.) или ≈ 200 люкс (дом).
- Фиксируйте дистанцию просмотра в высотах картинки (PVD или DVD) для каждого зрителя.
- Открывайте ≈ 5 отбрасываемыми «пустышками», рандомизируйте порядок, держите сессии под ≈ 30 минут.
- Отбраковывайте ненадёжных один раз, по правилу эксцесса BT.500, зафиксированному до взгляда на данные.