Содержание статьи +
- Кратко
- Почему это важно
- От столбца голосов к числу, которое можно защитить
- MOS – это оценка, а не измерение: доверительный интервал
- Какой разброс считать нормальным? Гипотеза SOS
- Отбраковка ненадёжных субъектов: три семейства методов
- Проверка значимости: действительно ли два условия различаются?
- Сколько субъектов вам на самом деле нужно?
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
Субъективный тест даёт вам столбец голосов на каждый клип, и среднее этого столбца – Mean Opinion Score – это оценка с погрешностью, а не точное измерение, поэтому рядом с каждым отчётным MOS нужен доверительный интервал. Четыре куска арифметики превращают сырые голоса в результат, который выдержит проверку: доверительный интервал на каждый MOS, защищаемое правило удаления или взвешивания ненадёжных субъектов, проверка значимости – действительно ли два условия различаются – и расчёт размера выборки, который говорит, сколько зрителей вам вообще было нужно. Действующий стандарт ITU-T P.910 (10/2023) теперь требует минимум 24 валидных субъекта для контролируемого теста – а не 15, как пишут большинство старых руководств, – потому что анализ мощности показал: 15 часто недостаточно, чтобы различить разницу, которая важна командам. Статья показывает арифметику вслух, с рабочими числами, которые вы можете воспроизвести, и поставляет лёгкий калькулятор, выполняющий все четыре задачи на ваших собственных оценках.
Почему это важно
Смысл субъективного теста – выдать число, на основе которого инженер может действовать и которое скептик не сможет отмести, а это случается, только если статистика верна. Статья – для инженера, QA-лида или исследователя, кто уже провёл тест и теперь держит таблицу голосов, которую надо превратить в решение: энкодер B действительно лучше энкодера A, или разрыв – это просто шум? Это аналитическая половина блока субъективного тестирования: дизайн и проведение идут первыми, вывод – здесь. Ошибитесь – и вы выкатите изменение кодека, которого не видит ни один зритель, или зарубите то, что увидел бы каждый. Короткая версия субъективного тестирования для оператора энкодера живёт в обзоре субъективного тестирования раздела Video Encoding; здесь – глубокий разбор чисел.
От столбца голосов к числу, которое можно защитить
Субъективный тест заканчивается матрицей: строка на субъекта, столбец на клип, в каждой ячейке – оценка. Инстинкт – усреднить каждый столбец и назвать эти средние результатом. Среднее – правильная отправная точка: Mean Opinion Score, или MOS, – это ровно усреднение оценок субъектов по клипу, подробно разобранное в MOS, DMOS и шкалы оценки. Но среднее из 24 мнений – это выборочная оценка того, что сказала бы вся популяция, а выборочная оценка надёжна ровно настолько, насколько позволяют её разброс и размер. Принять голое среднее за истину – самая частая статистическая ошибка в работе с качеством видео.
Между сырой матрицей и защищаемым результатом стоят четыре задачи, и остаток статьи – по одной на раздел. Первая: поставить доверительный интервал на каждый MOS, чтобы читатель видел неопределённость, а не только точку. Вторая: найти и обработать субъектов, чьи голоса ненадёжны, по правилу, зафиксированному до того, как вы взглянули на данные. Третья: проверить, реальна ли разница между двумя условиями или она в пределах шума. Четвёртая – логически первая, но проще понять её последней – рассчитать, сколько субъектов тесту было нужно, чтобы различить интересующую вас разницу. Пропустите любую – и число выглядит готовым, но таковым не является.
MOS – это оценка, а не измерение: доверительный интервал
Начните с разброса. Стандартное отклонение оценок мнения по одному клипу – насколько далеко отдельные голоса отстоят от собственного среднего, обозначаемое SOS в стандартах, – это сырая мера того, насколько панель не согласилась насчёт этого клипа. У клипа, который все оценили на 4, крошечный SOS; у клипа, расколотого между 2 и 5, – большой. SOS – не помеха, которую надо усреднить; это вход, который говорит, насколько доверять MOS.
Из разброса и числа вы получаете стандартную ошибку среднего – типичное расстояние между MOS вашей выборки и истинным MOS популяции. Стандартная ошибка – это стандартное отклонение, делённое на корень из числа субъектов:
стандартная ошибка = SOS / sqrt(N)Этот корень – вся суть размера выборки, и мы к нему вернёмся. 95-процентный доверительный интервал – полоса, которая содержала бы истинный MOS в 95 из 100 повторов теста, – это MOS плюс-минус кратное этой стандартной ошибки. ITU-R BT.500-15 (05/2023), Приложение 1, использует множитель нормального распределения 1,96:
95% ДИ = MOS ± 1.96 × (SOS / sqrt(N))ITU-T P.910 (10/2023) аккуратнее для малых панелей, которые субъективные тесты реально используют. С немногими субъектами вы оценили разброс по той же малой выборке, поэтому используете t-распределение Стьюдента – слегка более тяжелохвостого родственника нормальной кривой, – и множитель уже не фиксированные 1,96, а t-значение, зависящее от размера панели. Для 24 субъектов множитель около 2,07; для 15 – около 2,14; для 6 – около 2,57. t-версия всегда чуть шире версии с 1,96, и эта дополнительная ширина – честность по поводу того, что разброс оценён по горстке людей.
Посчитаем реальное число. Допустим, клип оценили 24 субъекта, MOS вышел 3,80 по 5-балльной шкале, а SOS (разброс этих 24 голосов) – 0,90.
стандартная ошибка = SOS / sqrt(N) = 0.90 / sqrt(24) = 0.90 / 4.899 = 0.184
BT.500 (1.96): половина ДИ = 1.96 × 0.184 = 0.360
→ MOS = 3.80 ± 0.36 → [3.44, 4.16]
P.910 (t = 2.069, 23 ст.св.): половина = 2.069 × 0.184 = 0.380
→ MOS = 3.80 ± 0.38 → [3.42, 4.18]«Оценка» клипа – не 3,80. Это «где-то между примерно 3,4 и 4,2, скорее всего около 3,8». Сообщайте интервал, а не только точку – MOS без доверительного интервала есть мнение о мнении. И заметьте практический посыл, спрятанный в стандартной ошибке: поскольку она делит на корень из N, чтобы вдвое сузить интервал, нужно вчетверо больше субъектов, а не вдвое. Этот единственный факт управляет каждым решением о размере выборки дальше в статье.
Какой разброс считать нормальным? Гипотеза SOS
Прежде чем доверять разбросу панели, полезно знать, как вообще выглядит нормальный разброс. Здесь самый полезный результат в современной статистике субъективного качества – гипотеза SOS, введённая Хоссфельдом, Шатцем и Эггером в 2011 году. Она гласит: в хорошо проведённом тесте несогласие между субъектами не случайно от клипа к клипу – оно следует предсказуемому квадратичному закону, привязанному к MOS. Несогласие наименьшее на краях шкалы, где почти все согласны, что клип отличный или невыносимый, и наибольшее в середине, где «удовлетворительно против хорошо» – настоящий вопрос суждения.
Для 5-балльной шкалы (низшая оценка 1, высшая 5) гипотеза записывает дисперсию (квадрат SOS) одной параболой:
SOS²(x) = a × ( -x² + 6x - 5 ) x = MOS, шкала 1..5Единственное свободное число, a, – это параметр SOS. Он идёт от 0 (каждый субъект идеально согласился по каждому клипу – невозможно чисто) до 1 (субъекты раскололись к краям – максимальный беспорядок). Он сводит межсубъектное несогласие всего теста к одному значению, что делает его быстрой проверкой и честным способом сравнить шумность двух экспериментов.
Применим к рабочему клипу. При MOS = 3,80 скобка параболы равна -(3.80²) + 6(3.80) - 5 = -14.44 + 22.80 - 5 = 3.36. Наблюдаемый SOS был 0,90, значит наблюдаемая дисперсия – 0.90² = 0.81, а подразумеваемый параметр – a = 0.81 / 3.36 = 0.24. Значение a около 0,2–0,25 непримечательно для аккуратного лабораторного ACR-теста, так что разброс этого клипа нормален, а не тревожен. Будь у того же MOS значение SOS 1,6, подразумеваемое a было бы 2.56 / 3.36 = 0.76 – красный флаг, что шкала путала, контент был неоднороден или панель загрязнена, и сигнал заглянуть в голоса до того, как доверять MOS.
Отбраковка ненадёжных субъектов: три семейства методов
Часть субъектов голосует так, что это не отражает качество: они неверно читают шкалу, теряют внимание или оценивают случайно. Их голоса расширяют каждый интервал и могут сдвинуть MOS. В статье проведение теста представлено одно правило отбраковки, которое должна запускать каждая лаборатория; статистический блок – место для альтернатив, потому что выбор метода меняет результат. Семейств три, и они меняют простоту на точность.
Первое семейство – правило эксцесса ITU-R BT.500-15, Приложение 1. Это жёсткий тест на выбросы: для каждого клипа он спрашивает, колоколообразны ли голоса (через эксцесс – четвёртый статистический момент), задаёт ожидаемую полосу в два стандартных отклонения (или √20 ≈ 4,47, если голоса не колоколообразны), считает, как часто каждый субъект попадает выше и ниже полосы, и отбраковывает субъекта, который часто вне полосы и чьи промахи сбалансированы вверх и вниз – подпись случайного голосования. Полная процедура и рабочий пример – в предыдущей статье; BT.500 говорит применять её только один раз и только к малым панелям неэкспертов. Её достоинство в том, что она зафиксирована и проверяема; её предел – что это грубое «да/нет» с заданными вручную порогами.
Второе семейство – скрининг на корреляции, метод в Приложении A ITU-T P.910. Он вычисляет для каждого субъекта, насколько хорошо его оценки отслеживают MOS панели – линейный коэффициент корреляции Пирсона (и часто также ранговую корреляцию Спирмена) между столбцом этого субъекта и средними по клипам. Субъект, который действительно воспринимает качество, сильно коррелирует с группой; случайный голосующий коррелирует около нуля. Субъектов ниже порога корреляции удаляют. Это ловит субъекта, который стабильно неправ (отрицательно или слабо коррелирует), даже когда его отдельные голоса никогда не выглядят явными выбросами – режим отказа, который тест на эксцессе может пропустить.
Третье семейство – модель поведения субъекта, новейшая и теперь знаменосец. Чжи Ли и Кристос Бампис из Netflix предложили в 2020 году модель, которая трактует каждый голос как истинное качество плюс два эффекта на субъекта: смещение (субъект, оценивающий всё на полбалла выше) и непостоянство (субъект, чьи голоса широко рассеяны независимо от качества). Оценка методом максимального правдоподобия (MLE) восстанавливает истинное качество, смещение каждого субъекта и непостоянство каждого субъекта разом, затем формирует MOS со снятым смещением и взвешиванием по постоянству – взвешенное среднее, тихо доверяющее стабильным субъектам больше, а хаотичным меньше, вместо того чтобы грубо оставлять или выбрасывать их. Это было стандартизировано в ITU-T P.913 (06/2021), пункт 12.6, и сопутствующая процедура в ITU-T P.910 (10/2023), а открытая библиотека Netflix sureal это реализует. Её заявленные преимущества над жёсткими тестами – более узкие доверительные интервалы, лучшая устойчивость к выбросам и отсутствие порогов, заданных вручную. Это разница между жёсткой обработкой выбросов (оставить или отбраковать) и мягкой (взвесить по надёжности); исследование 2025 года, сравнивавшее их, нашло, что мягкая, модельная обработка обычно восстанавливает более чистые оценки.
| Метод скрининга | Что делает | Что ловит | Где врёт / предел |
|---|---|---|---|
| Эксцесс BT.500-15 (жёсткий) | Отбраковывает субъектов, часто выходящих за полосу 2σ/√20·σ со сбалансированными промахами | Случайного голосующего | Грубо; пороги вручную; только малые панели неэкспертов; применяется один раз |
| Корреляция P.910 Прил. A (жёсткий) | Удаляет субъектов, чьи оценки слабо коррелируют с MOS | Стабильно-неправого голосующего, которого эксцесс пропускает | Всё ещё пороговое отсечение; реальное мнение меньшинства может выглядеть как низкая корреляция |
| Модель поведения субъекта (мягкий) | MLE восстанавливает истинное качество + смещение + непостоянство на субъекта; взвешивает по постоянству | Смещение и непостоянство по отдельности, без выбрасывания данных | Тяжелее в расчёте; нужна библиотека (напр. Netflix sureal); новее, менее знакома рецензентам |
Какой бы вы ни выбрали, зафиксируйте его до того, как увидите данные, и сообщите вместе с результатом. Единственный запрещённый ход – пробовать методы, пока не появится желаемый ответ.
Проверка значимости: действительно ли два условия различаются?
Это вопрос, ради которого тест и существует. У вас MOS_A для энкодера A и MOS_B для энкодера B, у каждого свой доверительный интервал. B действительно лучше, или разрыв внутри шума?
Быстрая визуальная проверка – планки погрешностей. Если два 95-процентных доверительных интервала не перекрываются, разница значима примерно на уровне 95% – безопасный вывод. Но обратное – ловушка: интервалы, которые перекрываются, всё равно могут быть значимо различны, потому что важен тест на разности, у которой своя, меньшая стандартная ошибка. Перекрывающиеся планки – повод посчитать, а не вердикт «разницы нет».
Для двух условий правильный инструмент – t-тест на разности. Когда одни и те же субъекты оценили оба условия – внутрисубъектный тест, обычный случай, – используйте парный t-тест, который снимает личное смещение каждого субъекта и заметно мощнее. Когда разные субъекты оценили каждое условие, используйте двухвыборочный t-тест. Посчитаем двухвыборочную версию – она показывает арифметику нагляднее. Энкодер A: MOS 3,80, SOS 0,90, N 24. Энкодер B: MOS 4,10, SOS 0,80, N 24. Разность – 0,30.
SE_разн = sqrt( SOS_A²/N_A + SOS_B²/N_B )
= sqrt( 0.90²/24 + 0.80²/24 )
= sqrt( 0.0338 + 0.0267 ) = sqrt(0.0605) = 0.246
t = (MOS_B - MOS_A) / SE_разн = 0.30 / 0.246 = 1.22
критическое t (95%, ~46 ст.св.) ≈ 2.01
1.22 < 2.01 → НЕ статистически значимоРазрыв в 0,30 балла, при этих разбросах и 24 субъектах в каждой группе, неразрешим – он сидит внутри шума. Это не причуда примера; это совпадает с собственными цифрами точности стандарта. ITU-T P.910 сообщает, по измерениям Пинсона 2020 года, что 5-балльный ACR-тест «редко даёт» разрешимую разницу (свой ΔSCI) ниже примерно 0,5 для 24 субъектов, 0,7 для 15, 1,1 для 9 и 1,5 для 6. Наша разница 0,30 ниже порога ~0,5 для 24 субъектов, так что недостижение значимости – ровно то, что предсказывает стандарт. Если B действительно лучше, вам нужна бóльшая панель или более чувствительный метод (парный дизайн или модель поведения субъекта), чтобы это доказать.
Когда вы сравниваете три и более условия, не запускайте все попарные t-тесты. Двадцать условий дают 190 пар, и при 5-процентной частоте ошибок на тест вы ожидали бы около девяти «значимых» результатов чисто по случайности. Правильный инструмент – дисперсионный анализ (ANOVA), который задаёт один глобальный вопрос – различается ли хоть одно условие, – а затем апостериорная процедура, которая корректирует на множественные сравнения (тест Тьюки HSD или поправка Бонферрони, делящая порог на число сравнений). Поправка – не педантизм; это разница между находкой и совпадением.
Сколько субъектов вам на самом деле нужно?
Всё вышесказанное указывает на одно решение, принятое до теста: размер панели. Стандартная ошибка делится на sqrt(N), поэтому наименьшая разрешимая разница сжимается с корнем из панели – и это, прокрученное назад, задаёт размер теста. Цифры точности P.910 – практическая таблица: чтобы различать разницы около 0,5 по 5-балльной шкале ACR, вам нужно 24 субъекта; 15 доводят лишь до примерно 0,7; шесть субъектов – до примерно 1,5, что составляет четверть всей шкалы и бесполезно для чего-то тонкого.
Вот почему заголовочное число изменилось. Годами цитируемым порогом было 15, из ITU-R BT.500-15, пункт 2.5. Но в 2018 году Бруннстрём и Барковски провели анализ мощности – балансируя риск пропустить реальный эффект против риска заявить ложный – и обнаружили, что 15 часто недостаточно, чтобы объявить разницу, которая важна командам, тогда как 24, давно используемые Video Quality Experts Group (VQEG), обычно достаточно. ITU-T P.910 (10/2023) принял этот вывод: пункт 10.1 теперь гласит, что для контролируемой среды должно использоваться минимум 24 субъекта (каждый стимул оценивается ≥24 после скрининга), и минимум 35 для неконтролируемой среды. Старые 15 теперь явно являются пилотным размером, годным для поиска трендов, но не для результата, который вы публикуете. Если вендор показывает вам «значимый» выигрыш качества из теста на 12 человек, это первое, что стоит поставить под вопрос.
Вы можете размерить тест как следует, а не хвататься за эвристику. Анализ мощности берёт разницу, которую надо обнаружить, ожидаемый разброс (оцените его по пилоту или по гипотезе SOS) и частоты ошибок, которые вы готовы терпеть, и возвращает минимальное N; VQEG публикует инструмент «Number of Subjects» ровно для этого, на который ссылается P.910. Как прикидка на салфетке: поскольку разрешимая разница масштабируется как 1/sqrt(N), переход от 0,5, которые покупают 24 субъекта, к цели 0,3 требует примерно 24 × (0.5/0.3)² ≈ 67 субъектов. Малые разницы качества по-настоящему дороги в доказательстве, и притворяться иначе с крошечной панелью – то, как команды выкатывают невидимые изменения. Калькулятор-компаньон ниже считает эту оценку, доверительный интервал, проверку SOS и тест значимости на ваших собственных числах.
«Частая ошибка – отчёт о MOS без доверительного интервала. Голый MOS 4,1 скрывает, была ли панель единодушна или расколота пополам. Всегда публикуйте интервал (MOS ± 1,96·SOS/√N или версию Стьюдента для малых N). Таблица точечных значений без планок погрешностей – не результат, который рецензент может проверить.»
«Частая ошибка – «планки перекрываются, значит разницы нет». Перекрывающиеся 95-процентные интервалы не означают, что условия равны; тест – на разности, у которой меньшая стандартная ошибка. Неперекрытие доказывает значимость; перекрытие не доказывает ничего – нужно запустить парный или двухвыборочный тест.»
«Частая ошибка – доверять «значимому» результату на 12 человек. По ITU-T P.910 (10/2023) контролируемому тесту нужно минимум 24 валидных субъекта; 15 – пилотный размер, а всё ниже разрешает лишь большие, очевидные разрывы. Малая панель может выдать значимо выглядящее число, которое тест нормального размера стёр бы.»
Где здесь Фора Софт
Фора Софт строит видеософт с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицину и видеонаблюдение, – и статистика из этой статьи – это то, как мы не даём заявлению о качестве обогнать его доказательства. Когда мы сравниваем две настройки энкодера для стримингового или OTT-клиента, мы сообщаем каждый MOS с его доверительным интервалом, запускаем парный тест на разности, а не оцениваем планки на глаз, и размеряем панель под наименьшую разницу, которая реально важна клиенту – так что «выигрыш», о котором мы сообщаем, найдёт и больший тест. Когда разброс панели выглядит неправильным, параметр SOS говорит нам об этом до того, как MOS кого-то введёт в заблуждение. Мы считаем 24 валидных субъекта полом для контролируемого результата, в согласии с действующим P.910, и прикладываем к субъективному числу ту же провенанс-цепочку, что и к нашей методологии бенчмарков: панель, правило скрининга и тест, изложенные так, чтобы результат держался после того, как комната опустеет.
Ключевые выводы
- MOS – это выборочная оценка; всегда сообщайте его с доверительным интервалом (MOS ± 1,96·SOS/√N или Стьюдент для малых N).
- Доверительный интервал сжимается как 1/√N – сузить его вдвое стоит вчетверо больше субъектов, а не вдвое.
- Гипотеза SOS (SOS² = a·(−x²+6x−5)) даёт проверку одним числом, нормален ли разброс панели.
- Значимость – это тест на разности; перекрывающиеся планки погрешностей не доказывают «разницы нет».
- Используйте парный t-тест для двух внутрисубъектных условий, ANOVA с апостериорной поправкой для трёх и более.
- ITU-T P.910 (10/2023) теперь требует ≥24 валидных субъектов для контролируемого теста (35 неконтролируемого); 15 – пилотный размер.