Краудсорсинговое тестирование качества видео

Автор: Николай СапуновОбновлено: август 202618 мин чтения
Содержание статьи +

Кратко

Краудсорсинговое субъективное тестирование проводит ваше исследование качества на сотнях оплачиваемых удалённых зрителей, которые оценивают клипы на своих экранах дома, обменивая контроль лаборатории над условиями просмотра на скорость, масштаб, низкую стоимость и реалистично разнообразную панель. Контроль, который вы отдаёте, приходится восстанавливать в софте – этап квалификации, проверяющий устройство и соединение каждого работника, gold-standard и trapping вопросы, отлавливающие невнимательных и жульничающих оценщиков, и проход скрининга данных, убирающий остальных, – а это ровно та машинерия, которую стандартизируют фреймворк краудсорсинга ITU-T P.808 (06/2021) и open-source краудсорсинговая реализация ITU-T P.910. Поскольку отбрасывается большая доля заявок, набирают гораздо больше людей, чем минимум стандарта в 35 валидных субъектов для неконтролируемого теста, а результат трактуют как сильное относительное ранжирование, а не как абсолютное лабораторное число. Статья показывает, как работает обмен, какая машинерия надёжности делает крауд-результат заслуживающим доверия, арифметику набора с учётом отбраковки и где всё же стоит заказать лабораторию – и поставляет планировщик, который размеряет и скринит крауд-тест за вас.

Почему это важно

Субъективный тест – это эталонная истина, против которой валидируется каждая метрика качества, но классическая лабораторная версия медленная, дорогая и ограничена маленькой однородной панелью – поэтому многие команды тихо пропускают её и доверяют метрике. Краудсорсинг убирает эти барьеры: вы можете получить пару сотен оценок за день, от зрителей на тех телефонах и ноутбуках, которыми реально пользуется ваша аудитория, за цену небольшой рекламной кампании. Статья – для инженера стриминга, кодирования или QA, кому нужен реальный человеческий вердикт по изменению качества, но кто не может ждать три недели лабораторию – и кто слышал, верно, что краудсорсинговые данные шумны и их легко обмануть. Задача здесь – показать, как получить результат, который можно защитить: когда крауда достаточно, как сделать его надёжным и когда честный ответ – всё же «возьмите лабораторию». Это половина «скорость против контроля» блока субъективного тестирования: дизайн, проведение и статистика всё ещё применимы, но комната теперь – весь интернет. Короткая версия субъективного тестирования для оператора энкодера живёт в обзоре субъективного тестирования раздела Video Encoding; эта статья – краудсорсинговый глубокий разбор, на который он указывает.

Что на самом деле меняет краудсорсинг

Начнём с того, что субъективный тест должен производить. Субъективный тест собирает оценки мнения у зрителей-людей и усредняет их в Mean Opinion Score – пишется MOS, среднее оценок панели по клипу – которое замещает «насколько хорошо это реально выглядит для людей». Классический способ собрать эти оценки – контролируемая лаборатория: калиброванный дисплей, фиксированный свет, измеренное расстояние просмотра и отобранная панель зрителей, всё прописано в ITU-R BT.500-15 (05/2023) для телевизионных изображений и ITU-T P.910 (10/2023) для мультимедиа. Вся ценность лаборатории в том, что она убирает каждую переменную, кроме видео, так что разница в оценках может прийти только из видео.

Краудсорсинговое субъективное тестирование – запуск той же задачи оценивания на онлайн-краудсорсинговой платформе, где анонимные оплачиваемые работники смотрят клипы на своём железе у себя дома и присылают оценки удалённо – сохраняет задачу оценивания и выбрасывает комнату. Никто не калибрует дисплей. Никто не измеряет расстояние до экрана и не приглушает свет. Панель – это кто угодно, кто записался, на любом устройстве, которым владеет, со всем, что ещё происходит в комнате. Взамен вы получаете четыре вещи, которые лаборатория дать не может: скорость (результаты за часы, а не недели), масштаб (сотни зрителей вместо двух десятков), низкую стоимость (центы – пара долларов за работника) и разнообразие (реальные устройства, реальные гостиные, реальные отвлечения – условия, в которые ваш продукт и поставляется).

Это и есть весь обмен, и его стоит назвать прямо: вы меняете контроль над условиями просмотра на скорость, масштаб, стоимость и реализм. Ни одна сторона не бесплатна. Лаборатория покупает вам чистый сигнал ценой времени и маленькой искусственной панели. Крауд покупает вам большую реалистичную панель быстро и дёшево – ценой шумного сигнала, который вы должны вычистить сами. Остальная часть статьи – про эту очистку, потому что крауд-тест без неё – это не более быстрый субъективный тест, а куча ненадёжных кликов.

Рисунок 1. Обмен в одну строку. Сдвиг от контролируемой лаборатории (BT.500 / P.910 контроль) к краудсорсингу (фреймворк P.808 / P.910 без контроля) покупает скорость, масштаб, стоимость и реализм устройств, а тратит контроль условий просмотра, который делает лабораторную оценку чистой.

Где краудсорсинг живёт в стандартах

Краудсорсинговое тестирование – не обходной путь, живущий вне стандартов: оно вписано в них, и знание того, какой документ чем владеет, держит ваш метод защищаемым.

Каноническая рекомендация по краудсорсингу – ITU-T P.808 (06/2021), озаглавленная «Subjective evaluation of speech quality with a crowdsourcing approach». Заметьте слово speech (речь): P.808 стандартизирует краудсорсинговое тестирование для телефонии и аудио, методом Absolute Category Rating – ACR, где каждый клип показывают один раз и оценивают по шкале 1–5 без эталона рядом. P.808 – источник той машинерии краудсорсинга, которую использует вся область – квалификационная задача работника, gold-standard и trapping вопросы, многоэтапный скрининг данных – но её предмет аудио, а не видео. Считайте P.808 фреймворком, а не видеостандартом.

Для видео контролирующий документ теперь – ITU-T P.910 (10/2023). До недавнего времени методы «оценивать видео в любой среде, включая дом» жили в отдельной рекомендации ITU-T P.913, чьё название – «Methods for the subjective assessment of video quality, audio quality and audiovisual quality of Internet video and distribution quality television in any environment» – было построено ровно вокруг той неконтролируемой обстановки, которая нужна краудсорсингу. Эта рекомендация была удалена 2 февраля 2024 года после того, как её содержание было включено в ITU-T P.910. Так что с 2024 года P.910 – единственный видеодокумент, покрывающий и контролируемую лабораторию, и неконтролируемый случай «любой среды», который представляет крауд. Если видите старый метод со ссылкой на P.913 – он не исчез, он переехал в P.910.

P.910 несёт и число, управляющее размером крауд-теста. Для контролируемой среды он требует минимум 24 валидных субъекта на стимул; для неконтролируемой среды – минимум 35 (пункт 10.1, прочитано прямо из текста P.910 10/2023). Лишние субъекты – это собственное признание стандарта, что неконтролируемая панель шумнее и что часть утраченной точности вы выкупаете большим числом людей. Последствия этого 35 мы разбираем ниже.

Наконец, мост от речевого фреймворка к видеопрактике уже существует в виде работающего кода. Бабак Надери и Росс Катлер из Microsoft опубликовали в 2022 году open-source краудсорсинговую реализацию ITU-T P.910 (проект microsoft/P.910), реализующую ACR, ACR со скрытым эталоном (ACR-HR), Degradation Category Rating (DCR) и Comparison Category Rating (CCR), вместе с квалификациями оценщика, среды, железа и сети плюс gold и trapping вопросами – машинерия P.808, портированная на видео. Они валидировали её как точную и хорошо воспроизводимую против существующих лабораторных исследований P.910 – это сильнейшее единичное доказательство, что правильно проведённый крауд-тест не является деградацией для многих задач.

Восстановить контроль, который вы отдали

Поскольку крауд убирает комнату, каждое ограждение, которое давала комната, приходится восстанавливать как шаг задачи. Их четыре, и идут они по порядку: квалифицировать работника, вставить вопросы с известными ответами, проскринить данные и спроектировать всё как два этапа, а не один.

Квалификация. Прежде чем работник оценит хоть один реальный клип, задача проверяет, что он может. Фреймворк P.808 называет это квалификационной задачей, а видеореализация расширяет её до четырёх проверок: оценщик (может ли следовать инструкциям и пользоваться шкалой, часто через короткое обучение и проверку понимания), среда (адекватна ли обстановка просмотра), железо (размер экрана, разрешение и цветопередача – телефон в портретной ориентации не может судить 4K-клип) и сеть (хватает ли полосы стримить тестовые клипы без того, чтобы сам плеер подвисал и портил оценку). Работник, проваливший квалификацию, никогда не входит в реальный тест, что дешевле, чем удалять его данные потом.

Gold-standard вопросы. Gold-standard испытание – это клип, чья верная оценка известна заранее: чистый, нетронутый эталон, который любой честный зритель оценивает у верха шкалы, или нарочно испорченный клип, который любой честный зритель оценивает у низа. Разбросайте несколько по сессии. Работник, оценивший чистый клип на 2 или испорченный на 5, либо не смотрит, либо не понимает, и вся его заявка становится подозрительной. Gold ловит зрителя, чьё суждение неверно.

Trapping вопросы. Trapping вопрос – иногда зовут вопросом на внимание или «honeypot» – другой: он несёт явную инструкцию внутри контента, например клип, на котором написано «чтобы показать, что вы внимательны, выберите 2 для этого видео». Никакого суждения о качестве; единственный способ ответить верно – смотреть и читать. Trapping ловит бота и кликающего наспех «спидера», который листает испытания не глядя. Gold ловит неверное суждение; trapping ловит отсутствующее внимание. Нужны оба. Open-source реализации перемежают примерно один gold и один trapping на каждые десять реальных испытаний.

Скрининг данных. После сессии тот же статистический скрининг, что и в лаборатории, всё ещё применим, и здесь он делает больше работы. Корреляционный метод P.910 оставляет субъекта только если его оценки достаточно тесно отслеживают MOS панели; правила выбросов отмечают голоса далеко за разбросом панели; а крауд-специфичные проверки отбраковывают сессии, завершённые невозможно быстро, ответившие на каждое испытание одним и тем же баллом или – новая угроза – пришедшие через remote-desktop соединение. Исследование 2025 года о надёжном участии на разных платформах задокументировало работников, эксплуатирующих метаданные видео и проходящих через remote-desktop (RD) каналы, которые тихо переэнкодят видео до того, как оно дойдёт до глаз, и предложило для этого детекторы; вывод – список скрининга не статичен, и крауд-вендор должен уметь сказать вам, что он проверяет.

Два этапа, а не один. Работа лучших практик, сформировавшая область – статья Хоссфельда с коллегами «Best Practices for QoE Crowdtesting» (IEEE Transactions on Multimedia, 2014) – показала, что разбиение работы на этап надёжности/квалификации с последующим отдельным этапом оценивания даёт заметно более надёжные результаты, чем единая объединённая задача. Сначала квалифицируйте, потом оценивайте; не подпускайте непроскрининенный крауд к вашим реальным стимулам.

Рисунок 2. Конвейер надёжности. Набранные работники проходят через квалификацию, затем задачу оценивания, засеянную gold и trapping испытаниями, затем скрининг данных; оранжевая полоса – отбракованная доля, поэтому набирают намного больше, чем 35 валидных субъектов, которых надо оставить.
ИзмерениеКонтролируемая лаборатория (BT.500-15 / P.910 контроль)Краудсорсинг (фреймворк P.808 / P.910 без контроля)Где крауд врёт / его предел
Условия просмотраКалиброванный дисплей, фикс. свет, измеренное расстояниеЧто есть у работника и где он сидитНет контроля; условия – скрытая неровная переменная
ПанельМаленькая, отобранная, часто однородная (≥24 валидных)Большая, разнообразная, самоотбор (≥35 валидных)Разнообразие реалистично, но добавляет шум в каждую оценку
СкоростьДни–недели (расписание, сессии)Часы–деньБыстро – но спешка со скринингом возвращает шум
СтоимостьВысокая (время лаборатории, надзор)Низкая (центы–пара долларов за работника)Дёшево за оценку, но отбракованные заявки – оплаченные потери
Контроль надёжностиФизический (комната его обеспечивает)Программный (квалификация, gold, trapping, скрининг)Лишь настолько хорош, насколько ограждения; жульничество эволюционирует
Лучше дляМалых пороговых разниц, контента под эталонный дисплейБольших разниц, ранжирований, реалистичного QoE, масштабаАбсолютного лабораторного MOS; цвето/HDR-критичных суждений

Два испытания с известным ответом в этом конвейере делают разную работу, и крауд-тесту нужны оба. Gold-standard вопрос – это клип, чья верная оценка известна заранее; trapping вопрос – клип, несущий инструкцию внутри контента. Один полицейский над суждением, другой – над вниманием.

Рисунок 3. Два испытания с известным ответом. Gold-standard вопрос (клип, чья верная оценка известна – чистый около 5, испорченный около 1) ловит неверное суждение; trapping вопрос (инструкция внутри контента, например «выберите 2») ловит отсутствующее внимание и ботов. Вставьте примерно по одному на каждые десять реальных испытаний и скриньте по обоим.

Сколько работников – и почему набирают больше, чем нужно

Стандарт говорит: минимум 35 валидных субъектов должны оценить каждый стимул в неконтролируемом тесте. Слово, которое стоит денег, – валидных. Квалификация, gold, trapping и скрининг – все отбрасывают людей, так что число, которое вы набираете, – это число, нужное вам после отбраковки, увеличенное на её долю.

Запишем долю отбраковки как дробь – назовём её r. Если ожидаете выбросить 40% заявок (реалистичная цифра для открытого крауда до ужесточения), то выживает только 60%, и число для набора, чтобы получить 35 валидных, такое:

набор = нужно_валидных / (1 − r)
      = 35 / (1 − 0,40)
      = 35 / 0,60
      = 58,3  →  набираем 59

Зависимость неумолима в верхней части. При доле отбраковки 30% вы набираете 50; при 40% – 59; при 50% набираете 70, чтобы оставить 35. Уполовинивание доли отбраковки – за счёт более жёсткой квалификации на входе, чтобы меньше плохих сессий доходило до этапа оценивания – стоит больше почти любой другой настройки, потому что вы платите за каждого набранного работника, валидного или нет.

Теперь масштабируем на реальное исследование. Допустим, у вас 200 клипов, каждому нужно минимум 35 валидных оценок, и каждый работник оценивает 50 клипов за раз. Всего нужно валидных оценок 35 × 200 = 7 000. При 50 валидных оценках за сессию это 7 000 / 50 = 140 валидных сессий. Увеличив на 40% долю отбраковки, набираем 140 / 0,60 = 233,3 → 234 сессии. И каждая сессия – не 50 испытаний, а около 60, как только вы вставите примерно пять gold и пять trapping элементов для контроля. Ничего экзотического – это просто бухгалтерия, отделяющая крауд-тест, возвращающий 35 крепких голосов на клип, от того, что возвращает 20 и широкий доверительный интервал.

Эта последняя фраза – связка обратно к статистике: точность MOS масштабируется как единица на корень из размера валидной панели, так что недонабор не просто уменьшает выборку – он расширяет каждую планку погрешности и может загнать реальную разницу обратно в шум. 35 стандарта – это пол не зря. Спутник-планировщик ниже делает эту арифметику – число набора, бюджет gold и trapping и грубую оценку времени и стоимости – из вашего числа клипов и доли отбраковки.

Когда краудсорсингового MOS достаточно – и когда нужна лаборатория

Честное правило решения – про размер разницы, которую вы пытаетесь увидеть, и про то, является ли сам экран частью того, что вы тестируете.

Краудсорсинга достаточно – часто он лучше лаборатории – когда разница комфортно видна, когда вам нужно относительное ранжирование и когда дом – и есть реальный контекст просмотра. Сравнение двух явно разных лестниц энкодера, ранжирование пяти кандидат-пресетов, скрининг большого набора клипов, чтобы найти немногие, достойные внимательного взгляда, или измерение качества пользовательского и live-контента (у которого нет чистого эталона и который и так смотрят на телефонах) – всё играет на сильные стороны крауда: масштаб, скорость и реализм устройств. Валидированная воспроизводимость краудсорсинговой реализации P.910 против лабораторных исследований – это доказательство, что, проведённый правильно, крауд приземляется туда же, куда и лаборатория, для этих задач.

Лаборатория нужна, когда разница мала и близка к порогу того, что вообще кто-то может увидеть, или когда дисплей – переменная, которую надо держать неподвижной. Наименьшая разница MOS, которую 5-балльный тест надёжно различает, – около 0,5 даже с чистой 24-субъектной лабораторной панелью; неконтролируемый крауд, шумнее на оценку, нуждается в своей большей панели просто чтобы это повторить, и всё равно борется ниже этого. Так что решение по кодеку, висящее на разрыве 0,2–0,3 MOS, – задача для лаборатории, не для крауда: никакой набор чисто не разрешает разницу меньше вашего шума на оценку. То же касается всего, где экран и есть эксперимент: HDR и 4K-контент, судимый на эталонном мониторе, цвето-критичный грейдинг или исследования, где калиброванная яркость и контраст – весь смысл. Крауд некалиброванных телефонов не может ответить на вопрос о калиброванном дисплее.

Рисунок 4. Крауд или лаборатория? Если разница у порога, дисплей – переменная или нужен публикуемый эталон, заказывайте лабораторию; иначе крауд быстрее, дешевле и – проведённый с полным конвейером надёжности – обычно так же точен для нужного вам ранжирования.

Есть и средний путь, который стандарты одобряют: используйте крауд, чтобы отобрать широко и быстро, затем подтвердите один-два близких случая, что выжили, в маленьком контролируемом тесте. Крауд сужает поле; лаборатория решает фотофиниш.

«Частая ошибка – нет gold или trapping вопросов. Без испытаний, чьи ответы вы уже знаете, нельзя отличить внимательного зрителя от бота, и ваш «MOS» – это среднее, включающее невидимый вам шум. Вставьте gold (клипы известного качества) и trapping (инструкции внутри контента) испытания, примерно по одному на десять реальных клипов, и скриньте по обоим – это ядро фреймворка ITU-T P.808 и open-source реализации P.910.»
«Частая ошибка – набрать ровно 35. 35 стандарта – это валидное число после скрининга, а не число для приглашения. Если набрать 35 и отбраковать 40%, останется 21, и каждый доверительный интервал расширится. Набирайте 35 / (1 − доля_отбраковки) и проверяйте выжившее число на клип, прежде чем доверять хоть одному MOS.»
«Частая ошибка – читать крауд-MOS как абсолютное лабораторное число. Шкала неконтролируемой панели может сдвигаться с устройством, контекстом и инструкциями, так что крауд-MOS 4,1 не взаимозаменяем с лабораторным MOS 4,1. Сравнивайте внутри одного теста – разницу или ранжирование между вашими условиями – а не абсолютное число против лабораторного результата, проведённого где-то ещё.»

Где здесь Фора Софт

Фора Софт строит видеософт с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицину и видеонаблюдение – и мы трактуем краудсорсинг как быстрый широкий первый проход, а не как замену контролируемому тесту. Когда клиенту нужно отранжировать настройки энкодера или проверить изменение качества на реальных телефонах и ноутбуках, которыми пользуется его аудитория, крауд-тест с полным конвейером надёжности – квалификация, gold и trapping испытания и скрининг P.910 – даёт защищаемый ответ за день вместо трёх недель. Когда решение висит на пороговой разнице, на HDR или цвете, или на числе, которое должно выдержать внешнюю проверку, мы вместо этого проводим маленький контролируемый тест и держим ту же провенанс-дисциплину, что и в нашей методологии бенчмарков: панель, платформа, правила скрининга и доля отбраковки – всё изложено так, чтобы результат держался после закрытия теста.

Главное

  • Краудсорсинг меняет контроль над условиями просмотра на скорость, масштаб, низкую стоимость и реализм устройств – осознанный, называемый обмен.
  • Утраченную надёжность восстанавливают в софте: квалификация, gold-standard вопросы, trapping вопросы и скрининг данных, в идеале в два этапа.
  • ITU-T P.808 (06/2021) – фреймворк краудсорсинга (для речи); видеокраудсорсинг теперь живёт в ITU-T P.910 (10/2023) после того, как P.913 влили в него в 2024-м.
  • P.910 требует минимум 35 валидных субъектов для неконтролируемого теста; набирайте 35 / (1 − доля_отбраковки), чтобы получить столько после скрининга.
  • Крауд-MOS – это сильное относительное ранжирование, а не абсолютное лабораторное число – сравнивайте внутри теста, не между средами.
  • Берите лабораторию для пороговых разниц (ниже ~0,5 MOS), контента под эталонный дисплей и публикуемого эталона.

Что читать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.