Термин

MOS

Англ.: Mean Opinion Score
Короткое определение

Средняя субъективная оценка качества (обычно 1–5) от панели зрителей. «Истина», к которой стремятся приблизиться объективные метрики.

MOS – Mean Opinion Score – средняя оценка качества от панели человеческих зрителей, выраженная по шкале 1–5: 1 = Bad, 2 = Poor, 3 = Fair, 4 = Good, 5 = Excellent. Появилась у телефонных инженеров в 1960-х для измерения качества звонков, MOS распространился на любой quality-of-experience домен – аудиокомпрессию, видеокомпрессию, видеоконференц-связь, стриминговые сервисы. Когда читаете «этот кодек достигает MOS 4.2 на 5 Mbps», это значит, что зрители в контролируемом тесте оценили выход кодека как уверенное «Good» на том bitrate. MOS – золотой стандарт ground truth, который пытается предсказывать любая объективная метрика качества (PSNR, SSIM, VMAF).

Методология регулируется ITU-рекомендациями P.800, P.910 и другими. Размер панели обычно 15–30 зрителей; ниже 15 статистический шум становится слишком высоким для уверенных выводов. Условия просмотра контролируются – откалиброванные дисплеи, заданное окружающее освещение, фиксированное расстояние просмотра – чтобы разные тестовые лаборатории могли сравнивать результаты. Дизайн теста использует методологии вроде ACR (оценка каждого клипа в одиночку), DSCQS (сравнение side-by-side) или DCR (оценка деградации относительно скрытого reference). Оценки статистически анализируются, и доверительный интервал репортится рядом со средним.

Для продуктовой команды MOS – оценка, которую всё остальное пытается предсказать. Вы будете видеть его цитируемым в кодек-статьях, вендорских white-paper и конкурентных бенчмарках. Практическая оговорка: MOS-значения из разных экспериментов нельзя напрямую сравнивать, если они не были спроектированы для сравнения – разные панели, экраны, наборы контента и методологии могут сдвинуть абсолютные MOS-значения на ±0.5 даже когда энкоды идентичны. Используйте MOS для относительных сравнений внутри одного теста и используйте объективные метрики (VMAF в частности, обученный предсказывать MOS) для cross-experiment-сравнения.

Считаете параметры для своего продукта?

Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.