Содержание статьи +
- Кратко
- Почему это важно
- Оценка – это предложение без подлежащего
- Вопрос 1 – Что это за метрика и чьей реализацией получена?
- Вопрос 2 – Какой моделью получена оценка?
- Вопрос 3 – Как сведены покадровые оценки?
- Вопрос 4 – Какой разброс? Читайте доверительный интервал
- Вопрос 5 – Сравнение «яблоки к яблокам»?
- Вопрос 6 – Не сломали ли метрику контент или отсутствие эталона?
- Чек-лист рецензента одной таблицей
- Про отчёты с BD-rate
- Частые ошибки при чтении отчёта
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Кратко
Отчёт о метриках качества – это набор утверждений, а голое число вроде «VMAF 95» – утверждение, из которого вынули доказательства: оно умалчивает о модели, пулинге, контенте и эталоне, на которых держится. Чтобы прочитать его и не обмануться, проверьте шесть вещей: какая это метрика и чьей реализацией получена, какой моделью, как сведены покадровые оценки, насколько широк доверительный интервал, честно ли «яблоки к яблокам» любое сравнение и не сломали ли метрику контент или отсутствие эталона. Большинство «побед», что вам покажут, – выигрыш в один пункт VMAF, заоблачная оценка на 480p-файле, чистое среднее по клипу с одной ужасной секундой – не выдерживают ни одного из этих вопросов. Эта статья – чек-лист скептика, с разобранным примером доверительного интервала, а также бесплатный линтер и печатный чек-лист, чтобы применить всё это за минуты.
Почему это важно
Чужих отчётов о качестве вы прочитаете гораздо больше, чем напишете своих: бенчмарк кодека от вендора, A/B энкодеров от коллеги, число на дашборде, таблицу результатов из статьи. Каждый просит принять решение – выкатить этот энкодер, принять этот релиз, поверить этому заявлению – и каждый может быть технически верным и при этом вводить в заблуждение. Эта статья – для лида по кодированию, взвешивающего смену кодека, для QA-инженера, подписывающего сборку, для стриминг-инженера, читающего дашборд доставленного качества, и для продукт-оунера, кому надо доверять цифре под ним. Навык, который она строит, – дешёвая страховка: несколько вопросов, заданных каждый раз, что не дают числу принять за вас решение, которое вы бы не приняли, видя полную картину.
Оценка – это предложение без подлежащего
Начните с привычки, которая чинит всё остальное. Оценка качества – не факт о видео; это ответ, который конкретный инструмент дал в конкретных условиях. «VMAF 95» – как предложение «набрал 95» без подлежащего, без теста и без шкалы: его нельзя прочитать, пока не подставишь недостающие части. Число, сплавляющее несколько перцептивных признаков в прогноз по шкале 0–100 того, как оценил бы видео зритель, – VMAF (Video Multimethod Assessment Fusion) – зависит от того, какую обученную модель вы запустили, как свернули тысячи покадровых чисел в одно и был ли у файла, который вы измеряли, вообще чистый исходник для сравнения.
Поэтому чтение отчёта – не «высокое ли число?». Это «что на самом деле утверждает это число и выдерживает ли утверждение проверку?». Дальше – шесть вопросов, что превращают голую оценку обратно в полное предложение. Задавайте их по порядку; первый же провалившийся обычно всё и решает.
Вопрос 1 – Что это за метрика и чьей реализацией получена?
Сначала назовите метрику и то, что она измеряет, потому что метрики не взаимозаменяемы и не лежат на одной шкале. PSNR (Peak Signal-to-Noise Ratio), в децибелах, докладывает, насколько пиксели расходятся с исходником; о том, заметна ли разница, она не говорит ничего. SSIM (Structural Similarity Index), по шкале 0–1, сравнивает локальную яркость, контраст и структуру. VMAF, по шкале 0–100, прогнозирует оценку человека. Отчёт со словами «качество 0.95» без названия метрики прочитать нельзя: 0.95 – отличный SSIM и невозможный VMAF. Если нужна короткая версия каждой метрики «на один экран» при настройке энкода, она есть в комбинированной статье о метриках качества раздела Video Encoding; эта же статья – глубокий разбор того, как читать выдаваемые ею числа.
Затем задайте вопрос, который почти все пропускают: чьей реализацией? Одно и то же имя метрики даёт разные числа в разных инструментах. Например, собственный SSIM от Netflix включает эмпирический шаг даунсэмплинга, которого нет у фильтра SSIM в FFmpeg, поэтому для одной и той же пары они докладывают разные значения SSIM (Netflix VMAF FAQ, 2026). С PSNR хуже: пакет VMAF ограничивает PSNR сверху на 60 дБ для 8-битного и 72 дБ для 10-битного контента по правилу 6·N + 12, тогда как другой инструмент может доложить для того же кадра большее или неограниченное значение (Netflix VMAF FAQ, 2026). Практическое правило: число SSIM или PSNR сравнимо лишь с другим, полученным тем же инструментом и той же версией. Две колонки SSIM из двух инструментов – это две разные линейки.
Вопрос 2 – Какой моделью получена оценка?
Для VMAF модель – часть числа, и её пропуск – самый частый способ ввести в заблуждение. Модель по умолчанию прогнозирует качество для 1080p ТВ на расстоянии в три высоты экрана (около 60 пикселей на градус); телефонная модель предполагает небольшой экран в руке и читается на несколько пунктов выше для того же файла; 4K-модель прогнозирует 4K ТВ на 1.5 высоты экрана (документация моделей Netflix VMAF, 2026; Netflix VMAF FAQ, 2026). Это разные вопросы с разными ответами. «VMAF 93» телефонной модели и «VMAF 93» модели по умолчанию – не одно и то же качество: файл с телефонной моделью на телевизоре заметно хуже.
Поэтому отчёт о доставленном качестве обязан называть модель, иначе его число значит «где-то в полосе 4–6 пунктов, смотря какую модель я выбрал и не сказал вам». Когда отчёт умалчивает о модели, считайте оценку предварительной и спрашивайте. Глубокий разбор выбора модели – в статье VMAF в деталях.
Вопрос 3 – Как сведены покадровые оценки?
Каждая полнореференсная метрика даёт по одной оценке на кадр; единственное заглавное число – сводка из тысяч таких оценок, и способ сводки меняет историю. По умолчанию VMAF докладывает арифметическое среднее покадровых оценок – ради простоты и согласованности со средним PSNR (Netflix VMAF FAQ, 2026). Но среднее – ровно та статистика, что прячет короткую катастрофу: клип, отличный 59 секунд и разваливающийся на одну, может показать среднее за 90, тогда как зритель запомнит только плохую секунду.
Поскольку человеческое мнение сильнее весит худшие моменты, инструменты VMAF дают и другие методы пулинга – гармоническое среднее, медиану, минимум и 5-й, 10-й, 20-й перцентили (Netflix VMAF FAQ, 2026). Отчёт, цитирующий только среднее, отвечает на «насколько хорош был средний кадр?», когда решение обычно зависит от «насколько плох был худший участок?». Лекарство при чтении – попросить нижний перцентиль или минимум рядом со средним. Среднее 93 при 5-м перцентиле 71 – это иное решение о релизе, чем среднее 93 при 5-м перцентиле 90. Почему худшие секунды доминируют в воспринимаемом качестве, разбирает статья пулинг покадровых оценок.
Вопрос 4 – Какой разброс? Читайте доверительный интервал
Оценка VMAF – это прогноз модели, обученной на выборке человеческих оценок, поэтому она несёт неопределённость, и VMAF может доложить её как 95-процентный доверительный интервал, используя бутстрэп-модель (документация доверительного интервала Netflix VMAF, 2026). Доверительный интервал – диапазон, в который, вероятно, попадает истинная оценка. Проигнорируете его – и примете шум за результат.
Вот арифметика на цифрах из собственного примера Netflix. Бутстрэп-прогон докладывает оценку и стандартное отклонение:
BOOTSTRAP_VMAF_score = 75.44
BOOTSTRAP_VMAF_stddev_score = 1.31В предположении нормального распределения 95-процентный доверительный интервал – это оценка плюс-минус 1.96 стандартного отклонения:
95% ДИ = 75.44 ± 1.96 × 1.31
= 75.44 ± 2.57
= [72.87, 78.01]То есть «VMAF 75.4» на самом деле – «где-то между примерно 73 и 78 с 95-процентной уверенностью». Теперь приложите это к сравнению. Пусть отчёт объявляет победителем энкодер B:
Энкодер A : VMAF 93.0 (95% ДИ 91.5 – 94.5)
Энкодер B : VMAF 94.0 (95% ДИ 92.4 – 95.6)Интервалы перекрываются почти целиком. «Победа» в один пункт лежит глубоко внутри шума, поэтому честное чтение – «при этом объёме выборки разница неизмерима», а не «B лучше». Отчёт, цитирующий одиночные оценки до десятых и объявляющий победителя без интервала и без разброса, приглашает прочитать в нём больше, чем там есть. И учтите: интервалы не одинаковы – в обучающих данных VMAF область высоких оценок плотнее, поэтому высокие оценки несут более узкие интервалы, чем низкие (документация доверительного интервала Netflix VMAF, 2026).
Вопрос 5 – Сравнение «яблоки к яблокам»?
Сравнение метрик корректно лишь когда постоянно всё, кроме того, что проверяется: те же исходные кадры, тот же эталон, то же разрешение, на котором считалась метрика, та же модель, тот же пулинг. Нарушьте хоть одно – и сравнение бессмысленно, как бы точно ни выглядели числа.
Разрешение – ловушка, в которую попадает большинство. Поскольку VMAF моделирует фиксированное расстояние просмотра, оценка пары низкого разрешения на её родном разрешении ведёт себя так, будто маленький кадр вырезан из большего и виден с гораздо большего расстояния, что прячет артефакты и завышает оценку. Собственный FAQ Netflix считает цифры: пара на 480 строк, оценённая нативно, моделирует расстояние просмотра в 6.75 высоты кадра вместо задуманных 3, что «скроет много артефактов и потому даст очень высокую оценку», и поэтому «НЕ следует сравнивать абсолютную оценку VMAF видео 1080 с оценкой видео 480, полученной на его родном разрешении» (Netflix VMAF FAQ, 2026). Правильный метод – апскейлить искажённое видео до разрешения эталона и считать VMAF там.
Эффект достаточно велик, чтобы перевернуть решение. Один и тот же 480p-энкод читается куда выше при нативной оценке, чем при честной – против своего 1080p-исходника. Файл не менялся, менялось только измерение.
Один 480p-энкод, два способа измерить (иллюстративно):
Оценён нативно на 480p → VMAF 96 (моделирует расстояние 6.75H)
Апскейл до 1080p, оценка против исходника → VMAF 82 (моделирует задуманные 3H)Читая мультиразрешающее сравнение, первым делом проверьте разрешение, на котором работала метрика. Если ступени лестницы битрейта оценивали каждую на её родном разрешении, сравнение недействительно, а нижние ступени польщены.
Вопрос 6 – Не сломали ли метрику контент или отсутствие эталона?
Наконец, спросите, применима ли метрика к этому контенту вообще. Каждая объективная метрика – прокси, валидированный против человеческих оценок на определённом материале, и у каждой есть контент, на котором она врёт. VMAF создавалась для артефактов сжатия и масштабирования в адаптивном стриминге; для других искажений, таких как потеря пакетов или ошибки передачи, «перцептивное качество ... МОЖЕТ быть предсказано неточно» (Netflix VMAF FAQ, 2026). PSNR, SSIM и VMAF v0.6.1 едва замечают бэндинг на плавном небе; зерно и плотная текстура путают полнореференсные метрики; тёмные и HDR-сцены прячут ошибки, которые глаз ловит. Высокая оценка на склонном к бэндингу или зернистом контенте – не свидетельство, что он выглядит хорошо, а свидетельство, что метрика тут слепа. Каталог того, какая метрика на каком контенте врёт, – в статье где врут объективные метрики.
Вторая половина этого вопроса – был ли вообще настоящий эталон. PSNR, SSIM и VMAF – полнореференсные метрики: им нужен чистый исходник, выровненный по кадрам с искажённым файлом. Удивительно много плохих оценок происходит не из плохого энкода, а из сломанного эталона – сдвига в один кадр между искажённым и эталоном или отсутствия метаданных цвета, из-за чего инструмент трактует пиксели в неверном цветовом пространстве и заваливает оценку (Ozer, Streaming Learning Center, 2024). Прежде чем доверять низкому числу, убедитесь, что оба файла выровнены и помечены правильно. А если контент лайв или пользовательский, исходника нет вовсе, поэтому любое полнореференсное число не слабое – оно невозможно, и отчёт должен использовать no-reference метрику. Это различие разбирает статья три схемы измерения.
Чек-лист рецензента одной таблицей
Держите её рядом с любым отчётом. Левая колонка – что показывает отчёт; средняя – что проверить; правая – как он обманет, если проверку пропустить.
| Что показывает отчёт | Что проверить | Как он вас обманет |
|---|---|---|
| Голую оценку («VMAF 95») | Названа метрика? Названы инструмент/реализация? | 0.95 SSIM ≠ 0.95 чего-либо ещё; SSIM двух инструментов различается |
| Число VMAF | Какая модель – default, phone или 4K? | Телефонная модель читается на пункты выше ТВ |
| Одно заглавное число | Пулинг – среднее или нижний перцентиль/минимум? | Среднее прячет короткий плохой участок, что помнит зритель |
| «A лучше B на 1 пункт» | Показан доверительный интервал / разброс? | Разрыв в 1 пункт внутри усов погрешности – это шум |
| Мультиразрешающую таблицу | Разрешение, на котором работала метрика | Нативные оценки низкого разрешения завышены расстоянием просмотра |
| Высокую оценку на сложном контенте | Бэндинг, зерно, темнота, потеря пакетов? | Метрика тут слепа; высокое ≠ хорошее |
| Любую полнореференсную оценку | Настоящий, выровненный по кадрам, верно помеченный эталон? | Сдвиг или баг цветовой пометки заваливает хороший энкод |
Про отчёты с BD-rate
Одно число заслуживает отдельного предупреждения, потому что его так часто читают неверно: BD-rate (Bjøntegaard Delta rate). Это вообще не оценка качества – это среднее различие битрейта между двумя энкодерами при равном качестве, вычисленное по их кривым «битрейт-качество» (Bjøntegaard, VCEG-M33, 2001). Со знаком путаются: отрицательный BD-rate означает, что тестовому энкодеру нужно меньше бит при том же качестве (выигрыш), а положительный – что больше. Отчёт со словами «BD-rate −30%» утверждает экономию битрейта 30% при равном качестве, а не выигрыш в качестве на 30%. И, как у каждой метрики выше, BD-rate действителен лишь с названными нижележащей метрикой, моделью, набором контента и якорем. Разбор на наших цифрах – в статье BD-rate на наших цифрах.
Частые ошибки при чтении отчёта
«Допущение об идеальной оценке. Естественно ждать, что файл, сравнённый сам с собой, наберёт VMAF 100. Это не так – машинно-обученный предиктор обычно возвращает что-то вроде 98.7 для идентичной пары (Netflix VMAF FAQ, 2026). Поэтому «не 100» не значит «деградировал», и отчёт, помечающий самосравнение в 98.7 как дефект, неверно читает собственную метрику.»
Помимо этого, повторяются четыре ошибки. Первая – читать одно среднее и пропускать худшие секунды; всегда ищите перцентиль или минимум. Вторая – сравнивать между шкалами метрик, будто «SSIM 0.95 лучше VMAF 90» что-то значит; это разные линейки. Третья – сравнивать между реализациями или разрешениями, где один и тот же контент даёт разные числа по причинам, не имеющим отношения к качеству. Четвёртая – принимать одно объективное число за эталон истины: каждая метрика – прокси человеческой оценки, и когда число и внимательный зритель расходятся, прав субъективный тест, а метрика промахнулась. Более глубокий вопрос «как мы вообще знаем, что метрика следует за глазом» – корреляции Пирсона и Спирмена, RMSE, процедура ITU-T P.1401 – разобран в статье валидация метрик по оценкам людей.
Где здесь Фора Софт
Фора Софт делает видеософт с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицину и видеонаблюдение, – и большинство отчётов о качестве, что мы читаем, приходят извне: бенчмарк кодека от вендора, существующий пайплайн клиента, open-source-сравнение. Мы читаем каждый по шести вопросам выше, прежде чем он повлияет на решение, потому что льстивое число, измеренное на нативном низком разрешении или сведённое средним, стоило не одной команде неверного выбора кодека. Публикуя собственные цифры, мы прикладываем метрику, модель, пулинг, доверительный интервал, набор контента и дату, чтобы читатель мог применить ту же придирчивость к нам; постоянные правила записаны в нашей методологии бенчмарков. Дисциплина симметрична: читай чужие отчёты скептически и делай свои такими, чтобы они выдержали то же чтение.
Главное
- Голая оценка – это утверждение без доказательств; подставьте метрику, модель, пулинг, разброс и эталон, прежде чем доверять.
- Одна метрика в двух инструментах – две линейки; SSIM и PSNR сравнимы только внутри одной реализации и версии.
- Называйте модель VMAF: телефонная читается на несколько пунктов выше модели по умолчанию для того же файла.
- Читайте доверительный интервал – «победа» VMAF в один пункт обычно лежит внутри усов погрешности.
- Нативные оценки низкого разрешения завышены; сравнивайте только при том же разрешении, кадрах, эталоне, модели и пулинге.
- Высокая оценка на бэндинге, зерне или тёмном контенте, как и любая полнореференсная оценка на лайве без исходника, – не свидетельство качества.