Содержание статьи +
- Кратко
- Почему это важно
- Что такое VMAF на самом деле
- Идея fusion: что объединяет VMAF
- Как обучалась модель: на человеческих оценках
- Чтение оценки VMAF: шкала от 0 до 100
- Разобранный пример: превращаем зазор VMAF в решение о битрейте
- Оценка VMAF бессмысленна без модели
- VMAF v1: поколение 2026 года
- Режим NEG: когда метрику можно обмануть
- Как вычислить VMAF с помощью FFmpeg и libvmaf
- Где VMAF всё ещё врёт
- Как VMAF сравнивается с PSNR и SSIM
- Частые ошибки с VMAF
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
VMAF – Video Multimethod Assessment Fusion – это full-reference-метрика качества видео, которую построил и открыл Netflix, чтобы по шкале от 0 до 100 предсказывать, насколько хорошо сжатое видео на самом деле выглядит для человека. Вместо одного показателя она измеряет сразу несколько – сколько визуальной информации уцелело, сколько мелких деталей потеряно и насколько картинка движется, – а модель машинного обучения, обученная на человеческих оценках, сводит их в одно число, которое отслеживает глаз лучше, чем PSNR или SSIM. В этом её сила и её подвох: оценка VMAF ничего не значит, пока вы не назвали модель за ней (default, phone или 4K), способ пулинга покадровых оценок и контент, на котором она считалась. Статья показывает, что VMAF объединяет, как он обучался, что означает каждый диапазон оценок, разбирает пример с переводом выигрыша VMAF в экономию битрейта, описывает новые модели v1 2026 года и точно называет, где VMAF всё ещё врёт.
Почему это важно
VMAF – это то число качества, в котором сейчас спорит вся индустрия стриминга. Оно решает, какими будут лестницы битрейтов, закрывает споры «какой кодировщик лучше», работает воротами релиза и встречается в каждом современном отчёте качества из FFmpeg – обычно в виде голого «VMAF 95» без названной модели, и это самый частый способ обмануть себя метрикой. Эта статья даёт метрику целиком: идею fusion, которая делает её перцептивной, обучение, которое заземляет её на человеческое мнение, шкалу и порог едва заметной разницы, правила выбора модели и слепые зоны, которые надо назвать прежде, чем доверять числу. Это глубокое погружение, на которое ссылается короткий обзор метрик качества на стороне кодирования в разделе Video Encoding.
Что такое VMAF на самом деле
Начнём с задачи, под которую построили VMAF. PSNR измеряет пиксельную ошибку и слабо коррелирует с тем, что видят люди. SSIM измеряет структурное сходство и отслеживает глаз лучше, но всё равно измеряет лишь одну вещь и насыщается у верха своей шкалы, где живут энкоды стримингового уровня. Netflix, оценивая тысячи энкодов в день по огромному каталогу, нуждался в числе, которое совпадает с человеческим мнением достаточно точно, чтобы принимать реальные решения по битрейту. Ни одна отдельная существующая метрика не справлялась со всем их контентом.
Их ответ – перестать искать одно идеальное измерение и вместо этого объединить несколько несовершенных. Это говорит и само название: Video Multimethod Assessment Fusion. VMAF берёт горсть устоявшихся измерений качества – каждое ловит свой вид повреждений – и сводит их моделью, которая на человеческих оценках научилась, как их взвешивать. На выходе – одно число от 0 до 100, предсказывающее Mean Opinion Score, который клипу выставила бы панель зрителей (Netflix Technology Blog, «Toward a Practical Perceptual Video Quality Metric», июнь 2016).
Два факта о VMAF задают всё остальное. Во-первых, как PSNR и SSIM, это full-reference-метрика: ей нужен чистый оригинал на диске, чтобы сравнивать искажённое видео кадр в кадр. Нет оригинала – нет VMAF, и это исключает её для прямых трансляций и пользовательского контента без мастера (три схемы разобраны в full-reference, reduced-reference, no-reference метрики). Во-вторых, VMAF обучен, а не выведен. PSNR берётся из формулы; VMAF берётся из модели, подогнанной под человеческие оценки. Поэтому он точнее – и поэтому несёт багаж, которого у формулы не бывает: обучающую выборку, условие просмотра и способ быть обманутым.
Идея fusion: что объединяет VMAF
Вот аналогия на всю статью. PSNR – это один судья, который считает только орфографические ошибки. VMAF – небольшая панель специалистов: один следит за потерей информации, другой – за потерей деталей, третий – как движется картинка, – и председатель, который на опыте научился, насколько доверять каждому судье на каждом типе материала. Панель бьёт любого одиночного судью, потому что каждый специалист ловит то, что другие пропускают.
В исходном и долго доминировавшем дизайне VMAF (поколение «v0», модели вроде vmaf_v0.6.1) у панели было три вида судей.
Visual Information Fidelity, или VIF – сколько информации картинки уцелело. VIF считает оригинальный кадр источником визуальной информации и спрашивает, сколько её проходит через сжатие к вашему глазу, опираясь на модель того, как зрение воспринимает сцену. Он вычисляется на четырёх пространственных масштабах, от грубого к мелкому, поэтому замечает и широкие, и мелкие потери (Sheikh и Bovik, «Image Information and Visual Quality», IEEE Transactions on Image Processing, 2006). Когда сжатие стирает тонкую текстуру кожи или листвы, реагирует именно VIF.
Detail Loss Metric, или DLM – сколько мелких деталей уничтожено, отдельно от добавленного шума. DLM делит урон на две части: деталь, которая потеряна (картинка становится менее чёткой), и помехи, которые добавлены (лишний мусор, отвлекающий глаз), – и оценивает потерю детали отдельно (Li, Zhang, Ma и Ngan, «Image Quality Assessment by Separately Evaluating Detail Losses and Additive Impairments», IEEE Transactions on Multimedia, 2011). Это судья, ловящий размытие и смазывание текстуры.
Движение – насколько движется картинка. VMAF измеряет временную разницу между соседними кадрами – в open-source-пакете это средняя разница совмещённых пикселей по каналу яркости (luma). Движение важно, потому что глаз прощает больше искажений на быстрой сцене: неподвижный кадр разглядывают, быстрый панорамный проезд – нет. Подача движения в модель позволяет ей откалибровать, насколько строго судить пространственный урон.
Каждый из них даёт число на кадр. По отдельности это ещё не VMAF. Весь смысл VMAF – в том, что происходит дальше.
Как обучалась модель: на человеческих оценках
Оценки судей сводит обученная модель – в open-source VMAF это регрессор на опорных векторах (Support Vector Machine, SVM), стандартная модель машинного обучения, которая учит гладкое отображение из набора входных чисел (оценок признаков) в одно выходное (предсказанное качество). Она «обучена» в прямом смысле: ей показали тысячи примеров, где оценки признаков известны, а истинное качество измерено, и она подобрала веса, лучше всего воспроизводящие истинное качество из признаков (Netflix Technology Blog, 2016).
Откуда взялось «истинное качество»? От людей. Netflix собрал набор клипов из собственного каталога, каждый по десять секунд, закодированных по сетке разрешений и уровней качества, чтобы получить широкий диапазон искажений. Зрители оценивали каждый в контролируемом лабораторном тесте по методу Absolute Category Rating – посмотреть клип, оценить по шкале от «плохо» до «отлично», – определённому в ITU-T P.910. Сырые мнения очистили от ненадёжных голосующих и шума до устойчивых оценок на клип, затем отобразили на шкалу VMAF, где примерно «плохо» попадает около 20, а «отлично» – на 100 (документация моделей Netflix VMAF, доступ 2026-06-23).
В этом вся основа авторитета VMAF и причина уважать его: метрика – это модель человеческого мнения, подогнанная под реальное человеческое мнение. Помните центральное правило раздела: каждая объективная метрика – это прокси, проверенный по субъективным оценкам, и глаз – это истина в последней инстанции (различие разобрано в субъективное и объективное качество). VMAF носит эту связь на рукаве: он буквально построен регрессией на субъективные оценки. Когда VMAF и аккуратный субъективный тест расходятся, побеждает тест, а модель ошиблась на этом контенте – как и для любой метрики.
Чтение оценки VMAF: шкала от 0 до 100
VMAF идёт от 0 до 100. Выше – лучше; 100 – потолок, достигаемый, когда энкод перцептивно неотличим от источника в условии просмотра модели. Шкала спроектирована примерно линейной к человеческому мнению, и это её большое преимущество удобства над SSIM: скачок с 60 до 70 значит примерно столько же воспринимаемого улучшения, сколько с 80 до 90, так что о разнице можно рассуждать арифметически.
Грубые, зависящие от контента диапазоны стоит запомнить. Ниже примерно 60 большинство зрителей находят качество плохим или раздражающим. Около 70 – удовлетворительно: смотрибельно, но видно сжатие. Около 80 – хорошо. Девяностые – туда целятся стриминговые сервисы для премиального контента: примерно от 93 и выше большинство зрителей перестаёт замечать сжатие при обычном просмотре. Считайте это ориентиром, а не законом – как выглядит конкретный VMAF, зависит от контента, экрана и зрителя, и только субъективный тест – это истина.
Самый полезный единичный факт для работы с VMAF – это едва заметная разница (just-noticeable difference, JND): около 6 пунктов VMAF. Рекомендация Netflix: разница примерно в 6 пунктов – это порог, на котором большинство зрителей (более половины) начинает замечать изменение качества. Дельта меньше примерно 2 пунктов – это шум, ею можно пренебречь; дельты выше 2 начинают значить; дельты в 6 и больше видны большинству людей (рекомендация Netflix по VMAF, 2017). Это число превращает VMAF из абстрактной оценки в инструмент принятия решений, как показывает разбор ниже.
Разобранный пример: превращаем зазор VMAF в решение о битрейте
Числа делают это конкретным. Допустим, вы выбираете между двумя энкодами одного мастера, измеренными с одной моделью (default 1080p) и одним пулингом (среднее), честно «яблоки к яблокам», на одних кадрах:
- Энкод A: 4,5 Мбит/с, VMAF 95,2
- Энкод B: 3,0 Мбит/с, VMAF 93,4
Проговорим два вопроса вслух. Первый – увидит ли зритель разницу в качестве? Вычтем оценки:
зазор VMAF = 95,2 − 93,4 = 1,8 пунктаЭти 1,8 ниже JND около 6 пунктов и даже ниже порога «незначимо» около 2 пунктов. Большинство зрителей не увидит разницы между A и B. Второй вопрос – во что обходится выбор B по качеству и что он экономит по полосе?
экономия битрейта = (4,5 − 3,0) / 4,5 = 1,5 / 4,5 = 0,333 = 33%Энкод B даёт 33% экономии битрейта за падение качества, которого большинство людей никогда не заметит. Умножьте это на миллионы потоков – и это разница между доступным сервисом и дорогим, ради чего Netflix и построил VMAF, и почему метрика, отслеживающая глаз, окупает себя (более широкий аргумент – в бизнес-обосновании измерения качества). Решение целиком держится на JND: без него 1,8 пункта выглядит реальной разницей; с ним видно, что экономия почти бесплатна.
Одна оговорка, нужная примеру. Предсказания VMAF несут неопределённость, и модели 0.6.2 и 0.6.3 умеют сообщать 95-процентный доверительный интервал, вычисленный бутстрэпом по остаткам модели на обучении (Netflix Technology Blog, «VMAF: The Journey Continues», октябрь 2018). Если оценку энкода B сообщают как 93,4 с 95-процентным интервалом, скажем, ±1,2 пункта – диапазон [92,2; 94,6], – то второй прогон на чуть других кадрах может попасть куда угодно внутри этой полосы. Зазор в 1,8 пункта между двумя энкодами с такими широкими интервалами – глубоко внутри шума. Сообщать VMAF без интервала, а затем считать разницу меньше пункта реальной – классическая ошибка. VMAF даёт вам погрешности; пользуйтесь ими. Практическая глубина по моделям, пулингу и доверительным интервалам – тема статьи VMAF в деталях.
Оценка VMAF бессмысленна без модели
Это и отделяет тех, кто пользуется VMAF хорошо, от тех, кто цитирует его плохо. «VMAF 95» – это не утверждение о качестве, пока вы не назвали модель. Модель default обучена под одно конкретное условие просмотра – 1080p HDTV в гостиной, на расстоянии в три высоты экрана. Поменяйте экран или дистанцию – и правильная модель меняется, потому что одно и то же искажение более или менее заметно в зависимости от того, насколько велика картинка и как близко вы сидите.
Netflix поставляет несколько моделей именно поэтому (документация моделей Netflix VMAF, доступ 2026-06-23):
- Модель default (vmaf_v0.6.1) предсказывает качество на 1080p-телевизоре на трёх высотах экрана. Это верный выбор по умолчанию для большинства гостиного стриминга.
- Модель phone, включаемая опцией просмотра на телефоне, предсказывает качество на маленьком экране смартфона. Поскольку телефон мал и держится на удобной дистанции, то же сжатие менее заметно, поэтому модель phone выдаёт более высокие оценки, чем default, на том же энкоде. Энкод, набирающий 88 на default-модели, может набрать под высокие 90-е на phone-модели – и обе верны для своих условий просмотра.
- Модель 4K (vmaf_4k_v0.6.1, добавлена в 2018) предсказывает качество на 4K-телевизоре на расстоянии в 1,5 высоты экрана – дистанция, на которой зритель действительно различает резкость 4K.
Правило строгое: сравнение VMAF корректно, только когда каждое число использует одну модель, посчитано одним инструментом и версией, на одних кадрах и в одном разрешении. Сравнивать оценку phone-модели с оценкой default-модели – это сравнивать два разных вопроса. Сообщая VMAF, называйте модель – «VMAF 93,4, модель default v0.6.1, пулинг – среднее», – а не просто «VMAF 93,4».
VMAF v1: поколение 2026 года
В июне 2026 Netflix выпустил новое поколение моделей – VMAF v1, первое существенное изменение набора признаков с запуска метрики. Это важно всем, кто сегодня читает или цитирует VMAF, потому что v1 чинит несколько известных слепых зон v0 – и потому что два поколения не взаимозаменяемы (Netflix Technology Blog, «VMAF v1: Good Is Not Good Enough», июнь 2026; документация моделей Netflix VMAF v1).
Заметны четыре изменения. Первое: v1 добавляет детектор бандинга. Чистый v0 был во многом слеп к бандингу – ступеням, проступающим там, где должно быть гладкое небо или градиент, – поэтому энкод мог заметно бандить, а VMAF оставался высоким. V1 включает CAMBI, детектор бандинга от Netflix, как признак, так что оценка теперь реагирует на бандинг (сам бандинг разобран в бандинг: когда гладкие градиенты ломаются в ступени). Второе: v1 видит цвет. V0 использовал только luma-признаки (яркость) и не знал о хроматических артефактах вроде растекания цвета; v1 добавляет хроматические признаки, так что повреждение цвета теперь влияет на оценку. Третье: v1 чище работает с дистанцией просмотра: вместо того чтобы прикручивать отдельные модели phone и 4K постфактум, v1 подстраивает вычисление признаков под нормализованную дистанцию просмотра напрямую, затем обучает одну согласованную модель, переприменяемую для phone (5H), 4K на 1,5H и потребительского 4K-на-3H – последнее с расширенным диапазоном [0, 110], чтобы количественно выразить дополнительную пользу 4K над 1080p на той же дистанции. Четвёртое, и неожиданное: v1 убирает VIF. Признак информационной точности, на котором держался v0, был вычислительно дорогим и, после улучшения остальных признаков, перестал заметно добавлять точность – поэтому его удаление сделало VMAF и точнее, и быстрее.
Две практические заметки. V1 лучше считать с точностью 10 бит даже для 8-битного SDR-контента, потому что дополнительная точность помогает ему видеть бандинг; 8-битный энкод можно измерить на 10 битах, предобработав оба входа. И v1 поставляет отдельные варианты для высокой частоты кадров (~50/60 fps), используя более широкое пятикадровое окно движения, чтобы устранить занижение, которое v0 показывал на быстром контенте. Главное для практикующего инженера: запускаете новую программу измерения в 2026 – оцените v1; есть история чисел v0 – не смешивайте два поколения в одном сравнении, перебазируйтесь.
Режим NEG: когда метрику можно обмануть
У VMAF есть свойство, которое в доставке – фича, а в сравнении кодеков – ловушка: он вознаграждает улучшение картинки. Поскольку он обучен предсказывать, что выглядит хорошо, повышение резкости или контраста перед кодированием может поднять оценку VMAF, хотя в самом сжатии ничего не улучшилось – кодировщик просто научился угождать метрике (Netflix Technology Blog, «Toward a Better Quality Metric for the Video Community», декабрь 2020).
Это нормально, когда вы и правда улучшили картинку для зрителя, но это портит тест «кодировщик против кодировщика», где вы хотите измерить только выигрыш сжатия. Решение Netflix – VMAF-NEG (No Enhancement Gain), режим, отключающий прибавку оценки от улучшайзеров, чтобы трюк с резкостью не мог раздуть результат. Default-модель используйте для предсказания доставленного качества; NEG – при сравнении кодировщиков, чтобы сравнение нельзя было сжульничать. Проблема «обмана метрики» и точное «когда сообщать NEG» – тема отдельной статьи VMAF-NEG простыми словами.
Как вычислить VMAF с помощью FFmpeg и libvmaf
Модель вы почти никогда не запускаете сами; повседневный путь – FFmpeg с фильтром libvmaf, который оборачивает библиотеку Netflix. Фильтр берёт два входа – сначала искажённый клип, затем опорный – и пишет лог с покадровым и сведённым VMAF. Текущий вызов (FFmpeg 7.x, libvmaf 3.x) выглядит так:
# VMAF искажённого энкода против опорного мастера.
# Искажённый — ПЕРВЫЙ вход, опорный — ВТОРОЙ.
# Пишет JSON-лог с покадровым и сведённым VMAF.
ffmpeg -i distorted.mp4 -i reference.mp4 \
-lavfi "libvmaf=log_path=vmaf.json:log_fmt=json:n_threads=4" \
-f null -Два правила, скрытых командой. Первое: два входа должны совпадать по разрешению и частоте кадров; если искажённый клип кодировался в меньшем разрешении, сначала отмасштабируйте его до разрешения опорного, иначе числа бессмысленны. Второе: если не назвать модель, вы получите default (vmaf_v0.6.1) – поэтому, чтобы взять модели phone, 4K или v1, явно укажите фильтру модель:
# Явная модель (здесь модель v1) и заодно вывод PSNR.
ffmpeg -i distorted.mp4 -i reference.mp4 \
-lavfi "[0:v]scale=1920:1080:flags=bicubic[dis];[dis][1:v]libvmaf=\
model='path=/usr/share/model/vmaf_v1.0.16/vmaf_v1.0.16_3d0h.json':\
feature='name=psnr':log_path=vmaf.json:log_fmt=json" \
-f null -В выходном JSON есть значение VMAF на кадр плюс сведённая оценка; пулинг по умолчанию – среднее, но его можно задать как гармоническое среднее или низкий перцентиль, чтобы вытащить худшие моменты, – выбор, который значит не меньше модели, разобран в пулинг: от покадровых оценок к одному числу. Полный рабочий процесс FFmpeg-и-libvmaf, с выбором модели и разбором вывода, – в статье измерение качества с FFmpeg и libvmaf; краткий справочник на стороне кодирования – в FFmpeg-шпаргалке раздела Video Encoding.
Чтобы оценка стала конкретной у вас за столом, мы собрали небольшой скрипт без тяжёлых зависимостей: он гоняет VMAF на паре файлов, затем парсит JSON и печатает сведённую оценку тремя способами – среднее, гармоническое среднее и 5-й перцентиль (худшие моменты), – рядом с покадровым минимумом и подразумеваемой полосой едва заметной разницы, чтобы было видно, сколько прячет одно заглавное число. Скачайте скрипт измерения и пулинга VMAF (Python) и запустите на собственных энкодах.
Где VMAF всё ещё врёт
VMAF – лучшая широко применяемая full-reference-метрика, но не оракул. Назвать её слепые зоны – это цена грамотного использования и честная суть раздела.
Во-первых, голое число VMAF неоднозначно – без названной модели, пулинга и контента его нельзя ни истолковать, ни сравнить, как показал раздел о моделях. Это не столько изъян VMAF, сколько самый частый изъян в том, как его цитируют.
Во-вторых, его можно обмануть улучшайзерами, ради чего и существует NEG. Кодировщик, настроенный максимизировать VMAF, может научиться угождать метрике способами, которые не угождают зрителю, – общая опасность оптимизации под любую метрику вместо глаза.
В-третьих, он обучен, поэтому слабее всего вне обучающего распределения. VMAF учился на определённом контенте – профессионально снятых видеоклипах. На контенте, непохожем на обучающий, – записи экрана и текст, захват видеоигр, сильное плёночное зерно, анимация, экстремальный HDR – его предсказания менее надёжны, и он может ранжировать энкоды в порядке, которого зритель бы не выбрал. Поколение v0 вдобавок было слепо к бандингу и цвету; v1 сужает, но не стирает эти пробелы. Какой контент какую метрику обманывает, каталогизировано в где врут объективные метрики.
В-четвёртых, пулинг по среднему прячет худшие секунды. Клип с одним сильно сломанным куском и кучей чистого материала всё равно может набрать высокий средний VMAF, потому что хорошие кадры перевешивают плохие. Когда важен локальный провал, читайте низкий перцентиль или покадровый минимум, а не только среднее.
В-пятых, это full-reference, поэтому он бесполезен для прямых трансляций и пользовательского контента, где нет чистого мастера для сравнения, – этот тяжёлый случай требует no-reference-метрик, разобранных в no-reference-качество для live и UGC.
Как VMAF сравнивается с PSNR и SSIM
VMAF – самая перцептивно точная из трёх full-reference-метрик, которые вы встречаете постоянно, и самая требовательная к корректному цитированию. Быстрее всего держать все три в голове рядом, с колонками, которые действительно важны, – что каждая измеряет и где каждая врёт.
| Метрика | Шкала | Что измеряет | Где врёт (слепая зона) | Лучше всего для |
|---|---|---|---|---|
| PSNR | дБ (≈20–50, ∞ при идентичности) | Средняя пиксельная ошибка против оригинала | Игнорирует, где ошибки; слабое совпадение с восприятием | Сравнение в одном кодеке, RDO, ворота регрессий |
| SSIM | 0–1 (выше лучше) | Структурное сходство: яркость, контраст, структура | Только luma, покадрово, насыщается у 1; зависит от реализации | Лучший-чем-PSNR структурный прокси; карты качества |
| VMAF | 0–100 (выше лучше) | Сведённое, обученное на восприятии качество (зависит от модели) | Бессмысленно без названной модели; обманываемо; пределы обучающего распределения | Предсказание воспринимаемого качества стриминга в масштабе |
Таблица 1. Три full-reference-метрики с одного взгляда. Всем нужен оригинал; различаются тем, насколько близко подбираются к глазу и что упускают. Выбирайте строку по задаче и всегда называйте условия – инструмент и версию для SSIM, модель и пулинг для VMAF.
Это глубокое погружение по нижней строке. Версия всех трёх «на один экран» для оператора кодировщика – в статье о метриках качества раздела Video Encoding; когда вы выбираете между метриками под конкретную задачу, путеводитель – как выбрать правильную метрику, а как каждую оценивают против глаза – валидация метрик по человеческим оценкам.
Частые ошибки с VMAF
«Ошибка: цитировать «VMAF 95» без названной модели. Модели default, phone и 4K дают разные оценки одному энкоду, потому что предсказывают разные условия просмотра. Число VMAF без модели, пулинга и контента нельзя истолковать. Всегда сообщайте «VMAF 95, default v0.6.1, пулинг – среднее».»
«Ошибка: считать зазор меньше JND реальной разницей. Около 6 пунктов VMAF – это едва заметная разница; меньше ~2 пунктов – шум. «Победа» в 1 пункт между двумя энкодами почти наверняка невидима – и может быть внутри доверительного интервала модели. Сравнивайте зазоры с JND, а не с нулём.»
«Ошибка: сравнивать кодировщики на default-модели. Повышение резкости может раздуть default-VMAF, не улучшив сжатие. Для тестов «кодировщик против кодировщика» берите VMAF-NEG, отключающий прибавку от улучшайзеров, чтобы сравнение мерило только сжатие.»
«Ошибка: смешивать версии VMAF или способы пулинга. Число v0 и число v1 несравнимы; равно как оценка по среднему и по гармоническому среднему. «Яблоки к яблокам» – это одна модель, одна версия, один пулинг, одни кадры, одно разрешение.»
Где здесь Фора Софт
Фора Софт строит видеософт с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицина и видеонаблюдение, – и VMAF – это метрика, к которой мы тянемся, когда вопрос звучит «насколько хорошо это будет выглядеть для зрителя», потому что это ближайший широко применяемый прокси глаза. Мы используем его, чтобы задавать целевые показатели качества для лестниц битрейтов, закрывать воротами изменения кодировщика до того, как они дойдут до пользователей, и ставить защитимое число на доставленное качество – всегда с указанной моделью, пулингом и контентом, и всегда читая его против JND около 6 пунктов, а не гоняясь за последним знаком после запятой. Для сравнения кодировщиков мы переходим на VMAF-NEG, чтобы результат нельзя было сжульничать, и на низкий перцентиль, когда худшие секунды важнее среднего. Наша методология бенчмарков фиксирует точную модель и пулинг за каждой публикуемой цифрой VMAF, потому что число качества, которое нельзя воспроизвести, – это маркетинг, а не измерение.
Ключевые выводы
- VMAF сводит несколько признаков качества моделью, обученной на человеческих оценках, в одно число 0–100.
- Он отслеживает глаз лучше PSNR и SSIM, потому что подогнан прямо под субъективное мнение.
- Оценка VMAF бессмысленна без названной модели – default, phone и 4K различаются.
- Около 6 пунктов VMAF – это едва заметная разница; меньшие зазоры обычно невидимы.
- Модели v1 2026 года добавляют чувствительность к бандингу и цвету, убирают VIF и быстрее.
- VMAF – full-reference, обманываем улучшайзерами (берите NEG) и слабее всего вне обучающего контента.