Содержание статьи +
- Кратко
- Почему это важно
- Три вещи, которые VMAF не умеет
- ITU-T P.1204: качество из битстрима без оригинала
- Apple AVQT: оценка просмотра, а не только картинки
- Следующее поколение: обучаемые метрики под обучаемые кодеки
- Сравнение бок о бок, со слепой зоной каждой метрики
- Нужны ли они вам уже сейчас?
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
VMAF – перцептивная оценка качества видео по умолчанию, но не единственная, и три вещи, которые он не умеет, породили целое поколение метрик, созданных именно для них: семейство ITU-T P.1204 считывает качество прямо из сжатого битстрима без оригинала для сравнения, AVQT от Apple оценивает качество так, как его показал бы конкретный экран на конкретной дистанции, а волна обучаемых метрик готовится под нейрокодеки, на которых VMAF никогда не настраивали. Битстрим-модель стандарта ITU-T P.1204.3 в своей валидации предсказала мнение людей точнее, чем full-reference VMAF (корреляция Пирсона 0,942 против 0,873), не требуя ни исходного файла, ни декодирования в пиксели. AVQT – учитывающий условия просмотра, нативный для HDR и быстрый на GPU инструмент по шкале 1–5, с оговоркой, что он работает только на macOS и поставляется закрытым. Ни одна из этих метрик не отправляет VMAF на пенсию сегодня; статья объясняет, что измеряет каждая, какую именно задачу решает там, где VMAF не справляется, и нужна ли она вам уже сейчас.
Почему это важно
Если вы знаете только VMAF, вы потянетесь к нему в ситуациях, под которые он не создан: оценить live-поток, где нет эталонного оригинала, судить, как клип выглядит на телефоне на расстоянии вытянутой руки, или ранжировать нейрокодек, чьих артефактов VMAF никогда не видел. Каждое из этого – отдельный вопрос, и под каждый теперь есть своя метрика. Статья – для видеоинженера, лида по кодированию или QA-инженера, кто стандартизировался на VMAF и хочет знать, что ещё существует, когда альтернатива действительно лучше, а когда новинка – пока исследовательская игрушка. Она предполагает, что вы прочли VMAF простыми словами и дисциплину модели и пулинга из VMAF в деталях; короткая версия метрик на стороне кодировщика – в обзоре метрик качества раздела Video Encoding.
Три вещи, которые VMAF не умеет
Начнём с того, что такое VMAF, чтобы пробелы стали очевидны. VMAF – Video Multimethod Assessment Fusion, перцептивная оценка Netflix по шкале 0–100, обученная машинным обучением, – это full-reference метрика: ей нужны исходный кадр и сжатый кадр рядом, и она сравнивает их область за областью. Этот замысел ровно подходит для сравнения кодеков на вашем контенте, и поэтому VMAF стал отраслевым стандартом. Но тот же замысел закрывает три двери.
Во-первых, VMAF нужен оригинал. Метрика, сравнивающая сжатый кадр с исходником, – это и есть смысл «full-reference», – бесполезна, как только исходника нет: live-трансляция, которую вы мониторите ниже по цепочке, пользовательский клип, пришедший уже сжатым, или любая точка измерения внутри сети доставки контента, куда мастер не путешествует. Метрики, работающие без оригинала, называются no-reference (или «слепыми»); таксономия разобрана в full-reference, reduced-reference, no-reference.
Во-вторых, VMAF оценивает картинку, а не просмотр. Один и тот же энкод по-настоящему выглядит иначе на 65-дюймовом телевизоре в метре от вас и на телефоне на вытянутой руке, потому что дистанция и размер экрана прячут или обнажают артефакты. Модели phone и 4K у VMAF подталкивают к этому, но это модели контента, а не настоящая модель вашего экрана и вашей дистанции просмотра.
В-третьих, VMAF обучался на кодеках своей эпохи. Его модель выучила связь между признаками и мнением человека на блочных, DSP-кодеках 2010-х (H.264, HEVC, VP9, AV1). Нейрокодеки, восстанавливающие кадры глубокими сетями, дают иначе выглядящие ошибки – придуманную деталь, смазанное движение, – и под них у VMAF обучения нет. Это и есть фронтир, за которым гонятся обучаемые преемники.
ITU-T P.1204: качество из битстрима без оригинала
Первое семейство, закрывающее реальный пробел VMAF, – ITU-T P.1204, набор стандартизированных моделей качества видео, опубликованный Международным союзом электросвязи в январе 2020 года для стриминга по надёжному транспорту на разрешениях до 4K/UHD-1 (ITU-T P.1204, 2020). Это не одна модель, а три, различающиеся тем, на что им разрешено смотреть.
Главный участник – P.1204.3, битстрим-модель. Вместо того чтобы декодировать видео и сравнивать пиксели, она разбирает сам сжатый битстрим – читая параметры квантования, векторы движения, размеры кадров и статистику коэффициентов преобразования, которые записал кодировщик, – и подаёт эти признаки в обученную модель, предсказывающую Mean Opinion Score, среднюю оценку панели людей, по шкале 1–5 (ITU-T P.1204.3, 2020; Rao et al., IEEE QoMEX 2020). Поскольку ей никогда не нужен исходный оригинал и она никогда не декодирует в пиксели, это no-reference метрика в строгом смысле, и она достаточно лёгкая, чтобы работать всюду, куда идёт битстрим: на origin, на узле CDN, внутри сетевого зонда или на устройстве клиента.
Две другие меняют эту свободу на больше входных данных. P.1204.4 – пиксельная модель, которая использует референс (reduced-reference замысел, ведущий себя близко к full-reference), для случаев, когда у вас есть декодированные пиксели и нужна пиксельная точность. P.1204.5 – гибридная no-reference модель, сочетающая данные битстрима с принятыми декодированными пикселями, но всё ещё без оригинала, – лучшая в своей категории в оценке стандарта (ITU-T P.1204, 2020; TU Ilmenau / Telecommunication-Telemedia-Assessment). Все три обучали и валидировали в конкурсе P.NATS Phase 2, проведённом совместно ITU-T Study Group 12 и Video Quality Experts Group (VQEG), на оценках более 600 субъектов по примерно 5 000 последовательностям.
Число, на которое стоит взглянуть дважды
Вот результат, который даёт P.1204.3 место в этой статье. Разработчики модели из TU Ilmenau прогнали её по открытой базе AVT-VQDB-UHD-1 – 756 последовательностей и 19 620 человеческих оценок, намеренно исключённых из собственного обучения стандарта, – и сравнили с PSNR, SSIM, MS-SSIM и VMAF на тех же клипах (технический отчёт TU Ilmenau; по материалам Ozer, Streaming Learning Center, 2020).
Согласие с мнением человека измеряют коэффициентом корреляции Пирсона – числом от −1 до 1, где 1 означает, что метрика идеально отслеживает оценки людей; статистика разобрана в валидации метрик по оценкам людей. P.1204.3 набрала 0,942. VMAF набрал 0,873. Зазор читается прямо:
P.1204.3 PCC 0.942
VMAF PCC 0.873
разница 0.069 → битстрим-модель ближе к глазуВдумайтесь, что это значит. Модель, которая никогда не видела исходный файл и не декодировала ни одного пикселя, предсказала мнение человека точнее, чем full-reference VMAF, у которого был исходник для сравнения. Причина в том, что битстрим несёт собственное признание кодировщика – какое квантование он применил, где сдался на движении, – и модель, обученная на этом признании, может быть на удивление честной. Оговорка, и она реальна: P.1204.3 определена только для битстримов H.264/AVC, HEVC и VP9; парсера для AV1 у неё нет, и она не может оценить контент, который не может разобрать.
Где P.1204 действительно к месту: QoE стриминга
P.1204 спроектирована не в вакууме. Она встраивается в ITU-T P.1203, первую стандартизированную модель Quality of Experience стриминга – качества всей сессии просмотра, а не одного клипа (ITU-T P.1203; TU Ilmenau). P.1203 сводит краткосрочный модуль видео, модуль аудио и модуль интеграции, который учитывает то, что портит сессию, но не трогает точность ни одного кадра: начальную задержку загрузки, сталлы перебуферизации и переключения качества. Метрики картинки из связи объективных метрик с QoE и сторона доставки из объяснения адаптивного битрейта раздела Video Streaming – две половины, которые соединяет этот фреймворк. В этом и более глубокая мысль: VMAF отвечает на «насколько хорош этот кадр»; стек P.1203/P.1204 отвечает на «насколько хороша была сессия», а это и есть вопрос, который реально стоит перед оператором стриминга.
Apple AVQT: оценка просмотра, а не только картинки
Вторая альтернатива – от Apple. Advanced Video Quality Tool (AVQT), представленный на WWDC 2021, – это инструмент командной строки для macOS, оценивающий перцептивное качество сжатого видео по шкале 1–5, зеркалящей Mean Opinion Score, где 1 – плохо, 5 – отлично (Apple, WWDC21). Как VMAF и PSNR, он full-reference: берёт исходник и сжатый файл и сообщает как покадровые, так и посегментные оценки (сегмент по умолчанию шесть секунд).
Две вещи делают AVQT достойным знакомства. Первая – учёт условий просмотра. AVQT берёт размер дисплея, разрешение дисплея и дистанцию просмотра как явные входные данные и корректирует предсказанное качество под то, как воспринял бы артефакты реальный зритель в этой обстановке, – потому что один и тот же артефакт, бьющий в глаза на мониторе на расстоянии руки, незаметен на том же контенте из другого конца комнаты. Собственный пример Apple: зафиксируйте контент и дисплей и отодвиньте зрителя с 1,5 высоты экрана на 3 высоты – оценка AVQT вырастет, потому что дальний зритель попросту не видит артефактов, видимых ближнему (Apple, WWDC21). У VMAF такой ручки нет.
Вторая – скорость и охват форматов. AVQT построен на AVFoundation от Apple, поэтому принимает сжатые файлы напрямую без отдельного шага декодирования в raw, и сгружает тяжёлую пиксельную математику на GPU через Metal. Apple называет примерно 175 кадров в секунду на контенте 1080p. Арифметику стоит проделать один раз:
10-минутный клип 1080p при 24 fps
= 10 мин × 60 с × 24 fps
= 14 400 кадров
14 400 кадров ÷ 175 fps ≈ 82 с ≈ 1,4 минуты на оценкуAVQT также нативно работает с форматами высокого динамического диапазона – HDR10, HLG и Dolby Vision, – которые full-reference конвейеры часто обрабатывают неверно, и хорошо держится на разных типах контента (анимация, натура, спорт), где Apple показала провал PSNR: два клипа с одинаковым PSNR около 35 получили оценки AVQT 4,4 и 2,5, и нижняя досталась клипу с видимыми артефактами на лице (Apple, WWDC21). Обновление 2022 года добавило оценку выбранных временных окон, интерактивный HTML-отчёт и распределение кадров по полосам Bad/Poor/Fair/Good/Excellent (Apple, WWDC22).
Честные ограничения важны не меньше сильных сторон. AVQT работает только на macOS, что делает его неудобным для масштабирования в Linux-конвейере CI/CD; команды прибегают к Mac-железу или облачным Mac-инстансам. Он закрытый, без опубликованных деталей модели, поэтому нельзя ни проверить, как получена оценка, ни подключить свою модель, как позволяет VMAF. И Apple сравнивала его с PSNR, а не с VMAF, так что прямое сравнение точности с действующим лидером остаётся за вами (Fraunhofer FOKUS, 2021). Для Apple-ориентированной команды, меряющей HDR на реальных экранах, AVQT – настоящий апгрейд; для кросс-платформенного автоматического конвейера – это трение.
Следующее поколение: обучаемые метрики под обучаемые кодеки
Новейший фронтир – не одна метрика, а проблема. По мере того как кодеки переходят от блочной математики к нейросетям, восстанавливающим кадры, артефакты меняют форму, и метрики, обученные на старых артефактах, начинают вводить в заблуждение. Свидетельство конкретно: в обзоре 2025 года нейрокодек Deep Render показал преимущество по битрейту 45% над SVT-AV1 в субъективном тесте, но лишь 3% по VMAF – метрика почти полностью пропустила выигрыш, который увидели люди (Ozer, Streaming Learning Center, 2025).
Формальные исследования подтверждают закономерность. На JPEG AI, обучаемом кодеке изображений, ранговая корреляция VMAF с человеческими оценками упала с 0,928 по всем кодекам до 0,899 на одном лишь ИИ-кодеке, и большинство метрик были «излишне оптимистичны» к качеству ИИ-сжатия (субъективное исследование, arXiv 2504.06301, 2025). Под обучаемые видеокодеки команда Microsoft построила MLCVQA, метрику, обученную прямо на контенте нейрокодеков; она достигла ранговой корреляции (Kendall Tau-b 95) 0,93 на уровне модели против 0,90 у переобученного VMAF – лучше, но требует восьми мощных GPU для обучения и пока без интеграции в FFmpeg или VQMT (Majeedi et al., arXiv 2309.00769; Ozer, 2025). Есть и поворот, связывающий с предыдущей статьёй раздела: VMAF-NEG, модель без выигрыша от улучшения из VMAF-NEG, на JPEG AI набрала лучше стандартного VMAF – совпадение, а не подтверждённая пригодность, и пока не повод доверять ей на нейроконтенте.
Сам Netflix сдвинул базовую планку в июне 2026 года выпуском VMAF v1, который исправил две давние слабости v0 – крен в сторону артефактов сжатия против даунскейла и слепоту к бандингу – и включил ограничение выигрыша от улучшения NEG по умолчанию (Netflix Technology Blog, 2026). Вероятная форма настоящего преемника – «vmaf_ai»: тот же интерпретируемый фреймворк на основе слияния, переобученный на выходах нейрокодеков с обучаемыми признаками. Пока что-то такое не появится в инструментах, которыми инженеры реально пользуются, практический ответ для нейрокодеков неизменен – триангулируйте несколько метрик, затем сверьтесь с реальным субъективным тестом, потому что для этого контента глаз всё ещё единственная истина.
Сравнение бок о бок, со слепой зоной каждой метрики
Сведём четыре семейства в одну таблицу. Важнее всего два последних столбца: что каждая метрика на самом деле измеряет и где она врёт.
| Метрика | Нужен референс | Шкала | Что измеряет | Где врёт / слепая зона |
|---|---|---|---|---|
| VMAF (v0/v1) | Full-reference | 0–100 | Слитая перцептивная точность к источнику | Нет оригинала – нет оценки; слаба на нейрокодеках; v0 не видит бандинг |
| P.1204.3 | Нет (битстрим) | 1–5 MOS | Качество по решениям кодировщика в битстриме | Только H.264/HEVC/VP9 – нет AV1; нужен доступ к битстриму |
| AVQT | Full-reference | 1–5 MOS | Перцептивное качество для конкретного экрана и дистанции | Только macOS, закрытая, без своих моделей |
| MLCVQA / обучаемые | Full-reference | обучена | Качество именно артефактов нейрокодеков | Исследовательская стадия; тяжёлый GPU; нет в FFmpeg/VQMT |
Читайте это как набор задач, а не рейтинг. Лучшей строки нет – есть лучшая метрика под вашу доступность референса, платформу, кодек и контент. Дерево решений ниже превращает таблицу в маршрут.
Нужны ли они вам уже сейчас?
Для большинства команд в 2026 году честный ответ такой: VMAF (и VMAF-NEG для сравнений) остаётся правильным выбором по умолчанию, а к остальным вы тянетесь, лишь упёршись в одну из трёх стен VMAF. Если у вас есть исходник и вы сравниваете блочные кодеки – оставайтесь на VMAF: он открыт, скриптуем, кросс-платформен и хорошо изучен. Добавьте вторую метрику – и вы следуете постоянному совету раздела о выборе правильной метрики.
Тянитесь за пределы VMAF, когда ситуация вынуждает. Если измерять нужно там, где оригинал недоступен, – мониторинг live или доставленных потоков в сети, – P.1204.3 или другая no-reference модель не роскошь, а единственный тип метрики, способный там работать; этот случай разобран в no-reference качестве для live и UGC. Если вы Apple-команда, оптимизирующая доставку HDR, и вам важно, как контент выглядит на конкретном устройстве, учёт условий просмотра и HDR в AVQT окупаются. А если вы оцениваете нейрокодек, ни одна нынешняя промышленная метрика не заслуживает доверия в одиночку – закладывайте бюджет на субъективный тест.
«Частая ошибка: сравнивать по шкалам разных метрик как по одной линейке. VMAF – это 0–100; P.1204.3 и AVQT – 1–5 Mean Opinion Score; PSNR – в децибелах. «4,2» у AVQT и «88» у VMAF несопоставимы, а перевод одного в другое масштабированием бессмыслен – их обучали на разных данных против разных панелей. Берите одну метрику на сравнение, называйте её версию и модель и никогда не смешивайте шкалы в одной таблице или графике.»
Где здесь Фора Софт
Фора Софт строит видеософт с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицина и видеонаблюдение, – и причина, по которой мы следим за метриками за пределами VMAF, в том, что наша работа регулярно попадает в его слепые зоны. Видеонаблюдение и живые конференции не дают эталонного оригинала для сравнения – это ровно та область, где место no-reference, битстрим-подобной модели; доставка OTT и телемедицины на конкретные устройства – там, где важна оценка с учётом условий просмотра; а когда клиент спрашивает про нейрокодек, мы прямо говорим, что одной метрики мало, и подключаем субъективный тест. Мы фиксируем метрику, версию, модель и допущения о просмотре за каждым числом в нашей методологии бенчмарков, чтобы результат был воспроизводимым, а не льстивым.
Ключевые выводы
- VMAF – выбор по умолчанию, но ему нужен оригинал, он игнорирует экран и старше нейрокодеков.
- ITU-T P.1204.3 оценивает из битстрима без референса – и в тесте обошёл VMAF по мнению людей.
- P.1204 встраивается в P.1203 – стандартную модель QoE всей сессии стриминга.
- AVQT от Apple учитывает условия просмотра и нативен для HDR, но только macOS и закрытый.
- Обучаемые метрики (MLCVQA, будущий «vmaf_ai») нацелены на нейрокодеки; пока исследовательская стадия.
- Метрику выбирают по доступности референса, платформе и кодеку – никогда не смешивайте шкалы.