За пределами VMAF: ITU-T P.1204, AVQT и метрики дальше

Автор: Николай СапуновОбновлено: август 202614 мин чтения
Содержание статьи +

Кратко

VMAF – перцептивная оценка качества видео по умолчанию, но не единственная, и три вещи, которые он не умеет, породили целое поколение метрик, созданных именно для них: семейство ITU-T P.1204 считывает качество прямо из сжатого битстрима без оригинала для сравнения, AVQT от Apple оценивает качество так, как его показал бы конкретный экран на конкретной дистанции, а волна обучаемых метрик готовится под нейрокодеки, на которых VMAF никогда не настраивали. Битстрим-модель стандарта ITU-T P.1204.3 в своей валидации предсказала мнение людей точнее, чем full-reference VMAF (корреляция Пирсона 0,942 против 0,873), не требуя ни исходного файла, ни декодирования в пиксели. AVQT – учитывающий условия просмотра, нативный для HDR и быстрый на GPU инструмент по шкале 1–5, с оговоркой, что он работает только на macOS и поставляется закрытым. Ни одна из этих метрик не отправляет VMAF на пенсию сегодня; статья объясняет, что измеряет каждая, какую именно задачу решает там, где VMAF не справляется, и нужна ли она вам уже сейчас.

Почему это важно

Если вы знаете только VMAF, вы потянетесь к нему в ситуациях, под которые он не создан: оценить live-поток, где нет эталонного оригинала, судить, как клип выглядит на телефоне на расстоянии вытянутой руки, или ранжировать нейрокодек, чьих артефактов VMAF никогда не видел. Каждое из этого – отдельный вопрос, и под каждый теперь есть своя метрика. Статья – для видеоинженера, лида по кодированию или QA-инженера, кто стандартизировался на VMAF и хочет знать, что ещё существует, когда альтернатива действительно лучше, а когда новинка – пока исследовательская игрушка. Она предполагает, что вы прочли VMAF простыми словами и дисциплину модели и пулинга из VMAF в деталях; короткая версия метрик на стороне кодировщика – в обзоре метрик качества раздела Video Encoding.

Три вещи, которые VMAF не умеет

Начнём с того, что такое VMAF, чтобы пробелы стали очевидны. VMAF – Video Multimethod Assessment Fusion, перцептивная оценка Netflix по шкале 0–100, обученная машинным обучением, – это full-reference метрика: ей нужны исходный кадр и сжатый кадр рядом, и она сравнивает их область за областью. Этот замысел ровно подходит для сравнения кодеков на вашем контенте, и поэтому VMAF стал отраслевым стандартом. Но тот же замысел закрывает три двери.

Во-первых, VMAF нужен оригинал. Метрика, сравнивающая сжатый кадр с исходником, – это и есть смысл «full-reference», – бесполезна, как только исходника нет: live-трансляция, которую вы мониторите ниже по цепочке, пользовательский клип, пришедший уже сжатым, или любая точка измерения внутри сети доставки контента, куда мастер не путешествует. Метрики, работающие без оригинала, называются no-reference (или «слепыми»); таксономия разобрана в full-reference, reduced-reference, no-reference.

Во-вторых, VMAF оценивает картинку, а не просмотр. Один и тот же энкод по-настоящему выглядит иначе на 65-дюймовом телевизоре в метре от вас и на телефоне на вытянутой руке, потому что дистанция и размер экрана прячут или обнажают артефакты. Модели phone и 4K у VMAF подталкивают к этому, но это модели контента, а не настоящая модель вашего экрана и вашей дистанции просмотра.

В-третьих, VMAF обучался на кодеках своей эпохи. Его модель выучила связь между признаками и мнением человека на блочных, DSP-кодеках 2010-х (H.264, HEVC, VP9, AV1). Нейрокодеки, восстанавливающие кадры глубокими сетями, дают иначе выглядящие ошибки – придуманную деталь, смазанное движение, – и под них у VMAF обучения нет. Это и есть фронтир, за которым гонятся обучаемые преемники.

Рисунок 1. Ландшафт измерения. VMAF и AVQT – full-reference метрики картинки; P.1204.3 и P.1204.5 считывают качество без оригинала; обучаемые метрики – формирующийся край.

ITU-T P.1204: качество из битстрима без оригинала

Первое семейство, закрывающее реальный пробел VMAF, – ITU-T P.1204, набор стандартизированных моделей качества видео, опубликованный Международным союзом электросвязи в январе 2020 года для стриминга по надёжному транспорту на разрешениях до 4K/UHD-1 (ITU-T P.1204, 2020). Это не одна модель, а три, различающиеся тем, на что им разрешено смотреть.

Главный участник – P.1204.3, битстрим-модель. Вместо того чтобы декодировать видео и сравнивать пиксели, она разбирает сам сжатый битстрим – читая параметры квантования, векторы движения, размеры кадров и статистику коэффициентов преобразования, которые записал кодировщик, – и подаёт эти признаки в обученную модель, предсказывающую Mean Opinion Score, среднюю оценку панели людей, по шкале 1–5 (ITU-T P.1204.3, 2020; Rao et al., IEEE QoMEX 2020). Поскольку ей никогда не нужен исходный оригинал и она никогда не декодирует в пиксели, это no-reference метрика в строгом смысле, и она достаточно лёгкая, чтобы работать всюду, куда идёт битстрим: на origin, на узле CDN, внутри сетевого зонда или на устройстве клиента.

Две другие меняют эту свободу на больше входных данных. P.1204.4 – пиксельная модель, которая использует референс (reduced-reference замысел, ведущий себя близко к full-reference), для случаев, когда у вас есть декодированные пиксели и нужна пиксельная точность. P.1204.5 – гибридная no-reference модель, сочетающая данные битстрима с принятыми декодированными пикселями, но всё ещё без оригинала, – лучшая в своей категории в оценке стандарта (ITU-T P.1204, 2020; TU Ilmenau / Telecommunication-Telemedia-Assessment). Все три обучали и валидировали в конкурсе P.NATS Phase 2, проведённом совместно ITU-T Study Group 12 и Video Quality Experts Group (VQEG), на оценках более 600 субъектов по примерно 5 000 последовательностям.

Рисунок 2. Семейство P.1204 по типу входа и как оно встраивается в модель Quality of Experience уровня сессии P.1203 рядом с модулями аудио и интеграции.

Число, на которое стоит взглянуть дважды

Вот результат, который даёт P.1204.3 место в этой статье. Разработчики модели из TU Ilmenau прогнали её по открытой базе AVT-VQDB-UHD-1 – 756 последовательностей и 19 620 человеческих оценок, намеренно исключённых из собственного обучения стандарта, – и сравнили с PSNR, SSIM, MS-SSIM и VMAF на тех же клипах (технический отчёт TU Ilmenau; по материалам Ozer, Streaming Learning Center, 2020).

Согласие с мнением человека измеряют коэффициентом корреляции Пирсона – числом от −1 до 1, где 1 означает, что метрика идеально отслеживает оценки людей; статистика разобрана в валидации метрик по оценкам людей. P.1204.3 набрала 0,942. VMAF набрал 0,873. Зазор читается прямо:

P.1204.3 PCC   0.942
VMAF PCC       0.873
разница        0.069  → битстрим-модель ближе к глазу

Вдумайтесь, что это значит. Модель, которая никогда не видела исходный файл и не декодировала ни одного пикселя, предсказала мнение человека точнее, чем full-reference VMAF, у которого был исходник для сравнения. Причина в том, что битстрим несёт собственное признание кодировщика – какое квантование он применил, где сдался на движении, – и модель, обученная на этом признании, может быть на удивление честной. Оговорка, и она реальна: P.1204.3 определена только для битстримов H.264/AVC, HEVC и VP9; парсера для AV1 у неё нет, и она не может оценить контент, который не может разобрать.

Где P.1204 действительно к месту: QoE стриминга

P.1204 спроектирована не в вакууме. Она встраивается в ITU-T P.1203, первую стандартизированную модель Quality of Experience стриминга – качества всей сессии просмотра, а не одного клипа (ITU-T P.1203; TU Ilmenau). P.1203 сводит краткосрочный модуль видео, модуль аудио и модуль интеграции, который учитывает то, что портит сессию, но не трогает точность ни одного кадра: начальную задержку загрузки, сталлы перебуферизации и переключения качества. Метрики картинки из связи объективных метрик с QoE и сторона доставки из объяснения адаптивного битрейта раздела Video Streaming – две половины, которые соединяет этот фреймворк. В этом и более глубокая мысль: VMAF отвечает на «насколько хорош этот кадр»; стек P.1203/P.1204 отвечает на «насколько хороша была сессия», а это и есть вопрос, который реально стоит перед оператором стриминга.

Apple AVQT: оценка просмотра, а не только картинки

Вторая альтернатива – от Apple. Advanced Video Quality Tool (AVQT), представленный на WWDC 2021, – это инструмент командной строки для macOS, оценивающий перцептивное качество сжатого видео по шкале 1–5, зеркалящей Mean Opinion Score, где 1 – плохо, 5 – отлично (Apple, WWDC21). Как VMAF и PSNR, он full-reference: берёт исходник и сжатый файл и сообщает как покадровые, так и посегментные оценки (сегмент по умолчанию шесть секунд).

Две вещи делают AVQT достойным знакомства. Первая – учёт условий просмотра. AVQT берёт размер дисплея, разрешение дисплея и дистанцию просмотра как явные входные данные и корректирует предсказанное качество под то, как воспринял бы артефакты реальный зритель в этой обстановке, – потому что один и тот же артефакт, бьющий в глаза на мониторе на расстоянии руки, незаметен на том же контенте из другого конца комнаты. Собственный пример Apple: зафиксируйте контент и дисплей и отодвиньте зрителя с 1,5 высоты экрана на 3 высоты – оценка AVQT вырастет, потому что дальний зритель попросту не видит артефактов, видимых ближнему (Apple, WWDC21). У VMAF такой ручки нет.

Вторая – скорость и охват форматов. AVQT построен на AVFoundation от Apple, поэтому принимает сжатые файлы напрямую без отдельного шага декодирования в raw, и сгружает тяжёлую пиксельную математику на GPU через Metal. Apple называет примерно 175 кадров в секунду на контенте 1080p. Арифметику стоит проделать один раз:

10-минутный клип 1080p при 24 fps
  = 10 мин × 60 с × 24 fps
  = 14 400 кадров
14 400 кадров ÷ 175 fps ≈ 82 с ≈ 1,4 минуты на оценку

AVQT также нативно работает с форматами высокого динамического диапазона – HDR10, HLG и Dolby Vision, – которые full-reference конвейеры часто обрабатывают неверно, и хорошо держится на разных типах контента (анимация, натура, спорт), где Apple показала провал PSNR: два клипа с одинаковым PSNR около 35 получили оценки AVQT 4,4 и 2,5, и нижняя досталась клипу с видимыми артефактами на лице (Apple, WWDC21). Обновление 2022 года добавило оценку выбранных временных окон, интерактивный HTML-отчёт и распределение кадров по полосам Bad/Poor/Fair/Good/Excellent (Apple, WWDC22).

Рисунок 3. Отличительный вход AVQT: условия просмотра. Тот же энкод набирает выше, когда зритель сидит дальше, потому что дистанция прячет артефакты.

Честные ограничения важны не меньше сильных сторон. AVQT работает только на macOS, что делает его неудобным для масштабирования в Linux-конвейере CI/CD; команды прибегают к Mac-железу или облачным Mac-инстансам. Он закрытый, без опубликованных деталей модели, поэтому нельзя ни проверить, как получена оценка, ни подключить свою модель, как позволяет VMAF. И Apple сравнивала его с PSNR, а не с VMAF, так что прямое сравнение точности с действующим лидером остаётся за вами (Fraunhofer FOKUS, 2021). Для Apple-ориентированной команды, меряющей HDR на реальных экранах, AVQT – настоящий апгрейд; для кросс-платформенного автоматического конвейера – это трение.

Следующее поколение: обучаемые метрики под обучаемые кодеки

Новейший фронтир – не одна метрика, а проблема. По мере того как кодеки переходят от блочной математики к нейросетям, восстанавливающим кадры, артефакты меняют форму, и метрики, обученные на старых артефактах, начинают вводить в заблуждение. Свидетельство конкретно: в обзоре 2025 года нейрокодек Deep Render показал преимущество по битрейту 45% над SVT-AV1 в субъективном тесте, но лишь 3% по VMAF – метрика почти полностью пропустила выигрыш, который увидели люди (Ozer, Streaming Learning Center, 2025).

Формальные исследования подтверждают закономерность. На JPEG AI, обучаемом кодеке изображений, ранговая корреляция VMAF с человеческими оценками упала с 0,928 по всем кодекам до 0,899 на одном лишь ИИ-кодеке, и большинство метрик были «излишне оптимистичны» к качеству ИИ-сжатия (субъективное исследование, arXiv 2504.06301, 2025). Под обучаемые видеокодеки команда Microsoft построила MLCVQA, метрику, обученную прямо на контенте нейрокодеков; она достигла ранговой корреляции (Kendall Tau-b 95) 0,93 на уровне модели против 0,90 у переобученного VMAF – лучше, но требует восьми мощных GPU для обучения и пока без интеграции в FFmpeg или VQMT (Majeedi et al., arXiv 2309.00769; Ozer, 2025). Есть и поворот, связывающий с предыдущей статьёй раздела: VMAF-NEG, модель без выигрыша от улучшения из VMAF-NEG, на JPEG AI набрала лучше стандартного VMAF – совпадение, а не подтверждённая пригодность, и пока не повод доверять ей на нейроконтенте.

Сам Netflix сдвинул базовую планку в июне 2026 года выпуском VMAF v1, который исправил две давние слабости v0 – крен в сторону артефактов сжатия против даунскейла и слепоту к бандингу – и включил ограничение выигрыша от улучшения NEG по умолчанию (Netflix Technology Blog, 2026). Вероятная форма настоящего преемника – «vmaf_ai»: тот же интерпретируемый фреймворк на основе слияния, переобученный на выходах нейрокодеков с обучаемыми признаками. Пока что-то такое не появится в инструментах, которыми инженеры реально пользуются, практический ответ для нейрокодеков неизменен – триангулируйте несколько метрик, затем сверьтесь с реальным субъективным тестом, потому что для этого контента глаз всё ещё единственная истина.

Сравнение бок о бок, со слепой зоной каждой метрики

Сведём четыре семейства в одну таблицу. Важнее всего два последних столбца: что каждая метрика на самом деле измеряет и где она врёт.

МетрикаНужен референсШкалаЧто измеряетГде врёт / слепая зона
VMAF (v0/v1)Full-reference0–100Слитая перцептивная точность к источникуНет оригинала – нет оценки; слаба на нейрокодеках; v0 не видит бандинг
P.1204.3Нет (битстрим)1–5 MOSКачество по решениям кодировщика в битстримеТолько H.264/HEVC/VP9 – нет AV1; нужен доступ к битстриму
AVQTFull-reference1–5 MOSПерцептивное качество для конкретного экрана и дистанцииТолько macOS, закрытая, без своих моделей
MLCVQA / обучаемыеFull-referenceобученаКачество именно артефактов нейрокодековИсследовательская стадия; тяжёлый GPU; нет в FFmpeg/VQMT

Читайте это как набор задач, а не рейтинг. Лучшей строки нет – есть лучшая метрика под вашу доступность референса, платформу, кодек и контент. Дерево решений ниже превращает таблицу в маршрут.

Рисунок 4. К какой метрике тянуться. Первый вопрос всегда – есть ли у вас оригинал; кодек и платформа решают остальное.

Нужны ли они вам уже сейчас?

Для большинства команд в 2026 году честный ответ такой: VMAF (и VMAF-NEG для сравнений) остаётся правильным выбором по умолчанию, а к остальным вы тянетесь, лишь упёршись в одну из трёх стен VMAF. Если у вас есть исходник и вы сравниваете блочные кодеки – оставайтесь на VMAF: он открыт, скриптуем, кросс-платформен и хорошо изучен. Добавьте вторую метрику – и вы следуете постоянному совету раздела о выборе правильной метрики.

Тянитесь за пределы VMAF, когда ситуация вынуждает. Если измерять нужно там, где оригинал недоступен, – мониторинг live или доставленных потоков в сети, – P.1204.3 или другая no-reference модель не роскошь, а единственный тип метрики, способный там работать; этот случай разобран в no-reference качестве для live и UGC. Если вы Apple-команда, оптимизирующая доставку HDR, и вам важно, как контент выглядит на конкретном устройстве, учёт условий просмотра и HDR в AVQT окупаются. А если вы оцениваете нейрокодек, ни одна нынешняя промышленная метрика не заслуживает доверия в одиночку – закладывайте бюджет на субъективный тест.

«Частая ошибка: сравнивать по шкалам разных метрик как по одной линейке. VMAF – это 0–100; P.1204.3 и AVQT – 1–5 Mean Opinion Score; PSNR – в децибелах. «4,2» у AVQT и «88» у VMAF несопоставимы, а перевод одного в другое масштабированием бессмыслен – их обучали на разных данных против разных панелей. Берите одну метрику на сравнение, называйте её версию и модель и никогда не смешивайте шкалы в одной таблице или графике.»

Где здесь Фора Софт

Фора Софт строит видеософт с 2005 года – стриминг, WebRTC-конференции, OTT, e-learning, телемедицина и видеонаблюдение, – и причина, по которой мы следим за метриками за пределами VMAF, в том, что наша работа регулярно попадает в его слепые зоны. Видеонаблюдение и живые конференции не дают эталонного оригинала для сравнения – это ровно та область, где место no-reference, битстрим-подобной модели; доставка OTT и телемедицины на конкретные устройства – там, где важна оценка с учётом условий просмотра; а когда клиент спрашивает про нейрокодек, мы прямо говорим, что одной метрики мало, и подключаем субъективный тест. Мы фиксируем метрику, версию, модель и допущения о просмотре за каждым числом в нашей методологии бенчмарков, чтобы результат был воспроизводимым, а не льстивым.

Ключевые выводы

  • VMAF – выбор по умолчанию, но ему нужен оригинал, он игнорирует экран и старше нейрокодеков.
  • ITU-T P.1204.3 оценивает из битстрима без референса – и в тесте обошёл VMAF по мнению людей.
  • P.1204 встраивается в P.1203 – стандартную модель QoE всей сессии стриминга.
  • AVQT от Apple учитывает условия просмотра и нативен для HDR, но только macOS и закрытый.
  • Обучаемые метрики (MLCVQA, будущий «vmaf_ai») нацелены на нейрокодеки; пока исследовательская стадия.
  • Метрику выбирают по доступности референса, платформе и кодеку – никогда не смешивайте шкалы.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.