Содержание статьи +
- Коротко
- Зачем это нужно
- Инструмент – не метрика, а пакет – не инструмент
- Первый вопрос: есть ли у вас оригинал?
- Четыре семейства инструментов измерения качества
- Ещё две оси: open-source против коммерческих, командная строка против GUI
- Что происходит сейчас: VMAF v1 меняет почву под инструментами
- Разбор примера: собрать на FFmpeg или купить пакет?
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Коротко
Инструменты, которыми измеряют качество видео, делятся на четыре семейства: полнореференсные движки метрик, что сравнивают кодированный файл с чистым оригиналом (FFmpeg с libvmaf, командная утилита vmaf, MSU VQMT, Apple AVQT); безреференсные инструменты, что оценивают видео без оригинала (NIQE, BRISQUE, FAST-VQA, DOVER и битстрим-модели); файловые QC-пакеты, что объединяют перцептивную оценку с проверками вещательного соответствия (Interra BATON, Telestream, SSIMPLUS); и продакшен-стеки аналитики, что измеряют доставленную сессию, а не картинку (Conviva, Mux, Bitmovin). Один вопрос сужает выбор быстрее всего – есть ли у вас оригинал для сравнения: он решает половину любого выбора инструмента. Большинство инженерных команд начинают с бесплатной связки FFmpeg и libvmaf и покупают коммерческий пакет лишь тогда, когда нужен безреференсный мониторинг в прямом эфире, вещательное соответствие, оператор-неинженер или контракт на поддержку. Эта статья – карта ландшафта; остальные статьи Блока 8 разбирают каждый инструмент подробно.
Зачем это нужно
Можно выбрать правильную метрику и всё равно выбрать неправильный инструмент для её расчёта – а неправильный инструмент стоит недель. Статья для инженера, стоящего в начале этого выбора: для стриминг- или энкодинг-лида, решающего, чем измерять качество; для QA-инженера, встраивающего проверку в пайплайн; для технического продакт-оунера, взвешивающего, написать скрипт самим или купить продукт. Каталог вариантов и правда сбивает с толку – open-source-фильтры командной строки, платные десктоп-приложения, облачные QC-сервисы и браузерные дашборды одинаково заявляют, что «измеряют качество видео», но отвечают на разные вопросы и работают в разных местах. Поняв карту, вы берёте нужный инструмент с первой попытки, а не с третьей. Не поняв – считаете полнореференсную метрику на прямом эфире, у которого нет оригинала, или платите за пакет ради того, что уже делает одна команда FFmpeg.
Инструмент – не метрика, а пакет – не инструмент
Начнём с трёх слов, которые путают и не должны путать. Метрика – это число: формула, что оценивает качество, например пиксельная мера ошибки PSNR или перцептивная мера VMAF. Инструмент – это программа, что считает это число и отдаёт его вам. Пакет (suite) – это упакованный продукт, что оборачивает один или несколько инструментов интерфейсом, базой данных, отчётностью и поддержкой. Метрика – это математика; инструмент – это двигатель; пакет – это машина, собранная вокруг двигателя.
Это важно, потому что одну и ту же метрику выдают совсем разные инструменты, и именно инструмент определяет почти всё в вашем рабочем дне – скорость, наличие графического интерфейса, масштабируемость до каталога и стоимость. VMAF, перцептивную метрику от Netflix, одинаково считают командная утилита vmaf, фильтр libvmaf в FFmpeg и платное приложение MSU VQMT. Число должно совпасть; опыт его получения – нет. Поэтому карта ниже сортирует инструменты по тому, что они делают и где работают, а не по тому, какую метрику печатают.
Первый вопрос: есть ли у вас оригинал?
Прежде всего ответьте на один вопрос – он убирает половину каталога. Полнореференсному (full-reference) инструменту нужен чистый оригинал – мастер-файл – чтобы сравнить с ним кодированную копию, как корректору нужна авторская рукопись, чтобы поймать каждую опечатку. Безреференсный (no-reference) инструмент оценивает видео само по себе, без оригинала на руках, как редактор судит, читается ли страница, ни разу не увидев первый черновик. (Есть промежуточная схема – сокращённо-референсная (reduced-reference): вместо целого файла передаются несколько компактных признаков оригинала; на практике она редка и разобрана в статье про полно-, сокращённо- и безреференсные метрики.)
Почему этот вопрос идёт первым: ваша ситуация часто делает выбор за вас. Если вы кодируете фильм из студийного мастера, оригинал у вас есть – значит, применимы полнореференсные инструменты, и они точнее. Если вы мониторите прямой эфир или оцениваете пользовательские загрузки, чистого мастера у плеера нет, и полнореференсный инструмент просто не сможет запуститься – нужен безреференсный (трудный случай разобран в безреференсном качестве для live и UGC). Попытка применить VMAF к прямому каналу – самая частая ошибка выбора инструмента, и она невозможна по определению, а не просто нежелательна.
Четыре семейства инструментов измерения качества
Когда на этот вопрос дан ответ, весь ландшафт раскладывается на четыре семейства. Первые два считают число качества картинки; третье оборачивает его в вещательный продукт; четвёртое измеряет другое – доставленный опыт, а не картинку.
Семейство 1 – полнореференсные движки метрик. Это рабочие лошадки, и большинство из них бесплатны. FFmpeg с библиотекой libvmaf – выбор по умолчанию: он считает PSNR, SSIM, MS-SSIM и VMAF одной командой, входит в стандартную сборку FFmpeg (версия 8.1 «Hoare», март 2026, с ключом --enable-libvmaf) и есть тот инструмент, наличие которого предполагает у вас вся остальная индустрия. Командная утилита vmaf от Netflix – референсная реализация VMAF, она же печатает PSNR, SSIM и MS-SSIM (libvmaf v3.1.0, апрель 2026). MSU VQMT – специализированное приложение, что считает около двух десятков метрик с ускорением на GPU и покадровой визуализацией. Apple AVQT – командная утилита для macOS, что возвращает одну перцептивную оценку по шкале от 1 до 5. Связке FFmpeg и libvmaf и VQMT с другими специализированными инструментами посвящены отдельные статьи.
Семейство 2 – безреференсные («слепые») инструменты. Когда оригинала нет, нужен инструмент, что судит видео в одиночку. Классические open-source-варианты выросли из статистики естественных сцен: NIQE и BRISQUE оценивают, насколько статистика изображения отклоняется от статистики чистых, естественных кадров. Современные обучаемые варианты сделаны под пользовательский контент: FAST-VQA для скорости сэмплирует небольшие фрагменты видео, а DOVER раздельно оценивает эстетическое и техническое качество. Параллельный подход вообще обходит пиксели – битстрим-модели серии ITU-T P.1204 читают метаданные кодированного потока и оценивают качество без оригинала. Им посвящены open-source-инструменты безреференсной оценки.
Семейство 3 – файловые QC-пакеты (в основном коммерческие). Вещанию и стриминговой доставке нужна не только оценка качества: нужно подтвердить, что файл соответствует спецификации – нужный кодек, нужная громкость, нет чёрных кадров, валидные субтитры, – и нужно, чтобы им управлял неинженер. Продукты вроде Interra Systems BATON, Telestream (Qualify и Vidchecker), Venera Pulsar и SSIMPLUS (от SSIMWAVE, теперь часть IMAX) объединяют перцептивную оценку с сотнями проверок соответствия, графический интерфейс, дашборды и контракт на поддержку. Компромисс разобран в коммерческих пакетах качества: когда покупать, а более широкий контекст пайплайна – в автоматизированном контроле качества.
Семейство 4 – продакшен-стеки QoE / аналитики. Они измеряют другое, и путать их с семействами выше – частая ошибка. Conviva, Mux Data, Bitmovin Analytics и подобные стеки инструментируют плеер, чтобы измерить доставленную сессию – время старта, ребуферинг, переключения битрейта, – а не качество картинки кодированного файла. Они отвечают на вопрос «хорошо ли было зрителю?», который зависит от сети не меньше, чем от энкода. Они относятся к стриминговой стороне и разобраны в метриках на стороне плеера; здесь они названы лишь для того, чтобы вы не приняли QoE-дашборд за инструмент измерения качества картинки.
Таблица ниже – та же карта в форме, которую удобно просмотреть при выборе. Обратите внимание на столбец «где врёт» – у каждого семейства есть слепое пятно, и назвать его – это разница между измерением и догадкой.
| Семейство | Что измеряет | Нужен оригинал | Интерфейс | Где врёт (слепое пятно) | Примеры |
|---|---|---|---|---|---|
| Полнореференсные движки | Качество картинки против мастера, покадрово | Да – оригинал | Командная строка (есть GUI) | Бесполезен без мастера; даже высокая оценка требует названной модели | FFmpeg+libvmaf, vmaf, MSU VQMT, AVQT |
| Безреференсные инструменты | Качество картинки из самого видео | Нет | Командная строка / библиотека | Менее точны; многие рушатся на контенте вне обучающей выборки | NIQE, BRISQUE, FAST-VQA, DOVER, P.1204 |
| Файловые QC-пакеты | Соответствие + перцептивное качество | Опционально | GUI / SaaS | Цена и привязка к вендору; перцептивная оценка – всё равно одна из метрик выше | BATON, Telestream, Pulsar, SSIMPLUS |
| Продакшен-стеки QoE | Доставленную сессию (старт, ребуферинг, переключения) | Нет – измеряет воспроизведение | Дашборд / SDK | Ничего не говорит о качестве картинки энкода | Conviva, Mux, Bitmovin |
Таблица 1. Четыре семейства рядом. Первый столбец – вопрос, на который отвечает каждое семейство; столбец «где врёт» – слепое пятно, о котором стоит помнить. Продакшен-стек QoE и полнореференсный движок – не замена друг другу: они измеряют разное.
Ещё две оси: open-source против коммерческих, командная строка против GUI
Два других различия пересекают четыре семейства и определяют ежедневную работу. Первое – open-source против коммерческих. Open-source-инструменты (FFmpeg, libvmaf, утилита vmaf, исследовательский код безреференсных метрик) бесплатны, скриптуемы и проверяемы – на них и строит большинство инженерных команд. Коммерческие инструменты стоят денег и добавляют то, чего open source не даёт бесплатно: отполированный интерфейс, поддержку вендора, гарантии уровня сервиса и готовый масштаб. Вы платите не за лучшую математику – VMAF внутри платного пакета тот же самый VMAF. Вы платите за обёртку, поддержку и за время, которое не тратите на их разработку.
Вторая ось – командная строка против графики. Инструменты командной строки (FFmpeg, vmaf) сделаны, чтобы их скриптовали в пайплайн и запускали на сервере без присмотра – ровно то, что нужно для гейтов качества в CI/CD. Графические инструменты (MSU VQMT, бесплатная оболочка FFMetrics, коммерческие пакеты) сделаны, чтобы человек водил их интерактивно, смотрел покадровый график качества и находил тот самый кадр, где качество просело. Большинство серьёзных пайплайнов используют оба: командный инструмент – для автоматического гейта, графический – когда человеку нужно посмотреть, почему клип не прошёл. Превращение покадровых чисел в картинки – отдельная дисциплина, разобранная в визуализации качества.
Что происходит сейчас: VMAF v1 меняет почву под инструментами
Одно событие этого месяца важно для каждого инструмента Семейства 1. 20 июня 2026 года Netflix выложил в open source VMAF v1 – первую крупную ревизию своей перцептивной метрики со времён оригинала (теперь его зовут v0) (Netflix Technology Blog, 2026). Это больше, чем подкрутка. VMAF v1 добавляет чувствительность к блочности, наконец различает бандинг, встроив индекс бандинга CAMBI, оценивает хроматические артефакты, что v0 игнорировал, и заменяет старый костыль с phone-моделью одной моделью, что подстраивается под дистанцию просмотра – с отдельными вариантами для 1080p, телефона и двумя для 4K. Он же работает быстрее, отказавшись от дорогого признака VIF, а его оценки откалиброваны так, чтобы держаться рядом с v0 и сохранять смысл привычных чисел.
Для выбора инструмента урок конкретен: у инструмента теперь есть версия метрики, и её нужно называть. VMAF 93 от v0 и VMAF 93 от v1 не гарантированно есть одна и та же оценка одного и того же клипа, особенно на контенте с бандингом или хроматическими артефактами. Любой гейт качества, любой бенчмарк, любой регрессионный эталон, что вы храните, должен записывать, какая версия VMAF и какая модель его породили – ровно та дисциплина, что в VMAF в деталях. Обновление инструмента, что молча переведёт вас с v0 на v1, сдвинет ваши оценки, а эталон, что не записал версию, прочтёт этот сдвиг как регрессию качества, которой не было.
Разбор примера: собрать на FFmpeg или купить пакет?
Самое частое реальное решение в этом ландшафте – собрать или купить, и немного арифметики закрывает большинство случаев. Возьмём сначала путь «собрать». Пусть вы кодируете 200 клипов в день и хотите оценку VMAF на каждом, офлайн, против уже имеющегося у вас мастера. FFmpeg с libvmaf бесплатен; единственная цена – время расчёта. 10-минутный клип 1080p на 30 кадрах в секунду – это 18 000 кадров. Если ваша машина считает VMAF примерно на 150 кадрах в секунду – консервативная цифра для одной машины и модели 1080p, – клип займёт:
18 000 кадров ÷ 150 кадров/с = 120 секунд = 2 минуты на клип
200 клипов × 2 минуты = 400 минут ≈ 6,7 машино-часов в деньЭто спокойно умещается на одном сервере за ночь – по цене железа, которое у вас уже есть. (Цифра иллюстративна; пропускная способность гуляет от модели и машины, а путь VMAF-CUDA на GPU даёт ускорение до 4,4×, что сократило бы эти 6,7 часа примерно до 1,5 – Netflix/NVIDIA, 2024.) На таком масштабе сборка на FFmpeg явно выигрывает. Вы не станете платить за пакет ради того, что уже делают одна команда и задача в cron.
Теперь поменяем ситуацию, а не объём. Пусть вы мониторите живую UGC-платформу: мастер-файла у плеера нет, тысячи одновременных потоков, контрактное требование по аптайму и команда эксплуатации, которая не из видеоинженеров. Ничего из этого не есть задача FFmpeg. Вам нужны безреференсная оценка (мастера не существует), мониторинг в реальном времени на масштабе, дашборды, понятные операторам, и вендор, что возьмёт трубку в три часа ночи. Именно это продаёт коммерческий пакет или управляемый QoE-стек. Переломный момент не в том, сколько ассетов, – а в том, есть ли у вас оригинал, идёт ли эфир вживую, кто водит инструмент и нужны ли соответствие и поддержка. Один объём редко оправдывает покупку; отсутствие оригинала, требование прямого эфира или оператор-неинженер – обычно да.
«Частая ошибка: сравнивать оценки двух разных инструментов как одну шкалу. VMAF из libvmaf в FFmpeg, VMAF из MSU VQMT и «оценка качества» из коммерческого пакета – все выглядят числами на экране, но сравнимы лишь тогда, когда метрика, модель, версия и настройки совпадают точно. Два инструмента могут разойтись, потому что один апскейлил искажённое видео до разрешения источника, а другой нет; или один считал VMAF v0, а другой v1; или пакет выдаёт собственную проприетарную оценку, которая вообще не VMAF. Для любого сравнения, на котором вы будете действовать, выберите один инструмент и одну конфигурацию, записывайте версию и никогда не читайте голое «качество: 93», не зная, какой движок и какая модель его выдали.»
Где здесь Фора Софт
Фора Софт делает видеософт с 2005 года – стриминг и OTT, видеоконференции, e-learning, телемедицину и видеонаблюдение, – и по этим продуктам мы прошли почти весь этот ландшафт. Для офлайн-проверки энкодов мы первым делом берём FFmpeg и libvmaf, потому что это бесплатно, скриптуемо и есть тот же движок, что цитируют все; добавляем специализированный инструмент вроде MSU VQMT, когда инженеру нужно увидеть покадровый график и найти кадр, что не прошёл. Для живых и пользовательских систем, где мастера у плеера нет, мы переходим к безреференсной оценке и метрикам сессии на стороне плеера. Инструмент, что мы советуем клиенту, – самый дешёвый из тех, что отвечает на его реальный вопрос: обычно это open-source-инструмент командной строки, встроенный в пайплайн, и изредка коммерческий пакет, когда живой мониторинг, соответствие или оператор-неинженер делают обёртку достойной оплаты. Наша методология бенчмарков работает ровно на этом open-source-стеке.
Ключевые выводы
- Четыре семейства инструментов: полнореференсные движки, безреференсные инструменты, файловые QC-пакеты и продакшен-стеки QoE.
- Сначала спросите, есть ли у вас мастер-файл, – это убирает половину вариантов.
- Метрика – это математика, инструмент – двигатель, пакет – продукт вокруг него.
- Open-source даёт ту же метрику бесплатно; коммерческий пакет продаёт обёртку, масштаб и поддержку.
- VMAF v1 (июнь 2026) сдвигает оценки – всегда записывайте версию метрики и модель.
- По умолчанию собирайте на FFmpeg; покупайте, когда нужен живой безреференсный мониторинг, соответствие или поддержка.