Real-ESRGAN и BasicVSR++ для апскейлинга OTT-архива – инженерный плейбук 2026

Автор: Николай СапуновОбновлено: август 202634 мин чтения
Содержание статьи +

TL;DR

У вас лежит back-каталог на SD или с низким битрейтом – тысячи эпизодов ситкома 2003 года, архив broadcast-мастеров 90-х, кинобиблиотека, оцифрованная с VHS в 1998-м, – а ваша аудитория смотрит всё это на 4K OLED-телевизорах. В 2026 году в production OTT-пайплайнах активно используются два практичных open-weight апскейлера: Real-ESRGAN – для кадровой реставрации изображений и BasicVSR++ – для временно согласованного видео-суперразрешения. В коммерческом сегменте два стандартных решения: Topaz Video AI – для оффлайн-кинематографической реставрации и Pixop – для облачных API в масштабах архивов. Эта статья проведёт нетехнического читателя через суть этих моделей, объяснит, как математика работает на уровне продакт-менеджера, почему кадровый апскейлер изображений вызывает мерцание на видео, как выбрать подходящий инструмент и сколько закладывать бюджета на минуту восстановленного контента. В финале вы сможете спланировать реальный проект апскейлинга OTT-архива, грамотно общаться с инженерами и избежать трёх типичных failure-mode, которые срывают большинство первых попыток.

Зачем это нужно знать

Стриминговые сервисы живут и умирают качеством и глубиной каталога, а большинство контента в нём – старый. По данным Bitmovin Video Developer Report 2024, около 60% премиального OTT-контента представлен в SD или 720p – это материалы, снятые до 2010 года, которые транслируются зрителям, чьи экраны по умолчанию способны отображать 8,3 миллиона пикселей. Разрыв между качеством исходного материала и возможностями современных дисплеев растёт с каждым годом: телевизоры становятся больше, а битрейты стриминга – выше. Технология ИИ-видеоапскейлинга превращает эту проблему из контентной в инженерную: можно взять мастер-версию 480p 1998 года и в 2026 году выдать зрителю смотримый 1080p или 4K-энкод без обращения к оригинальной плёнке (которая, возможно, уже утеряна) и без пересъёмки (что невозможно).

Этот текст адресован продакт-менеджеру, руководителю архивного отдела или инженеру видеоплатформы, который стоит перед выбором: строить, покупать или арендовать пайплайн апскейлинга для OTT-каталога. Он также является инженерной основой для всех последующих тем, связанных с реставрацией: content-aware encoding ladder, генеративный AI b-roll для постпродакшна в OTT, классификация сцен на архивных кадрах.

Ментальная модель: апскейл – это галлюцинация, а не ресайз

До появления ИИ «апскейл» означал геометрический ресэмплинг: изображение из 480 строк превращалось в 1080 строк за счёт интерполяции между известными пикселями. Стандартные методы – bilinear, bicubic, Lanczos – это математические формулы, вычисляющие значение нового пикселя как взвешенное среднее от соседних. Они быстрые, детерминированные и принципиально ограниченные: не могут придумать детали, которых не было в исходном изображении. Апскейл VHS-клипа с помощью bicubic – это просто увеличенный размытый прямоугольник, который ничего нового не раскрывает, а лишь показывает уже имеющееся крупнее.

ИИ-суперразрешение делает иначе. Модель обучается на большом корпусе высококачественных изображений, изучая, как выглядят текстуры высокого разрешения, а затем галлюцинирует правдоподобные детали на основе низкокачественного входа. Забор на заднем плане превращается в отдельные проволоки; кожа – в поры и волоски; листья на дереве – в чётко прорисованные элементы. Ничего из этого не было в исходном изображении. Модель сама это придумала, опираясь на то, как обычно выглядят высококачественные изображения.

В этом одновременно и сила технологии, и её ловушка. Сила – в том, что при достаточном объёме обучающих данных и правильной архитектуре галлюцинации выглядят визуально убедительными для большинства контента. Ловушка – в том, что когда галлюцинация ошибается, она ошибается правдоподобно: лицо получает не ту текстуру, текст на табличке превращается в нечитаемую заковыристую строку, похожую на настоящий текст, логотип переосмысливается. Real-ESRGAN, BasicVSR++ и каждый коммерческий апскейлер, о котором мы поговорим далее, – все они являются вариациями этой галлюцинирующей стратегии. Инженерный вопрос не в том, галлюцинировать ли; вопрос – в какой степени, с какими ограничениями и на каком типе контента.

Число яркости – то, что инженеры называют luma value, – для любого выходного пикселя больше не является детерминированным средним входных пикселей. Это обученная функция от всего окружающего патча, а также априорных представлений модели о том, как выглядит high-resolution-видео.

Рисунок 1. Классические ресэмплеры вычисляют значение нового пикселя как взвешенное среднее соседних пикселей. ИИ-суперразрешающие модели генерируют правдоподобную детализацию на основе обученного приора. Результат выглядит резче, потому что модель добавляет текстуры, которых не было в исходном изображении.

Как работает Real-ESRGAN – дефолт 2026 для пер-кадровой реставрации

Real-ESRGAN был представлен Xintao Wang и коллегами из Tencent ARC Lab в 2021 году под названием «Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data» (arXiv 2107.10833). Это практическое продолжение ESRGAN (ECCV 2018 Workshops), который, в свою очередь, развивался из SRGAN (CVPR 2017). Главная заслуга Real-ESRGAN – не в архитектуре (она уже была хорошо известна), а в методе синтетической генерации данных, позволившем модели эффективно работать с типичными деградациями, встречающимися в архивных видео.

Архитектура состоит из двух сетей, которые обучаются совместно. Генератор – это сеть, преобразующая изображение низкого разрешения в изображение высокого разрешения. Дискриминатор – сеть, которая пытается отличить настоящие изображения высокого разрешения от тех, что генерирует генератор. Они обучаются друг против друга в рамках generative adversarial network – GAN: генератор учится лучше обманывать дискриминатор, а дискриминатор – точнее выявлять подделки. В результате, после достаточного количества итераций, генератор начинает выдавать изображения, практически неотличимые от реальных.

Внутри генератора основную работу выполняют Residual-in-Residual Dense Blocks – RRDB. RRDB представляют собой стек плотных (dense) блоков, в которых выход каждого слоя подаётся на все последующие слои в пределах блока, и при этом весь блок обёрнут в остаточную (residual) связь – вход блока складывается с его выходом. В Real-ESRGAN-x4 используется 23 таких RRDB-блока. Выход последнего блока передаётся в апсэмплер на основе pixel shuffle, который увеличивает пространственное разрешение в 4 раза (или в 2 раза в более лёгких версиях), после чего финальная свёрточная голова формирует RGB-выход.

Тренировочные данные – вот в чём суть. ESRGAN обучали на парах изображений высокого разрешения и их уменьшенных копий, полученных методом bicubic. Такой подход работает хорошо на чистых, идеальных входных данных, но полностью проваливается на реальных видеоархивах, где изображения уже размыты, зашумлены, сжаты в JPEG и H.264, подвержены шарпингу, имеют артефакты ringing и блочности – всё это результат неизвестной цепочки предыдущей обработки. High-order degradation в Real-ESRGAN накладывает случайную последовательность размытия, уменьшения, добавления шума и JPEG-сжатия дважды на обучающие изображения, создавая входы, которые выглядят как настоящий потрёпанный архивный материал. Модель учится восстанавливать исходный вид, отменяя всю эту совокупную деградацию за один проход.

Модель доступна в трёх вариантах. RealESRGAN-x4plus (по умолчанию) – полная сеть на 16,7 миллиона параметров, предназначенная для обработки натуральных фото- и видеоконтента. RealESRGAN-x4plus-anime-6B – шестиблочный вариант, оптимизированный под анимацию и мультфильмы. RealESRGAN-x2plus – версия с 2× масштабированием для менее агрессивного увеличения. Также существует RealESR-general-x4v3 – более лёгкая и быстрая сеть, выпущенная в 2022 году, с улучшенной устойчивостью к шуму на реальных изображениях. Референсная реализация доступна на github.com/xinntao/Real-ESRGAN под лицензией BSD 3-Clause – полностью совместимой с коммерческим использованием.

Token-Free Математика, Прописанная Вслух

Real-ESRGAN – это не Transformer. Подсчёт вычислительной сложности отличается от арифметики Vision Transformer из урока про ViT primer. Процесс 4×-апскейла изображения размером 480×270 на входе до 1920×1080 на выходе проходит через генератор следующим образом.

Входной тензор – (480, 270, 3), то есть 388 800 чисел. Первая свёртка преобразует его в 64-канальный feature map (480, 270, 64) – примерно 8,3 миллиона чисел. Этот feature map проходит через 23 RRDB-блока, сохраняя то же пространственное разрешение и количество каналов. Каждый RRDB-блок выполняет около пяти dense-свёрток на 64-канальном тензоре; одна такая свёртка на изображении 480×270 с ядром 3×3 требует 480 × 270 × 64 × 64 × 9 ≈ 4,8 миллиарда операций умножения и сложения.

По 23 RRDB-блокам с 5 свёртками в каждом приходится 23 × 5 × 4,8 миллиарда ≈ 550 GFLOPs вычислений только на residual-ядро. Затем pixel-shuffle апсэмплер преобразует 64-канальный (480, 270, 64) feature map в выходное изображение 1920×1080 в формате RGB с помощью последовательности свёрток 1×1 и 3×3 в пространстве с большим числом каналов. От входа до выхода один прямой проход RealESRGAN-4xPlus на кадре 480p составляет примерно 700 GFLOPs.

На одной NVIDIA RTX 4090 (82 RT TFLOPS для fp16) теоретический пик кадровой скорости – 82 000 / 700 ≈ 117 FPS. Измеренная реальная скорость по данным бенчмарков проекта при fp16 без тайлинга на RTX 4090 составляет около 60–80 FPS при входном разрешении 480p, поскольку свёртки ограничены пропускной способностью памяти, а не вычислительной мощностью. При входе 1080p, апскейленном до 4K, пропускная способность падает до 6–10 FPS на той же карте. Для 4K, апскейленного до 8K, – менее 1 FPS, и обычно вход приходится разбивать на тайлы.

Для OTT-архивной нагрузки в 1 000 эпизодов по 22 минуты – это 22 000 минут или 39,6 миллиона кадров при 30 FPS и разрешении 480p. Одна видеокарта 4090 на скорости 60 FPS обработает 39,6M / 60 / 3600 ≈ 183 часа вычислений. Учтите время кодирования (обычно в 2–3 раза больше времени апскейла при высоком качестве x265-мастера) – итоговая нагрузка составит 600 часов, то есть около 25 дней на одной GPU, или примерно 25 часов на кластере из 24 GPU.

Почему Real-ESRGAN один мерцает на видео

Если применить Real-ESRGAN к видеоклипу кадр за кадром, происходят две вещи: кадры становятся резче, но начинают мерцать. Модель не учитывает временной контекст – каждый кадр увеличивается независимо, – и детали, «придуманные» нейросетью в момент t = 0, отличаются от тех, что появляются в t = 1, даже если содержание то же самое. Например, забор на заднем плане получает один набор вымышленных деталей в кадре 1 и слегка иной – в кадре 2. При воспроизведении это выглядит нестабильно: края дрожат, текстуры «ползут», а лица дергаются.

Temporal flicker – самый заметный визуальный дефект при апскейлинге видео с помощью ИИ, и именно поэтому подход, основанный на обработке каждого кадра отдельно, не готов к использованию в реальных проектах. На это появилось три инженерных решения. Первое – temporal smoothing: небольшой постобработочный этап размывает каждый выходной кадр с соседними, жертвуя чёткостью ради стабильности. Второе – video-нативные архитектуры, такие как BasicVSR++, которые передают информацию между кадрами непосредственно в процессе апскейлинга. Третье – anchored reference frames, фиксирующие галлюцинации так, чтобы они оставались согласованными на всём протяжении клипа.

На практике для OTT-архивных нагрузок ответ почти всегда один: используйте video-нативную модель для движущегося контента и оставьте Real-ESRGAN для стиллов, key-art, постеров и кадр-за-кадром обработки, где временная согласованность не имеет значения.

Как работает BasicVSR++ – рекуррентная передача для временной согласованности

BasicVSR представил Келвин Чан и коллеги из MMLab, NTU в 2021 году (CVPR 2021). Продолжение – BasicVSR++: Improving Video Super-Resolution with Enhanced Propagation and Alignment (arXiv 2104.13371, CVPR 2022) – стало open-source-эталоном временно согласованного video super-resolution и победило в NTIRE 2021 challenge (три чемпиона и один призёр в номинациях Video Super-Resolution и Compressed Video Enhancement).

Архитектура представляет собой рекуррентную сеть, основанную на двух ключевых идеях. Первая – bidirectional grid propagation. Модель поддерживает текущее представление признаков, которое передаёт информацию как вперёд (кадр 1 → кадр 2 → кадр 3), так и назад (кадр N → кадр N–1 → кадр N–2) по видео. Благодаря этому при формировании высококачественного выхода для текущего кадра модель имеет доступ к информации из более ранних и более поздних кадров. Вторая идея – flow-guided deformable alignment. Перед объединением информации с соседнего кадра модель деформирует его признаки, выравнивая их с текущим кадром. Для этого используется обученная оценка оптического потока и деформационные свёртки, которые корректируют выравнивание локально, на уровне каждого пикселя.

Результат впечатляет. На стандартном бенчмарке REDS4 (подмножество из четырёх клипов из датасета REDS, используемое в NTIRE) BasicVSR++ показывает 32,39 dB PSNR – это на 0,82 dB выше, чем у BasicVSR, при примерно одинаковом количестве параметров. На Vid4 (старый стандартный бенчмарк с низким разрешением) BasicVSR++ демонстрирует 27,79 dB. Эти показатели являются state of the art 2022 года для open-weight моделей чисто-обученных VSR, и в 2026 году модель остаётся рабочей лошадкой в production-пайплайнах, несмотря на три года появления новых конкурентов на основе диффузии, поскольку она работает быстрее, дешевле в развёртывании и хорошо понятна.

Reference-реализация доступна на github.com/ckkelvinchan/BasicVSR_PlusPlus (а также интегрирована в MMagic – тулкит OpenMMLab для генеративных моделей) под лицензией Apache 2.0. BasicVSR++ обобщается на задачи video deblurring и denoising – в сопутствующем техническом отчёте (arXiv 2204.05308) показано, что модель победила в соревновании NTIRE 2022 по улучшению качества сжатого видео.

Компромисс: BasicVSR++ предполагает, что входной материал уже предварительно очищен. Модель отлично восстанавливает детализацию из действительно высококачественного, но низкокачественного по разрешению источника (480p Blu-ray-мастер, 720p broadcast-фид) и заметно слабее справляется с сильно деградировавшими входными данными (VHS-rip, плёнка, перекодированная трижды). Для по-настоящему деградировавшего архивного контента производственный паттерн следующий: сначала запускается реставрация в стиле Real-ESRGAN (чтобы убрать артефакты сжатия и базовый шум), затем – видео-суперразрешение в стиле BasicVSR++ на предварительно очищенном промежуточном файле.

Рисунок 2. BasicVSR++ обрабатывает клип одновременно вперёд и назад, деформируя соседние кадры для выравнивания с текущим перед их объединением. Именно такая архитектура обеспечивает временную стабильность выходного видео.

Более широкое семейство – диффузионные апскейлеры и Frontier 2026

Real-ESRGAN и BasicVSR++ – две open-weight «рабочие лошадки», но они не единственные варианты. Ещё три семейства моделей стоит знать, потому что они активно используются в коммерческих продуктах и инженерных решениях будущего.

VideoGigaGAN (Adobe Research, arXiv 2404.12388, апрель 2024) – это video-нативный генеративный суперразрешитель, построенный на базе крупномасштабной GAN-архитектуры GigaGAN. Он демонстрирует более детализированные текстуры по сравнению с BasicVSR++ при 8×-апскейле – это ключевое утверждение статьи, – однако выпускается только в виде исследовательской версии, и Adobe не планирует внедрять его в Premiere Pro в ближайшее время. У модели есть серьёзное ограничение: производительность резко падает после примерно 200 кадров (8–10 секунд при 24 кадрах в секунду), что допустимо для обработки отдельных сцен, но неприемлемо для длинных OTT-эпизодов. Относитесь к нему как к исследовательскому бенчмарку, по которому оценивают коммерческие 8×-инструменты, а не как к готовому продукту для массового использования.

SeedVR (CVPR 2025 Highlight) и SeedVR2 (принят на ICLR 2026) – это модели восстановления видео от ByteDance на основе диффузионных трансформеров, выпущенные с открытыми весами на Hugging Face под некоммерческими лицензиями для базовых версий. SeedVR2 – это одношаговая диффузионная модель с адаптивным оконным вниманием, способная выполнять высококачественное восстановление за один проход денойзинга – в десять раз быстрее традиционных многошаговых диффузионных подходов. Главный релиз доступен по ссылке: ByteDance-Seed/SeedVR2-3B. Это на сегодняшний день самая мощная открытая модель VSR 2026 года для сильно деградированного контента, однако лицензия ограничивает её коммерческое использование – обязательно ознакомьтесь с условиями перед использованием в продакшене.

NVIDIA Maxine Video Super Resolution – проприетарное решение для обработки видео в реальном времени. Оно увеличивает разрешение видео в формате 16:9 с 480p до 4K (а в некоторых конфигурациях – и до 8K) с возможностью регулировки чёткости, шумоподавления и параметра, который в документации NVIDIA называется «hallucination limit». Maxine – стандартный выбор, когда требуется задержка менее одного кадра в прямых трансляциях или видеозвонках, а не офлайн-обработка архивов. Именно этот пайплайн обеспечивает работу RTX Video Super Resolution в драйверах NVIDIA и используется на этапе апскейла во многих продуктах для стриминга в реальном времени.

MambaVSR (2025) и MIA-VSR (CVPR 2024) – недавние модели на основе Transformer и state-space архитектуры, которые постепенно улучшают PSNR на наборе данных REDS4 по сравнению с BasicVSR++ на 0,3–0,6 дБ. Сегодня они относятся к исследовательскому уровню; ожидается, что к 2027 году хотя бы одна из них заменит BasicVSR++ в качестве стандартной open-weight модели для задач VSR. Однако в мае 2026 года BasicVSR++ остаётся наиболее готовой к использованию в продакшене открытой моделью для обработки движущегося контента.

Коммерческий слой – Topaz Video ИИ и Pixop

На рынке OTT-архивного апскейлинга доминируют два коммерческих продукта, и знать о них обоих важно, поскольку выбор между разработкой собственной системы и покупкой готового решения редко зависит только от качества.

Topaz Video AI – это офлайн-решение уровня кино. В релизе 2026 года поставляется девятнадцать специализированных моделей – Proteus, Iris, Iris LQ, Artemis, Theia, Rhea, Hyperion (HDR-обработка), Starlight (восстановление на основе диффузии) и другие, – каждая из которых настроена под определённый тип входного контента. Proteus – сбалансированный улучшатель для источников среднего качества. Iris обеспечивает наиболее чёткие края (с редкими артефактами искажения на лицах). Artemis специализируется на чересстрочном контенте. Hyperion работает с HDR-мастерингом. В конце 2025 года Topaz перешёл с бессрочной лицензии на подписку; тарифы 2026 года – $299 в год (Personal: 25 облачных кредитов в месяц, некоммерческое или ограниченное коммерческое использование) и $699 в год (Pro: 100 облачных кредитов в месяц, полное коммерческое использование, управление лицензиями). Локальный рендеринг – неограниченный в рамках подписки. Topaz – правильный выбор, если требуется максимальное визуальное качество на тщательно отобранном каталоге, у вас есть GPU в наличии и оператор, способный подобрать подходящую модель для каждого ассета.

Pixop – облачный API по умолчанию для архивного масштаба. Это чистый SaaS-продукт: вы загружаете файл, выбираете фильтры (super-resolution, denoise, deinterlace, deep restoration), обработка выполняется на GPU-серверах Pixop, после чего вы скачиваете результат. Ценообразование – pay-as-you-go, начиная с $10; оплата производится за минуту обработки исходного материала с учётом применённого фильтра; хранение и скачивание тарифицируются отдельно. Pixop предоставляет REST API для массовой интеграции; архивные клиенты и вещатели используют его именно потому, что не хотят держать собственную локальную GPU-инфраструктуру ради реставрации каталога объёмом 6 000 часов, которая проводится раз в год. Качество Pixop в целом сопоставимо с Topaz на типовом контенте; его преимущество – операционная простота при работе на больших масштабах.

Третья опция, которую большинство инженерных команд недооценивают, – операционная эксплуатация Real-ESRGAN + BasicVSR++ in-house на собственных GPU. Это бесплатно, кроме вычислительных затрат, даёт полный контроль над моделью и пайплайном и легко интегрируется в существующий encoding ladder. Цена – операционная: нужен инженер, разбирающийся в модели и GPU-флотилии, чтобы поддерживать её работу, а также storage и dataflow на терабайты промежуточного вывода, плюс терпение при настройке параметров под тип контента. Для OTT-оператора с 10 000-часовым каталогом и уже имеющейся in-house командой по видеоинжинирингу такой путь часто оказывается выгоднее по total cost of ownership. А для каталога в 100 часов или команды без опыта эксплуатации GPU предпочтительнее облачное решение.

СвойствоReal-ESRGAN (open)BasicVSR++ (open)Topaz Video AI (commercial)Pixop (cloud)SeedVR2 (open, NC)
ТипPer-frame GANRecurrent VSRMulti-model offlineCloud APIOne-step diffusion
Лучшее применениеСтиллы, key art, лёгкое видеоПодчищенный движущийся контентКурируемый архив, in-houseBulk-каталог, без GPU-opsСильно деградировавший источник
Open-sourceДа (BSD-3)Да (Apache 2.0)НетНетВеса да, лицензия NC
Temporal stabilityСлабая на видеоСильнаяСильнаяСильнаяСильная
Reference benchmarkDIV2K, OST300REDS4: 32,39 dBInternalInternalПревосходит BasicVSR++ на деградации
Cost modelБесплатно + своя GPUБесплатно + своя GPU$299/$699 в год~$0,50–$2 за мин источникаБесплатно + своя GPU (NC)
Production maturityПроверена в боюПроверена в боюПроверена в боюПроверена в боюНовая (ICLR 2026)

Три режима отказа, которые разрушают первые попытки

Мы отгрузили или оценивали ИИ-апскейлинг-пайплайны на шести OTT-проектах в Фора Софт за последние три года. Ниже перечислены три типичных сценария сбоев – они возникают примерно в таком же порядке каждый раз.

Ошибка 1: воспринимать «Upscale» как «сделать резче». Команда выбирает мощный апскейлер, применяет его к SD-мастеру, кодирует результат в 4K и отправляет на выход. Изображение действительно становится резче. Однако оно также неправильное: лица переоттекстурированы, волосы «перерисованы», текст на табличках превратился в заковыристую строку, похожую на текст, а логотипы полностью изменены моделью. Для документальных фильмов, новостных архивов и любого контента, где важна оригинальная визуальная достоверность, это – не улучшение качества, а нарушение целостности материала. Решение – ограничить «галлюцинации»: использовать более лёгкую модель (например, RealESR-general-x4v3 вместо RealESRGAN-x4plus или Topaz Proteus с низким значением параметра «Recover Detail»), снизить уровень резкости и провести финальную проверку, сравнивая результат с апскейленным по методу bicubic эталонным изображением, чтобы выявить и пометить клипы, слишком сильно отклоняющиеся от оригинала.

Ошибка 2: Игнорирование пайплайна кодирования. Команда запускает Real-ESRGAN, получает красивый 4K-мастер, прогоняет его через свою существующую x264-лестницу с теми же битрейтами, что использовались для SD-оригинала, и выкладывает результат. Зритель получает 4K-контент при 4 Мбит/с – это битрейт-голодный 4K, который был дополнительно размыт энкодером. Галлюцинированные детали, созданные апскейлером, – это именно тот высокочастотный сигнал, который кодеки первыми и отбрасывают. Решение – честно выделять битрейт. 4K-мастер, полученный с помощью ИИ-апскейлинга, требует тех же битрейтов, что и нативный 4K-материал: обычно 15–25 Мбит/с для HEVC и 8–15 Мбит/с для AV1, – потому что сигнал действительно содержит частотный контент уровня 4K, который энкодер должен сохранить.

Ошибка 3: Одна модель на всё. Команда выбирает RealESRGAN-x4plus и применяет её ко всему каталогу – stand-up комедиям, документальным фильмам, анимации и архивным новостям. Анимация получает неподходящие текстуры (нужно было использовать RealESRGAN-x4plus-anime-6B). В архивных новостях лица становятся неестественными (требовалась настройка с сохранением содержания). В документальных фильмах появляются правдоподобные, но ложные детали на критически важных архивных кадрах. Решение – выбор модели с учётом содержания: классифицировать каждый ассет (live-action, анимация, архивные новости, документальные фильмы, спорт) и направлять его к подходящей модели и пресету параметров. Здесь даже небольшой классификатор на Vision Transformer backbone окупается: одна инференция при загрузке, одно решение о маршрутизации, одна модель на тип контента.

Рисунок 3. Три failure-mode, разрушающие первые попытки ИИ-апскейлинга архива. У каждой – конкретное решение; ни одно из них не сводится к «выбору лучшей модели».

OTT-архивный пайплайн – как production реально выглядит

Рабочий пайплайн ИИ-апскейлинга архива состоит из шести стадий. Форма ниже – то, что мы используем в собственных OTT-проектах, и то, что вы можете видеть в различных вариациях в Topaz-воркфлоу, Pixop-пайплайнах и внутренних системах крупных сервисов.

Стадия 1 – Ingest и классификация. Каждый ассет поступает в пайплайн с манифестом: формат источника, разрешение, оценка качества (VMAF по сравнению с high-quality-референсом, если он доступен, иначе используется безреференсная метрика, например MUSIQ) и тип контента (live-action / animation / news / documentary / sports). Классификатор – небольшой Vision Transformer, дообученный на размеченном подмножестве вашего каталога; одноразовая разметка нескольких тысяч объектов.

Стадия 2 – Restore. Если качество исходного материала низкое (сильное сжатие, шум, чересстрочная развёртка), сначала нужно выполнить этап восстановления. Для этого подойдут Real-ESRGAN с консервативными настройками, Topaz Artemis – для чересстрочных источников, или SeedVR2 (при наличии подходящей лицензии) – для сильно деградировавшего контента. На выходе получается очищенный промежуточный файл в том же разрешении, что и исходник.

Стадия 3 – Upscale. Применить video-нативный супер-разрешитель: BasicVSR++ с масштабированием 4× к очищенному live-акшену; Topaz Iris или Proteus – для тех же задач; коммерческие решения – для анимации или архивного кино. При превышении объёма входных данных по сравнению с памятью GPU использовать тайлинг.

Стадия 4 – Temporal QA. Отобрать апскейленный выход и проверить его с помощью метрики временной стабильности – обычно это разность между последовательными кадрами после выравнивания с помощью optical flow. Эффекты мерцания (flicker) и ползучести (crawl) проявляются как аномально большие остатки. Клипы, не прошедшие пороговое значение, пометить для повторной обработки с более жёсткой временной регуляризацией.

Стадия 5 – Content-Integrity QA. Посчитать VMAF по сравнению с bicubic-апскейленным бейзлайном исходного материала. VMAF около 92 против bicubic-бейзлайна означает, что апскейлер сохранил структуру исходного изображения, добавив правдоподобную детализацию. VMAF ниже 80 говорит о том, что модель слишком сильно отклонилась от оригинала – требуется переобработка с менее агрессивными настройками. Для новостей, документальных фильмов и материалов, чувствительных к историческим фактам, дополнительно проверить совпадение лиц и текста с оригиналом с помощью модели face-identity и OCR-модели; оба результата должны полностью совпадать.

Стадия 6 – Encode на честном битрейте. Апскейленный 4K-мастер поступает в обычную цепочку кодирования с битрейтами, подходящими для 4K. Урок из Failure 2 применим: не занижать битрейт для 4K-мастера, полученного с помощью ИИ-суперразрешения.

Арифметика бюджета на 10 000-часовом каталоге при 30 FPS: это 1,08 миллиарда кадров. При 60 FPS на одной RTX 4090 (RealESRGAN-x4plus на входе 480p) один проход апскейла занимает примерно 1,08 млрд / 60 / 3600 ≈ 5000 GPU-часов. На кластере из 40 GPU это составляет 125 часов реального времени – около пяти дней. Добавьте восстановление (1×), проверку качества (~0,2×) и кодирование (3× для high-quality x265) – и полный пайплайн займёт в 5–6 раз больше времени, чем апскейл. Планируйте две-три недели реального времени на кластере из 40 GPU или два-три месяца на рабочей станции с 4 GPU. Стоимость по AWS p4d on-demand 2026 – восемь A100 по примерно $30 в час суммарно – составляет около $0,50–$1,50 за минуту исходного контента, все расходы включены, в зависимости от того, какая часть этапов выполняется на GPU, а какая – на CPU. Прайсинг Pixop следует этой оценке довольно близко – и это не случайно.

Где подключается Фора Софт

В Фора Софт мы внедрили ИИ-суперразрешение в видеопайплайны OTT, видеонаблюдения и телемедицины. В OTT-проекте мы запускали BasicVSR++ с масштабированием 4× на устаревшем эпизодическом контенте в связке с content-aware encoding ladder, чтобы апскейленный мастер действительно отгружался с битрейтом, соответствующим его качеству. В системе видеонаблюдения мы применяем Real-ESRGAN выборочно – только к still-кадрам, используемым в качестве доказательств, но ни в коем случае не на live-кадрах мониторинга, где галлюцинации модели могли бы нарушить chain of custody. В телемедицине архивные кадры консультаций апскейлятся с консервативными настройками для поддержки workflow удалённого второго мнения; у медицинских экспертов всегда есть доступ к оригиналу рядом с обработанной версией. Мы не проводим собственных исследований в области суперразрешения – вместо этого интегрируем передовые open-source и коммерческие решения в видеопайплайны, которые не просто запускаются, а остаются в эксплуатации.

Ключевые выводы

  • ИИ-апскейлинг добавляет детали, которых нет в оригинале (галлюцинирует); классические ресэмплеры – нет. Галлюцинация – одновременно и преимущество, и риск.
  • Real-ESRGAN – стандарт с открытыми весами для посткадровой реставрации; BasicVSR++ – стандарт с открытыми весами для временно-стабильного видеоапскейлинга.
  • Посткадровый апскейлинг на видео вызывает мерцание; для движущегося контента используйте архитектуру, нативную для видео, или временную постобработку.
  • Topaz Video ИИ – коммерческий стандарт оффлайн-обработки кинематографического качества; Pixop – стандарт облачного API для обработки архивов крупного масштаба.
  • Три типичных сбоя: дрейф галлюцинаций, 4K с недостаточным битрейтом и универсальная модель «на всё». У каждого – своё решение.
  • Реставрация 10 000-часового OTT-каталога обходится примерно в $0,50–$1,50 за минуту «под ключ» и занимает 2–3 недели на кластере из 40 GPU.

Что читать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.