Real-ESRGAN и BasicVSR++ для апскейлинга OTT-архива – инженерный плейбук 2026

Автор: Николай СапуновОбновлено: август 202630 мин чтения
Содержание статьи +

TL;DR

У вас лежит back-каталог в SD или с низким битрейтом – тысяча эпизодов ситкома 2003 года, хранилище broadcast-мастеров 90-х, кинобиблиотека, оцифрованная на VHS в 1998-м, – а ваша аудитория смотрит всё это на 4K OLED-телевизорах. В 2026 году в production OTT-пайплайны идут два практичных open-weight апскейлера: Real-ESRGAN для пер-кадровой реставрации изображений и BasicVSR++ для temporally-консистентного video super-resolution. В коммерческом сегменте два дефолта: Topaz Video AI для offline cinematic-restoration и Pixop для cloud-API в архивных масштабах. Эта статья проводит нетехнического читателя через то, что это за модели, как математика работает на уровне продакт-менеджера, почему пер-кадровый апскейлер изображения создаёт мерцание на видео, когда какой инструмент выбирать и какой бюджет закладывать за минуту восстановленного контента. В финале вы сможете спланировать реальный проект апскейлинга OTT-архива, грамотно поговорить с инженерами и обойти три failure-mode, которые разрушают большинство первых попыток.

Зачем Это Нужно Знать

Стриминговые сервисы живут и умирают глубиной каталога, а каталог в основном старый. Оценка Bitmovin Video Developer Report 2024 ставит примерно 60% premium OTT-инвентаря в SD или 720p – это контент, снятый до 2010 года, который доставляется зрителям, чей экран по умолчанию разрешает 8,3 миллиона пикселей. Разрыв между качеством источника и возможностями дисплея растёт каждый год: телевизоры становятся больше, битрейты стриминга – выше. AI video super-resolution превращает этот разрыв из контентной проблемы в инженерную: вы можете взять 480p-мастер 1998 года и отгрузить смотрибельный 1080p или 4K-энкод в 2026 без возврата к оригинальной плёнке (которой, возможно, уже нет) и без пересъёмки (это невозможно). Статья для продакт-менеджера, archive-лида или video-platform-инженера, которому нужно решить – строить, покупать или арендовать пайплайн апскейлинга для OTT-каталога. Это также инженерный фундамент под всеми поздними уроками, которые касаются реставрации – content-aware encoding ladder, генеративного AI b-roll для OTT post-production, классификации сцен на архивных кадрах.

Ментальная Модель – Апскейл Это Галлюцинация, А Не Ресайз

До ИИ «апскейл» означал геометрический ресэмплинг: изображение в 480 строк превращается в 1080 строк интерполяцией между известными пикселями. Стандартные рецепты – bilinear, bicubic, Lanczos – это математические формулы, оценивающие значение нового пикселя как взвешенное среднее соседей. Они быстрые, детерминистичные и фундаментально ограниченные: они не могут изобрести деталь, которой не было в источнике. Bicubic-апскейл VHS-клипа – это просто более крупный размытый прямоугольник, который не скрывает ничего нового, просто показывает крупнее.

AI super-resolution делает другое. Модель учит, как выглядят high-resolution-текстуры, на большом тренировочном корпусе высококачественных изображений, а затем галлюцинирует правдоподобную детализацию, получая low-resolution-вход. Забор на фоне становится отдельными проволоками; кожа становится порами и волосками; листья на дереве – каждый отрисован отдельно. Ничего из этого не было в источнике. Модель это изобрела, опираясь на то, как обычно выглядит high-resolution-видео.

В этом одновременно и сила технологии, и её ловушка. Сила: при достаточном объёме обучающих данных и правильной архитектуре галлюцинации визуально убедительны для большинства контента. Ловушка: когда галлюцинация ошибается, она ошибается правдоподобно – лицо получает не ту текстуру, текст на табличке превращается в нечитаемую заковыристую строку, которая похожа на текст, логотип переизобретается. Real-ESRGAN, BasicVSR++ и каждый коммерческий апскейлер, который мы обсуждаем дальше, – все они являются вариациями этой галлюцинирующей стратегии. Инженерный вопрос не галлюцинировать ли; вопрос – сколько, с какими ограничителями и на каком контенте.

Число яркости – то, что инженеры называют luma value, – для любого выходного пикселя больше не является детерминированным средним входных пикселей. Это обученная функция от всего окружающего патча плюс априорные представления модели о том, как выглядит high-resolution-видео.

Рисунок 1. Классические ресэмплеры вычисляют новый пиксель как взвешенное среднее соседей. AI super-resolver-ы изобретают правдоподобную детализацию из обученного приора. Выход выглядит резче, потому что модель добавила текстуры, которых не было в источнике.

Как Работает Real-ESRGAN – Дефолт 2026 Для Пер-Кадровой Реставрации

Real-ESRGAN был опубликован Xintao Wang и коллегами из Tencent ARC Lab в 2021 году под заголовком «Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data» (arXiv 2107.10833). Это практический наследник ESRGAN (ECCV 2018 Workshops), который сам был наследником SRGAN (CVPR 2017). Контрибуция, которая поставила Real-ESRGAN в каждый production-пайплайн, – не архитектура (она была уже хорошо известна), а процесс синтетической генерации данных, который наконец научил модель работать с такими видами деградаций, которые реально встречаются в архивных видео.

Архитектура состоит из двух сетей, которые тренируются вместе. Генератор – сеть, которая превращает low-resolution-изображение в high-resolution. Дискриминатор – сеть, которая пытается отличить настоящие high-resolution-изображения от выходов генератора. Они тренируются друг против друга в generative adversarial network – GAN – постановке: генератор учится лучше обманывать дискриминатор, дискриминатор лучше ловить подделки, и через достаточное количество раундов генератор выдаёт изображения, которые сходят за реальные.

Внутри генератора тяжёлую работу делают Residual-in-Residual Dense Blocks – RRDB. RRDB – это стек dense-блоков (каждый слой подаёт свой выход во все последующие слои в блоке), обёрнутый в residual-связь (вход блока добавляется к его выходу). Real-ESRGAN-x4 имеет 23 RRDB-блока. Выход последнего блока идёт в pixel-shuffle апсэмплер, который увеличивает пространственное разрешение в 4× (или 2× для более лёгких вариантов), а затем финальная свёрточная голова выдаёт RGB-выход.

Тренировочные данные – это и есть фокус. ESRGAN обучался на парах high-resolution-изображений и их bicubic-уменьшенных копий. Это работает для чистых входов и катастрофически проваливается на реальных видеоархивах, где вход также размыт, шумный, JPEG-сжатый, h.264-сжатый, шарпленый, с ringing и блочными артефактами от неизвестной цепочки прошлой обработки. High-order degradation Real-ESRGAN-а накладывает рандомизированную последовательность блюра, downsample, шума и JPEG-сжатия дважды на обучающие изображения, давая входы, которые выглядят как реально потёртый архивный материал. Модель учится откатывать эту совокупную деградацию за один проход.

Модель выходит в трёх размерах. RealESRGAN-x4plus (дефолт) – полная сеть на 16,7 миллиона параметров для натурального фото- и видеоконтента. RealESRGAN-x4plus-anime-6B – six-block вариант под анимацию и мультфильмы. RealESRGAN-x2plus – 2×-вариант для менее агрессивных апскейлов. Есть также RealESR-general-x4v3 – более лёгкая и быстрая сеть, выпущенная в 2022, с лучшей устойчивостью на шумных реальных входах. Reference-имплементация лежит на github.com/xinntao/Real-ESRGAN под BSD 3-Clause лицензией – полностью commercial-friendly.

Token-Free Математика, Прописанная Вслух

Real-ESRGAN – это не Transformer. Расчёт стоимости отличается от арифметики Vision Transformer из урока про ViT primer. 4×-апскейл 480×270 на вход в 1920×1080 на выход проходит через генератор так.

Входной тензор – (480, 270, 3), то есть 388 800 чисел. Первая свёртка отображает его в 64-канальный feature map (480, 270, 64) – около 8,3 миллиона чисел. Этот feature map проходит 23 RRDB-блока на том же пространственном разрешении и том же количестве каналов. Каждый RRDB выполняет примерно 5 dense-свёрток на 64-канальном тензоре; одна такая свёртка на 480×270 с ядром 3×3 стоит 480 × 270 × 64 × 64 × 9 ≈ 4,8 миллиарда multiply-add-операций.

По 23 RRDB-блокам с 5 свёртками в каждом получается 23 × 5 × 4,8 миллиарда ≈ 550 GFLOPs работы только на residual-ядро. Далее pixel-shuffle апсэмплер превращает 64-канальный (480, 270, 64) feature map в 1920×1080 RGB-выход через последовательность 1×1 и 3×3 свёрток в higher-channel пространстве. От входа до выхода один forward pass RealESRGAN-x4plus на 480p-кадре стоит примерно 700 GFLOPs.

На одной NVIDIA RTX 4090 (82 RT TFLOPS для fp16) теоретический пик кадровой скорости – 82 000 / 700 ≈ 117 FPS. Измеренная реальная скорость из бенчмарков проекта при fp16 без тайлинга на RTX 4090 ближе к 60–80 FPS для 480p-входа, потому что свёртки memory-bound, а не compute-bound. Для 1080p-входа, апскейленного до 4K, пропускная способность падает до 6–10 FPS на той же карте. Для 4K, апскейленного до 8K, – до меньше 1 FPS, и обычно вход приходится тайлить.

Для OTT-архивной нагрузки в 1 000 эпизодов по 22 минуты = 22 000 минут = 39,6 миллиона кадров на 30 FPS при 480p, одна 4090 на 60 FPS отработает 39,6M / 60 / 3600 ≈ 183 часа compute. Добавьте время кодирования (обычно 2–3× апскейл-времени для высококачественного x265-мастера) – и получится 600-часовая, 25-дневная кампания на одной GPU, или около 25 часов на кластере из 24 GPU.

Почему Real-ESRGAN Один Мерцает На Видео

Если взять Real-ESRGAN и прогнать его пер-кадрово по видеоклипу, происходят две вещи. Кадры становятся резче. Они же начинают мерцать. Модель не имеет понятия о времени – каждый кадр апскейлится независимо, – и галлюцинированные детали на кадре в t = 0 отличаются от галлюцинированных деталей на том же контенте в t = 1. Забор на фоне получает один набор изобретений в кадре 1 и слегка другой набор в кадре 2. При воспроизведении результат видимо нестабилен: края дрожат, текстуры ползают, лица дёргаются.

Temporal flicker – самый важный визуальный дефект в AI video upscaling, и именно поэтому пер-кадровая стратегия сама по себе не production-ready. Появились три инженерных ответа. Первый – temporal smoothing: маленький post-process размывает каждый выходной кадр с соседями, торгуя резкость на стабильность. Второй – video-native архитектуры типа BasicVSR++, которые пропагируют информацию между кадрами во время самого апскейлинга. Третий – anchored reference frames, привязывающие галлюцинацию так, чтобы она была консистентна по клипу.

На практике для OTT-архивных нагрузок ответ почти всегда такой: используйте video-native модель для движущегося контента и оставьте Real-ESRGAN для стиллов, key-art, постеров и пер-кадровых работ, где temporal consistency не важна.

Как Работает BasicVSR++ – Recurrent Propagation Для Temporal Consistency

BasicVSR представил Kelvin Chan и коллеги из MMLab, NTU в 2021 году (CVPR 2021). Продолжение – BasicVSR++: Improving Video Super-Resolution with Enhanced Propagation and Alignment (arXiv 2104.13371, CVPR 2022) – стало open-source-эталоном temporally-консистентного video super-resolution и подмело NTIRE 2021 challenge (три чемпиона и один runner-up в треках Video Super-Resolution и Compressed Video Enhancement).

Архитектура – рекуррентная сеть с двумя важными идеями. Первая – bidirectional grid propagation. Модель поддерживает running feature representation, которое пропагирует информацию как вперёд (кадр 1 → кадр 2 → кадр 3), так и назад (кадр N → кадр N-1 → кадр N-2) по видео. Информация из ранних и поздних кадров доступна, когда модель решает, как должен выглядеть high-resolution-выход для текущего кадра. Вторая – flow-guided deformable alignment. Перед слиянием информации с соседнего кадра модель искажает фичи соседа, выравнивая их с текущим кадром, используя обученную оценку optical flow и deformable convolutions, которые подстраивают alignment локально, попиксельно.

Результат впечатляет. На стандартном бенчмарке REDS4 (подмножество из четырёх клипов из датасета REDS, используемое в NTIRE) BasicVSR++ выдаёт 32,39 dB PSNR – улучшение на 0,82 dB над BasicVSR с примерно тем же количеством параметров. На Vid4 (старый стандартный low-resolution бенчмарк) BasicVSR++ выдаёт 27,79 dB. Эти числа – state of the art 2022 года для open-weight чисто-supervised VSR, и в 2026 году модель всё ещё рабочая лошадка в production-пайплайнах, несмотря на три года новых diffusion-конкурентов, потому что она работает быстрее, дешевле в развёртывании и хорошо понятна.

Reference-имплементация лежит на github.com/ckkelvinchan/BasicVSR_PlusPlus (а также интегрирована в MMagic, OpenMMLab-овский тулкит для генеративных моделей) под Apache 2.0. BasicVSR++ обобщается на video deblurring и denoising – follow-up technical report (arXiv 2204.05308) показывает, что модель выиграла NTIRE 2022 Quality Enhancement of Compressed Video challenges.

Trade-off: BasicVSR++ предполагает, что вход уже несколько подчищен. Модель отлично восстанавливает детализацию из реально высококачественного, но низкоразрешённого источника (480p Blu-ray-мастер, 720p broadcast-фид) и заметно слабее на сильно деградировавших входах (VHS-rip, плёнка, перекодированная трижды). Для по-настоящему деградировавшего архивного контента production-паттерн такой: сначала запустить Real-ESRGAN-стиль реставрации (чтобы убрать compression-артефакты и базовый шум), затем BasicVSR++-стиль video super-resolution на подчищенном промежуточном.

Рисунок 2. BasicVSR++ ходит и вперёд, и назад по клипу, искажая соседние кадры в выравнивание с текущим перед их слиянием. Это и есть архитектурная причина, по которой выход temporally стабилен.

Более Широкое Семейство – Диффузионные Апскейлеры И Frontier 2026

Real-ESRGAN и BasicVSR++ – две open-weight рабочие лошадки, но они не единственные опции. Ещё три семейства стоит знать, потому что они появляются в коммерческих продуктах и в инженерных решениях впереди.

VideoGigaGAN (Adobe Research, arXiv 2404.12388, апрель 2024) – это video-native генеративный super-resolver, построенный поверх large-scale image-GAN-а GigaGAN. Он выдаёт видимо более богатые текстуры, чем BasicVSR++, на 8×-апскейлах – главная заявка статьи, – но выпускается только как research preview, и Adobe заявляет, что не планирует немедленно везти его в Premiere Pro. У него также жёсткое ограничение: производительность резко падает после примерно 200 кадров (8–10 секунд при 24 FPS), что нормально для shot-level-обработки, но не для длинноформатных OTT-эпизодов. Относитесь к нему как к research-бенчмарку, по которому судили коммерческие 8×-инструменты, а не как к продукту, который можно отгрузить.

SeedVR (CVPR 2025 Highlight) и SeedVR2 (принят на ICLR 2026) – ByteDance-овские diffusion-transformer-based модели video restoration, выпущенные как open weights на Hugging Face под non-commercial лицензиями для младших вариантов. SeedVR2 – это one-step diffusion-модель с adaptive window attention, способная к high-quality restoration за один denoising-проход – в десять раз быстрее старых multi-step diffusion-подходов. Главный open-релиз – ByteDance-Seed/SeedVR2-3B. Это самая сильная open-weight VSR-опция 2026 года на сильно деградировавшем контенте, но лицензия ограничивает коммерческое использование – читайте до отгрузки.

NVIDIA Maxine Video Super Resolution – проприетарный real-time путь. Апскейлит 16:9-видео с 480p до 4K (а теперь заявляется и до 8K в некоторых конфигурациях) с user-controllable шарпом, denoise и тем, что документация NVIDIA называет «hallucination limit». Maxine – стандартный выбор, когда требование – sub-frame latency в live broadcast или video-call пайплайне, а не offline-обработка архива. Это и есть пайплайн, питающий RTX Video Super Resolution в драйверах NVIDIA и стадию апскейла во многих real-time стриминговых продуктах.

MambaVSR (2025) и MIA-VSR (CVPR 2024) – недавние Transformer и state-space варианты, которые инкрементально улучшают REDS4 PSNR над BasicVSR++ на 0,3–0,6 dB. Сегодня они research-grade; ожидайте, что хотя бы один из них вытеснит BasicVSR++ как дефолтный open-weight VSR к 2027, но в мае 2026 BasicVSR++ остаётся самой production-ready open-опцией для движущегося контента.

Коммерческий Слой – Topaz Video ИИ И Pixop

Два коммерческих продукта доминируют на рынке OTT-архивного апскейлинга, и нужно знать оба, потому что решение build-vs-buy редко касается одного только качества.

Topaz Video AI – offline cinematic-grade дефолт. В релизе 2026 года поставляется девятнадцать специализированных моделей – Proteus, Iris, Iris LQ, Artemis, Theia, Rhea, Hyperion (HDR-путь), Starlight (diffusion-based deep restoration) и другие, – каждая настроенная под свой тип входа. Proteus – сбалансированный enhancer для среднего по качеству источника. Iris даёт самые резкие края (с эпизодическими warping-артефактами на лицах). Artemis специализируется на interlaced-контенте. Hyperion работает с HDR-мастерингом. Topaz перешёл с perpetual-лицензирования на подписку в конце 2025 года; планы 2026 – $299/год (Personal – 25 cloud-кредитов/мес, non-commercial или limited commercial) и $699/год (Pro – 100 cloud-кредитов/мес, full commercial use, seat management). On-premise-рендеринг – безлимитный в рамках подписки. Topaz – правильный выбор, когда нужно максимальное визуальное качество на курируемом каталоге, у вас есть GPU в-хаусе и есть оператор, который выберет правильную модель под каждый ассет.

Pixop – cloud-API дефолт архивного масштаба. Это чистый SaaS-продукт: вы загружаете, выбираете фильтры (super-resolution, denoise, deinterlace, deep restoration), обработка идёт на cloud-GPU Pixop, вы скачиваете. Pricing – pay-as-you-go от минимума в $10, оплата за минуту источника за применённый фильтр; хранение и скачивания биллятся отдельно. Pixop предлагает REST API для bulk-интеграции; архивные клиенты и broadcaster-ы используют его именно потому, что не хотят содержать локальную GPU-флотилию ради 6 000-часовой реставрации каталога, которая запускается раз в год. Качество Pixop в целом сравнимо с Topaz на типовом контенте; его edge – операционная простота на масштабе.

Третья опция, которую большинство инженерных команд недооценивают, – операционная эксплуатация Real-ESRGAN + BasicVSR++ in-house на своих GPU. Это бесплатно, кроме compute, даёт полный контроль модели и пайплайна и чисто интегрируется в существующий encoding ladder. Цена – операционная: нужен инженер, который понимает модель, GPU-флотилия, чтобы её гонять, storage и dataflow на терабайты промежуточного вывода и терпение тюнить параметры под тип контента. Для OTT-оператора с 10 000-часовым каталогом и существующей video-engineering командой in-house-путь часто выигрывает по total cost of ownership. Для 100-часового каталога или команды без опыта эксплуатации GPU выигрывает cloud-путь.

СвойствоReal-ESRGAN (open)BasicVSR++ (open)Topaz Video AI (commercial)Pixop (cloud)SeedVR2 (open, NC)
ТипPer-frame GANRecurrent VSRMulti-model offlineCloud APIOne-step diffusion
Лучшее применениеСтиллы, key art, лёгкое видеоПодчищенный движущийся контентКурируемый архив, in-houseBulk-каталог, без GPU-opsСильно деградировавший источник
Open-sourceДа (BSD-3)Да (Apache 2.0)НетНетВеса да, лицензия NC
Temporal stabilityСлабая на видеоСильнаяСильнаяСильнаяСильная
Reference benchmarkDIV2K, OST300REDS4: 32,39 dBInternalInternalПревосходит BasicVSR++ на деградации
Cost modelБесплатно + своя GPUБесплатно + своя GPU$299/$699 в год~$0,50–$2 за мин источникаБесплатно + своя GPU (NC)
Production maturityПроверена в боюПроверена в боюПроверена в боюПроверена в боюНовая (ICLR 2026)

Три Failure-Mode, Которые Разрушают Первые Попытки

Мы отгрузили или оценивали ИИ-апскейлинг-пайплайны на шести OTT-проектах в Фора Софт за последние три года. Три failure-mode ниже всплывают примерно в таком порядке каждый раз.

Failure 1: Воспринимать «Upscale» Как «Сделать Резче». Команда выбирает сильный апскейлер, применяет его к SD-мастеру, кодирует выход в 4K и отгружает. Выход резче. Выход также неправильный: лица переотекстурированы, волосы переизобретены, текст на табличках стал заковыристой строкой, похожей на текст, логотипы перерисованы моделью. Для документалок, новостных архивов и всего, где важен оригинальный визуальный документ, это нарушение целостности контента, а не улучшение качества. Лечение – ограничить галлюцинацию: выбрать более лёгкую модель (RealESR-general-x4v3 вместо RealESRGAN-x4plus, или Topaz Proteus с низким «Recover Detail»), снизить ручку шарпа и прогнать финальный pass, сравнивающий выход с bicubic-апскейленным бейзлайном, чтобы пометить клипы, ушедшие слишком далеко от источника.

Failure 2: Игнорирование Encoding-Пайплайна. Команда гоняет Real-ESRGAN, получает красивый 4K-мастер, прогоняет его через свой существующий x264-лестницу на тех же битрейтах, что использовала для SD-оригинала, и отгружает. Зритель видит 4K-контент на 4 Mbps – bitrate-starved 4K, который был ре-замылен энкодером. Галлюцинированные детали, произведённые апскейлером, – ровно тот high-frequency сигнал, который кодеки первым и выкидывают. Лечение – честно бюджетировать битрейт. 4K-мастер, заработанный AI super-resolution, нуждается в тех же битрейтах, что и нативно отснятый 4K-мастер – обычно 15–25 Mbps для HEVC, 8–15 Mbps для AV1, – потому что сигнал реально содержит 4K-grade частотный контент, который энкодер должен сохранить.

Failure 3: Одна Модель На Всё. Команда выбирает RealESRGAN-x4plus и использует его для всего каталога: stand-up комедия, документалки, анимация, архивные новости. Анимация получает не те текстуры (нужно было использовать RealESRGAN-x4plus-anime-6B). Новостной архив получает переизобретённые лица (нужно было использовать content-preserving настройку). Документалка получает правдоподобные, но неверные детали на критическом архивном материале. Лечение – content-aware выбор модели: классифицировать каждый ассет (live-action / animation / archive news / documentary / sports) и роутить к подходящей модели и пресету параметров. Здесь маленький классификатор на Vision Transformer backbone отрабатывает свою цену: одна inference на ингесте, одно роутинг-решение, одна модель на тип контента.

Рисунок 3. Три failure-mode, разрушающие первые попытки ИИ-апскейлинга архива. У каждой – конкретное лечение; ни одно из них не «выбрать модель получше».

OTT-Архивный Пайплайн – Как Production Реально Выглядит

Рабочий production-пайплайн ИИ-апскейлинга архива имеет шесть стадий. Форма ниже – то, что мы используем в собственных OTT-проектах и что вы видите с вариациями внутри Topaz-воркфлоу, Pixop-пайплайнов и внутренних систем крупных сервисов.

Стадия 1 – Ingest и классификация. Каждый ассет входит в пайплайн с манифестом: формат источника, разрешение источника, оценка качества (VMAF против high-quality-референса, если он есть, иначе no-reference-метрика типа MUSIQ) и тип контента (live-action / animation / news / documentary / sports). Классификатор – маленький Vision Transformer, fine-tuned на размеченном подмножестве вашего каталога; одноразовое вложение в несколько тысяч меток.

Стадия 2 – Restore. Если качество источника низкое (сильное сжатие, шум, чересстрочная развёртка), сначала прогнать restoration-проход. Real-ESRGAN с консервативными настройками, Topaz Artemis для interlaced-источника или SeedVR2 (при подходящей лицензии) для сильно деградировавшего контента. Выход – подчищенный intermediate в том же разрешении, что и источник.

Стадия 3 – Upscale. Применить video-native super-resolver. BasicVSR++ на 4× на подчищенный live-action; Topaz Iris или Proteus на том же; коммерческие варианты для анимации или архивного кино. Тайлить входы, превышающие память GPU.

Стадия 4 – Temporal QA. Сэмплировать апскейленный выход и прогнать temporal-stability-метрику – обычно разность между последовательными кадрами после их выравнивания через optical flow. Flicker и crawl видны как аномально большие residuals. Пометить клипы, которые не прошли порог, для повторной обработки с более сильной temporal-регуляризацией.

Стадия 5 – Content-integrity QA. Посчитать VMAF против bicubic-апскейленного бейзлайна источника. VMAF в районе 92 против bicubic-бейзлайна означает, что апскейлер структурно остался верен источнику, добавив правдоподобную детализацию. VMAF ниже 80 означает, что модель ушла слишком далеко – переобработать с менее агрессивной настройкой. Для новостей, документалок и исторически чувствительного материала дополнительно сравнить лица и текст с источником моделью face-identity и OCR-моделью; и то, и то должно совпадать.

Стадия 6 – Encode на честном битрейте. Апскейленный 4K-мастер идёт в ваш обычный encoding ladder на 4K-appropriate битрейтах. Урок из Failure 2 применим: не недо-битрейтить 4K-мастер, заработанный AI super-resolution.

Арифметика бюджета на 10 000-часовом каталоге при 30 FPS: это 1,08 миллиарда кадров. На 60 FPS на одной RTX 4090 (RealESRGAN-x4plus на 480p-входе) апскейл-проход один занимает 1,08B / 60 / 3600 ≈ 5 000 GPU-часов. На кластере из 40 GPU – 125 часов wall-clock, около пяти дней. Добавьте restoration (1×), QA (~0,2×) и encode (3× для high-quality x265) – и полный пайплайн идёт в 5–6× апскейл-времени. Планируйте две-три недели wall-clock на 40-GPU кластере или два-три месяца на 4-GPU workstation. Стоимость по AWS p4d on-demand 2026 – восемь A100 по примерно $30/час суммарно – это приблизительно $0,50–$1,50 за минуту контента источника, all-in, в зависимости от того, какая доля стадий гонится на GPU vs CPU. Прайсинг Pixop трекит это число близко, и это не случайно.

Где Подключается Фора Софт

В Фора Софт мы интегрировали AI super-resolution в видеопайплайны OTT, видеонаблюдения и телемедицины. В OTT мы гоняли BasicVSR++ на 4× на legacy-эпизодическом контенте, в паре с content-aware encoding ladder, чтобы апскейленный мастер реально отгружался с битрейтом, который он заработал. В surveillance мы используем Real-ESRGAN селективно на still-frame экспортах доказательств – никогда на live-monitoring кадрах, где галлюцинированные детали создали бы chain-of-custody проблемы. В телемедицине архивные консультационные кадры апскейлятся с консервативными настройками для поддержки remote-second-opinion воркфлоу; у медицинских ревьюверов всегда есть доступ к оригиналу рядом с апскейленной версией. Мы не ведём собственных super-resolution-исследований; мы интегрируем open и коммерческий state of the art в видеопайплайны, которые отгружаются и остаются отгруженными.

Ключевые Выводы

  • ИИ-апскейлинг галлюцинирует деталь; классические ресэмплеры – нет. Галлюцинация – это и ценность, и риск.
  • Real-ESRGAN – open-weight дефолт для пер-кадровой реставрации; BasicVSR++ – open-weight дефолт для temporally-стабильного video super-resolution.
  • Пер-кадровый апскейлер на видео мерцает; для движущегося контента используйте video-native архитектуру или temporal post-process.
  • Topaz Video AI – offline cinematic-grade коммерческий дефолт; Pixop – cloud-API дефолт архивного масштаба.
  • Три failure-mode – hallucination drift, bitrate-starved 4K и одна модель на всё. У каждой – конкретное лечение.
  • Реставрация 10 000-часового OTT-каталога стоит примерно $0,50–$1,50 за минуту all-in и занимает 2–3 недели на 40-GPU кластере.

Что Читать Дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.