Содержание статьи +
- TL;DR
- Зачем это нужно знать
- Что Шеннон сказал в 1948 году
- Дверь в lossy: теория rate-distortion
- Где сидят conventional-кодеки в 2026 году
- Новая координата: восприятие
- Где сейчас стоят нейросетевые кодеки
- Насколько далёк предел Шеннона на самом деле
- Распространённая ошибка: трактовать «предел Шеннона» как одно число
- Рабочий пример: бюджет предела Шеннона на 4K SDR-каталог
- Где здесь Фора Софт
- Подводный камень: оптимизация под неправильную цель
- Ключевые выводы
- Что читать дальше
- Источники
TL;DR
Существует математический пол, ниже которого ни один кодек не может сжать данный источник без потери качества больше допустимого, и этот пол ещё в 1948 году обозначил Клод Шеннон. Для lossy-видео – а именно его отгружает любой современный стриминговый сервис – пол не одно число, а кривая, называемая функцией rate-distortion, и правильный способ читать прогресс кодеков – это насколько каждое новое поколение приближается к этой кривой. К 2026 году громкие межпоколенческие приросты от H.264 к AV1 и VVC (30–50%) ужались до однозначных процентов между последними conventional-стандартами, тогда как нейросетевые кодеки, обученные прямо против перцептивных потерь (DCVC-FM, DCVC-RT), уже сравнялись с VVC или обошли его по битрейту при том же VMAF. Продуктовый вопрос больше не «сколько эффективности ещё осталось», а «какой именно эффективности» – потому что классический предел Шеннона, перцептивный предел Блау–Михаэли (2019) и практический аппаратный предел тянут ответ в три разные стороны.
Зачем это нужно знать
Если вы запускаете стриминговый сервис, OTT-платформу, e-learning-библиотеку или сервис видеоконференций, ваш CDN-счёт растёт линейно с битрейтом, а пользовательское восприятие качества – нелинейно. Каждый процент экономии при том же качестве – реальные деньги. Но планировать вокруг маркетинга вендоров нельзя: слайд с «на 70% эффективнее AV1» нужно читать через призму теоретического максимума, иначе вы заложите кодинг-ферму под цифру, которая никогда не приедет. Эта статья даёт инструменты для чтения подобных заявлений: что на самом деле такое предел Шеннона, что он ограничивает, а что нет; где сидят conventional- и нейросетевые кодеки в 2026 году; и как оценить – для вашего контента и вашего целевого качества – сколько ещё осталось места.
Что Шеннон сказал в 1948 году
Статья Клода Шеннона A Mathematical Theory of Communication 1948 года сделала две связанные вещи. Во-первых, он ввёл число – энтропию (обозначается H), которое измеряет среднее количество информации в источнике: среднее число бит на символ при заданном распределении символов источника.1 Слово «среднее» здесь принципиально. Если источник всегда выдаёт один и тот же символ, его энтропия равна нулю – последовательность полностью предсказуема, и описание её стоит в среднем ноль бит на символ. Если источник равновероятно выдаёт один из 256 символов, его энтропия 8 бит – каждый символ максимально неожиданный.
Во-вторых, Шеннон доказал теорему о кодировании источника: lossless-сжать источник ниже его энтропии невозможно без потери информации, а любая схема, использующая в среднем меньше бит на символ, чем H, обязана в среднем не суметь восстановить источник.2 Подойти к H сколь угодно близко можно – современные энтропийные кодеры (арифметическое кодирование, CABAC) укладываются в доли процента от предела. Но опуститься ниже – нет. Это и есть lossless-пол.
Полезная аналогия. У запертого шкафа есть ключ, у ключа есть минимальное число бит, нужное чтобы описать его форму. Можно упаковать ключ в меньший конверт, изогнув его аккуратно, но сам ключ ровно N бит. Усохнуть может только конверт.
Для видео lossless-пол важен в архивировании и медицинской визуализации, где живут форматы FFV1, ProRes 4444 и JPEG-XL, но это не та область, где работают потребительские кодеки. Потребительские кодеки lossy: им разрешено выбрасывать информацию – и это открывает другую дверь.
Дверь в lossy: теория rate-distortion
В той же работе Шеннон определил второй предел, который уже применим к потребительскому видео. Функция rate-distortion R(D) даёт минимальный битрейт R, при котором источник можно закодировать так, чтобы средняя ошибка восстановления не превышала целевого искажения D.3 R(D) – кривая, а не число. По мере того как мы допускаем больше искажений (D растёт), требуемый битрейт R падает. Когда мы требуем почти идеального восстановления (D стремится к нулю), R приближается к энтропии H.
Форма кривой R(D) зависит от трёх вещей. Во-первых, от того, как выглядит сам источник: у low-motion talking-head своя кривая, у 4K-спортивной трансляции – другая, у компьютерной анимации – третья. Во-вторых, от того, как мерить искажение: MSE даёт одну кривую, SSIM – другую, VMAF – третью. В-третьих, от статистической модели источника: чем богаче модель (учитывающая пространственные и временны́е корреляции), тем ниже (плотнее) её R(D).
R(D) – правильный объект, чтобы сравнивать кодеки. Любой кодек, классический или нейросетевой, можно отметить точкой или кривой в координатах (R, D). Предел Шеннона – это нижне-левая огибающая: кривая, ниже которой не может опуститься ни один кодек для данного источника и данной метрики искажения. Прогресс кодеков из поколения в поколение – это медленное движение кривой кодека вниз, к пределу Шеннона.
Где сидят conventional-кодеки в 2026 году
Самые часто цитируемые межпоколенческие вехи коммерческих кодеков измеряют относительную экономию битрейта через Bjøntegaard delta rate (сокращённо BD-rate). BD-rate даёт среднее изменение битрейта между двумя кодеками при одинаковом объективном качестве, интегрированное по диапазону рабочих точек.4 Числа ниже – BD-rate-экономия относительно H.264, измеренная на стандартных тест-сетах JVET, преимущественно на HD и UHD-разрешениях.
HEVC (2013) выигрывает примерно 50% относительно H.264 на стандартизованном контенте, причём выигрыш больше на UHD, чем на HD, потому что большие coding tree units HEVC эффективнее обрабатывают плоские области в высоком разрешении.5 AV1 (2018) даёт примерно 30% относительно HEVC на том же контенте – или примерно 65% относительно H.264.6 VVC (2020) измеряется в 40–50% относительно HEVC на UHD-контенте, что в сумме даёт примерно 75% относительно H.264.7 На 8K-разрешении измерения BBC R&D, опубликованные в конце 2024, дают VVC 78% экономии, AV1 – 63%, HEVC – 53%, все относительно H.264.8
AV2, финализированный в конце 2025, добавляет ещё 30–40% относительно AV1 на внутренних тест-сетах Google.9 В сумме это примерно 77% относительно H.264 – почти то же самое, что VVC. AOMedia и проект JVET (который выпускает VVC и экспериментальные расширения ECM) теперь укладываются друг в друга в пределах нескольких процентных пунктов на большинстве контента.
Виден полезный паттерн. Переход H.264 → HEVC – halving на 50%. HEVC → AV1 – треть, 30%. AV1 → AV2 – снова треть, 30%. Абсолютный прирост каждого поколения уменьшается, но что важнее – оставшийся зазор уменьшается ещё быстрее. То есть каждому будущему поколению остаётся меньше места, на которое оно может претендовать. Предел Шеннона для естественного видео по conventional-метрикам искажения уже не бесконечно далёк.
| Кодек | Год | BD-rate vs H.264 | Примечание |
|---|---|---|---|
| H.264 / AVC | 2003 | 0% (база) | Рабочая лошадка интернета |
| HEVC / H.265 | 2013 | -50% | Патентный клубок замедлил внедрение |
| AV1 | 2018 | -65% | Royalty-free; 30% просмотров Netflix в 2025 |
| VVC / H.266 | 2020 | -75% | Лучший conventional-стандарт; слабая market traction |
| AV2 | 2025 | -77% | ~30% над AV1; AOMedia финализировала в конце 2025 |
Это типичная кривая diminishing returns любой зрелой технологии. Мы ещё не на полу – место для роста остаётся, особенно на high-motion и high-resolution-контенте – но место это становится тоньше с каждым циклом.
Новая координата: восприятие
Долгое время сообщество кодеков измеряло прогресс вдоль осей (R, D) объективными метриками искажения вроде PSNR или SSIM. Грязный секрет этих метрик: они плохо коррелируют с тем, что реально видит человеческий зритель. Картинка может иметь низкий MSE и выглядеть ужасно (восковые over-smoothed-лица), или высокий MSE и выглядеть отлично (реалистичное зерно, чёткие текстуры). VMAF от Netflix стал большим шагом вперёд, потому что коррелирует с субъективными оценками лучше, но это всё ещё per-frame-регрессия на фиксированную модель наблюдателя.
В 2018 и 2019 годах Йохай Блау и Томер Михаэли опубликовали серию статей, которая по-новому поставила задачу и стала центральной для области.10 Они показали, что искажение и перцептивное качество математически противоречат друг другу: при фиксированном битрейте нельзя одновременно минимизировать MSE и дивергенцию между распределением восстановленных кадров и распределением натуральных кадров. Два критерия trade-off-ятся между собой, и этот trade-off задаёт точную функцию rate-distortion-perception (RDP).11
Практическое следствие: при заданном битрейте картинку можно оптимизировать на «выглядит правильно» (правдоподобный кадр из того же распределения) ценой того, что она будет «немного неверной» (каждый пиксель отличается от оригинала чуть сильнее, чем нужно). Или наоборот – оптимизировать на pixel-accuracy ценой того, что выглядеть это будет чуть деградировано. Одновременно минимизировать обе цели нельзя. Современные нейросетевые кодеки, которые можно обучать против любой дифференцируемой функции потерь, начали это эксплуатировать: они сидят на другой части RDP-поверхности, чем conventional-кодеки.
Где сейчас стоят нейросетевые кодеки
Нейросетевой видеокодек заменяет некоторые (или все) hand-designed-блоки conventional-кодера – преобразование, prediction, entropy coder – на обученную модель. Обучают её прямо на rate-distortion-цели (или rate-distortion-perception) методом стохастического градиентного спуска, что позволяет ей эксплуатировать статистические регулярности в естественном видео, которые hand-coded-блоки упускают.
Линия работ Microsoft Research под именем DCVC – самая цитируемая. DCVC-DC (2023) стал первым нейросетевым видеокодеком, обогнавшим VTM (референсный VVC) на стандартных тест-сетах JVET в режиме intra-period 32. DCVC-FM (2024), с feature modulation и multi-scale temporal context, обходит VTM на 25.5% по BD-rate на том же тест-сете в более жёстком режиме intra-period -1 (один intra-кадр в начале, дальше неограниченный inter prediction).12 DCVC-RT (CVPR 2025) – первый real-time нейросетевой кодек: достигает примерно 21% BD-rate-выигрыша над VVC на framerate-ах, сопоставимых с conventional-энкодерами.13
Более свежий бенчмарк, опубликованный на CVPR 2025, оценивал DCVC-FM, DCVC-DC, ECM (экспериментальный кодек JVET, стоящий над VVC) и AVM (экспериментальный кодек AOM, ставший AV2). По VMAF на 4K-контенте DCVC-FM даёт экономию битрейта больше 8% относительно AVM, сравнима с ECM, и больше 37% относительно HEVC.14 При более аккуратном измерении перцептивного качества – через LPIPS или FID относительно распределений референсного видео – нейросетевые кодеки уходят дальше.
Загвоздка в 2026 та же, что и у нейросетевых кодеков с момента их появления: compute. Нейросетевому декодеру нужен GPU или мощный NPU, он работает на порядки выше по энергопотреблению, чем аппаратный HEVC-декодер, и пока не присутствует в кремнии потребительских устройств. «Real-time» бенчмарки DCVC-RT гоняются на NVIDIA RTX 4090 – настольной карте на 450 Вт. Для VOD-преэнкодинга (где GPU тратится один раз, а отбивается на каждом воспроизведении) и облачного транскодинга это ОК, но это пока не кодек доставки.
Насколько далёк предел Шеннона на самом деле
Полезный способ оценить – сравнить лучший текущий кодек с нижней оценкой R(D), вычисленной из источника. Для естественного видео на умеренных степенях сжатия несколько независимых оценок ложатся в одно русло. Теоретические работы на гауссовских моделях говорят, что оставшийся зазор от VVC и DCVC-FM до неограниченной границы R(D) находится в диапазоне однозначных процентов на типичных стриминговых битрейтах, и несколько больше на очень-низко-битрейтных рабочих точках.15 То есть для рабочих 1080p и 4K-битрейтов, где живёт большая часть интернет-просмотров, структурный пол близок настолько, что вряд ли осталось больше одного-двух больших поколенческих шагов по conventional-метрикам.
Две важные оговорки. Во-первых, этот пол не одно число – он зависит от метрики искажения. По PSNR пол близок. По перцептивным метрикам (VMAF, LPIPS) пол ниже (можно сильнее отличаться от оригинала попиксельно и всё равно выглядеть так же), и там осталось больше места. Во-вторых, RDP-поверхность вводит третью ось – восприятие – и пол по ней сложнее оценить, потому что у цели «перцептивная дивергенция» много возможных определений, и у каждого свой нижний предел.
Практический вывод: вопрос «сколько ещё компрессии осталось» делится на три:
- По PSNR и conventional MSE: однозначные проценты над VVC и AV2. Места почти не осталось.
- По перцептивным метрикам (VMAF, LPIPS): 20–40% запас, в основном доступный только нейросетевым кодекам, обученным под эти потери.
- По оси восприятия в RDP: большой запас, но вопрос смещается с «как мало бит» к «насколько натурально выглядит восстановление», а это уже другая цель.
Заголовок «70% улучшение компрессии» в 2026 году почти всегда измерен на перцептивной оси, под которую conventional-кодеки никогда не оптимизировались. Это правда – нейросетевые кодеки реально дают более натурально выглядящее видео при том же битрейте – но это не то же число, что «60% лучше HEVC», которое AV1 показывал по VMAF в 2018-м.
Распространённая ошибка: трактовать «предел Шеннона» как одно число
Самое дорогое заблуждение в этой области – допущение, что есть один «предел Шеннона», который можно процитировать для «видео», как есть одна скорость света. Нет. Функция rate-distortion R(D) зависит от:
- Источника. У 4K-спортивного стрима R(D) одна, у low-motion-лекционного видео – другая. У анимации – отличная от обеих.
- Метрики искажения. PSNR, SSIM, VMAF и LPIPS дают разные кривые на том же источнике.
- Статистической модели. Простая блочно-IID-гауссовская модель даёт одну R(D); temporally-correlated mixture model – гораздо более низкую R(D); глубокий авторегрессионный prior – ещё ниже.
Так что правильный способ читать заявление вендора – это «vs какой кодек, на каком контенте, по какой метрике, в какой рабочей точке». Заявление «на 30% лучше AV1» без контекста – это примерно подбрасывание монетки: на каком-то контенте и какой-то метрике оно окажется правдой, на каком-то – нет. Методология Бьонтегора и была придумана, чтобы стандартизовать этот разговор; JVET Common Test Conditions и AOM CTC задают, какие именно последовательности и какие именно конфигурации используются в академических сравнениях.16 Если заявление вендора не ссылается ни на одну из этих CTC – это маркетинг, а не измерение.
Рабочий пример: бюджет предела Шеннона на 4K SDR-каталог
Чтобы заякорить числа, представим стриминговый сервис с каталогом 10 000 часов 4K SDR, закодированным сейчас в HEVC Main 10 при среднем 12 Mbps. Каталог весит 10 000 × 3600 × 12 000 000 ÷ 8 = 54 TB. CDN-эгресс при 10x месячных воспроизведений каталога – 540 TB.
Переход на AV1 при том же качестве экономит примерно 30% относительно HEVC на таком контенте: новый битрейт около 8.4 Mbps, каталог около 38 TB, эгресс около 380 TB. При типичной CDN-цене 2026 года примерно 0.01 доллара за GB на tier-1-провайдере это (540 - 380) × 1000 × 0.01 = 1600 долларов в месяц, или 19 200 долларов в год экономии на относительно небольшой библиотеке.
Переход на лучший будущий conventional-кодек – AV2 или VVC – добавит ещё 5–8 процентных пунктов поверх AV1, возможно ещё 1000 долларов в месяц. Дальнейший переход на будущий нейросетевой кодек, обученный на перцептивных потерях, может дать ещё 15–20%, но ценой compute-стоимости декодера – пока потребительский кремний не получит нейросетевого декодера, эта экономия теоретическая для доставки и реальна только в облачном транскодинге.
Арифметика – пуант. Остаточный структурный запас сжатия conventional-кодеков на реальном CDN-бюджете – это несколько тысяч долларов в месяц на 10 000 часов каталога. Этого достаточно, чтобы оправдать смену кодека раз в пять-шесть лет, но недостаточно, чтобы в одиночку финансировать многолетнюю R&D-программу. Нейросетевые кодеки переписывают арифметику, потому что открывают другую ось (восприятие) и другой тип экономии, но они же и переписывают compute-стоимость.
Где здесь Фора Софт
Мы делаем системы видеостриминга, OTT, e-learning, телемедицины, видеоконференций и AR/VR, где решения по эффективности кодеков попадают в quarterly line items. Рамка, которую мы предлагаем продуктовым командам, та же, на которой заканчивается эта статья: разделить вопрос «сколько бит нам нужно на нашем контенте при нашей планке качества» и вопрос «сколько бит возможно в принципе». Первый ответ – это ваша инженерная цель; второй говорит, когда перестать ждать слишком многого от каждого нового поколения. В OTT- и e-learning-внедрениях мы обычно меряем first-party-R(D)-кривые на реальном клиентском контенте, а не полагаемся на стандартизованные тест-сеты, потому что неверное базовое предположение может промахнуться по CDN-контракту на 20% в любую сторону.
Подводный камень: оптимизация под неправильную цель
Инженеры, уже работающие с кодеками, иногда тратят optimisation-бюджет на снижение PSNR в рабочих точках, где PSNR уже не коррелирует с воспринимаемым качеством. Классический симптом – per-title encoding ladder, который хорошо стоит по объективным метрикам, но при субъективном просмотре на лицах появляется «воск», текстуры размазываются, градиенты неестественно гладкие. Лечение – выбрать метрику (или комбинацию, включая перцептивные вроде VMAF и learned-perceptual вроде LPIPS), которая соответствует тому, как ваша аудитория реально судит качество, и оптимизировать под неё. Иначе кодек продолжит двигаться вниз по кривой R(D), но не по той оси, и картинка будет выглядеть хуже на более низком битрейте.
Ключевые выводы
- Функция rate-distortion R(D) Шеннона – это математический пол lossy-сжатия при заданной планке качества.
- Пол – не одно число: он зависит от источника, метрики искажения и статистической модели.
- Conventional-кодеки 2026 года (VVC, AV2) сидят в пределах однозначных процентов от пола R(D) по PSNR на типичных стриминговых битрейтах.
- Нейросетевые кодеки (DCVC-FM, DCVC-RT) сравнялись с VVC или обходят его, особенно на перцептивных метриках.
- RDP-поверхность Блау–Михаэли добавляет третью ось, где значимый запас ещё остаётся.
- Следующие поколения будут давать меньший абсолютный выигрыш – но и оставшийся зазор тоже меньше.
Что читать дальше
- Краткая история видеокодеков: от H.120 до AV2
- Объективные метрики качества: PSNR, SSIM, MS-SSIM, VMAF
- Сравнительная таблица: MPEG-2, H.264, H.265, VP9, AV1, VVC
Источники
- Shannon, C. E. (1948). «A Mathematical Theory of Communication». Bell System Technical Journal. Основополагающая статья теории информации; определяет энтропию и доказывает теорему о кодировании источника. https://people.math.harvard.edu/~ctm/home/text/others/shannon/entropy/entropy.pdf. Доступ 2026-05-16.
- Теорема Шеннона о кодировании источника – Wikipedia, описание lossless-предела на скорости энтропии. https://en.wikipedia.org/wiki/Shannon%27s_source_coding_theorem. Доступ 2026-05-16.
- Rate-distortion theory – Wikipedia. Определение R(D), минимальной скорости кодирования источника при ограничении на искажение. https://en.wikipedia.org/wiki/Rate%E2%80%93distortion_theory. Доступ 2026-05-16.
- Bjøntegaard, G. (2001). «Calculation of average PSNR differences between RD-curves». VCEG-M33. Методология BD-rate, которой команды кодеков пользуются для сравнения. https://www.itu.int/wftp3/av-arch/video-site/0104_Aus/VCEG-M33.doc. Доступ 2026-05-16.
- Sullivan, G. J. et al. (2012). «Overview of the High Efficiency Video Coding (HEVC) Standard». IEEE Transactions on Circuits and Systems for Video Technology. ~50% BD-rate-экономии HEVC над H.264 на тест-сетах JVET. https://ieeexplore.ieee.org/document/6316136. Доступ 2026-05-16.
- Chen, Y. et al. (2020). «An Overview of Coding Tools in AV1». APSIPA Transactions on Signal and Information Processing. AV1 даёт в среднем ~30% BD-rate-выигрыша над HEVC в random-access-конфигурациях. https://www.cambridge.org/core/journals/apsipa-transactions-on-signal-and-information-processing/article/overview-of-coding-tools-in-av1-the-first-video-codec-from-the-alliance-for-open-media/. Доступ 2026-05-16.
- Bross, B. et al. (2021). «Overview of the Versatile Video Coding (VVC) Standard and its Applications». IEEE TCSVT. VVC ~40–50% BD-rate-выигрыша над HEVC на UHD-контенте. https://ieeexplore.ieee.org/document/9503377. Доступ 2026-05-16.
- Performance Comparison of VVC, AV1, HEVC, and AVC for High Resolutions (2024). MDPI Electronics. BD-rate-экономии на 8K: VVC -78%, AV1 -63%, HEVC -53% vs H.264. https://www.mdpi.com/2079-9292/13/5/953. Доступ 2026-05-16.
- AOMedia AV2 open video codec release nears, delivers around 40% bandwidth reduction (2025-11). CNX Software. Эффективность AV2 над AV1: 28.6% по YUV-PSNR, 32.6% по VMAF; ~30% среднее. https://www.cnx-software.com/2025/11/21/aomedia-av2-open-video-codec-release-nears-delivers-around-40-bandwidth-reduction/. Доступ 2026-05-16.
- Blau, Y., Michaeli, T. (2018). «The Perception-Distortion Tradeoff». CVPR 2018. Доказывает, что искажение и перцептивное качество математически противоречат друг другу при фиксированном битрейте. https://arxiv.org/abs/1711.06077. Доступ 2026-05-16.
- Blau, Y., Michaeli, T. (2019). «Rethinking Lossy Compression: The Rate-Distortion-Perception Tradeoff». ICML 2019. Вводит RDP-функцию как обобщение R(D) Шеннона. https://arxiv.org/abs/1901.07821. Доступ 2026-05-16.
- Li, J., Li, B., Lu, Y. (2024). «Neural Video Compression with Feature Modulation». CVPR 2024. DCVC-FM обходит VTM на 25.5% по BD-rate в intra-period -1. https://arxiv.org/abs/2402.17414. Доступ 2026-05-16.
- Jia, Z. et al. (2025). «Towards Practical Real-Time Neural Video Compression». CVPR 2025. DCVC-RT даёт ~21% BD-rate-выигрыша над VVC на real-time-framerate-ах. https://dcvccodec.github.io/. Доступ 2026-05-16.
- Benchmarking Conventional and Learned Video Codecs (2024). arXiv preprint. Кросс-кодек-сравнение DCVC-FM, ECM, AVM, AV1 по VMAF. https://arxiv.org/abs/2408.05042. Доступ 2026-05-16.
- Liu, J., Lu, G., Wang, Y. (2025). «Advances in Neural Video Compression: A Review and Benchmarking». Preprints.org. Обзор того, насколько близко текущие кодеки подошли к теоретической границе R(D) на естественном видео. https://www.preprints.org/manuscript/202604.0035. Доступ 2026-05-16.
- JVET Common Test Conditions и AOMedia Common Test Conditions – стандартизованные тест-сеты и конфигурации, которые делают BD-rate-сравнения осмысленными. https://www.itu.int/en/ITU-T/studygroups/2017-2020/16/Pages/video/jvet.aspx. Доступ 2026-05-16.