Self-hosting open-weights видеомоделей – HunyuanVideo, CogVideoX, Mochi и LTX-Video

Автор: Николай СапуновОбновлено: август 202626 мин чтения
Содержание статьи +

Кратко

Два предыдущих урока разбирали аренду видеомодели через closed API; этот – про обратный выбор: вы скачиваете модель и запускаете её на своём железе. В середине 2026 года мир open-weights определяют пять семейств – HunyuanVideo от Tencent, CogVideoX от Zhipu, Mochi от Genmo, LTX-Video и LTX-2 от Lightricks и Wan от Alibaba – и различаются они не столько качеством, сколько двумя вещами, которые реально решают судьбу проекта: что разрешает продавать лицензия и сколько памяти GPU нужно модели. Self-hosting почти никогда не экономит деньги на малых объёмах: аренда топового GPU стоит около двух-трёх долларов в час, а точка окупаемости против API лежит севернее примерно пяти тысяч клипов в месяц, если учесть инженеров, которые поддерживают систему. Self-hosting выбирают по трём причинам, не связанным с ценой за клип, – держать чувствительный контент на своих машинах, иметь лицензию для коммерческого продукта и дообучать модель под свою задачу, – и этот урок показывает, как понять, относится ли к вам хоть одна из них, прежде чем тратить деньги.

Зачем это нужно

Если вы делаете видеопродукт, рано или поздно кто-то задаёт очевидный вопрос: «вместо того чтобы вечно платить OpenAI или Runway, почему бы не запустить одну из этих бесплатных открытых моделей у себя?» Звучит как чистый способ срезать регулярный счёт – и иногда так и есть, но чаще это размен предсказуемого инвойса на непредсказуемый инженерный проект, и спрашивающие редко понимают, в каком они случае. Этот урок написан для основателя, продакт-менеджера или техлида, которому нужно ответить на этот вопрос цифрами, а не интуицией. Он опирается на урок про ландшафт generative video, где разобрано, что умеет каждая модель, и на урок про цены closed API, где посчитан путь «арендовать»; здесь мы считаем путь «владеть» и говорим, когда он выигрывает.

Что на самом деле значит «open-weights»

Начнём с самого термина, потому что в нём вся суть. Видеомодель внутри – это огромная таблица обученных чисел, миллиарды штук, которую называют весами модели. Веса – это то, что модель «знает»: прогоните картинку или промпт через них в правильном порядке, и на выходе получится видео. Closed-модель, как в предыдущих двух уроках, держит эту таблицу на серверах вендора, где вы её не видите; вы отправляете запрос через интернет и получаете клип обратно. Open-weights-модель – наоборот: вендор публикует всю таблицу для скачивания, и вы запускаете модель на своём компьютере, без единого запроса, покидающего ваше здание.

Простая аналогия – разница между заказать торт и получить рецепт. Closed API – это кондитерская: платите за каждый торт, кухню не видите и живёте по меню и часам кондитерской. Open weights – это опубликованный рецепт и ключи от кухни: теперь можно печь когда угодно, менять рецепт и печь тысячу тортов по цене ингредиентов, но придётся владеть печью, научиться печь и убирать за собой. Ни то ни другое не «лучше» в вакууме. Что выигрывает, зависит от того, сколько тортов вам нужно, насколько секретны ваши ингредиенты и разрешено ли перепродавать то, что выходит, – и именно на последнем пункте спотыкается большинство команд.

Одно предостережение, прежде чем идти дальше. «Open weights» – это не то же самое, что «делай что хочешь». Веса опубликованы, но к каждому прилагается лицензия – юридический документ, который описывает, что с ними можно делать, – и лицензии тянутся от «используй для чего угодно, включая платный продукт» до «только для исследований и личного использования, никакого коммерческого деплоя». Модель может быть бесплатной для скачивания и при этом нелегальной для встраивания в продукт, который вы продаёте. Мы будем проверять лицензию первой на каждой модели, а не последней.

Два вопроса, которые решают всё

До любого бенчмарка, до любого демо два вопроса сужают поле до одной-двух моделей, которые вообще стоит тестировать. Задавайте их в этом порядке.

Первый вопрос – «что разрешает продавать лицензия?» Это барьер «да/нет», и он первый, потому что никакое качество не имеет значения, если вы юридически не можете встроить вывод в продукт. Часть открытых видеомоделей несёт настоящую open-source-лицензию – золотой стандарт здесь Apache 2.0, – которая позволяет использовать вывод в коммерческом продукте, брать за него деньги, дообучать модель и никогда не спрашивать разрешения. Другие несут собственную лицензию, которая ограничивает коммерческое использование, ставит порог по выручке или запрещает его вовсе. Лицензия – жёсткий барьер: модель, не прошедшая его, выбывает, как бы хорошо она ни выглядела.

Второй вопрос – «влезет ли она в GPU, который я могу себе позволить?» GPU – graphics processing unit – это специализированный чип, который запускает такие модели, и важна его VRAM, видеопамять в гигабайтах (GB), которая держит модель во время работы. Если модели нужно больше VRAM, чем есть у вашего GPU, она просто не запустится – как программа, которой нужно больше памяти, чем есть у ноутбука. Видеомодели прожорливы: полные версии самых крупных требуют 60 GB и больше, то есть аренды дата-центровых карт, а урезанные версии влезают в 8–16 GB, которые несёт потребительская игровая карта. Первым вы упираетесь в стену VRAM, а не в скорость.

Получите эти два ответа – и остальное решение становится настройкой. Ошибётесь – и сожжёте неделю, строя на модели, которую не можете легально продать или физически запустить.

Рис. 1. Фильтр из двух барьеров. Лицензия – первый барьер, потому что это юридическое «да/нет»; VRAM – второй, потому что это физическое «да/нет». Качество лишь разрешает ничью между моделями, прошедшими оба.

Пять семейств, которые вы реально рассмотрите

В мире open-weights видео десятки моделей, но в продакшене середины 2026 почти всю реальную работу делают пять семейств. Разберём каждое простыми словами, затем поставим рядом. Для каждого сначала смотрим лицензию и VRAM; качество – это разрешение ничьей, чем оно и является.

HunyuanVideo (Tencent) – лидер качества с оговоркой в лицензии

HunyuanVideo – open-weights-модель Tencent, и сейчас важна версия HunyuanVideo 1.5, вышедшая в ноябре 2025. Главное в том, что Tencent сделала её меньше, не сделав хуже: ядро – денойзинг-бэкбон, та часть, что шаг за шагом превращает визуальный шум в чистую картинку, – сжалось с 13 миллиардов обученных чисел в первой версии до 8.3 миллиарда в 1.5. Меньше ядро, меньше памяти, то же качество вывода. Умеет и text-to-video (печатаете промпт – выходит клип), и image-to-video (даёте стоп-кадр плюс промпт, и модель оживляет фото в клип).

По памяти полноточная версия хочет примерно 24–28 GB VRAM, что уже превышает потребительскую карту. Но тут приходит вторая большая идея – quantization: хранить каждое из этих миллиардов чисел в меньшем, менее точном формате, чтобы сэкономить память, ценой небольшой потери в точности. Стандартный малый формат называется FP8 (восемь бит на число вместо шестнадцати), и FP8-сборка HunyuanVideo 1.5 опускается примерно до 14–16 GB – в пределах досягаемости топовой потребительской GPU. Сдвиньте ещё дальше, перенеся часть модели, читающую текст, в обычную системную память (это называется offloading), и след на GPU может упасть до диапазона 8–12 GB – медленно, но работает на обычной игровой карте. Ожидайте около 75 секунд на рендер одного короткого клипа 480p на RTX 4090.

Оговорка – в лицензии. HunyuanVideo 1.5 идёт под Tencent Hunyuan Community License, а не Apache 2.0. Она разрешает исследовательское и личное использование, но ограничивает коммерческий деплой – есть условия и пороги, которые нужно прочитать, прежде чем встраивать вывод в продукт на продажу. Если вы строите коммерческую фичу, это та модель, чью юридическую страницу читают дважды. Лидер качества, звёздочка в лицензии.

CogVideoX (Zhipu ИИ) – дружелюбная рабочая лошадка с малой VRAM

CogVideoX от Zhipu ИИ (веса лежат под аккаунтом zai-org) – модель, с которой большинство команд начинают, и причина во втором барьере: её действительно легко запустить. Есть два основных размера – 2 миллиарда и 5 миллиардов параметров – плюс обновлённое поколение CogVideoX 1.5. Модель 5B влезает примерно в 8 GB VRAM при правильных настройках – мало для карты среднего уровня вроде RTX 3060, – а 2B работает на железе нескольких лет от роду.

Две вещи объясняют её репутацию. Во-первых, лицензия дружелюбна на младшем конце: CogVideoX-2B идёт под Apache 2.0, чистой коммерческой лицензией. Старшая 5B несёт собственную лицензию CogVideoX с условиями, так что то же правило «читать дважды» действует по мере роста. Во-вторых, она бьёт выше своего размера по следованию промпту – насколько точно клип соответствует тому, что вы просили, – благодаря эффективному 3D Causal VAE, компоненту сжатия, который ужимает видео, не теряя деталей, делающих промпт точным. Компромисс – длина и разрешение: оптимум 5B-модели – шестисекундный клип в 720×480, а не кинематографический кадр 4K. CogVideoX берут, когда «работает на GPU, который у нас уже есть» важнее, чем «побеждает в конкурсе красоты».

Mochi 1 (Genmo) – большая, свободная, прожорливая по железу

Mochi 1 от Genmo на момент релиза была крупнейшей опубликованной открытой видеомоделью – 10 миллиардов параметров – и несёт лицензию, которую инженеры хотят видеть больше всего: Apache 2.0, бесплатно для коммерции, без потолка выручки, без разрешений. Построена на архитектуре AsymmDiT, которая намеренно тратит почти вчетверо больше мощности на картинку, чем на чтение текста, и это видно как сильное, плавное движение.

Цена этого размера – железо. Полноточная Mochi 1 хочет около 60 GB VRAM и на практике четыре дата-центровые карты H100, чтобы работать комфортно, – твёрдо за пределами потребительского диапазона. Сообщество это срезало: вариант в bfloat16 идёт около 22 GB, а сборка под ComfyUI ужимается ниже 20 GB, выводя модель на одну топовую карту при сниженных настройках. Mochi выбирают, когда нужна свободная коммерческая лицензия на крупной модели с сильным движением и есть (или можно арендовать) серьёзные GPU. Свободная лицензия, тяжёлый след.

LTX-Video и LTX-2 (Lightricks) – скорость и новинка с 4K и звуком

Lightricks сделала другую ставку – на скорость. LTX-Video была первой моделью своего класса, способной генерировать качественные клипы в реальном времени: на подходящем железе она выдаёт видео 30 кадров в секунду в 1216×704 быстрее, чем вы успеваете его смотреть. Идёт в размерах 2 и 13 миллиардов, с дистиллированными (сжатыми под скорость) сборками, влезающими в потребительскую VRAM. Лицензия – собственная open-weights-лицензия Lightricks, и примечательно, что 13B-модель бесплатна для лицензирования компаниям с годовой выручкой до $10 млн – намеренный трамплин для стартапов, с платным тарифом выше этой черты.

Более крупная история 2026 года – LTX-2, которую Lightricks анонсировала в октябре 2025 и полностью открыла – веса, инференс-код и тренировочный код, под чистой лицензией Apache 2.0 (бесплатно для коммерции компаниям с выручкой до $10 млн в год; выше – корпоративный тариф с поддержкой) – 6 января 2026. LTX-2 – первая готовая к продакшену открытая модель, генерирующая синхронные видео и звук за один проход в нативном 4K-разрешении и 50 кадрах в секунду, с lip-sync и фоновым звуком, из 14 миллиардов видеопараметров плюс 5 миллиардов аудиопараметров (19 миллиардов суммарно). Эта способность «одна модель, картинка и звук вместе» – то, чего ни одно из других четырёх открытых семейств не имело в начале 2026 года, и это самый свежий факт в уроке – большинство конкурирующих статей всё ещё описывают LTX как немое видео. Если вашему сценарию нужен звук, сгенерированный с картинкой, LTX-2 – открытый вариант, у которого он есть.

Wan (Alibaba) – лидер бенчмарков с трендом в лицензировании

Wan, семейство Alibaba, держит вершину открытого лидерборда. Wan 2.1 и Wan 2.2 выпущены под Apache 2.0 – чистой коммерческой лицензией, – и Wan 2.2 показывает наивысший публично подтверждённый open-source-результат VBench, около 84.7%. (VBench – стандартная шкала для видеогенераторов; выше агрегат – лучше общее качество по движению, согласованности и точности.) Wan 2.2 использует дизайн Mixture-of-Experts – 27 миллиардов параметров всего, но лишь 14 миллиардов включены на любой отдельный клип, приём, удерживающий рабочую память в управляемых рамках, – и меньшая dense-версия на 5 миллиардов работает на 8 GB-карте в 720p. Wan ведёт среди открытых моделей по человеческим лицам, коже и волосам и по промптам с несколькими взаимодействующими субъектами.

Тренд, за которым стоит следить, – направление лицензирования. Новые релизы Alibaba – Wan 2.5 и выше – перешли на API-first-модель, где новейшая версия доступна через сервис Alibaba Cloud, а не публикуется как open weights, и открытые релизы (если они будут) отстают. Поэтому правило для Wan в 2026-м точное: открытый, под Apache 2.0, self-hostable Wan, на который сегодня можно полагаться, – это 2.1 и 2.2; новейшие нумерованные версии могут быть только для аренды. Всегда сверяйте лицензию именно той версии, которую собираетесь релизить, – не считайте, что «Wan открыт» покрывает последний релиз.

Рис. 2. Пять семейств рядом. Сначала читайте столбец лицензии и столбец VRAM; столбец сильной стороны – разрешение ничьей среди моделей, прошедших оба барьера.

Главное решение: self-host или аренда?

Теперь вопрос, который и приводит команды на этот путь, – и честный ответ: «обычно аренда, иногда self-host, и решающий фактор редко цена за клип». Докажем это арифметикой, потому что интуиция «бесплатная модель = бесплатное видео» – самая дорогая ошибка в этой области.

Стоимость self-hosted-клипа – это часы GPU, а не ноль

Скачать модель бесплатно. Видео – нет, потому что его генерация занимает дорогой GPU на реальные секунды, а GPU стоит денег, владеете вы им или арендуете. В середине 2026 топовая дата-центровая карта H100 арендуется примерно за $2–2.70 в час на сервисе вроде RunPod, с более дешёвыми прерываемыми «spot»-ставками около $1.30–1.60. Стоимость одного клипа – это просто доля того часа, которую занял ваш рендер.

Пройдём расчёт вслух один раз. Допустим, ваша модель и настройки рендерят один клип за три минуты на H100, который вы арендуете за $2.40 в час:

стоимость клипа = (минуты рендера ÷ 60) × часовая ставка GPU
               = (3 ÷ 60) × $2.40
               = 0.05 × $2.40
               = $0.12 за клип

Двенадцать центов – примерно столько Runway берёт за секунду через API, а не за клип. Так что на первый взгляд self-hosting выглядит дёшево. Но эти двенадцать центов – только часы GPU. Сюда не входят простой GPU между задачами (вы арендуете его по часам, а не по секундам реальной работы), инженеро-дни на настройку и постоянная стоимость поддержки. Именно эти числа сдвигают решение.

Точка окупаемости – это объём, и она выше, чем кажется

Отраслевые расчёты затрат 2026 года кладут перелом прямо: ниже примерно 5 000 клипов в месяц маршрутизация через платный API без всей инфраструктуры – выбор дешевле и здоровее; self-hosting начинает окупаться только выше, и даже тогда лишь при загруженных GPU. Причина – в той части, которую скрывает расчёт «за клип».

Во-первых, настройка не бесплатна: поднять открытую видеомодель – установить нужные драйверы GPU, скачать десятки гигабайт весов, уместить модель в VRAM и отладить неизбежные конфликты версий – это примерно 20–40 инженеро-часов до первого продакшен-клипа. Во-вторых, поддержка не бесплатна: обновления модели, апгрейды зависимостей и работа над надёжностью добавляют постоянную нагрузку, которую расчёты затрат сводят к множителю 3–5× поверх голой аренды GPU. GPU за $1 700 в месяц аренды легко стоит $5 000–8 000 в месяц, если посчитать людей, которые его поддерживают. В-третьих, простаивающий GPU всё равно тарифицируется – если трафик неровный, вы платите и за тихие часы, а это ровно та неэффективность, которую API убирает, беря плату только за сделанную работу.

«Частая ошибка: считать self-hosting как «бесплатная модель × электричество». Команды сравнивают цену API за клип с self-hosted-ценой за клип около нуля и заключают, что self-hosting выигрывает с огромным отрывом. На малых объёмах он почти никогда не выигрывает, потому что реальная self-hosted-стоимость – это часы GPU, тарифицируемые круглосуточно, плюс множитель операций 3–5×, плюс 20–40 часов настройки до первого клипа. Всегда сравнивайте счёт API с полной self-hosted-стоимостью – аренда GPU, простой, амортизированная настройка и инженеры, которые её нянчат, – а не только с часами GPU.»

Так когда self-hosting реально выигрывает?

Если цена за клип редко его оправдывает, что оправдывает? Три причины, и ни одна из них – не заглавная стоимость.

Первая – резидентность данных и приватность. Если ваш контент чувствителен – медицинское видео в телемедицине, лица в видеонаблюдении, приватные пользовательские загрузки, – отправка его в сторонний API может быть неприемлема по юридическим или договорным причинам. Self-hosting держит каждый кадр на машинах, которые вы контролируете, и это может быть единственной причиной так поступить, цена побоку.

Вторая – объём. За чертой в 5 000+ клипов в месяц при действительно загруженных GPU стоимость собственной инфраструктуры на клип падает ниже платы API за клип, и экономия накапливается. Высокий устойчивый объём – тот случай, которого ждала арифметика «за клип».

Третья – лицензия и кастомизация. Только открытая модель позволяет fine-tune – слегка дообучить модель на своих примерах, чтобы она усвоила ваш конкретный стиль, продукт или домен, – и только свободно лицензированная открытая модель (Apache 2.0) позволяет релизить эту кастомизированную модель внутри продукта, который вы продаёте, без платы за вызов и без вендора, способного поменять условия или закрыть эндпоинт под вами. Если преимущество вашего продукта зависит от поведения модели, которого не даёт ни один API, self-hosting – не дешёвый путь, а единственный.

Рис. 3. Почему решает объём, а не цена за клип. Self-hosted-линия стартует высоко и остаётся почти ровной; API-линия стартует с нуля и растёт. Они пересекаются около 5 000 клипов в месяц – и три неценовые причины могут перевесить всю кривую.

Как вы это реально запускаете

Допустим, оба барьера пройдены и решение в пользу self-hosting. Как выглядит запуск открытой видеомодели на практике? Код рендеринга вы не пишете с нуля; вы опираетесь на одну из двух экосистем, к которым сошлось всё поле.

Первая – ComfyUI, визуальный инструмент, где вы собираете пайплайн генерации как диаграмму из связанных блоков: загрузить модель тут, подать промпт там, задать разрешение, забрать клип. Это среда художников и тинкереров, и, что важно, именно здесь сообщество выкладывает оптимизации памяти – FP8-quantization и трюки offloading, позволяющие 60-гигабайтной модели работать на карте с 20 GB. Если хотите протестировать пять моделей за неделю без кода, ComfyUI – то место.

Вторая – diffusers, Python-библиотека от Hugging Face, которая позволяет вашему коду загружать и запускать эти модели в несколько строк, одинаково для каждой. Это путь в продакшен: diffusers – то, что импортирует ваш бэкенд-сервис, когда пользователь жмёт «сгенерировать», и ваши серверы делают работу. Причина сгруппировать эти пять семейств в один урок в том, что все они идут с поддержкой diffusers и ComfyUI, так что окружающий код почти не меняется при замене одной модели на другую – тот же урок, что дал adapter для closed API, теперь на открытой стороне.

Если замеренное время рендера слишком велико для вашего продукта – это не тупик: семейство приёмов ускорения может срезать его в разы, мы разбираем их в уроке про ускорение диффузии. А если проблема не в скорости, а в том, чтобы держать один и тот же персонаж, сцену и движение камеры через множество клипов, – это отдельная дисциплина, разобранная в уроке про согласованность в продакшене.

Порядок действий в реальном проекте поэтому такой: выбрать модель двумя барьерами; прототипировать в ComfyUI, чтобы подтвердить качество на ваших реальных промптах; замерить время рендера на GPU, который будете арендовать, чтобы сделать расчёт затрат выше с реальными числами; затем встроить в бэкенд через diffusers за тем же adapter, что описал урок про closed API, сохранив свободу переключаться. Не считайте постоянной инфраструктурой и открытую модель: поле выпускает модель получше примерно раз в квартал, а дрейф Wan к API-first – напоминание, что у сегодняшних open weights не гарантирован открытый преемник.

Разбор: три типичные ситуации

Абстрактным правилам легче доверять, когда видишь, как они решают реальный выбор. Три коротких сценария, каждый решён двумя барьерами плюс кривой затрат.

Телемед-стартап хочет анимировать поясняющие клипы процедур, контент близок к пациентским данным, объём низкий. Резидентность данных доминирует, объём инфраструктуру не оправдывает – но причина приватности всё равно может склонить к self-hosting на малом арендованном приватном GPU с выбором CogVideoX 5B за низкую VRAM и достаточно чистую лицензию, либо к API с подписанным договором об обработке данных, если он приемлем. Решает барьер приватности, а не стоимость.

OTT-команда постпродакшена нуждается в сотнях B-roll-клипов в день, каждый день, со звуком, и продаёт готовый контент. Объём проходит окупаемость, звук обязателен, вывод коммерческий – значит LTX-2 (синхро аудио-видео 4K, open weights) на собственных или стабильно арендуемых дата-центровых GPU – сильный выбор, и стоимость за клип на таком объёме реально бьёт API. Решают объём и аудиовозможность.

Конференц-продукт хочет небольшой дообученный генератор аватаров, встроенный в приложение и поставляемый клиентам. Кастомизация и лицензия «на продажу» доминируют, поэтому модель под Apache 2.0Wan 2.2 или Mochi 1 – единственный жизнеспособный класс: дообучить под стиль аватаров продукта и поставить внутри приложения. Решает причина «лицензия плюс fine-tune»; здесь self-hosting – не дешёвый путь, а единственный. (Для говорящих голов и аватаров конкретно – урок про lip-sync и аватары сравнивает специализированные модели.)

Где здесь Фора Софт

Мы делаем видеопродукты в видеоконференциях, стриминге и OTT, видеонаблюдении, e-learning, телемедицине и AR/VR, и вопрос «self-host или аренда» ложится нам на стол в каждой из этих областей. В телемедицине и видеонаблюдении обычно решает барьер приватности: контент не может покинуть среду заказчика, поэтому открытая модель на контролируемом железе – единственный комплаентный маршрут. В OTT и e-learning, где команды генерируют большие объёмы вспомогательных клипов и владеют выводом, арифметика объёма и лицензия толкают к self-hosted, дообученным открытым моделям за переключаемым adapter. Работа редко в самом коде рендеринга – diffusers делает его коротким, – она в подборе парка GPU, честном расчёте полной стоимости и сохранении возможности перейти на лучшую модель следующего квартала. Именно эта дисциплина отличает фичу, которая живёт год, от той, что ломается на следующем релизе.

Главное

  • Open-weights значит, что вы скачиваете и запускаете модель сами; лицензия всё равно решает, что можно продавать.
  • Сначала проверьте два барьера: разрешает ли лицензия коммерцию и влезает ли модель в VRAM вашего GPU.
  • Apache-2.0-модели (CogVideoX-2B, Mochi 1, Wan 2.1/2.2) – безопасный коммерческий выбор; Hunyuan и новый Wan требуют осторожности.
  • Self-hosting редко бьёт API по цене ниже примерно 5 000 клипов в месяц при полном учёте затрат.
  • Self-host ради приватности, объёма или fine-tune – а не ради одной лишь цены за клип.
  • LTX-2 (open, январь 2026) – главный свежий факт: нативный 4K-видео с синхро-звуком за один проход.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.