Self-hosting open-weights видеомоделей – HunyuanVideo, CogVideoX, Mochi и LTX-Video

Автор: Николай СапуновОбновлено: август 202626 мин чтения
Содержание статьи +

Кратко

Два предыдущих урока были посвящены аренде видеомодели через закрытый API; этот – о противоположном подходе: вы скачиваете модель и запускаете её на своём оборудовании. В середине 2026 года рынок open-weights определяется пятью семействами моделей – HunyuanVideo от Tencent, CogVideoX от Zhipu, Mochi от Genmo, LTX-Video и LTX-2 от Lightricks, а также Wan от Alibaba. Эти модели отличаются не столько качеством, сколько двумя ключевыми факторами, определяющими успех проекта: условиями лицензии на коммерческое использование и объёмом видеопамяти GPU, необходимым для работы.

Самостоятельный хостинг почти никогда не окупается при небольших объёмах: аренда топового GPU обходится примерно в два-три доллара в час, а точка безубыточности по сравнению с использованием API находится выше отметки около пяти тысяч клипов в месяц – с учётом затрат на инженеров, поддерживающих систему. Самостоятельный хостинг выбирают по трём причинам, не связанным с ценой за один клип: хранение конфиденциального контента на собственных серверах, наличие лицензии для коммерческого продукта и возможность дообучения модели под конкретные задачи. Этот урок поможет понять, применимы ли к вам хотя бы одна из этих причин, прежде чем тратить деньги.

Зачем это нужно

Если вы работаете с видеопродуктом, рано или поздно кто-то задаст очевидный вопрос: «почему бы не запустить одну из бесплатных открытых моделей локально, вместо того чтобы постоянно платить OpenAI или Runway?» На первый взгляд – это чистый способ сэкономить на регулярных расходах, и иногда так и есть. Но чаще это замена предсказуемого счёта на непредсказуемый инженерный проект, а задающие вопрос редко осознают, в какую сторону они идут. Этот урок предназначен для основателя, продукт-менеджера или техлида, которому нужно ответить на этот вопрос цифрами, а не интуицией. Он опирается на урок про ландшафт generative video, где разбирается, что умеет каждая модель, и на урок про цены closed API, где просчитан путь «арендовать»; здесь мы считаем путь «владеть» и говорим, когда он выгоднее.

Что на самом деле означает «open-weights»

Начнём с самого термина – ведь в нём и заключается суть. Видеомодель внутри – это огромная таблица обученных чисел, насчитывающая миллиарды значений, которую называют весами модели. Веса – это то, что модель «знает»: пропустите через них картинку или промпт в правильном порядке – и на выходе получите видео. Closed-модель, как в двух предыдущих уроках, хранит эту таблицу на серверах разработчика, где вы её не видите; вы отправляете запрос через интернет и получаете готовый клип. Open-weights-модель – наоборот: разработчик публикует всю таблицу для скачивания, и вы запускаете модель на своём компьютере, не отправляя ни одного запроса за пределы своего устройства.

Простая аналогия – разница между заказом торта и получением рецепта. Closed API – это кондитерская: платите за каждый торт, кухню не видите и живёте по меню и графику работы. Open weights – это опубликованный рецепт и ключи от кухни: теперь можно печь в любое время, менять рецепт и выпекать тысячу тортов по цене ингредиентов, но придётся владеть печью, научиться печь и убирать за собой. Ни один из вариантов не «лучше» сам по себе. Что окажется выгоднее, зависит от того, сколько тортов вам нужно, насколько секретны ваши ингредиенты и разрешено ли перепродавать результат – именно на этом последнем вопросе спотыкается большинство команд.

Одно предостережение перед тем, как двигаться дальше. «Open weights» – это не то же самое, что «делай что хочешь». Веса опубликованы, но к каждому прилагается лицензия – юридический документ, который определяет, как с ними можно обращаться. Эти лицензии варьируются от «используй для любых целей, включая коммерческие продукты» до «только для исследований и личного использования, никакого коммерческого применения». Модель может быть бесплатной для скачивания, но при этом её использование в продаваемом продукте может оказаться незаконным. Мы будем проверять лицензию на каждой модели в первую очередь, а не в последнюю.

Два вопроса, которые решают всё

Прежде чем запускать бенчмарк или демонстрацию, два вопроса помогут сузить выбор до одной-двух моделей, которые действительно стоит тестировать. Задавайте их в указанном порядке.

Первый вопрос – «что разрешает продавать лицензия?» Это барьер «да/нет», и он стоит первым, потому что никакое качество не имеет значения, если вы юридически не можете использовать вывод модели в продукте. Некоторые открытые видеомодели распространяются под настоящей open-source-лицензией – золотым стандартом здесь является Apache 2.0, – которая позволяет использовать результаты в коммерческих целях, монетизировать их, дообучать модель и никогда не запрашивать разрешения. Другие используют собственную лицензию, которая ограничивает коммерческое применение, устанавливает порог выручки или запрещает его полностью. Лицензия – жёсткий фильтр: модель, не прошедшая его, выбывает, как бы хорошо она ни работала.

Второй вопрос – «влезет ли она в GPU, который я могу себе позволить?» GPU – graphics processing unit – это специализированный чип, отвечающий за запуск таких моделей, и ключевую роль здесь играет его VRAM, видеопамять в гигабайтах (GB), в которой модель хранится во время работы. Если модели требуется больше VRAM, чем доступно на вашем GPU, она просто не запустится – как программа, которой не хватает оперативной памяти на ноутбуке. Видеомодели очень прожорливы: полные версии самых крупных требуют 60 ГБ и больше, то есть приходится арендовать серверные видеокарты, а урезанные версии помещаются в 8–16 ГБ, которые есть у потребительских игровых карт. Первым препятствием становится нехватка VRAM, а не производительность.

Получите эти два ответа – и всё остальное сводится к настройке. Ошибётесь – и потратите неделю, пытаясь построить на модели, которую нельзя легально продать или физически запустить.

Рис. 1. Фильтр из двух барьеров. Лицензия – первый барьер, потому что это юридическое «да/нет»; VRAM – второй, потому что это физическое «да/нет». Качество лишь разрешает ничью между моделями, прошедшими оба.

Пять семейств, которые вы действительно рассмотрите

В мире open-weights для видео существует десятки моделей, но к середине 2026 года почти всю реальную работу в продакшене выполняют пять семейств. Разберём каждое простыми словами, а затем сравним их. Для каждой модели сначала рассмотрим лицензию и требования к VRAM; качество будем оценивать по разрешению – ведь именно оно определяет результат, и в этом вопросе часто бывает ничья.

HunyuanVideo (Tencent) – лидер по качеству с оговоркой в лицензии

HunyuanVideo – open-weights-модель от Tencent, и сейчас ключевой версией является HunyuanVideo 1.5, вышедшая в ноябре 2025 года. Главное её преимущество – уменьшение размера без потери качества: ядро модели – денойзинг-бэкбон, отвечающий за постепенное преобразование визуального шума в чёткое изображение, – сократилось с 13 миллиардов обученных параметров в первой версии до 8,3 миллиарда в 1.5. Меньше параметров – меньше требований к памяти, но при этом сохраняется то же качество генерации. Модель поддерживает text-to-video (по текстовому промпту создаётся видеоролик) и image-to-video (на основе статичного кадра и промпта модель превращает изображение в анимацию).

Полноточная версия модели требует около 24–28 ГБ видеопамяти, что уже выходит за рамки возможностей потребительских видеокарт. Но тут приходит вторая ключевая идея – quantization: хранение миллиардов чисел в более компактном, менее точном формате, чтобы сэкономить память, допустив небольшую потерю точности. Стандартный компактный формат называется FP8 (восемь бит на число вместо шестнадцати), и сборка HunyuanVideo 1.5 в формате FP8 занимает примерно 14–16 ГБ – уже в пределах возможностей топовой потребительской GPU. Если пойти дальше и перенести часть текстовой подмодели в обычную системную память (это называется offloading), потребление видеопамяти можно снизить до 8–12 ГБ – медленно, но работает даже на обычной игровой карте. Ожидайте около 75 секунд на рендер короткого клипа в разрешении 480p на RTX 4090.

Оговорка – в лицензии. HunyuanVideo 1.5 распространяется по Tencent Hunyuan Community License, а не по Apache 2.0. Лицензия разрешает исследовательское и личное использование, но ограничивает коммерческое применение – есть условия и пороги, которые необходимо изучить перед тем, как использовать модель в продукте, предназначенном для продажи. Если вы разрабатываете коммерческую функцию, эту модель стоит изучить особенно внимательно – её юридическую страницу нужно прочитать дважды. Лидер качества, звёздочка в лицензии.

CogVideoX (Zhipu AI) – дружелюбная рабочая лошадка с низким потреблением VRAM

CogVideoX от Zhipu AI (веса доступны в аккаунте zai-org) – модель, с которой большинство команд начинают работу, и причина в том, что она действительно легко запускается. Есть два основных варианта – 2 миллиарда и 5 миллиардов параметров – а также обновлённая версия CogVideoX 1.5. Модель с 5 миллиардами параметров помещается примерно в 8 ГБ видеопамяти при правильных настройках – что недостаточно для карты среднего уровня вроде RTX 3060, – а 2-гигапараметрная версия работает даже на довольно старом железе.

Две вещи объясняют её репутацию. Во-первых, лицензия дружелюбна на младшем конце: CogVideoX-2B идёт под Apache 2.0, чистой коммерческой лицензией. Старшая версия 5B использует собственную лицензию CogVideoX с дополнительными условиями – так что правило «читать дважды» остаётся актуальным по мере роста модели. Во-вторых, она превосходит ожидания по размеру в плане следования промпту – то есть насколько точно сгенерированный клип соответствует вашему запросу – благодаря эффективному 3D Causal VAE, компоненту сжатия, который уменьшает объём видео, не теряя деталей, важных для точности промпта. Компромисс – длина и разрешение: оптимальный формат для модели 5B – шестисекундный клип в разрешении 720×480, а не кинематографическое 4K. CogVideoX выбирают, когда важнее, чтобы модель «работала на GPU, который у нас уже есть», чем чтобы она «побеждала в конкурсе красоты».

Mochi 1 (Genmo) – большая, свободная, прожорливая по железу

Mochi 1 от Genmo на момент релиза стала крупнейшей опубликованной открытой видеомоделью – 10 миллиардов параметров – и распространяется под лицензией, которую инженеры ценят больше всего: Apache 2.0. Она бесплатна для коммерческого использования, не имеет ограничений по выручке и не требует дополнительных разрешений. Модель построена на архитектуре AsymmDiT, которая намеренно выделяет почти вчетверо больше вычислительных ресурсов на обработку изображения, чем на текст, что проявляется в плавности и выразительности движения.

Цена такого масштаба – железо. Полноразмерная Mochi 1 требует около 60 ГБ видеопамяти и на практике работает комфортно только на четырёх дата-центровых картах H100 – что твёрдо выходит за рамки потребительского сегмента. Сообщество это учло: версия в bfloat16 занимает около 22 ГБ, а сборка под ComfyUI сжимается ниже 20 ГБ, позволяя запустить модель на одной топовой видеокарте при пониженных настройках. Mochi выбирают, когда нужна свободная коммерческая лицензия для крупной модели с хорошей динамикой и есть (или можно арендовать) мощные GPU. Свободная лицензия, но тяжёлый аппаратный след.

LTX-Video и LTX-2 (Lightricks) – скорость и новинка с поддержкой 4K и звука

Lightricks сделала ставку на скорость. LTX-Video стала первой моделью своего класса, способной генерировать качественные видео в реальном времени: на подходящем оборудовании она выдаёт 30 кадров в секунду в разрешении 1216×704 – быстрее, чем вы успеете его просмотреть. Доступны версии на 2 и 13 миллиардов параметров, включая дистиллированные (сжатые для повышения скорости) сборки, которые помещаются в потребительскую видеопамять. Лицензия – собственная open-weights-лицензия Lightricks, и важно, что модель на 13 миллиардов параметров бесплатна для компаний с годовой выручкой до $10 млн – это намеренный шаг, чтобы помочь стартапам, при этом выше этой планки действует платный тариф.

Более масштабное событие 2026 года – LTX-2, которую компания Lightricks анонсировала в октябре 2025 года и полностью открыла 6 января 2026 года: веса, код инференса и код обучения – под чистой лицензией Apache 2.0 (бесплатно для коммерческого использования компаниями с выручкой до $10 млн в год; при превышении – корпоративный тариф с поддержкой). LTX-2 стала первой готовой к продакшену открытой моделью, способной генерировать синхронные видео и звук за один проход в нативном 4K-разрешении и 50 кадрах в секунду, с синхронизацией губ (lip-sync) и фоновым звуком, на основе 14 миллиардов видеопараметров и 5 миллиардов аудиопараметров (всего – 19 миллиардов). Эта возможность – «одна модель, видео и звук вместе» – была уникальной на начало 2026 года и отсутствовала у всех четырёх других открытых семейств. Это самый свежий факт в уроке: большинство конкурирующих статей до сих пор описывают LTX как немое видео. Если в вашем сценарии требуется звук, синхронизированный с изображением, LTX-2 – единственный открытый вариант, который это обеспечивает.

Wan (Alibaba) – лидер в бенчмарках с трендом на лицензирование

Семейство Wan от Alibaba возглавляет открытый лидерборд. Модели Wan 2.1 и Wan 2.2 выпущены под лицензией Apache 2.0 – полностью коммерческой – и Wan 2.2 демонстрирует наивысший публично подтверждённый open-source-результат на VBench – около 84,7%. (VBench – стандартная шкала для видеогенераторов: чем выше показатель, тем лучше общее качество по движению, согласованности и точности.) В Wan 2.2 используется архитектура Mixture-of-Experts: всего 27 миллиардов параметров, но при обработке каждого отдельного клипа задействуется лишь 14 миллиардов – такой подход позволяет держать потребление памяти в разумных пределах. Более компактная плотная версия на 5 миллиардов параметров работает на видеокарте с 8 ГБ памяти в разрешении 720p. Wan опережает другие открытые модели по качеству генерации человеческих лиц, кожи и волос, а также по обработке промптов с несколькими взаимодействующими субъектами.

Тренд, за которым стоит следить, – направление лицензирования. Новые релизы Alibaba – Wan 2.5 и выше – перешли на модель API-first, где последняя версия доступна через сервис Alibaba Cloud, а не публикуется в виде открытых весов, и открытые релизы (если они появятся) будут отставать. Поэтому правило для Wan в 2026 году чёткое: открытый, под лицензией Apache 2.0, self-hostable Wan, на который можно полагаться сегодня, – это версии 2.1 и 2.2; более новые нумерованные версии доступны только по аренде. Всегда проверяйте лицензию именно той версии, которую планируете использовать, – не полагайтесь на то, что «Wan открыт» автоматически означает, что последняя версия тоже открыта.

Рис. 2. Пять семейств рядом. Сначала читайте столбец лицензии и столбец VRAM; столбец сильной стороны – разрешение ничьей среди моделей, прошедших оба барьера.

Главное решение: self-host или аренда?

Теперь вопрос, который и приводит команды на этот путь, – и честный ответ: «обычно аренда, иногда self-host, и решающий фактор редко цена за клип». Докажем это арифметикой, потому что интуиция «бесплатная модель = бесплатное видео» – самая дорогая ошибка в этой области.

Стоимость self-hosted-клипа – это часы GPU, а не ноль

Скачать модель можно бесплатно. Видео – нет, потому что его генерация требует мощного GPU и занимает реальные секунды, а GPU стоит денег – независимо от того, владеете вы им или арендуете. В середине 2026 года топовая дата-центровая карта H100 стоит примерно $2–2,70 в час на сервисах вроде RunPod, а более дешёвые прерываемые «spot»-ставки – около $1,30–1,60. Стоимость одного клипа – это просто доля часа, которую занял ваш рендер.

Пройдём расчёт вслух один раз. Допустим, ваша модель и настройки рендерят один клип за три минуты на H100, который вы арендуете за 2,40 доллара в час:

стоимость клипа = (минуты рендера ÷ 60) × часовая ставка GPU
               = (3 ÷ 60) × $2.40
               = 0.05 × $2.40
               = $0.12 за клип

Двенадцать центов – примерно столько берёт Runway за секунду через API, а не за весь клип. Так что на первый взгляд самохостинг выглядит дешевле. Но эти двенадцать центов – только оплата часов GPU. Сюда не входят простои GPU между задачами (вы арендуете его по часам, а не по фактической продолжительности работы), инженерные дни на настройку и постоянные расходы на поддержку. Именно эти скрытые затраты и определяют итоговое решение.

Точка окупаемости – это объём, и она выше, чем кажется

Отраслевые расчёты затрат на 2026 год показывают переломную точку: при нагрузке ниже примерно 5 000 клипов в месяц маршрутизация через платный API без собственной инфраструктуры – более дешёвый и надёжный выбор; self-Hosting начинает окупаться только при больших объёмах, и то лишь при высокой загрузке GPU. Причина – в тех составляющих, которые скрывает расчёт «за клип».

Во-первых, настройка не бесплатна: поднять открытую видеомодель – установить нужные драйверы GPU, скачать десятки гигабайт весов, уместить модель в VRAM и отладить неизбежные конфликты версий – это примерно 20–40 инженеро-часов до первого продакшен-клипа. Во-вторых, поддержка не бесплатна: обновления модели, апгрейды зависимостей и работа над надёжностью добавляют постоянную нагрузку, которую расчёты затрат сводят к множителю 3–5× поверх голой аренды GPU. GPU за $1 700 в месяц аренды легко стоит $5 000–8 000 в месяц, если посчитать людей, которые его поддерживают. В-третьих, простаивающий GPU всё равно тарифицируется – если трафик неровный, вы платите и за тихие часы, а это ровно та неэффективность, которую API убирает, беря плату только за сделанную работу.

«Частая ошибка: считать self-Hosting «бесплатной моделью × электричество». Команды сравнивают стоимость API за клип с почти нулевой стоимостью self-hosting за клип и делают вывод, что self-hosting выигрывает с большим отрывом. На малых объёмах это почти никогда не так, потому что реальная стоимость self-hosting – это круглосуточная аренда GPU, множитель операций 3–5×, плюс 20–40 часов настройки до первого клипа. Всегда сравнивайте счёт за API с полной стоимостью self-hosting – аренда GPU, простои, амортизированная настройка и инженеры, которые этим занимаются, – а не только с часами работы GPU.»

Так когда self-Hosting реально выигрывает?

Если цена за клип редко оправдывает его, что тогда его оправдывает? Три причины – и ни одна из них не связана с основной стоимостью.

Первая – резидентность данных и приватность. Если ваш контент чувствителен – медицинское видео в телемедицине, лица в видеонаблюдении, приватные пользовательские загрузки, – отправка его в сторонний API может быть неприемлема по юридическим или договорным причинам. Self-hosting держит каждый кадр на машинах, которые вы контролируете, и это может быть единственной причиной так поступить, цена побоку.

Вторая – объём. При нагрузке более 5 000 клипов в месяц и действительно загруженных GPU стоимость собственной инфраструктуры на один клип становится ниже, чем плата за использование API, и экономия накапливается. Высокий устойчивый объём – вот тот случай, которого ждала арифметика «за клип».

Третья – лицензия и кастомизация. Только открытая модель позволяет fine-tune – слегка дообучить её на своих примерах, чтобы она усвоила ваш стиль, продукт или предметную область. Только свободно лицензированная открытая модель (Apache 2.0) даёт возможность выпускать кастомизированную версию в составе продаваемого продукта – без платы за вызовы и без зависимости от вендора, который может в любой момент изменить условия или закрыть доступ. Если ключевое преимущество вашего продукта основано на поведении модели, недоступном через стандартные API, self-hosting – не просто дорогая альтернатива, а единственный реальный путь.

Рис. 3. Почему решает объём, а не цена за клип. Self-hosted-линия стартует высоко и остаётся почти ровной; API-линия стартует с нуля и растёт. Они пересекаются около 5 000 клипов в месяц – и три неценовые причины могут перевесить всю кривую.

Как вы это реально запускаете

Допустим, оба барьера преодолены и принято решение в пользу self-hosting. Как выглядит запуск открытой видеомодели на практике? Код рендеринга вы не пишете с нуля – вы опираетесь на одну из двух экосистем, к которым сошлось всё поле.

Первая – ComfyUI, визуальный инструмент, в котором вы собираете пайплайн генерации как диаграмму из связанных блоков: загрузить модель здесь, подать промпт там, задать разрешение, получить клип. Это среда для художников и энтузиастов, и, что особенно важно, именно здесь сообщество публикует оптимизации памяти – FP8-quantization и приёмы offloading, позволяющие 60-гигабайтной модели работать на видеокарте с 20 ГБ. Если хотите протестировать пять моделей за неделю без написания кода, ComfyUI – именно то место.

Вторая – diffusers, Python-библиотека от Hugging Face, которая позволяет загружать и запускать эти модели всего в несколько строк кода – одинаково для каждой. Это путь в продакшен: именно diffusers импортирует ваш бэкенд-сервис, когда пользователь нажимает «сгенерировать», и именно ваши серверы выполняют работу. Причина объединить эти пять семейств моделей в один урок в том, что все они поддерживают diffusers и ComfyUI, так что окружающий код почти не меняется при замене одной модели на другую – тот же принцип, что дал адаптер для закрытых API, теперь работает и на открытой стороне.

Если замеренное время рендера слишком велико для вашего продукта – это не тупик. Семейство приёмов ускорения может сократить его в разы, о них мы подробно рассказываем в уроке про ускорение диффузии. А если проблема не в скорости, а в том, чтобы сохранить одного и того же персонажа, сцену и движение камеры на протяжении множества клипов, – это отдельная дисциплина, которую разбираем в уроке про согласованность в продакшене.

Поэтому в реальном проекте порядок действий такой: выбрать модель с двумя барьерами; прототипировать в ComfyUI, чтобы проверить качество на ваших реальных промптах; замерить время рендера на GPU, который вы планируете арендовать, чтобы рассчитать затраты с реальными цифрами; затем интегрировать в бэкенд через diffusers с тем же адаптером, что описан в уроке про closed API, сохранив возможность переключаться. Не стоит считать открытой модель и её инфраструктуру постоянными: рынок выпускает более качественные модели примерно раз в квартал, а тренд W&B к API-первому подходу – напоминание о том, что у сегодняшних открытых весов не гарантирован открытый преемник.

Разбор: три типичные ситуации

Абстрактным правилам легче доверять, когда видишь, как они помогают принимать реальные решения. Три коротких сценария – каждый решён с помощью двух барьеров и кривой затрат.

Телемед-стартап хочет анимировать обучающие клипы процедур. Контент близок к пациентским данным, объём небольшой. Резидентность данных – ключевой фактор, объём не оправдывает полноценную инфраструктуру, но требования приватности всё равно могут склонить к self-hosting на малом арендованном приватном GPU с выбором CogVideoX 5B – из-за низкой потребности в VRAM и достаточно чистой лицензии, либо к API с подписанным договором об обработке данных, если он приемлем. Решение определяется барьером приватности, а не стоимостью.

OTT-команда постпродакшена ежедневно нуждается в сотнях B-roll-клипов со звуком и продаёт готовый контент. Объём производства окупает затраты, звук обязателен, цель – коммерческий вывод, поэтому LTX-2 (синхронизация аудио и видео в 4K, open weights) на собственных или стабильно арендуемых GPU дата-центров – отличный выбор. На таких объёмах стоимость обработки одного клипа действительно ниже, чем при использовании API. Ключевые факторы – масштаб и аудиовозможности.

Конференц-продукт нуждается в небольшом дообученном генераторе аватаров, встроенном в приложение и поставляемом клиентам. Приоритеты – кастомизация и возможность продажи, поэтому модель под лицензией Apache 2.0, например Wan 2.2 или Mochi 1, – единственный жизнеспособный вариант: её можно дообучить под стиль аватаров продукта и использовать внутри приложения. Это решает проблему «лицензия плюс fine-tune»; в данном случае self-hosting – не просто дешёвый путь, а единственный возможный. (Для говорящих голов и аватаров в частности – урок про lip-sync и аватары сравнивает специализированные модели.)

Где здесь Фора Софт

Мы создаём видеопродукты для видеоконференций, стриминга и OTT, видеонаблюдения, e-learning, телемедицины и AR/VR, и вопрос «самостоятельный хостинг или аренда» возникает в каждой из этих областей. В телемедицине и видеонаблюдении решающим фактором становится барьер приватности: контент не может покидать среду заказчика, поэтому открытая модель на контролируемом железе – единственный комплаентный путь. В OTT и e-learning, где команды производят большие объёмы вспомогательных клипов и полностью контролируют результат, арифметика объёма и стоимость лицензий толкают к self-hosted-решениям – дообученным открытым моделям за переключаемым адаптером. Работа редко сосредоточена в самом коде рендеринга – diffusers делает его коротким, – она заключается в подборе парка GPU, честном расчёте полной стоимости владения и сохранении гибкости перехода на лучшую модель следующего квартала. Именно эта дисциплина отличает фичу, которая работает год, от той, что ломается на следующем релизе.

Главное

  • Открытые веса означают, что вы скачиваете и запускаете модель самостоятельно; при этом именно лицензия определяет, что можно продавать.
  • Сначала проверьте два ключевых барьера: разрешает ли лицензия коммерческое использование и поместится ли модель в VRAM вашего GPU.
  • Модели под лицензией Apache-2.0 (CogVideoX-2B, Mochi 1, Wan 2.1/2.2) – безопасный выбор для коммерции; Hunyuan и новая версия Wan требуют осторожности.
  • Самостоятельный хостинг редко оказывается выгоднее API по цене ниже примерно 5 000 клипов в месяц при полном учёте всех затрат.
  • Самостоятельный хостинг стоит использовать ради приватности, больших объёмов или дообучения – а не только из-за цены за один клип.
  • LTX-2 (открытая, январь 2026) – главный свежий факт: нативное 4K-видео с синхронизированным звуком за один проход.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.