Открытый фронтир – LLaVA, Qwen-VL, Pixtral, InternVL

Автор: Николай СапуновОбновлено: август 202628 мин чтения
Содержание статьи +

Кратко

«Открытый фронтир» – это набор vision-language-моделей, которые можно бесплатно скачать, запустить на своём железе и менять под себя; это открытый ответ на закрытые API от Google, OpenAI и Anthropic. Его определяют четыре линейки: LLaVA – академический проект, доказавший, что маленькая «перемычка» между готовым «читателем изображений» и готовым чат-ботом умеет видеть и рассуждать; и три производственных семейства, которые её обогнали – Qwen-VL от Alibaba (теперь Qwen3-VL, сильнейшие открытые веса 2026 года в среднем по всем задачам), InternVL от OpenGVLab (сильнейшая по-настоящему свободно лицензированная альтернатива) и Pixtral от Mistral (сильнейшая маленькая модель). Они различаются качеством, тем, насколько хорошо работают именно с видео, и – что для бизнеса важнее всего – лицензией на ПО, которая решает, можно ли законно встроить модель в продукт, который вы продаёте. Эта статья объясняет – для читателя без подготовки в машинном обучении – что собой представляет каждое семейство, как читать таблицы бенчмарков и не обмануться, и когда запустить открытую модель у себя выгоднее, чем арендовать закрытую.

Почему это важно

Если вашему продукту нужно понимать видео – прочитать этикетку в потоке со склада, сделать конспект телемедицинского приёма, модерировать пользовательские загрузки, отметить событие в потоке с камеры – у вас два пути: арендовать закрытую модель через API или запустить открытую модель на своих машинах. Урок о закрытом фронтире разобрал первый путь. Этот урок разбирает второй и существует потому, что открытый путь побеждает начисто в трёх ситуациях, которые встречаются постоянно: когда данные легально не могут покинуть ваши серверы, когда объёмную функцию дешевле хостить, чем арендовать, и когда нужно дообучить модель на своём домене. Читатель, для которого это написано, – продакт-менеджер, основатель или операционный руководитель, которому предстоит сидеть на встрече «строить или покупать» и понимать, почему инженеры твердят «Qwen3-VL для общих задач, InternVL если нервничают юристы, Pixtral когда должно влезть на одну видеокарту». Урок предполагает, что вы прочитали введение в видео-VLM; если слова «токен», «сэмплирование кадров» и «контекстное окно» вам новы, начните с него.

Что на самом деле значит «открытый фронтир»

Начнём с двух слов – каждое несёт вес. Открытый здесь – сокращение от open-weights: обученная модель (огромная таблица чисел, называемых весами, в которой лежит всё, чему модель научилась) опубликована как файл, который можно скачать, запустить на своём компьютере, изучить и изменить. Противоположность – закрытая модель, чьи веса живут только на серверах вендора, и вы арендуете доступ через интернет. Фронтир – самые способные модели своего класса, те, с которыми сравнивают модели поменьше. Значит, открытый фронтир – это самые способные модели, которые вам разрешено скачать и иметь.

Вот аналогия, которую стоит держать в голове. Закрытая модель – это как нанять блестящего аналитика через агентство: вы отправляете материал наружу, обратно приходит ответ, вы платите за страницу и никогда не видите его рабочего стола. Открытая модель – это нанять аналитика в штат: вы платите один раз, чтобы взять его, он работает целиком внутри вашего здания, ваш материал никогда не уходит, и его можно обучить по вашему регламенту – но ещё вы должны дать ему стол, компьютер и зарплату, занят он или простаивает. Этот «стол и зарплата» – и есть подвох открытых моделей: веса бесплатны, а железо, чтобы их запускать, – нет, и кто-то в вашей команде должен поддерживать всё работающим. Остальная статья – о том, когда нанять в штат правильно и какого кандидата нанять.

Рис. 1. Два пути к пониманию видео. Закрытый арендует способность за вызов; открытый владеет ею на вашем железе. Весь урок – о том, когда выигрывает правый столбец.

Общий рецепт – почему все эти модели похожи внутри

Прежде чем разбирать четыре семейства, выучите одну общую для них архитектуру: как только вы её увидите, поле перестаёт быть стеной из названий. Каждая модель здесь собрана из трёх частей, скрученных вместе, и этот дизайн доказала первая модель в нашем списке, LLaVA, в 2023 году.

Первая часть – читатель изображений (технически визуальный энкодер) – компонент, уже обученный превращать картинку в список чисел, описывающих, что на ней. Большинство этих моделей используют читатель из системы под названием CLIP, которая уже научилась сопоставлять изображения их текстовым описаниям. Вторая часть – языковая модель, тот же тип системы, что питает текстовый чат-бот, уже обученный читать и писать гладкую прозу. Третья часть, между ними, – это и есть хитрость: маленькая перемычка (инженеры зовут её проектор или адаптер), которая переводит числа читателя изображений в форму, ожидаемую языковой моделью, чтобы чат-бот мог «прочитать» картинку как слова.

Аналогия: читатель изображений – глаз, языковая модель – красноречивый собеседник, который никогда не видел, а перемычка – зрительный нерв, несущий увиденное глазом в язык, которым собеседник владеет. Озарение LLaVA в 2023-м было в том, что не нужно строить все три части с нуля. Возьмите готовый глаз (CLIP), готового собеседника (открытый чат-бот по имени Vicuna) и обучите только дешёвый зрительный нерв между ними плюс лёгкую полировку собеседника. Это сделало способную vision-language-модель обучаемой на скромном бюджете и задало шаблон, который уточняло каждое следующее семейство.

Рис. 2. Общий рецепт. Читатель изображений, языковая модель и маленькая перемычка между ними. Четыре семейства различаются в основном тем, насколько хороша каждая часть и как их обучают, – а не базовой формой.

Четыре семейства

LLaVA – академический первопроходец, задавший шаблон

LLaVA расшифровывается как Large Language and Vision Assistant. Она вышла из академических лабораторий в 2023 году и важна не столько тем, что вы развернули бы сегодня, сколько тем, что доказала. Её метод, визуальная инструкция-настройка (visual instruction tuning), первым использовал текстовый GPT-4, чтобы сгенерировать обучающие диалоги о картинках, а затем этими диалогами обучить связку «перемычка плюс чат-бот» отвечать на вопросы о картинках. По исходной статье рецепт был нарочито экономным: соединить замороженный читатель изображений CLIP ViT-L/14 с замороженной языковой моделью Vicuna, обучить перемычку на наборе из 558 000 примеров выравнивания, затем дообучить на примерно 150 000 сгенерированных GPT инструкций. Этот двухэтапный рецепт теперь – стандартный учебник всего поля.

Линейка росла – LLaVA-1.5, LLaVA-NeXT (он же LLaVA-1.6), затем LLaVA-OneVision, добавившая понимание видео через обработку клипа как последовательности кадров. Честный статус на 2026 год двойной. Как производственная модель основная LLaVA обогнана: её сырые баллы теперь позади Qwen-VL и InternVL. Но как открытый фреймворк линейка жива и до сих пор ставит рекорды по открытости – релиз LLaVA-OneVision-1.5 (2025) опубликовал все обучающие данные и код и сообщил, что его модель на 8 миллиардов параметров обгоняет сопоставимую Qwen2.5-VL-7B на 18 из 27 бенчмарков. Так что классическую LLaVA вы редко развернёте в продукте сегодня, но её статьи обязательно прочтёте, чтобы понять поле, а фреймворк OneVision используете, если для вашего исследования важна полная воспроизводимость. LLaVA – ключевой запрос, который большинство ищет; и ответ на «стоит ли использовать LLaVA в продакшене в 2026?» обычно «нет, возьмите одну из следующих трёх, но поблагодарите LLaVA за рецепт, который они все используют».

Qwen-VL – всесторонний лидер в 2026 году

Qwen-VL – линейка vision-language от команды Qwen в Alibaba, и в 2026 году это открытая модель, которую большинству команд стоит попробовать первой. Текущее поколение – Qwen3-VL, выпущенное в конце 2025-го. Оно поставляется в широком диапазоне размеров, чтобы подобрать модель под железо: маленькие плотные модели на 2, 4, 8 и 32 миллиарда параметров для одной видеокарты и edge-работы, и крупные модели mixture-of-experts (дизайн, в котором на каждый вход срабатывает лишь часть параметров модели, давая качество большой модели по стоимости работы меньшей) вплоть до флагмана на 235 миллиардов параметров.

Две вещи делают Qwen-VL сильным именно на видео. Первая – нативная поддержка очень длинного контекста: 256 000 токенов из коробки, расширяемых к миллиону, что по математике токенов из введения в VLM хватает, чтобы удержать многочасовое видео с индексацией по секундам. Вторая – предыдущее поколение, Qwen2.5-VL, ввело динамическое сэмплирование частоты кадров и абсолютное кодирование времени: модель знает не только какие кадры видела, но и когда каждый произошёл в реальных секундах, поэтому может ответить «что было на 4-й минуте 12-й секунде?», а не только «что было в видео?». Эта временна́я точность – ровно то, что нужно видео-продуктам. Модель Qwen2.5-VL на 72 миллиарда параметров была отмерена как конкурентная закрытым моделям вроде GPT-4o, и по состоянию на май 2026 линейка Qwen держит сильнейшие баллы среди открытых весов в среднем по всем задачам.

Есть ещё одна причина, по которой инженеры тянутся к Qwen первым, и она не техническая – её лицензия. Qwen3-VL выпущен под Apache 2.0, открытой лицензией без ограничений на коммерческое использование в любом масштабе. Почему это важно – ниже; часто это решающий фактор.

InternVL – сильнейшая свободно лицензированная альтернатива

InternVL создан в OpenGVLab (Шанхайская лаборатория ИИ и партнёры) и является ближайшим открытым соперником Qwen-VL. Текущее поколение, InternVL3, примечательно изменением в обучении, которое звучит академично, но имеет практические следствия: нативное мультимодальное предобучение. Более ранние модели – включая LLaVA – сперва обучали языковую модель только на тексте, а потом прикручивали зрение отдельным этапом. InternVL3 вместо этого учит язык и зрение вместе с самого начала, за один проход предобучения. Выигрыш, о котором сообщает команда, – лучшее и более согласованное мультимодальное рассуждение, потому что модели не приходится дооснащать зрением задним числом.

В цифрах крупнейшая модель InternVL3 (78 миллиардов параметров) набирает около 72 процентов на MMMU – трудном бенчмарке из вопросов уровня колледжа, смешивающих изображения и текст, – что ставит её на вершину открытого поля и в досягаемость закрытых моделей. Её меньшие размеры конкурентны Qwen-VL класс в класс. Для видео-продукта InternVL обрабатывает тот же подход «кадры как токены», что и остальные, и поддерживает расширенный мультимодальный контекст.

Отличительная причина выбрать InternVL – снова лицензия: он выпущен на свободных условиях (типа MIT), которые некоторые юридические команды предпочитают даже Apache 2.0 за краткость и отсутствие патентного или атрибуционного трения. Когда юристы компании хотят максимально чистую лицензию, а InternVL проходит планку качества, – это выбор.

Pixtral – сильнейшая маленькая модель

Pixtral – заявка Mistral, и её слава в том, что она бьёт выше своей весовой категории. Pixtral 12B сочетает компактный читатель изображений на 400 миллионов параметров с языковой моделью на 12 миллиардов – достаточно маленькой, чтобы работать на одной массовой видеокарте, – и на релизе обгоняла другие открытые модели своего класса на задачах следования инструкциям. Её читатель изображений использует технику RoPE-2D, которая позволяет обрабатывать картинки в их родном разрешении и форме, а не сплющивать каждое изображение в один фиксированный квадрат, что помогает с документами, диаграммами и широкими кадрами видео. Pixtral обрабатывает любое число изображений в окне контекста на 128 000 токенов и поставляется под Apache 2.0.

Pixtral – модель, которую выбирают, когда ограничение – железо, а не сырая способность. Если функция должна работать на одной скромной видеокарте – на edge-устройстве, в чувствительной к стоимости пакетной задаче или встроенной рядом с камерой – модель на 12 миллиардов параметров, которая держится молодцом, стоит больше, чем флагман на 235 миллиардов, который вы не можете позволить держать запущенным. Это выбор «влезает на одну видеокарту и всё равно работает».

Семейства с одного взгляда

Таблица ниже – ориентировочный снимок на 2026 год, а не контракт. Модели с открытыми весами выпускают новые версии каждые несколько месяцев, и числа бенчмарков движутся вместе с ними, поэтому относитесь к баллам как к «какой порядок величины», а не «что записать в ТЗ».

СемействоПроисхождениеЛучшее поколение 2026РазмерыЛицензияБерите, когда…
LLaVAАкадемия (UW-Madison и др.)LLaVA-OneVision-1.5~4B, 8BApache 2.0, полностью открытые данныеНужен воспроизводимый исследовательский эталон, а не продакшен
Qwen-VLAlibabaQwen3-VL2B–32B плотные, до 235B MoEApache 2.0Нужна лучшая всесторонняя открытая модель – безопасный выбор по умолчанию
InternVLOpenGVLab / Shanghai AI LabInternVL31B–78Bтипа MITНужно топ-качество под максимально чистой лицензией
PixtralMistralPixtral 12B12B (и вариант покрупнее)Apache 2.0Функция должна влезть на одну скромную видеокарту

Поколения и размеры – снимок 2026 года и меняются каждые несколько месяцев. Все четыре поставляются под дружественными бизнесу лицензиями – это и есть главный заголовок: открытый фронтир в 2026 году по-настоящему пригоден для коммерческих продуктов.

Лицензия – это настоящее решение, а не бенчмарк

Вот правило, удивляющее большинство команд: для бизнеса, выпускающего продукт, лицензия на ПО обычно важнее пары баллов бенчмарка. Лицензия – это юридический документ, говорящий, что вам разрешено делать со скачанными весами: можно ли использовать коммерчески, в каком масштабе и какие условия привязаны. Выберите модель, набравшую на два балла больше, но с лицензией, которую ваши юристы отклонят, – и вы не выбрали ничего.

По открытому фронтиру встречаются три формы лицензий, и достаточно их узнавать. Apache 2.0 (Qwen-VL, Pixtral) и MIT (InternVL) – самые дружелюбные: они разрешают использовать, менять и поставлять модель коммерчески в любом масштабе, на своих серверах или встроенной в продукт, который вы продаёте, без лимита по использованию и без спроса разрешения. Третья форма – community-лицензия, используемая некоторыми другими популярными открытыми моделями (особенно семейством Llama от Meta): коммерческое использование разрешено, но с условиями – самое известное – оговорка, которая срабатывает только на гипермасштабе, ограничивая крупнейшие компании (с сотнями миллионов пользователей в месяц), плюс требование атрибуции. Почти для любой компании эта оговорка никогда не срабатывает, но это source-available, а не формально open-source, и некоторые отделы закупок принципиально к этому не притронутся.

Практический вывод короток. Все четыре семейства в этом уроке поставляются под по-настоящему свободными лицензиями – Apache 2.0 или MIT, – именно поэтому они образуют рекомендованный открытый фронтир: вы можете встроить их в продукт, который продаёте, без оговорки юриста. Когда модель вне этого набора соблазняет более высоким баллом, читайте её лицензию раньше её бенчмарка. Частая дорогая ошибка – месяцами прототипировать на модели, чья лицензия запрещает то развёртывание, что вы всегда планировали.

Рис. 3. Выбор открытой модели – короткое дерево решений, и вопрос лицензии стоит близко к верху – над сырым баллом. Qwen3-VL – выбор по умолчанию; ветки – это исключения.

Сколько на самом деле стоит запустить её самому

Веса бесплатны; железо – нет. Честная стоимость открытой модели – это стоимость видеокарты (GPU) (специализированного чипа, который её запускает) плюс часы инженеров на эксплуатацию. Пройдём грубый пример вслух, потому что арифметика – это весь смысл «строить или покупать».

Допустим, вы арендуете одну облачную видеокарту, способную обслуживать VLM среднего размера, по показательной цене 2026 года около 2,00 \$ в час. Запустим её круглосуточно на месяц:

2,00 $/час × 24 часа × 30 дней = 1 440 $ в месяц, фиксировано

Эти 1 440 \$ покупают машину, которая работает, занята она или простаивает, – тот самый «стол и зарплата» из аналогии. Теперь сравним с арендой закрытого API. Если закрытая модель берёт примерно 0,05 \$ за анализ одного короткого видео (цифра, выведенная в уроке о закрытом фронтире), то точка безубыточности:

1 440 $ ÷ 0,05 $ за видео = 28 800 видео в месяц

Ниже примерно 29 000 видео в месяц закрытый API дешевле, потому что вы платите только когда используете. Выше – выигрывает своя видеокарта, потому что её стоимость фиксирована, пока счёт за API растёт с объёмом. Одна видеокарта обычно обрабатывает гораздо больше 29 000 коротких видео в месяц, так что по-настоящему объёмная функция склоняется к собственному хостингу – и чем больше вы запускаете, тем шире разрыв. Поэтому говорят, что открытый путь выигрывает «в масштабе»: фиксированную стоимость стоит платить только когда работы достаточно, чтобы машина была занята. Та же арифметика, проведённая с вашей реальной ценой GPU и вашей реальной ценой API за видео, – ядро любого честного решения «строить или покупать», и инструмент вроде калькулятора стоимости из урока о модели затрат существует именно для того, чтобы провести её за вас.

Две стоимости, которые арифметика выше прячет и о которых команды регулярно забывают. Первая – загрузка: если видеокарта простаивает 90 процентов времени, вы платите 1 440 \$ за работы на 144 \$, и безубыточность сдвигается сильно против вас – собственный хостинг окупается только когда машина занята. Вторая – эксплуатация: кто-то должен развернуть модель, держать сервер пропатченным, мониторить его и перезапускать в 3 часа ночи, когда он упадёт. Фреймворки обслуживания вроде vLLM делают это куда проще, чем раньше, но «бесплатные веса» никогда не значат «бесплатно запускать». Закладывайте в бюджет людей, а не только чипы.

Частая ошибка – выбор по одному лидерборду

Чаще всего мы видим ошибку выбора модели по одному числу бенчмарка – обычно по той, что возглавляет график, который кто-то заскринил в соцсетях на этой неделе. Три вещи делают это обманчивым. Первая – заглавные бенчмарки (MMMU, OCRBench и подобные) проверяют неподвижные изображения; модель может их возглавлять и всё равно быть посредственной на видео, которое зависит от временны́х бенчмарков вроде Video-MME, которых заскриненный график, вероятно, не показал. Если ваш продукт про видео – взвешивайте видео-бенчмарки, а не изображенческие.

Вторая – разница в один-два балла обычно шум: в пределах, где другой промпт, другая частота сэмплирования кадров или другая версия ПО перевернули бы ранжирование. Считайте разрыв в два балла ничьёй и решайте по лицензии, размеру и стоимости обслуживания. Третья – лидерборды редко показывают лицензию, размер модели или железо, нужное для этих баллов, – а именно эти три определяют, сможете ли вы выпуститься. Лечение – это дисциплина, а не график: отберите шорт-лист по лицензии, отфильтруйте до размеров, которые тянет ваше железо, и только потом сравнивайте видео-бенчмарки среди выживших, а две лучшие прототипируйте на своих данных, прежде чем брать обязательства. Модель, которая выигрывает на вашем материале при вашем бюджете задержки, – правильная, независимо от того, кто возглавляет публичный график в этом месяце.

Где здесь Фора Софт

Мы разворачиваем эти открытые модели внутри реальных видео-продуктов в вертикалях, в которых работаем, и выбор семейства чисто на них ложится. В видеонаблюдении и телемедицине, где материал часто не может законно покинуть серверы заказчика, открытая модель на месте (on-premises) – нередко единственный соответствующий требованиям вариант, и Qwen3-VL или InternVL3 на собственном железе заказчика – то, с чего мы начинаем. В e-learning и OTT, где функции вроде конспектирования лекций или тегирования контента работают на большом объёме, экономика собственной видеокарты выше склоняет арифметику «строить или покупать» к собственному хостингу, и дообученная открытая модель на приватном домене обгоняет универсальную закрытую. Для edge- и встроенной работы рядом с камерой однокарточный след Pixtral оправдывает своё место. Суждение, которое мы привносим, – то самое, чему учит эта статья: выбирайте сперва по лицензии и стоимости обслуживания, взвешивайте видео-бенчмарки выше изображенческих и оставляйте путь закрытого API для малообъёмных функций и быстрых прототипов, где скорость выпуска важнее удельной стоимости.

Ключевые выводы

  • Open-weights VLM позволяют запускать понимание видео на своём железе, держать данные у себя и дообучать.
  • Все модели делят один рецепт: читатель изображений, перемычка и языковая модель – дизайн, доказанный LLaVA в 2023.
  • Qwen3-VL – всесторонний выбор по умолчанию 2026; InternVL3 – чистейше лицензированный соперник; Pixtral – лучший однокарточный.
  • Лицензия на ПО обычно важнее пары баллов бенчмарка – читайте её раньше лидерборда.
  • Свой хостинг бьёт закрытый API только выше точки безубыточности; простой GPU и эксплуатация – скрытые счета.
  • Для видео-продуктов взвешивайте видео-бенчмарки вроде Video-MME, а не изображенческие баллы вроде MMMU.

Что читать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.