Решение «просто возьмём VLM» – когда мультимодальная модель фронтира заменяет кастомный CV

Автор: Николай СапуновОбновлено: август 202626 мин чтения
Содержание статьи +

Кратко

Модель, которая читает и картинку, и текст – её называют vision-language model или VLM, – теперь отвечает почти на любой вопрос о кадре видео без предварительного обучения, и это соблазняет команды выбросить кастомный пайплайн компьютерного зрения и «просто взять VLM». Этот инстинкт верен для задач с малым объёмом, меняющимися или трудноописуемыми категориями – и ошибочен для высокообъёмных, фиксированных задач реального времени, а граница проходит в основном по стоимости за кадр и по миллисекундам, а не по тому, какая модель «умнее». В статье вы получите арифметику: примерно на 100 000 кадрах в месяц универсальный VLM API перестаёт быть дешевле небольшого кастомного детектора, который вы хостите сами, а на частоте кадров видео облачный VLM вообще не укладывается в бюджет реального времени. Паттерн, который реально доезжает до продакшена в 2026 году, – гибрид: дешёвая и быстрая кастомная модель фильтрует поток, а VLM видит лишь те редкие кадры, которые оправдывают его цену.

Почему это важно

Два года назад фича, понимающая, что внутри кадра, означала сбор тысяч размеченных картинок, обучение кастомной модели и вечную её поддержку. Сегодня вы вставляете кадр во frontier-мультимодальную модель и спрашиваете «есть ли погрузчик в пешеходной зоне?» обычными словами – и получаете рабочий ответ за один вызов API без всякого обучения. Этот короткий путь реален и меняет то, как строятся видеопродукты, но применённый не там он тихо жжёт деньги, ломает бюджет задержки и рождает красивое демо, которое не выживает при продакшен-нагрузке. Статья для продакт-менеджера, основателя или видеоинженера, которому нужно для одной конкретной фичи решить: тянуться к VLM-шорткату или строить кастомный пайплайн – и который хочет опереться на цифры стоимости и задержки, а не на хайп.

Два инструмента на столе

Прежде чем решение обретёт смысл, нужна чистая картина того, чем на самом деле является каждый инструмент. В демо они выглядят взаимозаменяемыми, а в продакшене ведут себя по-разному.

Первый инструмент – кастомная модель компьютерного зрения, её часто называют детектором объектов. Самое распространённое семейство – YOLO (от «You Only Look Once»), а также более новые архитектуры вроде RF-DETR. Вы заранее решаете, что именно модель должна находить («человек», «транспорт», «каска»), собираете и размечаете примеры, обучаете модель. После обучения она берёт кадр и возвращает аккуратный список рамок: у каждой – координаты, метка категории и уверенность. Представьте очень быстрого, очень буквального работника, который заучил один конкретный список и делает только это, одинаково, каждый раз.

Второй инструмент – vision-language model, или VLM, мультимодальный родственник чат-бота. Примеры – Google Gemini, OpenAI GPT и Anthropic Claude, а также модели с открытыми весами вроде LLaVA и Qwen-VL. Вы даёте ему кадр и вопрос обычным языком, а он отвечает обычным языком. На ваших конкретных объектах его не обучали; он изучил визуальный мир в целом. Представьте эрудированного универсала, которого можно спросить о чём угодно, – но который иногда путается, формулирует один и тот же ответ двумя разными способами и берёт плату за каждый вопрос.

Главное отличие: детектор детерминирован и фиксирован, а VLM гибок и вероятностен. Прогоните один кадр через обученный детектор сто раз – получите сто одинаковых ответов. Прогоните через VLM сто раз – получите, возможно, девяносто шесть одинаковых ответов и четыре чуть отличающихся. Держите этот контраст в голове: почти всё в этом решении вытекает из него.

Рисунок 1. Кастомный детектор возвращает фиксированный, повторяемый список рамок; VLM возвращает гибкий язык о чём угодно, о чём вы спросите. Решение определяет форма вывода, а не «ум» модели.

Решение – это на самом деле три числа

Этот выбор формулируют как «достаточно ли умён VLM?». Честная формулировка: «вписывается ли VLM в мой бюджет стоимости, задержки и стабильности?». Почти в любой продакшен-фиче видео способность уже не узкое место – frontier VLM в 2026 году опишет почти любую сцену, которую вы покажете. Чего он не всегда может – описать её достаточно дёшево, достаточно быстро и одинаково дважды. Эти три числа – стоимость за кадр, задержка за кадр и стабильность между прогонами – решают дело гораздо чаще, чем чистая точность.

Пройдём по каждому числу с реальной арифметикой. Цифры ниже используют Google Gemini 2.5 Flash как опорный VLM, потому что это один из более дешёвых frontier-вариантов с опубликованными ценами; выводы переносятся на GPT и Claude, которые стоят за изображение дороже, а не дешевле.

Число первое: стоимость за кадр и точка безубыточности

Кастомный детектор стоит денег крупным куском вперёд и почти ничего после. Вы платите за сбор данных, разметку, обучение модели и за сервер для её запуска. Дальше каждый обработанный кадр почти бесплатен – вы платите лишь за электричество и долю GPU, который и так арендуете. VLM API – зеркальная противоположность: ничего вперёд, но маленькая пошлина за каждый кадр, навсегда.

Чтобы их сравнить, нужна пошлина за кадр. VLM видит изображение не как одно целое; он режет его на квадратные тайлы и берёт плату за тайл. Gemini считает тайл как 258 токенов, где токен – маленькая единица текста или данных изображения, по которой эти модели тарифицируются. Кадр стандартной чёткости 960×540 пикселей даёт шесть тайлов.

Покажем эту арифметику вслух, как будем показывать каждое число в статье:

Размер кадра:        960 × 540 пикселей
Единица обрезки:     floor(min(960, 540) / 1.5) = floor(360) = 360 px
Тайлов по ширине:    960 / 360 = 2.67  ->  3 тайла
Тайлов по высоте:    540 / 360 = 1.5   ->  2 тайла
Всего тайлов:        3 × 2 = 6 тайлов
Токенов изображения: 6 × 258 = 1 548 токенов на кадр

Gemini 2.5 Flash берёт около $0.30 за миллион входных токенов (опубликованная ставка середины 2026). Добавьте короткий промпт и короткий ответ – и один проанализированный кадр обходится примерно так:

Входное изображение:  1 548 токенов
Входной промпт:         ~60 токенов
Выходной ответ:         ~40 токенов  (по $2.50 / 1M на выход)
Стоимость ≈ (1 608 × $0.30 + 40 × $2.50) / 1 000 000
         ≈ ($0.000482 + $0.000100)
         ≈ $0.00058 за кадр

То есть около шести сотых цента за кадр. Звучит ничтожно – и при малом объёме так и есть. Беда в том, что видео состоит из огромного числа кадров. Одна камера на скромных 5 кадрах в секунду даёт 432 000 кадров в день, или около 13 миллионов в месяц. Прогнать каждый кадр через VLM стоило бы:

13 000 000 кадров × $0.00058 ≈ $7 540 в месяц — на одну камеру.

Теперь поставьте рядом кастомный детектор. Реалистичная одноразовая сборка – разметка, обучение и четверть бюджетного GPU-сервера – выходит где-то в $8 000–$20 000, после чего стоимость работы за кадр – доли цента, потому что пошлины за вызов нет. Важна именно точка перелома. Отраслевые рекомендации 2026 года, включая опубликованный фреймворк решений Roboflow, кладут эмпирическое правило примерно на 100 000 изображений в месяц: ниже неё обычно выигрывает удобство VLM без настройки; выше – выигрывает почти нулевая стоимость детектора за кадр, и разрыв быстро растёт с объёмом. Одна загруженная камера перелетает эту черту за день.

Урок не в том, что «VLM дорогой». Он в том, что стоимость VLM растёт линейно с числом кадров, а стоимость детектора почти плоская, поэтому правильная модель целиком зависит от того, сколько кадров вам реально нужно осмотреть, – и ровно поэтому существует гибридный паттерн ниже.

Число второе: задержка за кадр и стена реального времени

Задержка – это интервал между захватом кадра и моментом, когда у системы есть ответ о нём. Для одних фич пара секунд нормальна, для других – фатальна. Это одно число выводит VLM из большого класса видеозадач, как бы ни сошлась математика стоимости.

Маленький кастомный детектор создан для скорости. Самый компактный вариант YOLO11 обрабатывает кадр примерно за 1,5 миллисекунды на серверном GPU, а на edge-устройстве вроде NVIDIA Jetson Orin выдаёт около 28–41 кадра в секунду в зависимости от точности (бенчмарки 2026). Этого хватает, чтобы успевать за живым видео и реагировать в том же кадре – линия сварочного контроля, которая должна остановить конвейер до того, как дефект уедет дальше; система безопасности, которая обязана сразу отметить человека в опасной зоне.

Облачный VLM живёт в другом часовом поясе. Кадр должен доехать до дата-центра, отстоять в очереди, обработаться моделью с миллиардами параметров и вернуться. Этот круг обычно измеряется в секундах, а не миллисекундах. Продакшен-рекомендация Roboflow 2026 года прямолинейна: облачные VLM «редко пригодны для жёстких требований к задержке» и место им – в пакетной обработке или сценариях human-in-the-loop, где пара секунд на кадр приемлема.

Вот стена, без обиняков. Если фича обязана успевать за живым видеопотоком – аналитика реального времени, автономное управление, всё, где запоздавший ответ есть неверный ответ, – облачный VLM покадровую работу не вытянет, точка. Неважно, что он умён. Верный ответ, пришедший через три секунды после момента, – это провал. Поэтому большинство разговоров «просто возьмём VLM для живого видео» заканчивает вопрос задержки, а не вопрос способностей.

Число третье: стабильность и что покупает детерминизм

Третье число команды обнаруживают последним и жалеют о нём сильнее всего. Кастомный детектор детерминирован: одинаковый вход – одинаковый выход, каждый раз. VLM вероятностен: один и тот же кадр и промпт могут дать чуть иную формулировку, иную рамку или – иногда – уверенное описание того, чего в кадре нет. У последнего сбоя есть имя в литературе: галлюцинация.

Для многих фич вариативность безвредна. Если VLM описал дефект одежды как «свободная нить у левой манжеты» в одном прогоне и «разлохмаченный шов на левом рукаве» в другом – человек, читающий отчёт, поймёт оба. Но как только система принимает автоматическое решение по ответу – годен/брак, тревога/игнор, занеси для аудитора, – недетерминизм превращается в риск. Системам комплаенса и контроля качества часто нужно доказать, что один и тот же вход всегда давал одно и то же решение; модель, которая «обычно» согласна сама с собой, такого обещать не может.

Сбой острее всего в задачах подсчёта и пространственных рассуждений, на которые видеофичи опираются постоянно. Исследование 2026 года GroundCount задокументировало, что vision-language модели устойчиво галлюцинируют при подсчёте объектов, с точностью «существенно ниже, чем в других задачах визуального рассуждения», – и что слабость переживает даже новейшие reasoning-VLM, потому что идёт от способа интеграции пространства и смысла, а не от изъянов конкретной модели. Отдельный бенчмарк 2026 года OmniSpatial нашёл, что и открытые, и закрытые VLM показывают «значительные ограничения» в пространственных рассуждениях – относительное положение, перспектива, динамические связи. Практический вывод конкретен и стоит запоминания: не спрашивайте у VLM точные количества или точные позиции. Спросите – и он часто будет уверенно неправ. Обученный детектор или специализированная модель глубины дают эти числа надёжно; VLM – для смысла, а не для измерения.

«Частая ошибка: задать VLM вопрос, на который надёжно ответит только детектор. «Сколько людей в кадре?» и «Коробка левее паллеты?» кажутся простыми, поэтому их отдают VLM. Подсчёт и точные пространственные отношения – ровно те запросы, где VLM галлюцинирует сильнее всего (GroundCount, OmniSpatial, 2026). Используйте детектор для подсчёта и локализации; оставьте VLM на «что происходит и важно ли это?». Приём 2026 года, когда их надо объединить, – подавать рамки детектора в промпт VLM, чтобы модель рассуждала над реальными координатами, а не угадывала, – именно это подняло точность подсчёта на несколько пунктов в работе GroundCount.»

Сводная таблица сравнения

Три числа плюс практические соображения вокруг них укладываются в одну таблицу. Используйте её как первичный фильтр для любой фичи, которую оцениваете.

КритерийКастомный детектор (YOLO, RF-DETR)Vision-language model (Gemini, GPT, Claude)
КатегорииФиксированы; новая требует переобученияОткрыты; спросите что угодно обычным языком
Задержка за кадр~1,5 ms (серверный GPU) – ~25 ms (edge)Секунды (облачный круг)
Форма стоимостиБольшая одноразовая сборка, почти ноль за кадрНоль настройки, пошлина за кадр навсегда
Перелом экономикиВыигрывает выше ~100K кадров/месВыигрывает ниже ~100K кадров/мес
СтабильностьДетерминирован – одинаковый вывод каждый разВероятностен – формулировки и рамки плавают
Подсчёт / точная позицияНадёжноСклонен к галлюцинациям (избегать)
Время до первой версииНедели (данные, разметка, обучение)Часы (API + промпт)
Постоянная зависимостьВы владеете всей системойПривязка к API, ценам и поведению вендора
Редкие / невиданные объектыНет – отнесёт к ближайшему известномуДа – опишет невиданное при обучении

Читайте таблицу как баланс, а не приговор. Детектор выигрывает строки, важные для высокообъёмной, реального времени, аудируемой продакшен-работы. VLM выигрывает строки, важные для быстрых итераций, меняющихся требований и открытого понимания. Большинство реальных фич задевают оба столбца – и это сигнал перестать выбирать и начать комбинировать.

Дерево решений, которое можно прогнать в уме

Когда вы оцениваете одну конкретную фичу, дело решают шесть вопросов. Идите по порядку и останавливайтесь на первом ясном ответе.

Первый: можете ли вы заранее выписать полный список того, что фича должна распознавать? Если нет – потому что категории открыты, меняются по сезонам или включают редкие хвостовые случаи, которые не перечислить, – естественен VLM, ведь предзаданный список ему не нужен. Если можете – дальше.

Второй: должна ли фича успевать за живым видео? Если запоздавший ответ есть неверный ответ, нужна миллисекундная задержка детектора; облачный VLM в бюджет не влезет. Если пара секунд на кадр приемлема – дальше.

Третий: будете ли обрабатывать больше примерно 100 000 кадров в месяц? Выше этой черты выигрывает плоская стоимость детектора за кадр, и запас растёт с каждой новой камерой. Ниже – обычно дешевле нулевая настройка VLM. Дальше.

Четвёртый: зависит ли от вывода прямо автоматическое решение с требованием аудита или комплаенса? Если да, детерминизм детектора стоит дорого – вы докажете, что один вход всегда давал одно решение. Если вывод проверяет человек, редкая вариативность VLM терпима. Дальше.

Пятый: есть ли у вас ML-люди и недели, нужные собрать данные, разметить, обучить и поддерживать модель? Если нет, VLM доводит фичу до продакшена за дни, а не недели. Если есть, детектор – лучший фундамент вдолгую. Последний вопрос.

Шестой: нужно ли фиче понимание сверх того, где объекты, – контекст, связи, чтение текста в сцене, суждение, выглядит ли что-то не так? Если да – это территория VLM; детектор выдаёт лишь рамки. Если нужны только положение и идентичность известных объектов, детектор – чище и дешевле.

Рисунок 2. Шесть вопросов, прогнанных сверху вниз, разрешают почти любое решение «детектор или VLM?». Останавливайтесь на первой ветке, дающей ясный ответ.

Паттерн, который реально доезжает: гибридная фильтрация

На практике лучшие команды редко выбирают один инструмент. Они строят воронку, где дешёвая быстрая модель держит шквал кадров, а дорогая умная видит лишь немногие кадры, заслужившие внимание. Это самая полезная идея статьи, и её стоит сделать конкретной.

Представьте фичу видеонаблюдения, которая должна давать тревогу, когда «посторонний в запретной зоне после закрытия». Гнать каждый кадр в VLM – как мы посчитали, тысячи долларов в месяц на камеру и слишком медленно для живой реакции. Вместо этого стройте поэтапно:

Первый этап – дешёвый фильтр. Крошечный детектор движения или маленькая кастомная YOLO работает прямо на чипе камеры и отбрасывает примерно 99% кадров, где ничего значимого не происходит. Он быстр и почти бесплатен и отвечает лишь на один вопрос: есть ли тут вообще человек? Ничего дорогого не запускается, пока этот фильтр не откроется.

Второй этап – измерение. На редких кадрах, прошедших фильтр, кастомный детектор точно локализует человека, а шаг глубины или геометрии решает, действительно ли он внутри запретной зоны, – то точное пространственное суждение, которое детектор делает надёжно, а VLM нет.

Третий этап – понимание, и только здесь появляется VLM. Для горстки кадров, где человек реально в зоне, вы отправляете один чёткий кадр в VLM со структурированным вопросом: «Это техник с видимым ID-бейджем или неопознанный человек?» Это контекстно-смысловой вопрос, на который детектор не ответит, а VLM ответит хорошо, – и поскольку вы шлёте несколько кадров в день, а не тринадцать миллионов в месяц, стоимость ничтожна, а задержка в пару секунд нормальна: момент решения здесь – «поднимать ли тревогу», а не «останавливать ли конвейер».

Этап 1 — Фильтр движения / крошечный детектор  →  отбрасывает ~99% кадров, on-device, ~бесплатно
Этап 2 — Кастомный детектор + геометрия         →  точная локализация и проверка зоны на прошедших
Этап 3 — VLM, структурированный промпт          →  суждение о контексте на редком заслужившем кадре

Две продакшен-страховки делают этап VLM надёжным. Первая – ограничьте вывод: просите да/нет или фиксированный набор вариантов, а не свободную прозу, чтобы ответ было легко применить и трудно «увести». Вторая – для высокоставочных решений требуйте согласия по двум выбранным кадрам перед действием: если VLM говорит «посторонний» на одном кадре и «работник» на следующем, считайте расхождение сигналом эскалировать к человеку, а не запускать тревогу. Эти две привычки превращают вероятностную природу VLM из обузы в управляемый вход.

Рисунок 3. Гибридная воронка: дешёвая быстрая модель слева фильтрует поток, чтобы дорогой умный VLM справа видел лишь редкие кадры, оправдывающие его цену и задержку.

Ещё две гибридные формы, которые стоит знать

Воронка-фильтр – самый частый паттерн, но две другие повторяются достаточно часто, чтобы их назвать.

Первая – VLM для разметки, детектор для продакшена. В начале проекта размеченных данных ещё нет, а ручная разметка – самая медленная и дорогая часть постройки детектора. Можно автоматически разметить VLM-ом тысячи кадров – «обведи каждый погрузчик», – затем обучить быстрый кастомный детектор на этих VLM-метках и развернуть детектор для высокообъёмного продакшена. VLM делает одноразовую тяжёлую работу; детектор – повторяемую дешёвую. Это убирает узкое место недель разметки, не платя пошлину VLM в рантайме.

Вторая – детектор для частого случая, VLM для краевого. Фича сортировки документов классифицирует рутинные формы быстрым детектором и эскалирует в VLM лишь те документы, в которых не уверена, – а VLM читает незнакомые макеты и объясняет, что это. Неуверенные случаи затем становятся новыми обучающими данными, так что детектор постепенно вбирает хвост, а VLM зовут всё реже. Система дешевеет и становится самодостаточнее по мере работы.

Все три формы делят один принцип: пусть дешёвая модель решает, как часто запускается дорогая. Когда тянет «просто взять VLM» на весь поток, починка почти никогда не в том, чтобы отказаться от VLM, – а в том, чтобы поставить перед ним фильтр.

Когда «просто возьмём VLM» – действительно верный выбор

Было бы ошибкой прочесть это как «VLM для демо, детекторы для продакшена». Есть реальные фичи, где тянуться прямо к VLM, вовсе без кастомной модели, – верное инженерное решение в 2026 году.

Тянитесь к одному VLM, когда объём мал, а ценность кадра высока – телемедицинский инструмент, резюмирующий один короткий клип на приём; e-learning, генерирующий описание одного загруженного слайда лекции; поиск по архиву, отвечающий на редкий вопрос архивариуса о старой записи. Тянитесь к нему, когда категории действительно открыты или постоянно меняются, так что обучать детектор не на чем. Тянитесь, когда нужно выкатить на этой неделе и доказать ценность фичи до вложений в пайплайн, – VLM-прототип это самый быстрый способ узнать, нужна ли фича кому-то вообще. И тянитесь к нему ради грязных контекстных суждений, недоступных детекторам: «выглядит ли сцена небезопасной?», «что тут необычного?», «прочитай рукописную записку в углу и скажи, что там».

Честная позиция: граница смещается каждый квартал. VLM становятся быстрее и дешевле, а тренд 2026 года – модели поменьше, работающие меньше чем за секунду и даже on-device, что втянет больше near-real-time работы в территорию VLM. Но базовая физика не меняется: модель, обученная делать одно узкое дело, всегда будет быстрее и дешевле за кадр, чем универсал, которого просят делать всё, а универсал всегда гибче специалиста. Решение не в том, что лучше, – а в том, что вписывается в три числа этой фичи сегодня.

Где здесь Фора Софт

Мы строим видеопродукты в видеоконференцсвязи, видеостриминге, OTT, видеонаблюдении, e-learning и телемедицине, и вопрос «детектор или VLM?» ложится на наш стол почти для каждой ИИ-фичи в них. Паттерн, к которому мы возвращаемся, – гибридная воронка: маленькая on-device модель, фильтрующая frontier VLM, – потому что это единственная форма, уважающая одновременно бюджет реального времени и реальный потолок стоимости. В наблюдении дешёвый фильтр держит стоимость камеры в узде, пока VLM берёт редкий контекстный вызов; в e-learning и телемедицине, где объём ниже, а каждый клип ценнее, VLM часто делает всю работу один. Инженерная ценность, которую мы добавляем, – в основном в том, чтобы провести эту границу верно для конкретной фичи, а затем построить фильтрацию так, чтобы дорогая модель видела лишь оправдывающие её кадры.

Главное

  • Выбор решают стоимость за кадр, задержка и стабильность – не то, какая модель умнее.
  • Облачный VLM не вписывается в бюджет живого видео; для реального времени – кастомный детектор.
  • Около 100 000 кадров в месяц хостимый кастомный детектор становится дешевле VLM API.
  • Никогда не спрашивайте у VLM точные количества или позиции – он галлюцинирует на подсчёте и пространстве.
  • Доезжающий паттерн – гибрид: дешёвая быстрая модель фильтрует поток, VLM видит редкие кадры.
  • «Просто возьмём VLM» верно для малообъёмных, меняющихся или контекстных фич, которые могут подождать секунды.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.