Содержание статьи +
- Коротко
- Почему это важно
- Одна идея – картинки и слова в одном пространстве
- Как устроен CLIP – два энкодера, одна цель
- Контрастный приём – учиться на том, что НЕ совпадает
- Zero-shot классификация – функция, которая прославила CLIP
- Числа за моделями – что вы на самом деле скачиваете
- CLIP, OpenCLIP и открытая экосистема
- SigLIP – почему функция потерь изменилась в 2025 году
- От одного кадра к видео – куда идёт идея дальше
- Что питает CLIP – тихий движок современного мультимодального ИИ
- Частая ловушка – CLIP читает картинки, но не читает их внимательно
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Коротко
Vision-language модель – это модель, которая умеет сравнить картинку и фразу и сказать, насколько они друг другу подходят. CLIP – сокращение от Contrastive Language-Image Pre-training, выпущена OpenAI в январе 2021 года – именно та модель, которая заставила эту идею работать на больших масштабах. CLIP обучает две отдельные сети: одна превращает изображение в список чисел, другая превращает текст в список чисел – так, чтобы фото собаки и слова «фото собаки» оказывались рядом в одном числовом пространстве, а несовпадающие пары – далеко друг от друга. Один этот приём даёт zero-shot классификацию (разметить изображение словами, которым модель явно не обучали), поиск картинок по тексту и «глаза» внутри почти каждой современной мультимодальной системы – от Stable Diffusion до видео-ассистентов, которые ваша продуктовая команда проектирует прямо сейчас. Это введение объясняет – для читателя без подготовки в машинном обучении – как именно работает CLIP, почему преемник SigLIP в 2025 году изменил функцию потерь и как та же идея масштабируется от одного кадра до поиска по видеоархиву.
Почему это важно
Почти любая мультимодальная функция, которую вы захотите выпустить в видео-продукте – «найди фрагмент, где человек поднимает красную табличку», «авто-тегирование записей наблюдения», «дай пользователям искать в архиве обычными словами», «опиши, что происходит на экране» – опирается на vision-language модель под капотом. Если не понимать одну идею в её основе, остальная глава 4 читается как магия, и вы не сможете рассуждать, почему функция дешёвая или дорогая, быстрая или медленная, точная или хрупкая. Это базовый урок всего мультимодального блока. Продакт-менеджер, дочитавший его, сможет сидеть на ревью архитектуры и понимать, почему команда повторяет «эмбеддинги», «общее пространство» и «zero-shot» – и отличать задачу, которую CLIP решает почти бесплатно, от задачи, которой нужна тяжёлая модель из урока о закрытом фронтире.
Одна идея – картинки и слова в одном пространстве
Начнём с мысленной картинки. Представьте огромную комнату, и каждая точка в ней – это позиция, заданная длинным списком координат: не тремя, как для физической комнаты, а несколькими сотнями. Теперь представьте, что мы можем взять любое изображение и поместить его в одну конкретную точку этой комнаты, а любую фразу – в точку той же комнаты. Вся игра vision-language модели в этом: поставить изображение и описывающие его слова в близкие точки, а изображение и не относящиеся к нему слова – в далёкие.
Список координат для одного объекта называется эмбеддинг – простыми словами, это краткая сводка чего-либо фиксированной длины, записанная строкой чисел. Картинка золотистого ретривера на пляже может стать строкой из 768 чисел. Фраза «собака на песке» становится своей строкой из 768 чисел. Если модель хороша, эти две строки близки. Фраза «таблица квартальной выручки» становится строкой, которая лежит далеко. Близость измеряется простой операцией – скалярным произведением: вы перемножаете две строки позиция за позицией и складываете результаты; большое число означает «направлены в одну сторону», что мы читаем как «похожи».
У этой общей комнаты есть имя, которое инженеры используют постоянно: общее пространство эмбеддингов, или совместное пространство эмбеддингов. «Совместное» – потому что и картинки, и слова живут в нём вместе. Как только оно есть, удивительное число функций становится почти бесплатным. Хотите найти каждое изображение в архиве, подходящее под «человек в каске»? Превратите фразу в её эмбеддинг и найдите ближайшие эмбеддинги изображений. Хотите разметить кадр как одну из пятидесяти категорий, не обучая классификатор? Превратите название каждой категории в эмбеддинг и выберите ближайший. Ничего из этого не потребовало обучать что-то новое. Это и есть выигрыш, и остальная часть статьи – о том, как строится эта комната.
Как устроен CLIP – два энкодера, одна цель
CLIP – это две нейросети, обучаемые бок о бок. Первая – энкодер изображений – сеть, которая читает картинку и выдаёт её эмбеддинг. В самых используемых моделях CLIP это Vision Transformer, архитектура, которая режет изображение на сетку маленьких патчей и обрабатывает их как слова в предложении; мы разобрали её от начала до конца в введении в Vision Transformer. Вторая – энкодер текста – Transformer, та же семья сетей, что и в больших языковых моделях, которая читает строку слов и выдаёт её эмбеддинг. Важно: оба энкодера настроены так, чтобы их выходы были одной длины. В оригинальном CLIP от OpenAI эта длина была от 512 до 768 чисел в зависимости от размера модели. Они обязаны совпадать, потому что нельзя посчитать скалярное произведение строки из 512 чисел и строки из 768.
Поначалу оба энкодера не знают ничего. Энкодер изображений выдаёт случайные эмбеддинги; энкодер текста выдаёт случайные эмбеддинги; ничто не выровнено. Обучение – это процесс, который медленно подкручивает обе сети, пока совпадающие пары «картинка-текст» не выстроятся рядом. И единственный ингредиент, нужный обучению, – это данные, а именно очень большая куча изображений, каждое из которых пришло с подписью.
OpenAI собрала ровно такую кучу. Датасет, который они назвали WebImageText (WIT), содержал 400 миллионов пар «картинка-подпись», собранных из открытого интернета. Его построили, составив список из 500 000 текстовых запросов – из частых слов английской Википедии, информативных пар слов, заголовков статей Википедии выше порога по объёму поиска и из лексической базы WordNet – и набрав до 20 000 пар «картинка-текст» на запрос. Ни один человек не садился их размечать. «Ярлыком» для каждого изображения была просто та подпись, что уже сопровождала его в вебе. Это вторая тихая революция CLIP: он учится на естественном языковом надзоре, который изобилен и бесплатен, вместо ручных категориальных меток, которые редки и дороги.
Контрастный приём – учиться на том, что НЕ совпадает
Слово в середине «Contrastive Language-Image Pre-training» делает всю работу. Контрастный означает, что модель учится через контраст – ей показывают совпадающее рядом с несовпадающим и заставляют их различать.
Вот механизм, мелкими шагами. Во время обучения модели подают батч – группу пар «картинка-подпись» сразу, скажем, 256 штук, а в самых больших прогонах – 32 768. Для этого батча из, возьмём круглое число, N пар, модель считает эмбеддинг каждой картинки и каждой подписи. Затем строит сетку: N изображений по вертикали, N подписей по горизонтали, а в каждой ячейке – скалярная схожесть этого изображения и этой подписи. В сетке N × N ячеек.
В этой сетке ровно N ячеек – правильные совпадения: те, что на диагонали, где картинка номер 3 встречает подпись номер 3, потому что они с одной веб-страницы. Любая другая ячейка – несовпадение: картинка 3 против подписи 7, картинка 12 против подписи 2 и так далее. Цель обучения проста до жестокости: поднять оценки на диагонали и опустить все ячейки вне диагонали. Притянуть правильные пары; оттолкнуть каждую неправильную. Прогоните это на 400 миллионах пар снова и снова – и оба энкодера вынуждены открыть, что на самом деле связывает картинки со словами.
Вот почему несовпадения важны не меньше совпадений. Модель, которая видела бы только правильные пары, могла бы схитрить, сделав всё похожим. «Негативы» вне диагонали и заставляют её быть разборчивой. В одном батче из 256 каждая правильная пара контрастируется с 255 неправильными; в батче из 32 768 – с 32 767. Больше негативов на шаг обычно означает более чёткую модель, поэтому размер обучающего батча оказывается реальным рычагом, и поэтому поздние работы потратили столько сил, чтобы сделать большие батчи доступными.
Функция потерь, которая всё это оценивает, имеет учебниковое имя – это симметричная кросс-энтропия по сетке схожести, иногда её называют InfoNCE или multi-class N-pair loss. «Симметричная» – потому что применяется дважды: один раз по строкам (для каждой картинки – какая подпись подходит?) и один раз по столбцам (для каждой подписи – какая картинка подходит?). Есть ещё один обучаемый рычаг, который стоит назвать – температура: одно число, которое модель настраивает в процессе, контролируя, насколько резко она разделяет близкое и далёкое. Низкая температура делает модель решительной; высокая – осторожной. В CLIP температуру не задают вручную; модель учит её сама.
Zero-shot классификация – функция, которая прославила CLIP
Единственный результат, сделавший CLIP вехой, – zero-shot классификация: разметка изображения категорией, которую модель специально распознавать не учили, используя только название этой категории.
Пройдём, как это работает, потому что это умнее, чем звучит, и это шаблон для половины того, что вы будете строить. Допустим, нужно сортировать кадры на «стройка», «офис» и «склад». Обычному классификатору изображений понадобились бы тысячи размеченных примеров каждого и прогон обучения. CLIP не нужно ничего. Вы пишете три коротких фразы – «a photo of a construction site», «a photo of an office», «a photo of a warehouse» – и прогоняете каждую через энкодер текста, получая три текстовых эмбеддинга. Затем прогоняете кадр через энкодер изображений и получаете один эмбеддинг картинки. Считаете скалярное произведение эмбеддинга картинки с каждым из трёх текстовых эмбеддингов и выбираете наибольшее. Это и есть предсказанный ярлык. Фраза «a photo of a {class}» – не украшение; OpenAI обнаружила, что обёртка голого названия класса в короткий шаблон вроде этого измеримо повышает точность – приём, который они назвали prompt engineering для зрения ещё до того, как термин стал общим.
Заголовочное число из статьи 2021 года: лучшая модель CLIP – ViT-L/14 при разрешении 336 пикселей – достигла примерно 76% top-1 точности на ImageNet – бенчмарке на 1000 категорий – не обучаясь ни на одной метке ImageNet. Это сравнялось с сильным ResNet-50, который был обучен прямо на 1,3 миллиона размеченных изображений ImageNet. Модель, не видевшая обучающую выборку бенчмарка, сравнялась с моделью, построенной под него. Ещё поразительнее: CLIP был гораздо устойчивее, когда тестовые изображения были необычными – скетчи, состязательные рендеры, странный свет – именно потому, что учился на пёстром открытом вебе, а не на одном чистом датасете.
Сделаем арифметику конкретной, потому что стоимость zero-shot классификации – это стоимость нескольких скалярных произведений, и это стоит почувствовать руками. Допустим, вы классифицируете кадр против 50 кандидатов-ярлыков, каждый – эмбеддинг из 768 чисел. Картинка проходит через энкодер один раз. Затем вы считаете 50 скалярных произведений, каждое – 768 умножений-сложений:
50 ярлыков × 768 чисел = 38 400 операций умножения-сложенияСовременный процессор делает миллиарды таких в секунду. Сравнение ярлыков практически бесплатно; единственная реальная стоимость – прогнать энкодер изображения один раз на кадр. Более того, 50 текстовых эмбеддингов вы считаете один раз и переиспользуете для каждого кадра навсегда. Именно эта экономическая форма делает CLIP таким развёртываемым: платите один раз за кодирование каждой картинки и почти ничего – за сравнение её с любым числом текстовых ярлыков.
Числа за моделями – что вы на самом деле скачиваете
CLIP – не одна модель, а семейство, и имена кодируют устройство. Ярлык вроде ViT-L/14 читается так: Vision Transformer, размер Large (большой), с патчами 14×14 пикселей. Буквы размера идут B, L, H, G – base, large, huge, giant – по возрастанию. Меньше – быстрее и дешевле; больше – точнее и медленнее. Таблица ниже перечисляет ViT-релизы OpenAI, чтобы вы видели обмен в конкретных терминах.
| Модель | Разрешение | Параметры зрения | Длина эмбеддинга | Выпуск |
|---|---|---|---|---|
| ViT-B/32 | 224×224 | 88M | 512 | янв 2021 |
| ViT-B/16 | 224×224 | 86M | 512 | июл 2021 |
| ViT-L/14 | 224×224 | 304M | 768 | янв 2022 |
| ViT-L/14@336px | 336×336 | 304M | 768 | апр 2022 |
Две колонки заслуживают второго взгляда. Параметры зрения – это примерно то, насколько тяжёл энкодер изображений – 88 миллионов у маленького, 304 миллиона у большого – и это напрямую связано с тем, сколько GPU-памяти и времени стоит каждая картинка. Длина эмбеддинга – размер строки чисел, в которую превращается каждая картинка и подпись – здесь 512 или 768. Она важна для счёта за хранение: если закодировать миллион архивных кадров по 768 чисел каждый, хранимых как 4-байтные числа, это:
1 000 000 кадров × 768 чисел × 4 байта = 3 072 000 000 байт ≈ 3,07 ГБТри гигабайта, чтобы сделать архив из миллиона кадров искомым по обычному тексту. Это то самое число, которое превращает функцию «когда-нибудь» в пункт квартального плана.
Стоимость обучения, для контраста, – это часть, которую вы никогда не оплатите сами и пытаться не должны. Самый большой ViT у OpenAI обучался 12 дней на 256 топовых GPU V100; самый большой вариант ResNet – 18 дней на 592 GPU. Вы скачиваете готовые веса – OpenAI их выложила, а открытое сообщество выложило ещё много – и оказываетесь по ту сторону этих вычислений бесплатно.
CLIP, OpenCLIP и открытая экосистема
OpenAI выложила оригинальные веса, но оставила датасет из 400 миллионов пар закрытым. Именно этот разрыв закрыло открытое сообщество. OpenCLIP, поддерживаемый группой LAION и ML Foundations, воспроизвёл и расширил CLIP на опубликованных датасетах – LAION-400M, LAION-2B и DataComp-1B – так что любой может проверить данные и переобучить. OpenCLIP ViT-L/14, обученный на LAION-2B, увидел 32 миллиарда примеров за 160 эпох на 384 более новых GPU. Практический вывод для вас: когда инженер говорит «возьмём CLIP», он почти всегда имеет в виду одну из CLIP-подобных моделей из меню из десятков, большинство которых open-weight и бесплатны для самостоятельного хостинга. Урок о форматах артефактов моделей и решении open-vs-closed при закупке разбирает, как выбрать среди них и что разрешают лицензии.
Другие группы довели идею до предела. ALIGN от Google обучили на более чем миллиарде более шумных пар «картинка-alt-текст» и показали, что масштаб бьёт аккуратную чистку. EVA-CLIP масштабировали рецепт вплоть до модели на 18 миллиардов параметров, достигшей около 82% zero-shot точности на ImageNet – на несколько пунктов выше оригинала. Тренд устойчив и стоит запомнить как эвристику планирования: больше данных и больше параметров продолжают покупать точность без признаков стены – поэтому «лучший CLIP» – движущаяся цель, которую вы переоцениваете каждый квартал, а не фиксированный ответ.
SigLIP – почему функция потерь изменилась в 2025 году
Если CLIP – это идея, то SigLIP – уточнение, которое в 2025 году тихо заняло прод, так что стоит понять одну вещь, которую он меняет.
Вспомните контрастную сетку: для батча из N пар CLIP оценивает все N×N комбинаций и применяет softmax – нормализацию, которая для каждой картинки распределяет фиксированный «бюджет вероятности» по всем N подписям в батче. Эта нормализация связывает каждую пару с каждой другой парой в батче. Это работает, но прожорливо по памяти, потому что для корректного счёта нужна вся сетка N×N сразу. SigLIP – сокращение от Sigmoid Loss for Language-Image Pre-training, представлен командой Google на конференции ICCV 2023 – меняет softmax на сигмоиду. Вместо вопроса «среди всех подписей в батче – какая подходит этой картинке?» он задаёт более простой вопрос «да/нет» каждой отдельной ячейке «картинка-подпись» независимо: «совпадают ли эти двое – да или нет?» Каждая ячейка становится своей маленькой задачей «истина/ложь».
Звучит как малое изменение. Его последствие велико. Поскольку сигмоида рассматривает каждую пару отдельно, вы больше не платите налог памяти за полную softmax-сетку, поэтому можете уместить гораздо большие батчи на том же железе. Оригинальная статья SigLIP показала, что на четырёх чипах TPU можно обучать Base-модель при размере батча 4096, тогда как эквивалентная softmax-схема CLIP упиралась в 2048. Большие батчи – больше негативов на шаг, а, как мы видели выше, больше негативов обычно означает более чёткую модель. SigLIP сравнялся с CLIP или превзошёл его, будучи дешевле в обучении.
SigLIP 2, выпущенный Google DeepMind в феврале 2025 года, добавил сверху больше: мультиязычное обучение, декодерную цель, самодистилляцию и лучшие «плотные» признаки, которые ловят, где находятся объекты на изображении, а не только что на нём. Точность сдвинулась вместе с этим – Base-модель SigLIP 2 при разрешении 256 пикселей достигает около 79% zero-shot top-1 на ImageNet, а вариант на 512 пикселей – около 81%, против примерно 77% у оригинального SigLIP. Почему это важно продуктовой команде – из-за того, что идёт дальше: к 2026 году энкодеры семейства SigLIP – «глаза» по умолчанию внутри ведущих открытых мультимодальных моделей вроде Qwen3-VL и Gemma 3, вытеснившие оригинальный CLIP в новых сборках. Когда ваши инженеры выбирают энкодер в этом году, SigLIP 2 обычно – стартовая точка, а оригинальный CLIP держат в основном для совместимости со старыми пайплайнами.
| CLIP (2021) | SigLIP / SigLIP 2 (2023 / 2025) | |
|---|---|---|
| Функция потерь | Softmax-контраст (батч связан) | Sigmoid (каждая пара отдельно) |
| Память при больших батчах | Тяжело – нужна вся сетка N×N | Легко – пары независимы |
| Макс. практичный батч | Меньше на том же железе | Больше на том же железе |
| Zero-shot ImageNet (лучший base) | ~76% (ViT-L/14@336) | ~79–81% (SigLIP 2 Base) |
| Статус 2026 | Совместимость / legacy | Энкодер по умолчанию в новых VLM |
От одного кадра к видео – куда идёт идея дальше
Всё до сих пор было про одно неподвижное изображение. Видео – это просто изображения подряд (обычно 24–60 в секунду), так что естественный вопрос – как CLIP растягивается во времени. Честный ответ на 2026 год: доминирующий подход всё ещё на удивление прост, и эта простота – хорошая новость для вашего бюджета.
Рабочая лошадка – по-кадровый эмбеддинг плюс пулинг. Вы семплируете кадры из видео – не все; одного раз в секунду-две обычно достаточно – прогоняете каждый семплированный кадр через энкодер изображений CLIP, и теперь у вас последовательность эмбеддингов изображений, по одному на кадр. Чтобы получить один эмбеддинг на весь клип, вы пулите их, что чаще всего значит просто усреднить строки чисел позиция за позицией. Усредните десять эмбеддингов кадров – и получите один эмбеддинг клипа, который сравниваете с текстом ровно как раньше. Этот baseline со средним пулингом настолько эффективен, что для zero-shot поиска «видео-текст» он сравнялся с многими специально построенными видео-моделями или обошёл их. Иногда самый дешёвый метод одновременно и почти лучший.
Сделаем стоимость конкретной. 10-минутный клип, семплированный по одному кадру в секунду, – это 600 кадров. При, скажем, 5 миллисекундах GPU-времени на кадр на энкодере изображений:
600 кадров × 5 мс/кадр = 3000 мс = 3 секунды GPU-времениТри секунды вычислений, чтобы сделать десятиминутное видео искомым по обычному тексту. Проиндексируйте тысячу таких клипов за ночь – и наутро у вас видеоархив, по которому пользователи ищут своими словами.
Более изощрённые варианты существуют, когда среднего пулинга не хватает – когда важен порядок, например отличить «человек садится» от «человек встаёт». Модели вроде X-CLIP, ViFi-CLIP и VideoCLIP добавляют лёгкие временные компоненты, дающие кадрам «поговорить» друг с другом перед пулингом, улавливая движение, которое шаг усреднения выбрасывает. Мы углубляемся в эти архитектурные решения – частоту семплирования кадров, потоковую передачу токенов, когда временное моделирование окупает свою стоимость – в уроке о видео-VLM. Пока удержите такую модель в голове: CLIP даёт вам по-кадровые «глаза»; понимание видео – в основном вопрос того, насколько умно вы комбинируете кадры.
Что питает CLIP – тихий движок современного мультимодального ИИ
Легко отправить CLIP в папку «интересное исследование 2021 года» и упустить, что он – несущая инфраструктура систем, которыми вы пользуетесь сегодня. Три примера показывают это.
Первое – генерация изображений по тексту. Stable Diffusion и его родственники используют текстовый энкодер CLIP, чтобы превратить ваш промпт в эмбеддинг, который направляет генерируемое изображение. Когда вы печатаете «акварельная лиса в лесу», именно текстовый эмбеддинг CLIP слушает генератор. Генератор изображений никогда не видит ваши слова напрямую; он видит понимание этих слов от CLIP.
Второе – глаза внутри мультимодальных языковых моделей. Стандартный рецепт модели, которая умеет «посмотреть» на изображение и поговорить о нём – той, что питает визуальных ассистентов в видеозвонках – таков: взять замороженный энкодер изображений в стиле CLIP, добавить маленький адаптер (часто просто двухслойную проекцию), который переводит эмбеддинги изображений в словарь внутренних токенов языковой модели, и пристыковать к большой языковой модели. Открытая модель LLaVA сделала ровно это с CLIP ViT-L/14 при 336 пикселях и двухслойной проекцией. Более ранний Flamingo от DeepMind заморозил энкодер изображений в стиле CLIP и соединил его с замороженной языковой моделью. Этот паттерн повсюду, потому что он работает и дёшев: дорогие энкодеры предобучены один раз, а вы обучаете только маленький мост между ними. Урок о VLM открытого фронтира прослеживает, как этот рецепт стал LLaVA, Qwen-VL и остальными.
Третье – семантический поиск и модерация по медиаархивам. Поскольку изображения и текст делят пространство, вы можете построить «поиск по фотобиблиотеке на английском», «найти кадры, похожие на этот референс», или «помечать любой кадр, подходящий под список запрещённых понятий» одной и той же машинерией скалярных произведений. Без покатегорийного обучения, без размеченного датасета – только эмбеддинги и поиск ближайших соседей. Это основа мультимодальных поисковых систем, к которым мы вернёмся в уроке о video RAG.
Частая ловушка – CLIP читает картинки, но не читает их внимательно
Чаще всего команды переоценивают точность CLIP. CLIP отлично схватывает суть изображения – кухня это или пляж, собака или машина, день или ночь. Он ненадёжен в мелких деталях, подсчёте, чтении текста и пространственных отношениях. Попросите его отличить «три человека» от «четырёх» или «чашка слева от ноутбука» от «чашка справа» – и он часто ошибётся. Его можно и обмануть: знаменитая демонстрация показала, как CLIP принял яблоко за iPod, когда на яблоко наклеили бумажку со словом «iPod», потому что он научился читать текст на изображениях как сильную подсказку. CLIP также слаб в отрицании – «улица без машин» склонна совпадать с изображениями, на которых машины есть, потому что модель цепляется за «машины» и в основном игнорирует «без».
Практическое правило: тянитесь за эмбеддингами в стиле CLIP для грубого сопоставления, поиска, тегирования и фильтрации, где сильная «суть» – именно то, что нужно, а редкий промах дёшево исправить. Когда функции действительно нужно тонкое чтение – подсчёт товаров на полке, чтение номерного знака, рассуждение о точной пространственной раскладке – это работа для более тяжёлой мультимодальной модели или специализированного детектора, и попытка втиснуть туда CLIP даёт демо, которое впечатляет на встрече и разочаровывает в проде. Знание, по какую сторону этой черты лежит ваша функция, – большая часть инженерного суждения, которому учит вся эта глава.
Где здесь Фора Софт
Мы строим функции, на которые опирается это введение. В продуктах видеонаблюдения эмбеддинги в стиле CLIP позволяют операторам искать в записях обычным языком – «покажи всех в жёлтом жилете у погрузочной зоны» – вместо перематывания таймлайнов вручную. В платформах e-learning и OTT тот же поиск по общему пространству делает каталог навигируемым по теме и сцене, а не по имени файла. В инструментах видеоконференций и телемедицины замороженные энкодеры в стиле CLIP – глаза внутри ассистентов, которые описывают, что на экране, или помечают моменты для последующего разбора. По всем этим вертикалям инженерный паттерн – тот, что описан в статье: закодировать один раз, сравнивать дёшево и выбирать самую лёгкую модель, которая берёт планку точности, реально нужную функции.
Главное
- Vision-language модель помещает изображения и текст в одно общее пространство, где совпадающие пары лежат рядом.
- CLIP обучает два энкодера контрастно на 400 млн веб-пар «картинка-подпись» – совпадения притягиваются, несовпадения отталкиваются.
- Zero-shot классификация размечает изображения только по названиям категорий, без покатегорийного обучения, ценой нескольких скалярных произведений.
- SigLIP (2023) и SigLIP 2 (2025) меняют softmax на сигмоиду, давая бо́льшие батчи и выше точность.
- Для видео кодируйте семплированные кадры через CLIP и усредняйте – дёшево и часто не хуже специальных моделей.
- Используйте CLIP для грубого сопоставления и поиска; он слаб в подсчёте, деталях, тексте и пространственных отношениях.
Что почитать дальше
- Введение в Vision Transformer для инженеров видео-ИИ – архитектура внутри энкодера изображений CLIP, с нуля.
- Видео-VLM в 2026 – семплирование кадров против потока токенов – как масштабировать по-кадровую идею CLIP до настоящего понимания видео.
- Форматы артефактов моделей и решение open-vs-closed при закупке – как выбрать и лицензировать энкодер для прода.