Материал
CLIP и визуально-языковые модели – справочник
Одностраничная шпаргалка: идея общего пространства эмбеддингов, как обучается CLIP, классификация без обучающих примеров, сравнение CLIP и SigLIP, таблица размеров моделей OpenAI ViT и рецепт пулинга кадров для видео.
Что внутри
- Одна идея
- Как обучается CLIP
- ZERO-SHOT классификация
- CLIP против SigLIP
- Размеры моделей (OpenAI ViT)
- От кадра к видео
- Ловушка
Кому пригодится
Инженерам, которые впервые берут vision-language модель в видеозадачу. Справочник объясняет общее пространство эмбеддингов, как обучается CLIP, откуда берётся zero-shot классификация, чем SigLIP отличается от CLIP, какие бывают размеры моделей OpenAI ViT и как усреднять кадры для видео – без этого эмбеддинги считают, но не понимают, что именно сравнивают.

Без регистрации и почты – файл открывается сразу
Источник
Из какого курса материал
ИИ в видеоинженерии
Компьютерное зрение, речь, мультимодальные модели, генеративное видео, агенты и регламент ЕС об ИИ.
CLIP и контрастное обучение vision-language – введение для каждого инженера видео-ИИ
Vision-language модель – это модель, которая умеет сравнить картинку и фразу и сказать, насколько они друг другу…
Ещё материалы
Похожие материалы
Все материалы →Выбираете технологию под проект?
Пройдём чек-лист вместе и посчитаем стоимость вариантов на ваших объёмах.