Глава 4 из 10

Глава 4. Мультимодальные модели: от CLIP до видео-VLM

Семь статей по порядку – 3 часа 31 минута чтения. Ниже маршрут главы: высота каждого шага соответствует времени чтения.

Глава 4 из 10дальше: Генеративное видео: интеграция и производство

Мультимодальные модели: контрастное обучение CLIP, видео-VLM и главный их размен – сэмплирование кадров против потока токенов. Рядом закрытый и открытый фронтир поимённо, дообучение под домен, поиск по видеоархиву на мультимодальном RAG и computer-use агенты.

Маршрут главы

7 статей · 3 ч 31 мин
4.1CLIP и контрастное обучение vision-language – введение для каждого инженера видео-ИИVision-language модель – это модель, которая умеет сравнить картинку и фразу и сказать, насколько они друг другу…28 мин·от начала главы 0 ч 0 мин4.2Видео-VLM в 2026 – сэмплирование кадров против потоковой передачи токеновВидео-модель ИИ – то, что инженеры называют мультимодальной системой, или vision-language-моделью (VLM), научившейся…29 мин·от начала главы 0 ч 28 мин4.3Закрытый фронтир – Gemini 2.5, GPT-5, Claude Opus 4, Claude Computer UseТри закрытых «передовых» семейства моделей – Gemini от Google, GPT-5 от OpenAI и Claude Opus 4 от Anthropic – это самые…29 мин·от начала главы 0 ч 57 мин4.4Открытый фронтир – LLaVA, Qwen-VL, Pixtral, InternVL«Открытый фронтир» – это набор vision-language-моделей, которые можно бесплатно скачать, запустить на своём железе и…28 мин·от начала главы 1 ч 26 мин4.5Fine-tuning видео-VLM на домене – видеонаблюдение, телемедицина, e-learningFine-tuning (дообучение) – это когда вы берёте уже выбранную открытую vision-language-модель и продолжаете её обучение…26 мин·от начала главы 1 ч 54 мин4.6Video RAG: мультимодальный RAG по видео-архивуVideo RAG (retrieval-augmented generation по видео) – это приём, который позволяет ИИ ответить на вопрос, сначала найдя…33 мин·от начала главы 2 ч 20 мин4.7Claude Code, Manus AI, Operator, Perplexity Comet и Apple Intelligence – computer-use агентыComputer-use агент – это ИИ, который работает с программами так же, как человек: смотрит на экран, решает, куда кликнуть…38 мин·от начала главы 2 ч 53 мин

Строите такую систему?

Поможем выбрать кодек и собрать пайплайн под ваши объёмы – 20 лет в видеоразработке, 250+ проектов.