Глава 2 из 10
Глава 2. Примитивы компьютерного зрения в рабочей системе
18 статей по порядку – 9 часов 51 минута чтения. Ниже маршрут главы: высота каждого шага соответствует времени чтения.
Глава 2 из 10дальше: Звук и речь: распознавание, синтез, шумоподавление
Примитивы компьютерного зрения, которые доезжают до рабочей системы: детекция и трекинг, сегментация и поза, OCR, глубина, оптический поток, апскейл архива, поиск аномалий. Отдельно – где мультимодальная модель заменяет кастомный CV и что с лицами разрешает EU AI Act.
Маршрут главы
18 статей · 9 ч 51 мин2.1Предобработка видео для ML – Computer Vision проекты, применения и инженерный плейбук 2026Любой проект computer vision, который не доходит до продакшна, проваливается по одной и той же причине: команда…33 мин·от начала главы 0 ч 0 мин2.2YOLO в рабочей системе – v8, v9, v10, v11, v12Между январём 2023 и февралём 2025 года семейство YOLO – рабочая лошадка детекции объектов, которая в видеопродуктах…31 мин·от начала главы 0 ч 33 мин2.3Детекция по открытому словарю – Grounding DINO, Florence-2, OWLv2, RT-DETR, RF-DETRКлассический детектор объектов, обученный на 80 классах бенчмарка COCO – person, car, bottle и так далее – способен…33 мин·от начала главы 1 ч 4 мин2.4SAM 2 Для Видео – Memory Module, Propagation, Rotoscoping/ROISegment Anything Model 2, или SAM 2, – это foundation-модель компьютерного зрения от Meta (2024), которая по одному…26 мин·от начала главы 1 ч 37 мин2.5Сегментация MediaPipe Selfie V2 на WebGPU – размытие фона для рабочей системыИИ-размытие фона – эффект, который скрывает комнату за вами на видеозвонке, размывая каждый пиксель, не относящийся к…26 мин·от начала главы 2 ч 3 мин2.6Детекция и распознавание лиц под EU AI Act – что легально в 2026Детекция лиц – поиск прямоугольников, в которых находится лицо на видеокадре, – это commodity-технология, доступная в…42 мин·от начала главы 2 ч 29 мин2.7OpenPose, MediaPipe Pose, RTMPose, ViTPose – стек pose-трекинга для видео в 2026Pose tracking – определение скелета человека на кадре видео – это вторая по популярности задача компьютерного зрения в…30 мин·от начала главы 3 ч 11 мин2.8Отслеживание множества объектов в 2026 году – DeepSORT, ByteTrack, OC-SORT и трекеры, которые работают в рабочей системеОтслеживание множества объектов (multi-object tracking, MOT) – задача сохранить один и тот же идентификатор за одним и…29 мин·от начала главы 3 ч 41 мин2.9Vision Transformer – основы для инженеров видео-ИИ: от ViT до ViViT, Video Swin и HieraVision Transformer – сокращённо ViT – это архитектура, которая с 2020 по 2024 год вытеснила свёрточные сети, став…38 мин·от начала главы 4 ч 10 мин2.10Real-ESRGAN и BasicVSR++ для апскейлинга OTT-архива – инженерный плейбук 2026У вас лежит back-каталог на SD или с низким битрейтом – тысячи эпизодов ситкома 2003 года, архив broadcast-мастеров…34 мин·от начала главы 4 ч 48 мин2.11Примитивы оптического потока – RAFT против Lucas-KanadeOptical flow – это попиксельная карта того, куда в следующем кадре переместились все объекты, видимые в текущем. Это…27 мин·от начала главы 5 ч 22 мин2.12PaddleOCR для видео – подробный разбор распознавания текстаPaddleOCR – это open-source-инструментарий оптического распознавания символов, выпущенный Baidu на базе PaddlePaddle в…26 мин·от начала главы 5 ч 49 мин2.13Depth Anything и SmolVLM – маленькие модели компьютерного зрения на устройствеDepth Anything V2 и SmolVLM2 – две open-source-модели, благодаря которым в 2026 году малые модели компьютерного зрения…25 мин·от начала главы 6 ч 15 мин2.14Решение «просто возьмём VLM» – когда мультимодальная модель фронтира заменяет кастомный CVМодель, способная обрабатывать и изображение, и текст – её называют vision-language model или VLM, – теперь может…27 мин·от начала главы 6 ч 40 мин2.15Обнаружение аномалий в видео – инженерный плейбук 2026 годаОбнаружение аномалий в видео в 2026 году – это уже не одна модель, выбирающая «странные» кадры в потоке, а…44 мин·от начала главы 7 ч 7 мин2.16Алгоритмы обнаружения аномалий – 12 подходов для рабочей системыДвенадцать алгоритмов покрывают практически любой production-сервис обнаружения аномалий в видео в 2026 году, а…50 мин·от начала главы 7 ч 51 мин2.17Компьютерное зрение в ритейле и промышленности: интеллектуальная видеоаналитикаКомпьютерное зрение превращает обычную камеру в умный датчик, способный распознавать, классифицировать и реагировать на…29 мин·от начала главы 8 ч 41 мин2.18Детектор, трекер и сегментер реального времени на Jetson OrinЭтот итоговый проект объединяет всё, чему учили на главе 2, в единую работающую систему: рядом с камерой стоит небольшой…41 мин·от начала главы 9 ч 10 мин
Строите такую систему?
Поможем выбрать кодек и собрать пайплайн под ваши объёмы – 20 лет в видеоразработке, 250+ проектов.