Карта видеоаналитики: что умеет детектировать

Автор: Николай СапуновОбновлено: август 202620 мин чтения
Содержание статьи +

Это инженерное руководство, а не юридическая консультация. Уточняйте детали у квалифицированного юриста.

Кратко

Современное ПО видеонаблюдения не просто записывает видео – оно его «смотрит», превращая пиксели в поток типизированных событий («человек вошёл в зону», «номер ABC-123 проехал ворота», «оставлена сумка»), на которые можно настроить тревогу и которые можно искать спустя месяцы. Эти события создаёт небольшое семейство аналитик – детекция и классификация объектов, трекинг и re-identification, распознавание лиц, распознавание номеров, поведенческие правила, детекция аномалий и поиск по событию – и эта статья их общая карта: что каждая детектит, где работает, как попадает в Video Management System (VMS) и насколько она на самом деле точна. Две из них – распознавание лиц и распознавание номеров – биометрические, поэтому это юридический барьер прежде, чем функция, ограниченный GDPR, EU AI Act и Illinois BIPA. Прочтите это первым, чтобы понять весь каталог, а затем переходите по ссылкам в подробную статью по каждой аналитике.

Зачем это нужно

Если вы проектируете или покупаете систему видеонаблюдения, вендор вручит вам список функций – «детекция людей, классификация авто, распознавание лиц, LPR, вторжение, праздношатание, аномалии, умный поиск» – и все галочки будут проставлены. Список не говорит ничего о том, какие аналитики вам действительно нужны, где каждая работает, во что обойдётся в ложных тревогах и какие нельзя включить без ревью приватности. Эта статья – каталог, превращающий безликий список функций в карту, о которой можно рассуждать: что детектит каждая аналитика, какую реальную точность даёт при реальном свете и нагрузке, как проявляется в виде события для поиска в ПО ваших операторов и какие из них биометрические и потому юридически ограничены. Системный интегратор, продакт-лид или служба эксплуатации в ритейле или городе должны закончить чтение и точно знать, какую подробную статью читать дальше – и какие функции оставить выключенными, пока юрист не дал добро.

От пикселей к событиям: что такое «видеоаналитика»

Начнём с единственного определения, на котором держится вся статья. Видеоаналитика – это ПО, которое смотрит поток камеры и превращает изображение в смысл: вместо того чтобы человек таращился в стену мониторов, ПО сообщает «человек пересёк эту линию в 14:03 на камере 7». Удобный способ это удержать: камера производит пиксели, а видеоаналитика производит события. Событие – это маленькая типизированная запись с меткой времени: тип объекта, рамка на кадре, оценка уверенности, иногда атрибут вроде цвета или строки номера – и именно эта запись делает систему пригодной для поиска и тревог, а не просто диском, забитым видео, в котором никто ничего не найдёт.

Держим отдельно одну вещь, потому что это другой вопрос со своей статьёй. Где работает аналитика – внутри камеры, на сервере в здании или в облаке – это решение о развёртывании, и оно задаёт задержку, трафик и приватность. Здесь мы это не переспориваем; об этом – аналитика на краю против облака. Тут мы отвечаем на вторую половину: что система умеет детектировать и как каждая детекция становится пригодным событием. Обе половины делят имя – «видеоаналитика» – но чётко расходятся: та статья владеет тем, где идёт работа, эта – тем, что работа производит.

Для шага «становится пригодным событием» есть отраслевой стандарт, и это часть, которой владеет этот раздел. ONVIF – это общий язык, позволяющий камерам и ПО разных производителей понимать друг друга, и один профиль ONVIF создан специально для аналитики. ONVIF Profile M стандартизирует метаданные и события, которые отдаёт аналитика: общую классификацию объектов плюс конкретные метаданные для геолокации, транспорта, номера, лица и тела человека, а также интерфейсы событий для подсчёта объектов, распознавания номеров и распознавания лиц (ONVIF, Profile M). Деталь, важная для этой карты: продукт с Profile M может быть камерой, сервером на объекте или облачным сервисом, а потребителем может быть VMS, NVR или облачное приложение – так что один и тот же язык событий работает независимо от того, где отработала аналитика (ONVIF). Когда вендор говорит, что аналитика «попадает в VMS», всё чаще это именно Profile M. Метаданные могут ехать внутри видеопотока, через сервис событий ONVIF или поверх MQTT – лёгкого протокола обмена сообщениями, распространённого в системах подключённых устройств. Как всегда с ONVIF, соответствие – это база: два продукта с Profile M надёжно обменяются стандартными событиями, но особый атрибут вендора всё равно может потребовать его собственного SDK. Про стандартный слой под этим – события, метаданные и интерфейс аналитики ONVIF.

Рисунок 1. Конвейер, общий для всех аналитик. Слева входят пиксели; аналитика превращает их в маленькое типизированное событие (метаданные ONVIF Profile M); VMS индексирует это событие, чтобы оно могло вести живую тревогу сейчас и поиск по архиву через месяцы. Видео – сырьё; событие – продукт.

Карта: одна база, семь семейств

Почти всё, что система умеет детектировать, построено на одном фундаменте и раскладывается в семь семейств. Фундамент – детекция объектов: найти объекты в кадре и обвести каждый рамкой. Всё богаче – слой сверху: классифицировать, что в каждой рамке, проследить рамку во времени, распознать конкретную личность внутри неё, прочитать с неё текст, применить правило к её движению или выучить, что «нормально», чтобы необычное выделялось. Держите карту в голове – и любой список функций вендора сам разложится по полкам.

Сквозь всю карту проходит вторая организующая мысль, и это редакционный хребет раздела: точность – всегда диапазон, никогда не одно число и никогда не «100%». Качество каждой аналитики описывают две величины в натяжении – precision (доля её тревог, что реальны) и recall (доля реальных событий, что она ловит) – и обе двигаются со сценой, светом, ракурсом камеры и тем, насколько хорошо систему настроили. Где статья даёт числа, это честные диапазоны с приложенными условиями. Инженерия моделей, дающая эти числа – сети детекции, обучение, точность на бюджет вычислений – живёт в нашем разделе AI for Video Engineering; эта статья владеет тем, как каждая аналитика встраивается в камеру, VMS и хранилище и что даёт на практике.

Рисунок 2. Весь каталог на одной карте. Детекция объектов – база; классификация, трекинг и re-identification, распознавание лиц, распознавание номеров, поведенческие правила, детекция аномалий и поиск по событию – семейства над ней. Оранжевым отмечены две биометрические аналитики – лица и номера – которые барьер прежде, чем функция.

1. Детекция и классификация объектов – фундамент

Что детектит: предметы и что это. Детекция объектов обводит каждый объект интереса рамкой; классификация маркирует каждую рамку – человек, легковая, грузовик, велосипед, сумка, животное. Это аналитика, на которой построены все остальные, и для большинства покупателей самая полезная: «дай тревогу, когда человек (не кот, не тень) входит сюда после закрытия» уже убирает большинство паразитных тревог старой детекции движения, срабатывавшей на любое изменение пикселей.

Реальность точности: качество детекции на стандартном академическом бенчмарке (датасет COCO) измеряют как mean average precision (mAP), и нынешние детекторы реального времени дают примерно 38–55% mAP по строгой метрике mAP@50–95 – например, компактный YOLOv10n около 38,5, а более тяжёлый трансформерный детектор RF-DETR около 54,7 (Ultralytics; Roboflow). Это строгое число кажется низким, потому что требует почти идеальных рамок для объектов разных размеров; в фиксированной хорошо освещённой сцене настроенный детектор достигает заметно более высоких рабочих precision и recall по немногим классам, что вам важны. Честная формулировка для покупателя: спрашивайте precision и recall при вашем свете и расположении камеры, никогда не одно «99%».

Где работает и как проявляется: детекция достаточно лёгкая для ИИ-чипа самой камеры, поэтому это обычно уровень края, отдающий событие классифицированного объекта на каждую детекцию. В VMS проявляется как фильтруемое событие («покажи все события транспорт у разгрузочной рампы между 02:00 и 04:00»). Внутренности модели – территория статьи детекция и классификация объектов в видеонаблюдении, которая дальше ссылается на раздел ИИ.

2. Трекинг и re-identification – следить за одним

Что детектит: непрерывность. Трекинг связывает рамки одного объекта в соседних кадрах, чтобы система знала «это тот же идущий человек, а не пять разных по одному на кадр». Re-identification (re-ID) расширяет это на камеры: распознать, что человек, ушедший из поля камеры 3, – тот, кто появился на камере 8, – не зная, кто это. Это разница между подсчётом тел и слежением за траекторией.

Реальность точности: трекинг внутри одной камеры зрелый; межкамерный re-identification ощутимо сложнее и деградирует с разрывами во времени, сменой света и скученностью, потому что система сопоставляет внешность (одежду, телосложение, походку), а не удостоверение. Считайте межкамерный re-ID сильным следственным подспорьем с реальной частотой ошибок, а не гарантией.

Где работает и вес для приватности: трекинг часто идёт на краю рядом с детекцией; межкамерный re-ID обычно требует сервера или облака, потому что сравнивает по многим потокам. Re-ID несёт больший вес для приватности, чем простая детекция – он строит трассу перемещения человека – даже не называя его. Механика и нюанс приватности подробно разобраны в трекинг и re-identification по камерам.

3. Распознавание лиц – личность и первый юридический барьер

Что детектит: кто. Сначала разведём два термина, что путают. Детекция лица находит, что в кадре есть лицо (рамка) – небиометрическая, и основа функций приватности вроде размытия. Распознавание лица измеряет лицо в числовой шаблон и сопоставляет с галереей известных людей, отвечая «это Персона X?» – это биометрическая идентификация и совсем другое дело.

Реальность точности: в независимых тестах NIST лучшие алгоритмы распознавания лиц поразительно точны в контролируемых условиях – лидер оценки «один ко многим» 2025 года промахивался всего около 0,07% поисков по галерее из 12 миллионов изображений (NIST FRTE). Но видеонаблюдение – не контролируемое условие: точность падает на лицах под углом, при смазе, плохом свете и низком разрешении, и собственные работы NIST документируют, что частота ошибок может различаться между демографическими группами (NIST FRVT, демографические эффекты). Поэтому честная формулировка – «почти идеально в кабинке для паспорта, ощутимо хуже на широкоугольной камере в сумерках» – никогда не плоское «100%».

Юридический барьер идёт прежде возможности. Поскольку шаблон лица – биометрические данные, распознавание лиц сильно ограничено. По GDPR ЕС биометрические данные, обрабатываемые для уникальной идентификации человека, – особая категория (ст. 9), которая обычно требует явного законного основания и оценки воздействия на защиту данных (DPIA) (GDPR; EDPB Guidelines 05/2022). EU AI Act идёт дальше: он запрещает неизбирательный сбор CCTV для построения баз распознавания лиц и запрещает биометрическую идентификацию в реальном времени в публичных местах для силовиков (действует с февраля 2025), а прочую дистанционную биометрическую идентификацию относит к высокому риску – эти обязанности применяются с 2 декабря 2027 по соглашению об упрощении 2026 года (Еврокомиссия, AI Act). В Иллинойсе закон о приватности биометрической информации (BIPA, 740 ILCS 14) даёт людям частный иск со статутными убытками $1 000 за неосторожное и $5 000 за умышленное нарушение – хотя поправка 2024 года (SB 2979) ограничила повторный сбор того же идентификатора одним взысканием. Решите, можете ли вы по закону запускать распознавание лиц, прежде чем оцените, способны ли. Полный закон – в распознавании лиц в видеонаблюдении и в Блоке 6; это инженерное руководство, а не юридическая консультация.

4. Распознавание номеров (LPR / ANPR) – читать текст с мира

Что детектит: строки номеров. Распознавание номеров – также automatic number-plate recognition (ANPR) – находит номер в кадре и читает его символы в текст, превращая «проехал автомобиль» в «автомобиль ABC-123 проехал в 14:03». Оно питает парковки, контроль доступа, платные дороги и городской трафик и имеет самый ясный, самый коммерческий спрос во всём блоке.

Реальность точности: реальный LPR работает примерно на 90–98% в хороших условиях и может превысить 99% в контролируемой полосе со специальной камерой, но точность резко падает – ниже 70–80% в части тестов – при движении, косых ракурсах, грязных или повреждённых номерах, бликах и сильном дожде или снеге, и зависит от региона и дизайна номера (Carmen Cloud; обзорная литература). Камера для номеров – специализированный инструмент: правильный угол монтажа, выдержка и нередко ИК-подсветка важнее, чем сами по себе мегапиксели.

Вес для приватности: в большинстве юрисдикций номер – персональные данные, потому что связан с зарегистрированным владельцем, так что LPR несёт обязанность по приватности и хранению, даже не будучи «биометрией» в смысле лица. Считайте данные номеров регулируемыми. Конвейер «от захвата до символов» и юридическая рамка – в распознавании номеров (LPR / ANPR).

5. Поведенческая аналитика – правила поверх детекции

Что детектит: движение против правила, что вы задали. Поведенческая аналитика сидит поверх детекции и трекинга и срабатывает, когда поведение объекта совпадает с заданным вами в VMS шаблоном: человек пересекает виртуальную линию (растяжку), входит в нарисованную зону (вторжение), задерживается слишком долго (праздношатание), толпа превышает порог плотности, или предмет появляется и остаётся (оставленный) либо исчезает (унесённый). Ум – в правиле, нарисованном на виде камеры, а не в новом виде модели.

Реальность точности: поведенческие правила хороши ровно настолько, насколько хороша детекция под ними и аккуратность рисунка правила. Плохо размещённая зона вторжения, включившая колышущееся на ветру дерево или блик фары, будет давать ложные тревоги всю ночь. Здесь настройка зарабатывает свой хлеб, и потому у блока есть целая статья об этом – настройка аналитики: ложные срабатывания, точность и реальность оператора.

Где работает и как проявляется: правила обычно идут там, где идёт детекция (часто край), и проявляются как именованные события правил («Вторжение – Зона A – камера 12»). Ремесло авторинга правил – в поведенческой аналитике: праздношатание, вторжение, толпа и зоны.

6. Детекция аномалий – отметить необычное без правила

Что детектит: отклонение от нормы. Где поведенческая аналитика срабатывает на написанное вами правило, детекция аномалий выучивает нормальный паттерн сцены со временем и отмечает то, что от него отходит – авто, едущее не туда, человек в зоне, обычно пустой в этот час, необычная толпа. Полезна именно там, где нельзя заранее перечислить каждое плохое событие.

Реальность точности: детекция аномалий меняет охват на ложные тревоги резче любой другой аналитики, потому что «необычное» неотъемлемо размыто. Настроенная свободно – кричит «волки»; настроенная жёстко – пропускает. Лучше использовать как сортировочную подсказку, поднимающую внимание оператора, а не как жёсткий триггер. Внутренности модели принадлежат разделу ИИ – про применение в видеонаблюдении см. детекцию аномалий на видео, которая ссылается на тот плейбук.

7. Поиск по событию – окупаемость всего этого

Что детектит: ничего нового – она использует всё, что произвели остальные шесть. Поиск по событию (поиск по архиву) – функция, ради которой аналитика окупается для большинства покупателей. Поскольку каждая детекция сохранена как типизированное событие с меткой времени и атрибутами, следователь может спросить «покажи каждый красный грузовик у северных ворот в прошлый вторник между 12:00 и 14:00» и получить ответ за секунды вместо перемотки 48 камеро-часов видео руками. Она читает метаданные, произведённые выше (часто через Profile M), и видео, сохранённое уровнем записи.

Здесь же вся карта окупается архитектурно: ценность детекции, классификации, трекинга и распознавания реализуется во время поиска, когда месяцы архива становятся базой данных с запросами. Сам опыт поиска – в поиске по событию: сделать месяцы архива находимыми; хранилище под ним – как работает хранение в видеонаблюдении.

Каталог на одной странице

Вот вся карта таблицей – версия, которую держат рядом со списком функций вендора. Читайте строку, чтобы разместить аналитику; читайте сначала колонку «вес приватности», если комплаенс – ваше связывающее ограничение.

АналитикаЧто детектитРеальность точности (с условиями)Где обычно работаетВ VMS какВес приватности
Детекция + классификацияЛюди, авто, объекты – и что это~38–55% mAP@50–95 на COCO; выше настроенные precision/recall в фикс. сценеКрай (камера)События классиф. объектовНизкий
Трекинг + re-IDОдин объект по кадрам и камерамСильно в камере; межкамерный re-ID хуже при свете, разрывах, толпеКрай / серверТраектории, совпадения re-IDСредний – трасса перемещения
Распознавание лицКонкретная личностьПочти идеально в лаб. (~0,07% промах, NIST); хуже на широком угле/в темноте; демографияСервер / облакоСобытия совпадения личностиВысокий – биометрия, барьер
Распознавание номеровСимволы номера текстом~90–98% в норме; <70–80% при движении, ракурсе, грязи, непогодеКрай / серверСобытия чтения номераВысокий – персональные данные
ПоведенческаяНарушения правил: линия, зона, шатание, толпаХороша как детекция под ней и нарисованное правилоКрайИменованные события правилНизк.–средний
Детекция аномалийОтклонения от выученной нормыРезкий компромисс охват/ложныеСервер / облакоТревоги аномалийСредний
Поиск по событиюНичего нового – запрос по событиямХорош как метаданные, его питающиеСервер / облакоИнтерфейс поискаНаследует вес источника

Таблица 1. Семь семейств аналитики против того, что покупателю реально надо знать. Две строки высокого веса – распознавание лиц и номеров – те, что требуют ревью приватности/права до развёртывания, а не просто переключателя настройки.

Рисунок 3. Каталог как карточка-справка. Те же семь строк, что в таблице, с цветом по весу приватности – оранжевые строки (лица, номера) – юридически ограниченные аналитики.

Разобранный пример: почему «99% точности» всё равно затопит операторов

Самое важное число во всей карте – не точность, а объём ложных тревог, и немного арифметики покажет почему. Возьмём объект на 30 камер с детекцией вторжения. По этим камерам аналитика оценивает каждый день большое число кандидатов на движение – людей, авто, летящий мусор, тени, фары. Скажем, объект производит 100 000 кандидатных событий движения в день (оживлённый смешанный объект внутри/снаружи легко столько даёт).

Теперь пусть аналитика «99% точна» в том смысле, что любят называть вендоры – 1% частоты ложных срабатываний на этих кандидатах. Арифметика безжалостна:

ложных тревог в день = 1% × 100 000 кандидатов = 1 000 ложных тревог.

Против них число реальных вторжений может быть 10 в день. Так операторы видят примерно 1 010 тревог, чтобы найти 10 реальных – precision системы, как её переживают, около:

precision ≈ 10 реальных ÷ 1 010 всего ≈ 1%.

Детектор «99% точности» выдал поток тревог на 1% полезный. Это проблема базовой частоты, и потому раздел отказывается от фразы «100% точности»: в масштабе пригодность решает не то, как часто система права на одном кадре, а сколько ложных тревог доживёт до человека. Слоистая форма карты – это и есть исправление: дешёвая лёгкая детекция в основании фильтрует кандидатов, так что дорогие аналитики (и ваши операторы) видят лишь немногие, что важны. Сделать эту фильтрацию правильно – тема честного итогового разбора блока, настройки аналитики.

Частая ошибка, которой стоит избегать

Самый дорогой паттерн, что мы видим – покупать аналитику по галочке в списке функций, а не по частоте ложных в вашей сцене – и сразу за ним включать биометрическую аналитику, словно это просто ещё один переключатель. Лист вендора со всеми галочками не говорит ничего о том, как ведёт себя правило вторжения в 2 часа ночи на ветру в деревьях или можно ли вообще законно запускать распознавание лиц на вашем объекте. Исправление – дисциплина, на которой построена карта: выбирайте аналитики под задачу, требуйте precision и recall в ваших условиях, ставьте биометрические за ревью приватности до любой технической работы и судите всё по потоку тревог, с которым реально живёт оператор – а не по демо.

Где здесь Фора Софт

Фора Софт строит ПО реального времени для видео, стриминга и компьютерного зрения с 2005 года, в 250+ выпущенных проектах, и карта аналитики – разговор, который мы ведём почти с каждым клиентом по видеонаблюдению, потому что коробочные платформы поставляют весь список функций включённым и оставляют покупателю позже узнать счёт за ложные тревоги и барьер комплаенса. К нам приходят строить аналитики, что реально нужны – детекцию и поведенческие правила, настроенные под их сцены, чтобы операторы доверяли тревогам, межкамерный трекинг, что держится, и биометрические аналитики, оставленные на оборудовании и на законном основании, удовлетворяющем сотрудника по защите данных. Рамка, с которой мы начинаем, всегда – сначала как система ведёт себя под реальной нагрузкой: реальные precision и recall при вашем свете, частота ложных, с которой будут жить операторы, и осанка приватности, что держит развёртывание законным – а потом возможность. Система, которой операторы доверяют, бьёт ту, что хорошо смотрится в демо.

Главное

  • Видеоаналитика превращает пиксели в типизированные события для поиска; продукт – событие, не видео.
  • Каталог – это одна база (детекция объектов) и семь семейств вплоть до поиска по событию.
  • Точность – всегда диапазон precision/recall, привязанный к сцене и свету – никогда не «100%».
  • Распознавание лиц и номеров – биометрия: юридический барьер прежде, чем функция.
  • ONVIF Profile M – то, как аналитика попадает в VMS стандартными событиями.
  • Судите аналитику по объёму ложных тревог, с которым живут операторы, а не по списку функций.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.