Содержание статьи +
Это инженерное руководство, а не юридическая консультация. Уточняйте детали у квалифицированного юриста.
Кратко
Современное ПО видеонаблюдения не просто записывает видео – оно его «смотрит», превращая пиксели в поток типизированных событий («человек вошёл в зону», «номер ABC-123 проехал ворота», «оставлена сумка»), на которые можно настроить тревогу и которые можно искать спустя месяцы. Эти события создаёт небольшое семейство аналитик – детекция и классификация объектов, трекинг и re-identification, распознавание лиц, распознавание номеров, поведенческие правила, детекция аномалий и поиск по событию – и эта статья их общая карта: что каждая детектит, где работает, как попадает в Video Management System (VMS) и насколько она на самом деле точна. Две из них – распознавание лиц и распознавание номеров – биометрические, поэтому это юридический барьер прежде, чем функция, ограниченный GDPR, EU AI Act и Illinois BIPA. Прочтите это первым, чтобы понять весь каталог, а затем переходите по ссылкам в подробную статью по каждой аналитике.
Зачем это нужно
Если вы проектируете или покупаете систему видеонаблюдения, вендор вручит вам список функций – «детекция людей, классификация авто, распознавание лиц, LPR, вторжение, праздношатание, аномалии, умный поиск» – и все галочки будут проставлены. Список не говорит ничего о том, какие аналитики вам действительно нужны, где каждая работает, во что обойдётся в ложных тревогах и какие нельзя включить без ревью приватности. Эта статья – каталог, превращающий безликий список функций в карту, о которой можно рассуждать: что детектит каждая аналитика, какую реальную точность даёт при реальном свете и нагрузке, как проявляется в виде события для поиска в ПО ваших операторов и какие из них биометрические и потому юридически ограничены. Системный интегратор, продакт-лид или служба эксплуатации в ритейле или городе должны закончить чтение и точно знать, какую подробную статью читать дальше – и какие функции оставить выключенными, пока юрист не дал добро.
От пикселей к событиям: что такое «видеоаналитика»
Начнём с единственного определения, на котором держится вся статья. Видеоаналитика – это ПО, которое смотрит поток камеры и превращает изображение в смысл: вместо того чтобы человек таращился в стену мониторов, ПО сообщает «человек пересёк эту линию в 14:03 на камере 7». Удобный способ это удержать: камера производит пиксели, а видеоаналитика производит события. Событие – это маленькая типизированная запись с меткой времени: тип объекта, рамка на кадре, оценка уверенности, иногда атрибут вроде цвета или строки номера – и именно эта запись делает систему пригодной для поиска и тревог, а не просто диском, забитым видео, в котором никто ничего не найдёт.
Держим отдельно одну вещь, потому что это другой вопрос со своей статьёй. Где работает аналитика – внутри камеры, на сервере в здании или в облаке – это решение о развёртывании, и оно задаёт задержку, трафик и приватность. Здесь мы это не переспориваем; об этом – аналитика на краю против облака. Тут мы отвечаем на вторую половину: что система умеет детектировать и как каждая детекция становится пригодным событием. Обе половины делят имя – «видеоаналитика» – но чётко расходятся: та статья владеет тем, где идёт работа, эта – тем, что работа производит.
Для шага «становится пригодным событием» есть отраслевой стандарт, и это часть, которой владеет этот раздел. ONVIF – это общий язык, позволяющий камерам и ПО разных производителей понимать друг друга, и один профиль ONVIF создан специально для аналитики. ONVIF Profile M стандартизирует метаданные и события, которые отдаёт аналитика: общую классификацию объектов плюс конкретные метаданные для геолокации, транспорта, номера, лица и тела человека, а также интерфейсы событий для подсчёта объектов, распознавания номеров и распознавания лиц (ONVIF, Profile M). Деталь, важная для этой карты: продукт с Profile M может быть камерой, сервером на объекте или облачным сервисом, а потребителем может быть VMS, NVR или облачное приложение – так что один и тот же язык событий работает независимо от того, где отработала аналитика (ONVIF). Когда вендор говорит, что аналитика «попадает в VMS», всё чаще это именно Profile M. Метаданные могут ехать внутри видеопотока, через сервис событий ONVIF или поверх MQTT – лёгкого протокола обмена сообщениями, распространённого в системах подключённых устройств. Как всегда с ONVIF, соответствие – это база: два продукта с Profile M надёжно обменяются стандартными событиями, но особый атрибут вендора всё равно может потребовать его собственного SDK. Про стандартный слой под этим – события, метаданные и интерфейс аналитики ONVIF.
Карта: одна база, семь семейств
Почти всё, что система умеет детектировать, построено на одном фундаменте и раскладывается в семь семейств. Фундамент – детекция объектов: найти объекты в кадре и обвести каждый рамкой. Всё богаче – слой сверху: классифицировать, что в каждой рамке, проследить рамку во времени, распознать конкретную личность внутри неё, прочитать с неё текст, применить правило к её движению или выучить, что «нормально», чтобы необычное выделялось. Держите карту в голове – и любой список функций вендора сам разложится по полкам.
Сквозь всю карту проходит вторая организующая мысль, и это редакционный хребет раздела: точность – всегда диапазон, никогда не одно число и никогда не «100%». Качество каждой аналитики описывают две величины в натяжении – precision (доля её тревог, что реальны) и recall (доля реальных событий, что она ловит) – и обе двигаются со сценой, светом, ракурсом камеры и тем, насколько хорошо систему настроили. Где статья даёт числа, это честные диапазоны с приложенными условиями. Инженерия моделей, дающая эти числа – сети детекции, обучение, точность на бюджет вычислений – живёт в нашем разделе AI for Video Engineering; эта статья владеет тем, как каждая аналитика встраивается в камеру, VMS и хранилище и что даёт на практике.
1. Детекция и классификация объектов – фундамент
Что детектит: предметы и что это. Детекция объектов обводит каждый объект интереса рамкой; классификация маркирует каждую рамку – человек, легковая, грузовик, велосипед, сумка, животное. Это аналитика, на которой построены все остальные, и для большинства покупателей самая полезная: «дай тревогу, когда человек (не кот, не тень) входит сюда после закрытия» уже убирает большинство паразитных тревог старой детекции движения, срабатывавшей на любое изменение пикселей.
Реальность точности: качество детекции на стандартном академическом бенчмарке (датасет COCO) измеряют как mean average precision (mAP), и нынешние детекторы реального времени дают примерно 38–55% mAP по строгой метрике mAP@50–95 – например, компактный YOLOv10n около 38,5, а более тяжёлый трансформерный детектор RF-DETR около 54,7 (Ultralytics; Roboflow). Это строгое число кажется низким, потому что требует почти идеальных рамок для объектов разных размеров; в фиксированной хорошо освещённой сцене настроенный детектор достигает заметно более высоких рабочих precision и recall по немногим классам, что вам важны. Честная формулировка для покупателя: спрашивайте precision и recall при вашем свете и расположении камеры, никогда не одно «99%».
Где работает и как проявляется: детекция достаточно лёгкая для ИИ-чипа самой камеры, поэтому это обычно уровень края, отдающий событие классифицированного объекта на каждую детекцию. В VMS проявляется как фильтруемое событие («покажи все события транспорт у разгрузочной рампы между 02:00 и 04:00»). Внутренности модели – территория статьи детекция и классификация объектов в видеонаблюдении, которая дальше ссылается на раздел ИИ.
2. Трекинг и re-identification – следить за одним
Что детектит: непрерывность. Трекинг связывает рамки одного объекта в соседних кадрах, чтобы система знала «это тот же идущий человек, а не пять разных по одному на кадр». Re-identification (re-ID) расширяет это на камеры: распознать, что человек, ушедший из поля камеры 3, – тот, кто появился на камере 8, – не зная, кто это. Это разница между подсчётом тел и слежением за траекторией.
Реальность точности: трекинг внутри одной камеры зрелый; межкамерный re-identification ощутимо сложнее и деградирует с разрывами во времени, сменой света и скученностью, потому что система сопоставляет внешность (одежду, телосложение, походку), а не удостоверение. Считайте межкамерный re-ID сильным следственным подспорьем с реальной частотой ошибок, а не гарантией.
Где работает и вес для приватности: трекинг часто идёт на краю рядом с детекцией; межкамерный re-ID обычно требует сервера или облака, потому что сравнивает по многим потокам. Re-ID несёт больший вес для приватности, чем простая детекция – он строит трассу перемещения человека – даже не называя его. Механика и нюанс приватности подробно разобраны в трекинг и re-identification по камерам.
3. Распознавание лиц – личность и первый юридический барьер
Что детектит: кто. Сначала разведём два термина, что путают. Детекция лица находит, что в кадре есть лицо (рамка) – небиометрическая, и основа функций приватности вроде размытия. Распознавание лица измеряет лицо в числовой шаблон и сопоставляет с галереей известных людей, отвечая «это Персона X?» – это биометрическая идентификация и совсем другое дело.
Реальность точности: в независимых тестах NIST лучшие алгоритмы распознавания лиц поразительно точны в контролируемых условиях – лидер оценки «один ко многим» 2025 года промахивался всего около 0,07% поисков по галерее из 12 миллионов изображений (NIST FRTE). Но видеонаблюдение – не контролируемое условие: точность падает на лицах под углом, при смазе, плохом свете и низком разрешении, и собственные работы NIST документируют, что частота ошибок может различаться между демографическими группами (NIST FRVT, демографические эффекты). Поэтому честная формулировка – «почти идеально в кабинке для паспорта, ощутимо хуже на широкоугольной камере в сумерках» – никогда не плоское «100%».
Юридический барьер идёт прежде возможности. Поскольку шаблон лица – биометрические данные, распознавание лиц сильно ограничено. По GDPR ЕС биометрические данные, обрабатываемые для уникальной идентификации человека, – особая категория (ст. 9), которая обычно требует явного законного основания и оценки воздействия на защиту данных (DPIA) (GDPR; EDPB Guidelines 05/2022). EU AI Act идёт дальше: он запрещает неизбирательный сбор CCTV для построения баз распознавания лиц и запрещает биометрическую идентификацию в реальном времени в публичных местах для силовиков (действует с февраля 2025), а прочую дистанционную биометрическую идентификацию относит к высокому риску – эти обязанности применяются с 2 декабря 2027 по соглашению об упрощении 2026 года (Еврокомиссия, AI Act). В Иллинойсе закон о приватности биометрической информации (BIPA, 740 ILCS 14) даёт людям частный иск со статутными убытками $1 000 за неосторожное и $5 000 за умышленное нарушение – хотя поправка 2024 года (SB 2979) ограничила повторный сбор того же идентификатора одним взысканием. Решите, можете ли вы по закону запускать распознавание лиц, прежде чем оцените, способны ли. Полный закон – в распознавании лиц в видеонаблюдении и в Блоке 6; это инженерное руководство, а не юридическая консультация.
4. Распознавание номеров (LPR / ANPR) – читать текст с мира
Что детектит: строки номеров. Распознавание номеров – также automatic number-plate recognition (ANPR) – находит номер в кадре и читает его символы в текст, превращая «проехал автомобиль» в «автомобиль ABC-123 проехал в 14:03». Оно питает парковки, контроль доступа, платные дороги и городской трафик и имеет самый ясный, самый коммерческий спрос во всём блоке.
Реальность точности: реальный LPR работает примерно на 90–98% в хороших условиях и может превысить 99% в контролируемой полосе со специальной камерой, но точность резко падает – ниже 70–80% в части тестов – при движении, косых ракурсах, грязных или повреждённых номерах, бликах и сильном дожде или снеге, и зависит от региона и дизайна номера (Carmen Cloud; обзорная литература). Камера для номеров – специализированный инструмент: правильный угол монтажа, выдержка и нередко ИК-подсветка важнее, чем сами по себе мегапиксели.
Вес для приватности: в большинстве юрисдикций номер – персональные данные, потому что связан с зарегистрированным владельцем, так что LPR несёт обязанность по приватности и хранению, даже не будучи «биометрией» в смысле лица. Считайте данные номеров регулируемыми. Конвейер «от захвата до символов» и юридическая рамка – в распознавании номеров (LPR / ANPR).
5. Поведенческая аналитика – правила поверх детекции
Что детектит: движение против правила, что вы задали. Поведенческая аналитика сидит поверх детекции и трекинга и срабатывает, когда поведение объекта совпадает с заданным вами в VMS шаблоном: человек пересекает виртуальную линию (растяжку), входит в нарисованную зону (вторжение), задерживается слишком долго (праздношатание), толпа превышает порог плотности, или предмет появляется и остаётся (оставленный) либо исчезает (унесённый). Ум – в правиле, нарисованном на виде камеры, а не в новом виде модели.
Реальность точности: поведенческие правила хороши ровно настолько, насколько хороша детекция под ними и аккуратность рисунка правила. Плохо размещённая зона вторжения, включившая колышущееся на ветру дерево или блик фары, будет давать ложные тревоги всю ночь. Здесь настройка зарабатывает свой хлеб, и потому у блока есть целая статья об этом – настройка аналитики: ложные срабатывания, точность и реальность оператора.
Где работает и как проявляется: правила обычно идут там, где идёт детекция (часто край), и проявляются как именованные события правил («Вторжение – Зона A – камера 12»). Ремесло авторинга правил – в поведенческой аналитике: праздношатание, вторжение, толпа и зоны.
6. Детекция аномалий – отметить необычное без правила
Что детектит: отклонение от нормы. Где поведенческая аналитика срабатывает на написанное вами правило, детекция аномалий выучивает нормальный паттерн сцены со временем и отмечает то, что от него отходит – авто, едущее не туда, человек в зоне, обычно пустой в этот час, необычная толпа. Полезна именно там, где нельзя заранее перечислить каждое плохое событие.
Реальность точности: детекция аномалий меняет охват на ложные тревоги резче любой другой аналитики, потому что «необычное» неотъемлемо размыто. Настроенная свободно – кричит «волки»; настроенная жёстко – пропускает. Лучше использовать как сортировочную подсказку, поднимающую внимание оператора, а не как жёсткий триггер. Внутренности модели принадлежат разделу ИИ – про применение в видеонаблюдении см. детекцию аномалий на видео, которая ссылается на тот плейбук.
7. Поиск по событию – окупаемость всего этого
Что детектит: ничего нового – она использует всё, что произвели остальные шесть. Поиск по событию (поиск по архиву) – функция, ради которой аналитика окупается для большинства покупателей. Поскольку каждая детекция сохранена как типизированное событие с меткой времени и атрибутами, следователь может спросить «покажи каждый красный грузовик у северных ворот в прошлый вторник между 12:00 и 14:00» и получить ответ за секунды вместо перемотки 48 камеро-часов видео руками. Она читает метаданные, произведённые выше (часто через Profile M), и видео, сохранённое уровнем записи.
Здесь же вся карта окупается архитектурно: ценность детекции, классификации, трекинга и распознавания реализуется во время поиска, когда месяцы архива становятся базой данных с запросами. Сам опыт поиска – в поиске по событию: сделать месяцы архива находимыми; хранилище под ним – как работает хранение в видеонаблюдении.
Каталог на одной странице
Вот вся карта таблицей – версия, которую держат рядом со списком функций вендора. Читайте строку, чтобы разместить аналитику; читайте сначала колонку «вес приватности», если комплаенс – ваше связывающее ограничение.
| Аналитика | Что детектит | Реальность точности (с условиями) | Где обычно работает | В VMS как | Вес приватности |
|---|---|---|---|---|---|
| Детекция + классификация | Люди, авто, объекты – и что это | ~38–55% mAP@50–95 на COCO; выше настроенные precision/recall в фикс. сцене | Край (камера) | События классиф. объектов | Низкий |
| Трекинг + re-ID | Один объект по кадрам и камерам | Сильно в камере; межкамерный re-ID хуже при свете, разрывах, толпе | Край / сервер | Траектории, совпадения re-ID | Средний – трасса перемещения |
| Распознавание лиц | Конкретная личность | Почти идеально в лаб. (~0,07% промах, NIST); хуже на широком угле/в темноте; демография | Сервер / облако | События совпадения личности | Высокий – биометрия, барьер |
| Распознавание номеров | Символы номера текстом | ~90–98% в норме; <70–80% при движении, ракурсе, грязи, непогоде | Край / сервер | События чтения номера | Высокий – персональные данные |
| Поведенческая | Нарушения правил: линия, зона, шатание, толпа | Хороша как детекция под ней и нарисованное правило | Край | Именованные события правил | Низк.–средний |
| Детекция аномалий | Отклонения от выученной нормы | Резкий компромисс охват/ложные | Сервер / облако | Тревоги аномалий | Средний |
| Поиск по событию | Ничего нового – запрос по событиям | Хорош как метаданные, его питающие | Сервер / облако | Интерфейс поиска | Наследует вес источника |
Таблица 1. Семь семейств аналитики против того, что покупателю реально надо знать. Две строки высокого веса – распознавание лиц и номеров – те, что требуют ревью приватности/права до развёртывания, а не просто переключателя настройки.
Разобранный пример: почему «99% точности» всё равно затопит операторов
Самое важное число во всей карте – не точность, а объём ложных тревог, и немного арифметики покажет почему. Возьмём объект на 30 камер с детекцией вторжения. По этим камерам аналитика оценивает каждый день большое число кандидатов на движение – людей, авто, летящий мусор, тени, фары. Скажем, объект производит 100 000 кандидатных событий движения в день (оживлённый смешанный объект внутри/снаружи легко столько даёт).
Теперь пусть аналитика «99% точна» в том смысле, что любят называть вендоры – 1% частоты ложных срабатываний на этих кандидатах. Арифметика безжалостна:
ложных тревог в день = 1% × 100 000 кандидатов = 1 000 ложных тревог.
Против них число реальных вторжений может быть 10 в день. Так операторы видят примерно 1 010 тревог, чтобы найти 10 реальных – precision системы, как её переживают, около:
precision ≈ 10 реальных ÷ 1 010 всего ≈ 1%.
Детектор «99% точности» выдал поток тревог на 1% полезный. Это проблема базовой частоты, и потому раздел отказывается от фразы «100% точности»: в масштабе пригодность решает не то, как часто система права на одном кадре, а сколько ложных тревог доживёт до человека. Слоистая форма карты – это и есть исправление: дешёвая лёгкая детекция в основании фильтрует кандидатов, так что дорогие аналитики (и ваши операторы) видят лишь немногие, что важны. Сделать эту фильтрацию правильно – тема честного итогового разбора блока, настройки аналитики.
Частая ошибка, которой стоит избегать
Самый дорогой паттерн, что мы видим – покупать аналитику по галочке в списке функций, а не по частоте ложных в вашей сцене – и сразу за ним включать биометрическую аналитику, словно это просто ещё один переключатель. Лист вендора со всеми галочками не говорит ничего о том, как ведёт себя правило вторжения в 2 часа ночи на ветру в деревьях или можно ли вообще законно запускать распознавание лиц на вашем объекте. Исправление – дисциплина, на которой построена карта: выбирайте аналитики под задачу, требуйте precision и recall в ваших условиях, ставьте биометрические за ревью приватности до любой технической работы и судите всё по потоку тревог, с которым реально живёт оператор – а не по демо.
Где здесь Фора Софт
Фора Софт строит ПО реального времени для видео, стриминга и компьютерного зрения с 2005 года, в 250+ выпущенных проектах, и карта аналитики – разговор, который мы ведём почти с каждым клиентом по видеонаблюдению, потому что коробочные платформы поставляют весь список функций включённым и оставляют покупателю позже узнать счёт за ложные тревоги и барьер комплаенса. К нам приходят строить аналитики, что реально нужны – детекцию и поведенческие правила, настроенные под их сцены, чтобы операторы доверяли тревогам, межкамерный трекинг, что держится, и биометрические аналитики, оставленные на оборудовании и на законном основании, удовлетворяющем сотрудника по защите данных. Рамка, с которой мы начинаем, всегда – сначала как система ведёт себя под реальной нагрузкой: реальные precision и recall при вашем свете, частота ложных, с которой будут жить операторы, и осанка приватности, что держит развёртывание законным – а потом возможность. Система, которой операторы доверяют, бьёт ту, что хорошо смотрится в демо.
Главное
- Видеоаналитика превращает пиксели в типизированные события для поиска; продукт – событие, не видео.
- Каталог – это одна база (детекция объектов) и семь семейств вплоть до поиска по событию.
- Точность – всегда диапазон precision/recall, привязанный к сцене и свету – никогда не «100%».
- Распознавание лиц и номеров – биометрия: юридический барьер прежде, чем функция.
- ONVIF Profile M – то, как аналитика попадает в VMS стандартными событиями.
- Судите аналитику по объёму ложных тревог, с которым живут операторы, а не по списку функций.