Содержание статьи +
- Кратко (TL;DR)
- Почему это важно
- Что на самом деле значит «ИИ в камере видеонаблюдения»
- Зачем вообще нужны ИИ-камеры: проблема ложных тревог
- Нюанс видеонаблюдения: где аналитика на самом деле работает?
- Расчёт трафика, который доводит аналитику до предела
- Граница, которая решает всё: наблюдать за событиями или распознавать людей
- Корзина детекции: где прячутся предвзятость и точность
- Корзина идентификации: не функция, а отдельный продукт
- Три способа добавить ИИ в систему видеонаблюдения
- Расчёт стоимости на примере: дивиденд от ложных тревог и счёт за трафик
- Шлюз, через который проходит каждое развёртывание: приватность, правовое основание и хранение
- Плейбук: от «добавить ИИ к камерам» до полноценной системы
- Где здесь Фора Софт
- Ключевые выводы
- Что читать дальше
Кратко (TL;DR)
ИИ-камера видеонаблюдения – если отбросить маркетинг, – это обычная камера с небольшим чипом, на котором работает интеллектуальная видеоаналитика: программа, определяющая, что именно изменилось в кадре – человек, машина, животное или просто качнутая веткой. Одно это решение и составляет суть продукта: оно сокращает поток ложных срабатываний датчика движения на 90–95% и превращает камеру, которую раньше игнорировали, в ту, на которую люди действительно обращают внимание.
Функции делятся на три группы, каждая из которых работает по-своему:
- Обнаружение объектов и событий (человек в запрещённой зоне, машина на линии, упавший работник) – это основная, относительно простая часть, приносящая наибольшую ценность;
- Анализ поведения во времени (подсчёт людей, праздношатание, длина очереди, распознавание номеров) – строится на основе первого уровня;
- Идентификация личности по лицу – уже относится к биометрической сфере, которую EU AI Act классифицирует как высокорисковую, а использование в реальном времени в общественных местах напрямую запрещает.
Под каждой функцией – второй выбор: где именно работает аналитика:
- на самой камере (дёшево по трафику, приватно по умолчанию),
- на локальном сервере (наилучшая синхронизация между камерами),
- или в облаке по подписке (масштабируемо, но требует передачи видео за пределы здания).
Этот плейбук даёт продакт-менеджеру и инженеру общую карту: каталог функций, три возможных места для работы ИИ, юридическую границу между наблюдением за событиями и идентификацией людей, выбор «купить или построить» (включая стандарт метаданных ONVIF и требования NDAA к закупкам), а также расчёты по ложным тревогам и трафику – ключевым параметрам, определяющим бюджет.
Почему это важно
Видеонаблюдение – это большой и быстро растущий рынок: к 2026 году объём рынка систем видеонаблюдения оценивается в $64–72 млрд, доля интеллектуальной видеоаналитики составляет около $15 млрд и продолжает расти, а модель подписки – видеонаблюдение как услуга (VSaaS) – оценивается в $7,6 млрд и удваивает темпы роста каждый год, поскольку покупатели всё чаще переходят от покупки оборудования к аренде функциональности. «Добавить ИИ к камерам» – теперь стандартная задача в дорожной карте почти каждого системного интегратора, оператора зданий, ритейлера и города. За этой фразой стоят реальные инженерные и юридические вызовы: какая аналитика работает на камере, какая – на сервере, а какая – в облаке, какой трафик и вычислительные мощности это требует, на что разрешают наводить камеры EU AI Act и GDPR, и у каких вендоров вообще можно закупать оборудование по законам США. Этот плейбук отвечает на эти вопросы именно для вертикали видеонаблюдения. Он написан так, чтобы продакт-менеджер мог спланировать функцию и оценить её риски без диплома по компьютерному зрению или праву, а инженер – понять, где каждая аналитика подключается к видеопотоку и где может возникнуть сбой. Более глубокие уроки этого раздела – это подробные инструкции по отдельным компонентам: детекция объектов, трекинг, обнаружение аномалий, распознавание лиц, edge-оборудование; а данная карта – вертикальная навигация, которая подсказывает, с какого из них начать.
Что на самом деле значит «ИИ в камере видеонаблюдения»
Если убрать маркетинг, ИИ-камера видеонаблюдения – это обычная камера, подключённая к мини-компьютеру, на котором работает интеллектуальная видеоаналитика – софт (сокращённо IVA, от intelligent video analytics), который анализирует видео и отвечает на вопросы о нём структурированными данными, а не просто записывает пиксели. Чаще всего он отвечает на самый важный вопрос: то, что только что шевельнулось, – это что-то, на что мне стоит обратить внимание? Всё остальное строится на этой основе.
Полезно ознакомиться со всем каталогом до обсуждения любой отдельной функции, потому что функции делятся на три группы, к которым по-разному относятся закон, железо и бюджет.
Первая группа – обнаружение объектов и событий. Камера запускает детекцию объектов – технологию, которая обводит предмет в кадре рамкой и определяет его: «человек», «машина», «грузовик», «собака». На основе этой одной возможности строятся ключевые функции: человек в запрещённой зоне после закрытия, машина, пересекающая виртуальную линию, оставленная сумка, рабочий без каски, человек, упавший и не поднявшийся. Это основная часть ценности, к которой статья постоянно возвращается.
Вторая группа – анализ поведения во времени. Если камера способна обнаружить объект на одном кадре, она может отслеживать его между кадрами – это трекинг множества объектов (multi-object tracking, сокращённо MOT). На основе такого отслеживания можно определять количество, время пребывания, праздное шатание, длину очереди, плотность толпы, строить тепловые карты потоков людей и распознавать автомобильные номера (ANPR). Эти функции отвечают на вопросы «сколько», «как долго» и «куда», а не просто «есть ли что-то».
Третья группа – идентификация конкретного человека по лицу или другой биометрической информации: распознавание лиц, при котором изображение сравнивается со списком наблюдения или базой данных известных лиц. На первый взгляд это выглядит как ещё одна форма аналитики. Однако это не так. Как только камера перестаёт задавать вопрос «есть ли здесь человек?» и начинает спрашивать «это Иван Иванов?», она переходит в режим биометрической обработки, регулируемый иными законами и инженерными стандартами. Смешивать её с первыми двумя группами – самая серьёзная и дорогостоящая ошибка, которую может допустить команда видеонаблюдения.
Зачем вообще нужны ИИ-камеры: проблема ложных тревог
Прежде чем переходить к топологии и закону, стоит чётко понять, зачем вообще добавляют ИИ к камере – ведь причина сводится к одному измеримому числу. Обычные камеры фиксируют активность с помощью детекции движения: сравнивают каждый кадр с предыдущим и срабатывают, когда меняется достаточное количество пикселей. Проблема в том, что качающееся дерево, тень от облака, фары, скользящие по стене, дождь, паук на объективе или пластиковый пакет на ветру тоже вызывают изменения пикселей – и детекция движения постоянно кричит «волки!».
Подставим числа. Одна уличная камера на парковке при простой детекции движения генерирует примерно 80–120 событий движения за обычную ночь; из них, возможно, два-три – реальная угроза безопасности. Масштабируем это до скромной площадки из 50 камер – и получаем около 5 000 тревог движения каждую ночь. Если бы оператор тратил всего по 15 секунд на проверку каждой, это:
5 000 тревог × 15 секунд = 75 000 секунд ≈ 20,8 часа просмотра — каждую ночьНи одна служба безопасности не может просматривать 20 часов видео за ночь, поэтому на практике тревоги отключают и игнорируют – в индустрии это называют усталостью от тревог (alarm fatigue). Из-за этого единственный реальный нарушитель теряется в море ложных срабатываний и теней. Система на основе детекции движения в масштабах – по сути, это выключатель с лишними шагами.
ИИ меняет одно ключевое решение. Вместо вопроса «изменились ли пиксели?» камера теперь задаёт: «появился ли человек или машина?» – то есть классифицирует объект до срабатывания тревоги. Благодаря этому деревья, тени, дождь и животные больше не вызывают ложных срабатываний. По всей отрасли это снижает количество ложных тревог на 90–95%. Прогоните ту же территорию из 50 камер заново: ИИ отфильтровывает каждую камеру до примерно 2–5 реальных событий за ночь – скажем, по 4. Тогда:
50 камер × 4 события = 200 тревог за ночь
200 тревог × 15 секунд ≈ 3 000 секунд = 50 минут просмотраПятьдесят минут – это реальный объём работы, который один оператор может выполнить: каждая тревога просмотрена, ничего не пропущено. Именно этот переход – от 5000 игнорируемых тревог к 200 обработанным, сокращение на 96% – и является главной причиной существования ИИ-камер. Все остальные функции из каталога – лишь «глазурь» поверх этого одного расчёта. Модель детекции, выполняющая классификацию, – тема урока про линейку YOLO и урока про детекцию и трекинг объектов; суждение «это нормально?», наложенное сверху, – описывается в плейбуке по обнаружению аномалий.
Нюанс видеонаблюдения: где аналитика на самом деле работает?
Вот структурное решение, которое привязывает «ИИ» именно к «видеонаблюдению» – и это аспект, который большинство обзоров-руководств упускают. В образовательном продукте ключевой вопрос – на каких часах работает функция; в системе видеонаблюдения – где физически выполняется аналитика, потому что именно этот выбор определяет трафик, задержку, приватность и стоимость сразу. Таких мест три, и большинство реальных систем используют более одного.
Первое место – на самой камере, на краю (edge). Современные камеры оснащены небольшим чипом зрения – системой-на-кристалле (SoC) со встроенным нейроускорителем (линейка CVflow от Ambarella, ARTPEC от Axis или модуль-приставка вроде Hailo-8), – который запускает модель детекции прямо внутри камеры. Камера анализирует собственное видео, принимает решение: «человек, зона 3, 02:14, уверенность 0.92» – и отправляет только небольшой пакет метаданных, а также короткий клип, если что-то действительно произошло. Никакие данные не покидают камеру, пока это не имеет значения. Такой подход экономит трафик, обеспечивает быструю реакцию, гарантирует приватность по умолчанию и ограничивает последствия взлома – при компрометации одной камеры под угрозу попадает только она, а не вся площадка.
Второе место – локальный сервер: коробка в здании с системой управления видео (VMS, video management software), которая принимает поток с каждой камеры и запускает аналитику централизованно, обычно на GPU. Суперсила сервера – корреляция: поскольку он видит все камеры одновременно, он может отследить одного человека – сначала на камере 4, потом на 7, затем на 12 – и воссоздать его маршрут по территории. Этого не может сделать ни одна отдельная edge-камера. Цена – в том, что каждая камера должна непрерывно передавать полное видео на сервер, а самому серверу требуется мощное «железо».
Третье место – облако: видеонаблюдение как услуга (VSaaS), где видеопотоки направляются в дата-центр провайдера, а аналитика, хранение и дашборды находятся там же по подписке. Привлекательность – в операционной модели: не нужно содержать собственные серверы, ёмкость легко масштабируется, а вместо капитальных затрат – ежемесячная оплата. Однако цена – в том, что видео покидает территорию объекта: возникают расходы на трафик, вопросы приватности и ключевой момент – вы арендуете функционал, а не владеете им.
В 2026 году честный ответ для большинства нетривиальных развёртываний – гибрид: детекция работает на камере, чтобы устранить проблему трафика и ложных срабатываний, а сервер или облако коррелируют события и хранят поисковую историю. Эти компоненты обмениваются данными через стандартный канал метаданных. Выбор топологии развёртывания – что размещать на краю, а что в облаке – обсуждается в уроке про задержку и топологию развёртывания, а возможности edge-аппаратуры, включая реальное количество камер, которые может обрабатывать плата Jetson или Hailo, разбираются в капстоне на Jetson Orin.
Расчёт трафика, который доводит аналитику до предела
Выбор из трёх мест – не эстетика, а арифметика, и арифметика настолько перекошена, что её стоит показать. Возьмём типичную современную камеру: сенсор на 4 мегапикселя, сжатие H.265, поток в 4 мегабита в секунду. Отправьте 50 таких камер непрерывно в облачный сервис аналитики – и устойчивый аплинк составит:
50 камер × 4 Мбит/с = 200 Мбит/с аплинка, 24 часа в суткиУ большинства зданий просто нет лишних 200 Мбит/с именно исходящего канала, а полные сутки такой нагрузки – это:
200 Мбит/с × 86 400 секунд/сутки ÷ 8 бит/байт ≈ 2,16 терабайта в суткисырого видео, пересекающего интернет и оседающего в облачном хранилище, и счетов за egress. Теперь запустите детекцию на камере. Одно событие детекции человека – «человек, камера 12, зона 3, 02:14:33, уверенность 0.92» – занимает несколько сотен байт в формате JSON. Даже при насыщенной ночи с 200 такими событиями на объекте это:
200 событий × ~300 байт ≈ 60 килобайт метаданных на всю ночьПлюс несколько коротких клипов на значимые события. Аплинк падает с стабильных 200 Мбит/с до единиц килобайт – снижение примерно на четыре-пять порядков. Именно этот разрыв стал причиной того, что архитектура «обрабатывай аналитику на камере и отправляй только важное» стала доминирующей, а также объясняет, почему главным сдвигом последних лет стал переход от записи всего в центральную коробку к камерам, которые принимают решения самостоятельно. Стандарт метаданных, позволяющий событиям с камеры поступать в софт любого вендора, рассматривается в двух следующих разделах.
Граница, которая решает всё: наблюдать за событиями или распознавать людей
В разделе про ложные тревоги связующим ограничением была точность; в разделе про топологию – трафик; в законе – что камере позволено узнавать о человеке, и отсюда следует простое правило: обнаружить, что там человек, – это обычная аналитика, а опознать, кто этот человек, по лицу или телу – биометрическая обработка, другая юридическая категория с куда более высоким стандартом. Европа зафиксировала эту границу в законе, и поскольку EU AI Act (Регламент (ЕС) 2024/1689) применяется к любой системе, используемой в ЕС, а GDPR – к любому, кто обрабатывает данные жителей ЕС, он задаёт рамки почти для любого серьёзного развёртывания.
Граница разделяет аналитику видеонаблюдения на три уровня.
Верхний уровень – стандартная событийная аналитика, и именно здесь сосредоточено большинство задач, которые команды реально хотят реализовать. Обнаружить человека или транспорт, зафиксировать вторжение или пересечение линии, оценить занятость, выявить праздношатание, распознать номер – всё это отслеживание событий без привязки к конкретным лицам. EU AI Act не относит такие функции к высокорисковым и не накладывает на них жёсткие ограничения. Однако требования к ним возникают из закона о защите данных: по GDPR необходимо иметь законное основание для установки камер, размещать понятные информационные таблички о видеонаблюдении, устанавливать разумные сроки хранения данных вместо бессрочных и – для большинства систем видеонаблюдения, регулярно работающих в публичных пространствах, – провести оценку влияния на защиту данных (DPIA, data protection impact assessment): письменный анализ рисков для приватности и мер по их снижению, предусмотренный статьёй 35 GDPR. Это направление планируется в первую очередь и внедряется быстро, с учётом приватности с самого начала.
Средний уровень – высокорисковая биометрическая идентификация. Когда система пытается определить, кому конкретно принадлежит лицо – сопоставляя его со списком наблюдения или базой данных личностей, – речь идёт о биометрической идентификации, отнесённой к высокорисковым системам согласно Annex III, пункт 1 EU AI Act. Высокорисковый режим вступает в силу с 2 августа 2026 года: требуется задокументированная система управления рисками, контроль за обучающими данными, человеческий надзор по дизайну, продемонстрированная точность для различных групп людей, автоматическое логирование, техническая документация и оценка соответствия до запуска системы. Кроме того, GDPR относит биометрические данные, используемые для идентификации, к особой категории данных по статье 9 – самой защищённой категории, – что обычно требует явного согласия или специального правового основания и делает обязательной оценку воздействия на защиту персональных данных, а не делает её опциональной. Это не просто галочка в настройках камеры – это отдельный продукт со своим проектом по обеспечению соответствия. Именно эту часть команды часто недооценивают, поскольку поставщик представляет распознавание лиц как ещё один переключатель.
Нижний уровень – запрещено. С 2 февраля 2025 года статья 5 AI Act ЕС прямо запрещает несколько биометрических практик. Главная из них для видеонаблюдения – удалённая биометрическая идентификация в реальном времени в общественных местах: использование камер с распознаванием лиц на улице, вокзале или площади для опознания людей по мере их прохождения – запрещено, за исключением строго определённых правоохранительных задач (поимка конкретных лиц, предотвращение неминуемой террористической угрозы, установление местонахождения подозреваемого в тяжком преступлении). Даже в этих случаях такая идентификация возможна только при наличии предварительной судебной или независимой санкции и оценки влияния на основные права.
Ещё два важных запрета касаются: анализа эмоций людей по их лицам на рабочем месте или в школах, а также создания баз данных лиц на основе нецелевого сбора изображений из интернета или с камер видеонаблюдения. Штрафы за нарушение не являются символическими – они могут достигать 35 млн евро или 7% мирового годового оборота компании. Функции вроде «живая идентификация лиц на публичном входе» или «определение настроения толпы по видео с камеры» – это граница, которую нельзя пересекать.
Та же логика работает и за пределами Европы, даже там, где законодательство отличается: идентификация конкретного человека влечёт за собой последствия, которых не несёт учёт анонимных лиц, поэтому она требует более высоких стандартов проверки точности, справедливости, человеческого контроля и ведения записей – независимо от места применения. EU AI Act лишь делает эту границу чёткой и обязательной. Что касается самих биометрических компонентов и их правового оформления, – об этом в уроке про детекцию и распознавание лиц под EU AI Act, а более широкий регуляторный инжиниринг – в уроке про регуляторику EU AI Act.
Корзина детекции: где прячутся предвзятость и точность
Возьмём сначала уровень событийной аналитики – именно здесь ценность решения и качественная инженерия дают наибольший эффект. Ключевая особенность в том, что камера выдаёт флаг, а не вердикт: она сообщает «человек в зоне 3», а уже человек – оператор, охранник или проверяющий – принимает решение о дальнейших действиях. Правильно организуйте эту форму – и система остаётся гибкой; воспринимайте флаг как автоматическое принудительное действие – и она превращается в обязательство.
У точности два режима отказа, и оба стоят денег. Ложноположительный – назвать тень человеком – возвращает систему к усталости от ложных тревог, к той самой проблеме, которую ИИ должен был решить. Поэтому модель детекции и её порог уверенности нужно настраивать под конкретную площадку, освещение и сезон, а не оставлять на заводских настройках вендора. Ложноотрицательный – пропустить реального человека, потому что он мал в кадре, частично скрыт или плохо освещён – ещё опаснее, ведь система безопасности, которая молча не замечает угрозу, хуже, чем её полное отсутствие: она порождает ложное чувство защищённости. Честный инженерный подход – измерить оба показателя на вашем видео до того, как доверять системе, и держать человека в контуре на всех решениях, имеющих последствия.
Есть измерение справедливости, которое команды видеонаблюдения должны воспринимать всерьёз, поскольку камеры направлены на людей. Модели детекции и, особенно, распознавания имеют задокументированную историю неравномерной работы в зависимости от тона кожи, условий освещения и положения камер. Аналитика, хорошо работающая с одной группой и плохо – с другой, – это не просто ошибка качества: в контексте безопасности она приводит к неравному обращению.
Дисциплина здесь – тестировать паритет детекции и распознавания по тем группам, которые камера реально будет видеть, до внедрения, и проектировать систему так, чтобы при низкой уверенности результат вызывал проверку человеком, а не автоматическое действие.
Когда вопрос на самом деле звучит: «Нормально ли это для данной сцены?», а не «Знаком ли это объект?» – правильным инструментом становится обнаружение аномалий, а не фиксированный список классов (подробно разъяснено в уроке про алгоритмы обнаружения аномалий). А когда жёсткий список классов оказывается неподходящим для открытой сцены, детекция с открытым словарём (описана в уроке про open-vocabulary детекцию) позволяет камере находить объекты, на которые она явно не обучалась.
«Частая ошибка: включить распознавание лиц, потому что камера это умеет. Современные камеры оснащены функцией распознавания лиц или «идентификации в реальном времени». Демо выглядит как бесплатный апгрейд, и команда включает эту опцию, чтобы «знать, кто находится на объекте». Одним щелчком развёртывание переходит с управляемого уровня событийной аналитики, соответствующей GDPR, в высокорисковую биометрическую зону (EU AI Act, Приложение III, пункт 1; особая категория данных по статье 9 GDPR, требует обязательной оценки воздействия) – или, если камера направлена на общественное пространство и распознаёт людей в реальном времени, попадает в запрещённую практику согласно статье 5, влекущую штрафы до €35 млн или 7% годового оборота. Исправление должно быть структурным, а не формальным отказом от ответственности: держите биометрическую идентификацию выключенной по умолчанию, рассматривайте её как отдельный, чётко определённый продукт с собственной юридической экспертизой, никогда не используйте удалённое распознавание в реальном времени в общественных местах и задавайте себе вопрос по поводу каждой камеры: «нужно ли ей знать, кто это, или достаточно понять, что там человек?» – ведь почти всегда правильный ответ – второй.»
Корзина идентификации: не функция, а отдельный продукт
Высокорисковый уровень – это та зона, где видеонаблюдение на основе ИИ становится особенно сложным, и именно здесь большинству команд стоит замедлить темп. Распознавание лиц и сверка с базами наблюдения обладают свойством, отсутствующим у событийной аналитики: ошибка в выводе напрямую влияет на человека – ложное совпадение может привести к задержанию невиновного, отказу в доступе или слежке. Такой ущерб человек не может легко исправить, поэтому закон относит эти технологии к высокорисковым, а инженерные требования соответственно повышаются.
Защищаемый паттерн зеркалит корзину детекции, но с большим весом на каждую гарантию. Система предлагает возможную личность с оценкой уверенности и доказательствами в её пользу; обученный человек проверяет соответствие до выполнения любого действия; порог совпадения установлен достаточно высоко, чтобы система предпочла сказать «не уверена», а не делать предположение; точность модели оценивается отдельно по демографическим группам, а выявленные разрывы документируются и устраняются; каждый запрос фиксируется в журнале; правовое основание – согласие или конкретная законная санкция – устанавливается до того, как будет зачислено хоть одно лицо.
Верификация (подтверждение, что человек действительно тот, за кого себя выдаёт: один-к-одному, у двери, к которой он сам подошёл) – более простая задача, чем идентификация (выбор лица из толпы по базе данных: один-ко-многим), и руководящие документы чётко проводят эту границу: человек, представившийся сенсору, принципиально отличается от камеры, сканирующей улицу.
Вывод для продакта тот же, что и в случае с ошибкой: не позволяйте функции идентификации попасть в дорожную карту на инерции от функций детекции. Это отдельный продукт со своей работой по соответствию, собственным тестированием на справедливость, своим правовым основанием и своим сроком. Честный дефолт для большинства продуктов видеонаблюдения – запустить аналитику событий уже сейчас, а биометрическую идентификацию рассматривать как осознанное, чётко очерченное и более позднее решение – если вообще.
Три способа добавить ИИ в систему видеонаблюдения
Если вы разрабатываете или интегрируете систему видеонаблюдения, добавление ИИ сводится к одному из трёх подходов – и каждый из них влияет на скорость и уровень контроля так же, как и платформенные решения всегда это делают.
Первый маршрут – встроить через стандарт и вендора. У видеонаблюдения здесь реальное преимущество: зрелый стандарт совместимости. ONVIF – индустриальный орган, чьи спецификации позволяют камерам и программному обеспечению разных производителей взаимодействовать друг с другом. Его Profile M (для метаданных) стандартизирует именно то, что выдают ИИ-камеры: события и аналитические метаданные, включая классификацию объектов, подсчёт, распознавание лиц и номеров – всё в едином формате (в том числе JSON-события через лёгкий протокол MQTT). Profile M означает, что ИИ-камера одного производителя может передавать свои детекции в систему управления видео другого – без необходимости писать кастомные интеграционные решения. Через ONVIF и VMS или аналитику от вендора вы запускаете детекцию, обнаружение вторжений и подсчёт за дни или недели, используя модели вендора и камеру, выдающую стандартизированные события. Минус в том, что качество и развитие аналитики зависят от вендора, а вы ограничены тем, какие функции он предоставляет. ONVIF Profile M стоит изучить отдельно; Фора Софт подробно разбирает его технические аспекты в блоге, а более широкий взгляд на вопрос «купить или построить» в системах управления видео – в нашем плейбуке по VMS.
Второй маршрут – собрать стек компьютерного зрения: объединить модель детекции и трекинга с собственной логикой обработки событий и дашбордом проверки – на локальном сервере или в облаке. Это более трудоёмкий шаг, требующий от нескольких недель до месяцев, но он даёт реальный контроль: вы сами решаете, какая аналитика используется, как её настраивать и куда направлять видео. Взамен вы берёте на себя ответственность за модели, настройку точности и проектирование приватности. Вопрос о том, когда универсальная визуально-языковая модель сможет заменить набор кастомных детекторов, становится всё более актуальным, особенно для открытых запросов вроде «опиши, что происходит» в системе видеонаблюдения – об этом подробно в уроке «просто возьмём VLM».
Третий маршрут – и единственный, при котором видео полностью остаётся на вашем оборудовании, – использование моделей с открытыми весами на краю сети: запуск открытого детектора, например YOLO, на edge-устройствах (NVIDIA Jetson, ускоритель Hailo, SoC Ambarella) внутри собственных камер или шлюзов. Этот подход требует наибольших предварительных инженерных усилий – обычно месяцы разработки, – но при этом видео ни разу не покидает устройство, не возникает облачных расходов на камеру, а вы полностью контролируете модель и данные на всех этапах. Такой путь оправдан там, где ключевыми являются приватность или независимость от поставщика: тюрьмы, больницы, оборонные объекты, розничные сети, чувствительные к конфиденциальности. Адаптация модели под ограниченные ресурсы чипа камеры без существенной потери точности – это отдельная специализация, подробно рассмотренная в уроке про дистилляцию и квантизацию для edge-устройств.
Одна закупочная заметка пересекает все три маршрута и удивляет команды поздно: вы не сможете купить любую камеру, какую захотите. В США раздел 889 Закона о национальной обороне (NDAA) и «Covered List» Федеральной комиссии по связи (FCC) запрещают федеральным агентствам и их подрядчикам использовать оборудование некоторых производителей – Hikvision и Dahua наиболее заметны, – что, по некоторым оценкам, исключает около трети мирового предложения камер из подходящих тендеров и вынуждает покупателей переходить на совместимые бренды (Axis, Hanwha и другие), которые, как правило, стоят на 20–35% дороже. Даже если вы не поставляете государству, соответствие NDAA стало распространённым требованием корпоративных закупок, так что выбор оборудования приобретает юридическое значение ещё до того, как речь зайдёт об ИИ.
Расчёт стоимости на примере: дивиденд от ложных тревог и счёт за трафик
Бюджет ИИ-видеонаблюдения определяется двумя разными цифрами, и после расчётов они сходятся к одному выводу. Первое – дивиденд по стоимости оператора, полученный за счёт устранения ложных тревог, рассчитанный выше: с 50 камер количество ночных тревог сокращается с ~5 000 (≈21 час невозможного просмотра) до ~200 (≈50 минут реального просмотра) – снижение на 96%. Ценность здесь не только в экономии рабочего времени, но и в том, что тревоги снова становятся достойными доверия, и реальное вторжение действительно замечают. Именно этот дивиденд – главная отдача от всей инвестиции.
Второе – счёт за трафик и инфраструктуру, который решение «где работает ИИ» меняет кардинально. Поток с 50 камер в облако на анализ – это около 200 Мбит/с постоянно и примерно 2,16 ТБ видео в сутки; запуск детекции на самой камере с отправкой только событий – десятки килобайт за ночь плюс несколько клипов. Сравните эти сценарии – и картина становится ясной: edge-решение заменяет более высокую стоимость оборудования на камеру почти нулевым трафиком и хранением; облачный подход заменяет низкую первоначальную цену постоянным счётом за трафик и подписку, который растёт с каждой новой камерой.
| Драйвер стоимости | Масштабируется с | База на детекции движения | AI / edge-подход |
|---|---|---|---|
| Просмотр оператором | Тревоги за ночь | ~5 000 тревог (≈ 21 ч) → игнорируются | ~200 тревог (≈ 50 мин) → отрабатываются |
| Доля ложных тревог | Среда | Деревья, тени, дождь – всё тревожит | ~90–95% меньше ложных тревог |
| Трафик аплинка | Камеры наружу | ~200 Мбит/с на 50 камер (облако) | десятки КБ/ночь метаданных (край) |
| Видео хранимое/egress | Часы хранения | ~2,16 ТБ/сутки сырого (облако) | только клипы событий (край) |
| Железо камеры | На камеру | дешевле «глупая» камера | edge-AI-камера дороже заранее |
Числа носят иллюстративный характер и зависят от характеристик камер, кодеков и тарифов провайдеров – важно именно форму. Дорогие компоненты архитектуры «всё в облако» – стабильный аплинк, хранение и egress – как раз те элементы, которые аналитика на стороне камеры делает почти бесплатными. В то же время ключевая статья расходов в edge-решении – более умные камеры – представляет собой разовую капитальные затраты. Подробный расчёт стоимости по функциям для всех трёх подходов приведён в уроке про реальную стоимость ИИ в видео.
Шлюз, через который проходит каждое развёртывание: приватность, правовое основание и хранение
Здесь дорожная карта видеонаблюдения постепенно приобретает юридический статус. Воспринимайте далее изложенное как контекст, релевантный с инженерной точки зрения, а не как юридический совет – уточняйте детали у квалифицированного юриста для юрисдикций, в которых вы работаете.
Правовое основание и уведомление идут первыми. Согласно GDPR, нельзя направлять камеру на людей просто потому, что можете – необходимо законное основание (обычно «законный интерес», сбалансированный с вторжением в приватность и задокументированный), а также информировать людей о съёмке с помощью понятных табличек. Камера, систематически наблюдающая за общественно доступной зоной, как правило, требует оценки влияния на защиту данных до запуска – письменного анализа рисков и мер по их снижению. А для любой биометрической идентификации такая DPIA обязательна, поскольку данные относятся к особой категории и требуют ещё более строгого правового основания.
Минимизация данных и хранение идут вторыми. Уважающий приватность дизайн предполагает хранение как можно меньшего объёма данных и на минимально возможный срок: записывайте клипы событий, а не непрерывный поток, если это допустимо сценарием; устанавливайте сроки хранения и удаляйте данные по расписанию, а не накапливайте видео бессрочно; отдавайте предпочтение архитектурам – аналитике на стороне камеры, метаданным вместо исходного видео, – которые вообще не передают персональные изображения за пределы устройства. GDPR также требует, чтобы сама запись была защищена: зашифрована при передаче и хранении, а доступ к ней имелся только у тех, кому он действительно необходим.
Слой EU AI Act идёт третьим, поверх GDPR, а не вместо него. Для событийной аналитики закон остаётся лёгким, и работа сводится к выполнению требований GDPR. В случае биометрической идентификации закон вводит полный высокорисковый режим: управление рисками, контроль данных, человеческий надзор, проверку точности и предвзятости, ведение логов, техническую документацию и оценку соответствия – с 2 августа 2026 года. А для удалённой идентификации в реальном времени в общественных местах он вообще исключает такую возможность, за исключением узкого круга правоохранительных исключений. Таким образом формируются два режима: развёртывание распознавания лиц в ЕС должно соответствовать и GDPR, и AI Act, а более широкий регуляторный инжиниринг по обоим – в уроке про EU AI Act.
Правило для всех трёх шлюзов такое же, как и для всей статьи: человек остаётся в контроле над всем, что касается его самого. Правовое основание – ваше право на съёмку; минимизация и хранение – ваша дисциплина в отношении того, что вы сохраняете; AI Act – это потолок того, что камера может узнавать. Развёртывание, уважающее все три принципа, – актив; то, что нарушает хотя бы один из них, – обязательство, ожидающее регулятора.
Плейбук: от «добавить ИИ к камерам» до полноценной системы
Соберите части – и добавление ИИ к системе видеонаблюдения сводится к четырём вопросам, заданным по порядку.
Первое, отсортируй функцию: определяет ли она конкретного человека – распознавание лиц, сверка со списком наблюдения, биометрический ID? Если нет – это стандартная событийная аналитика; применяй подход в соответствии с GDPR: таблички, хранение данных и оценка воздействия. Если да – это высокорисковая биометрическая обработка по пункту 1 Приложения III; выдели её как отдельный продукт, обеспечь соответствие с тестированием справедливости и человеческим контролем, и ни в коем случае не используй удалённую идентификацию в реальном времени в общественных местах – это прямо запрещено.
Второе, размести аналитику: на камере – для низкотрафиковых сценариев и защиты приватности, на сервере – для отслеживания одного человека через несколько камер, в облаке – для масштабируемости и отказоустойчивости – и будь готов к комбинированию этих решений.
Третье, принцип «флаг и проверка»: пусть ИИ ставит флаг при обнаружении или предлагает совпадение, а окончательное решение принимает человек до любых последствий – никогда не запирай дверь автоматически, не вызывай охрану и не действуй на основе идентификации, основанной исключительно на флаге ИИ.
Четвёртое, и без исключений, шлюз соответствия: установи правовое основание, повесь информационные таблички, проведи DPIA, установи лимиты хранения и шифрование, а для любой биометрической функции – подтверди выполнение высокорисковых обязательств по EU AI Act и технических требований NDAA до запуска.
Это весь плейбук. Более глубокие уроки по разделам – подробные инструкции для каждого блока: детекция YOLO и трекинг множества объектов для событийной аналитики, обнаружение аномалий для слоя «это нормально?», компьютерное зрение в ретейле и промышленности для анализа поведения покупателей, детекция лиц под EU AI Act для компонентов идентификации, к которым нужно подходить с особой осторожностью, и агент-исследователь видео для поиска по архиву постфактум.
Где здесь Фора Софт
Мы разрабатываем платформы видеонаблюдения, компьютерного зрения и стриминга, в которых реализована аналитика – дашборды VMS, edge-конвейеры анализа и интеграции камер. Поэтому мы регулярно применяем этот плейбук при работе с клиентами. Когда клиенту нужно быстро развернуть систему на стандартном оборудовании, мы интегрируем ИИ-камеры и пакет аналитики через ONVIF Profile M в VMS и сначала решаем вопросы правового обоснования, информирования пользователей и хранения данных. Если важны приватность или независимость, мы строим решения на собственных конвейерах: запускаем открытые модели детекции на edge-устройствах, чтобы видео не покидало устройство, коррелируем события на локальном сервере и проектируем минимизацию данных, а также внедряем паттерн «флаг и проверка» уже с первого спринта. Когда речь заходит о распознавании лиц или биометрической идентификации, мы рассматриваем это как отдельный, высокорисковый продукт с собственной юридической экспертизой. Эти четыре вопроса плейбука – те же, что мы обсуждаем на скоупинг-звонках, когда клиент, работающий с видеонаблюдением, спрашивает, где в его системе может быть применён ИИ.
Ключевые выводы
- Искусственный интеллект в камере используется для наблюдения за событиями, анализа поведения и идентификации людей.
- Выбор места обработки – на камере, сервере или в облаке – влияет на объём трафика, задержку и уровень приватности.
- Основная задача ИИ – устранить ложные срабатывания: снижение их количества составляет около 90–95% по сравнению с детекцией движения.
- Обработка на стороне камеры позволяет сократить исходящий трафик с примерно 200 Мбит/с до нескольких килобайт метаданных с 50 камер.
- Идентификация лиц в реальном времени в общественных местах запрещена в ЕС с февраля 2025 года.
- При этом аналитика событий считается относительно безопасной с точки зрения GDPR, тогда как распознавание лиц относится к высокорисковым процессам.