Обнаружение аномалий в видео – инженерный плейбук 2026 года

Автор: Николай СапуновОбновлено: август 202639 мин чтения
Содержание статьи +

TL;DR

Обнаружение аномалий в видео в 2026 году – это уже не одна модель, выбирающая «странные» кадры в потоке, а слоистый pipeline, который объединяет быстрый edge-детектор, weakly-supervised классификатор и Vision-Language Model (VLM)-rescorer, объясняющий каждое срабатывание понятным языком. Ландшафт моделей разделился на четыре production-grade семейства – 3D-CNN на базе I3D и SlowFast с multiple-instance-learning головами по-прежнему держат вершину бенчмарка UCF-Crime на уровне примерно 97% AUC, методы на CLIP (VadCLIP, TPWNG) позволяют стартовать с двух-трёх примеров на класс аномалии, frontier-VLM (Gemini 2.5, GPT-5, Claude Opus 4.7) превращают каждое срабатывание в аудируемый текст, а edge-NPU (Jetson Orin, Hailo-8) запускают всё это на камере с задержкой меньше 200 мс. Рынок вырос соответственно: глобальный рынок video analytics прогнозируется в $14.65 млрд в 2026 году с ростом до $41.39 млрд к 2031-му, а рынок data anomaly detection растёт на 19.5% в год. Правильная архитектура для вашего продукта зависит от четырёх чисел – бюджет латентности, число камер, число размеченных примеров и регуляторный режим – и эта статья проходит каждое из них, пока вы не сможете спорить от защищаемой таблицы.

Зачем это нужно

Если вы шипите видеопродукт в 2026 году – surveillance, OTT, телемедицину, e-learning, conferencing – и не детектите аномалии, конкуренты уже это делают. Обнаружение аномалий между 2023 и 2025 годами переехало из исследовательского курьёза в строчку RFP, а в 2026-м это разница между корпоративной surveillance-сделкой, которую вы выигрываете, и той, которую вы проигрываете. Хорошая новость – базовая технология наконец готова к проду: академические бенчмарки стабилизировались, API вендоров повзрослели, edge-кремний подешевел, а регуляторная рамка стала если не стабильной, то по крайней мере видимой. Плохая новость – поле теперь настолько глубокое, что продакт-менеджер, читающий только маркетинговый текст, выберет неправильную архитектуру и будет платить за неё три года. Эта статья для продакта, которому нужно защищать архитектурный выбор перед бордом, для основателя, выбирающего между SaaS-контрактом по $50 за камеру в месяц и кастомной разработкой, и для инженера, объясняющего этому основателю, почему «давай просто возьмём VLM» иногда работает, а иногда сжигает runway. Предполагается, что вы уже читали урок 1.2 о латентности и топологии деплоя и урок 1.4 о стоимости ИИ в видеопродуктах, потому что любое решение в этой статье сводится либо к цифре задержки, либо к цифре в долларах.

Что на самом деле означает «аномалия» в видеопродукте

Слово «аномалия» в большинстве продуктовых спек делает слишком много работы, а выбор модели целиком зависит от того, какую именно аномалию вы имеете в виду. Таксономия ниже – та, которой мы пользуемся в Фора Софт, когда садимся с новым клиентом и просим показать пальцем на проблему, которую он хочет решить. Пока эта таксономия не ясна, никакой разговор о выборе модели не имеет смысла.

Поведенческая аномалия – человек или объект делает что-то, что политика пространства запрещает: покупатель бежит по «no-running» зоне склада, кто-то лезет через забор, бродяжничает в закрытом коридоре, падает на платформе метро. Это доминирующая академическая категория и доминирующая production-категория для surveillance-продуктов. Они темпоральные – нужно несколько секунд контекста, чтобы их распознать, – и это естественный дом 3D-CNN (I3D, SlowFast) и видео-трансформеров (TimeSformer, VideoSwin, VideoMAE).

Физическая аномалия – объект, которого не должно быть, или которого должно быть, но нет: оставленная сумка на станции, лужа на цеху, отсутствующий огнетушитель в коридоре больницы, упавший знак на дороге. Это покадровая проблема с темпоральным слоем persistence; правильная архитектура – это object detector (YOLO, RT-DETR), питающий state-tracking слой, который срабатывает, когда объект провисел дольше порога.

Аномалия плотности или толпы – счётчик людей или объектов в заданном регионе пересекает порог: переполненная очередь, формирующаяся давка, слишком плотная платформа, опустевшая холодильная секция. Это задачи heat-map регрессии плюс per-region threshold; современные модели crowd-counting из семейства MMDetection CrowdNet справляются на 30 fps на скромной GPU.

Расписание / темпоральная аномалия – движение, присутствие или отсутствие, нарушающие правило времени суток или дня недели: движение в здании в 03:00, машина в пожарном проезде дольше пяти минут, пропускной дверной проём, открытый в рабочие часы. В основном решаются правилами плюс слоем обучения нормальному паттерну; ценность ИИ здесь – в подавлении ложных тревог обучением вида «движение в loading-dock в 06:00 во вторник нормально», а не в самой детекции.

Статистическая / сигнальная аномалия – отклонение на уровне потока данных: внезапное падение качества, замёрзший камерный поток, заклинивший энкодер, всплеск jitter в сети, метрика внутри pipeline-а, пересекающая выученный порог. Это уже не «что в кадре», а задача временного ряда, и она живёт с Isolation Forest, autoencoder reconstruction loss или LOF на инженерных признаках. Это важно, потому что failure mode любого vision-pipeline-а сверху включает «камера тихо замёрзла, а pipeline продолжает выдавать предсказания на последнем хорошем кадре» – и только signal-level detection это ловит.

Самый большой выигрыш, который можно внести в RFP по anomaly detection, – назвать класс аномалии в первом же абзаце. «Нам нужно real-time anomaly detection» – это не спека; «нам нужно детектить человека, бегущего в обозначенной no-running зоне, за 250 миллисекунд, на Jetson Orin Nano, на 30 fps» – это спека.

Рисунок 1. Пять классов аномалий в видеопродукте с лучшим семейством моделей для каждого.

Бюджет латентности 2026 – первое число, которое вы согласовываете

Real-time означает «достаточно быстро, чтобы среагировать до конца события», и это переводится в конкретные бюджеты, которые вся остальная архитектура должна уважать. Промахнётесь с этим числом – и каждое следующее решение умножит ошибку; попадёте – и выбор модели, выбор железа и выбор топологии падают сами собой.

Падение на платформе метро, которое должно триггернуть закрытие гейта или удержание состава, должно уложиться в 150 миллисекунд end-to-end – от события до команды актуатору. В этот бюджет влезают примерно 33 мс на захват и кодек, 50 мс на inference, 30 мс на шину тревог и 30 мс запаса. На сетевой round-trip места нет; inference обязан крутиться на устройстве рядом с камерой.

Прорыв периметра или лазание через забор, которое должно запустить сирену и отправить охрану, живёт в полосе 200–300 мс. В этот бюджет влезает тонкий edge-to-edge hop или жёстко настроенный LAN round-trip к on-site NVR с GPU.

Воровство в ритейле, которое должно вывести персонал на торговый зал вовремя, чтобы перехватить, – в полосе 300–500 мс. Это sweet spot для гибридной архитектуры: быстрый edge-детектор с высоким recall плюс cloud-rescorer, подтверждающий тревогу до отправки персонала.

Тревога плотности толпы или очереди, запускающая решения о персонале или маршрутизации, – в полосе 500–1000 мс. Cloud inference здесь нормально; WAN round-trip и скромная GPU-очередь всё ещё помещаются в секунду.

Forensic-переанализ не имеет real-time требования – минуты-часы это нормально, – и архитектура оптимизируется под цену и точность, а не задержку. Здесь frontier-VLM оправдывают свои потокены.

Следствие острее, чем кажется. Если ваше целевое событие – «человек может это предотвратить, если получит alert за 10 секунд», вам нужен edge inference. Если целевое событие – «расследуем постфактум», cloud нормально, дешевле и проще обновлять. Архитектуры для этих двух случаев не разделяют ни одного компонента, кроме камеры; не позволяйте вендору продать одну вместо другой.

Прорабатываемый пример. Камера 1080p на 30 fps выдаёт кадр каждые 33 мс. Jetson Orin Nano Super с квантованной SlowFast-моделью инференсит примерно 25–35 мс на клип. ONVIF event publish на локальный broker – около 5 мс. Реле-актуатор рядом с камерой реагирует примерно за 10 мс. End-to-end: 33 + 30 + 5 + 10 = 78 мс. Тот же pipeline, проложенный через cloud-регион с 50 мс WAN round-trip, становится 33 + 50 + 30 + 50 + 10 = 173 мс – и 150-мс бюджет на удержание состава взорван. Железо не поменялось – поменялась топология.

Рисунок 2. Полосы бюджета латентности и единственная топология деплоя, которая каждую из них уважает.

Семейства моделей, которые имеют значение в 2026, – слоистый стек, а не конкурс красоты

Ландшафт моделей сменился дважды между 2023 и 2026. В 2023-м поле было соревнованием 3D-CNN и ранних видео-трансформеров; в 2024-м методы на CLIP попали на лидерборды; в 2025-м мультимодальные LLM (Holmes-VAD, AnomalyRuler, VadCLIP++) начали выдавать объяснения, которые клиенты могут реально использовать; в 2026-м консенсусная production-архитектура – это слоистый стек, а не одна модель. Разберём каждый слой.

Первый слой – быстрый дешёвый покадровый детектор, бегущий на каждом кадре на edge. Его задача – поднимать кандидатские клипы – окна времени, статистически достаточно необычные, чтобы стоить более пристального взгляда. Два подхода: квантованный 3D-CNN (I3D или SlowFast в INT8) на Jetson Orin Nano Super или Hailo-8, и autoencoder (ST-AE, MemAE), помечающий кадры, у которых reconstruction loss выше порога. 3D-CNN-подход быстрее и точнее, когда есть метки; autoencoder – единственное, что работает, когда меток нет вообще. Оба гоняются на 30 fps на $250-устройстве.

Второй слой – weakly-supervised классификатор, перепроверяющий кандидатские клипы и присваивающий им классы аномалий. Это слой, на котором живёт академический state of the art. Multiple instance learning (MIL) – RTFM, MGFN, Unbiased MIL и более свежий Multi-Timescale Feature Learning (MTFL, 2024) – позволяют тренировать instance-level классификатор по video-level меткам, и это разница между проектом, который шипится, и проектом, который тонет в стоимости разметки. На UCF-Crime текущий SOTA – примерно 88–90% AUC для свежих MIL-вариантов на raw признаках и 95% AUC+ при стеке трансформера сверху. На XD-Violence эквивалентная цифра – 85–86% AP.

Третий слой – CLIP-based или VLM-based rescorer, который делает две вещи, на которые MIL-слой неспособен: open-vocabulary детекция (ловит аномалии, на которых модель не обучалась, по их текстовому описанию) и few-shot адаптация к новым площадкам. VadCLIP – первый CLIP-based weakly-supervised VAD-метод – интегрирует text и visual prompts и обходит более старый MIL-only SOTA на UCF-Crime. TPWNG (Text Prompt with Normality Guidance, CVPR 2024) фьюзит visual-признаки с CLIP text embeddings, чтобы выдавать pseudo-labels для тренировки. VadCLIP++ и TrCLIP-VAD (2025–2026) идут дальше – динамические vision-language модели и CLIP-тренировка, улучшенная text rewriting. Практический выигрыш – две вещи: вы описываете новый класс аномалии одним предложением и получаете разумную детекцию без переобучения, и вы режете бюджет разметки примерно на 80% на длинном хвосте.

Четвёртый слой – frontier-VLM, обрабатывающий самые сложные запросы и выдающий объяснение. Holmes-VAD построил первый крупномасштабный мультимодальный VAD instruction-tuning бенчмарк (VAD-Instruct50k) и показал, что fine-tuned мультимодальный LLM может и точно локализовать аномалию во времени, и выдать связный нарратив о том, что произошло. AnomalyRuler делает few-shot prompting с нормальными reference-сэмплами, чтобы навести правила, которые LLM потом применяет к новой плёнке. Статья Cerberus 2025 года показала, что каскадная VLM-архитектура может выдать 97.2% точности на UCF-Crime, бегая при этом на 57.68 fps на NVIDIA L40S – в диапазоне real-time для VLM-класса, наконец. В проде сегодня практический паттерн – маленький VLM (Llama 3.2 Vision, Qwen-VL, LLaVA) on-device для объяснения и frontier-VLM (Gemini 2.5 Pro, Claude Opus 4.7) в облаке для пограничных случаев, в которых маленькая модель не уверена.

Пятый слой, который часто упускают, – детектор сигнальных аномалий, наблюдающий за самим pipeline-ом. Isolation Forest или LSTM-autoencoder на инженерных признаках (длительность зависшего кадра, дисперсия битрейта энкодера, доля потерянных пакетов, гистограмма confidence-а модели) ловит failure modes, которые vision-слои не видят: заклинивший энкодер, камера, медленно ушедшая из фокуса, модель, начавшая предсказывать модальный класс на каждом кадре из-за тихого дрейфа данных. Мы видели production-системы, неделями бегающие со всеми vision-слоями в зелёном, пока камера в цикле кормила pipeline статичной картинкой парковки на закате. Сигнальный слой – не опция.

СлойЗадачаТиповая модельГде работаетЗачем нужен
1 – Candidate filterПоднимать необычные окнаI3D / SlowFast INT8, MemAEEdge NPU30 fps на железе за $250
2 – Class classifierПрисвоить класс аномалииMIL (RTFM, MGFN, MTFL)Edge или cloud GPU90% AUC на UCF-Crime
3 – VLM rescorerOpen-vocabulary + few-shotVadCLIP, TPWNG, VadCLIP++Cloud GPUДлинный хвост, мало меток
4 – ОбъяснениеЧеловеческий нарративHolmes-VAD, Gemini 2.5, ClaudeCloudAudit trail, ревью регулятора
5 – Signal anomalyНаблюдать pipelineIsolation Forest, LSTM-AEEdge / cloud sidecarЛовить тихие отказы

Рисунок 3. Пятислойный стек, который выкатывает в 2026-м production-pipeline anomaly detection. Большая часть провальных историй трассируется к отсутствующему слою или отсутствующему хэндоффу между слоями.

Форма этого стека – это форма разговора с вендором. Если вендор предлагает одну модель – «наш трансформер детектит аномалии» – он продаёт второй слой и притворяется, что остальное решено. Если вендор предлагает целый pipeline по одной цене – спросите, какие из пяти слоёв он владеет, а какие подразумевает, что вы построите сами; обычно он владеет слоями 1 и 2, а остальное – ваша интеграционная задача.

Датасеты и бенчмарки, которые стоит знать, – и те, что вам соврут

Бенчмарки якорят разговор о моделях, хотя production-поведение они не предсказывают. Референсные цифры 2026 года ниже – те, которые инженер должен знать, чтобы читать статью или оценивать вендора, и те же цифры, которые невнимательный читатель неправильно использует.

UCF-Crime – доминирующий weakly-supervised бенчмарк: 1 900 surveillance-видео, 13 классов аномалий, включая abuse, arrest, arson, assault, burglary, fighting, road accidents, robbery, shooting, shoplifting, stealing и vandalism. SOTA за последние два года прошёл диапазон 84–90% AUC для MIL-only методов на raw признаках, с абсолютно лучшими CLIP-augmented и transformer-augmented методами на уровне примерно 95–97% AUC. Когда вендор говорит число на UCF-Crime, смотрите две вещи: тестировал ли он на стандартном test split или на cherry-picked подмножестве, и репортит ли video-level AUC или frame-level AUC – разница может составлять 8 пунктов.

ShanghaiTech Campus – 437 видео campus life, в основном пешеходные сценарии. SOTA на стандартном сплите – 95–96% AUC с VideoSwin и VideoMAE. Смотрите версию датасета – оригинал (one-class supervised, без аномалий в трейне) и weakly-supervised реорганизация (Zhong et al.) имеют разную сложность.

Avenue – 47-видео сет необычного пешеходного поведения. Достаточно мал, чтобы всё в нём оверфитилось; SOTA – выше 98% AUC. Относитесь к репортам выше 98% AUC на Avenue как к «модель прошла датасет», а не «модель работает».

XD-Violence – 4 754-видео сет с аудио, 6 классов, multi-label. SOTA – около 85–86% AP для свежих CLIP-based и MIL-подходов.

Street Scene – cross-domain бенчмарк, который большинство репортов опускают. Та же модель, что выдаёт 97% AUC на UCF-Crime, обычно теряет 10–15 пунктов на Street Scene. Этот разрыв – тот разрыв, который вы должны ожидать между benchmark-производительностью и первым месяцем прода у вашего клиента.

Честная читка бенчмарков такая: модель с 97% на UCF-Crime потребует fine-tuning на 2–6 неделях ваших реальных кадров, прежде чем выдать customer-grade производительность на ваших камерах. Заложите этот сбор данных и переразметку в бюджет заранее, и вы не удивитесь. Любой вендор, который не спрашивает про ваши site-данные, – это вендор, который никогда не отгружал в прод.

Как CLIP и VLM изменили поле – и когда за ними тянуться

Самый большой инженерный сдвиг в video anomaly detection между 2024 и 2026 – приход CLIP-based и VLM-based методов. Они достаточно отличаются от старого MIL-стека, что под них нужна отдельная ментальная модель.

CLIP – это contrastive vision-language model, обученная на парах image–text из открытого веба. Она мапит картинки и короткие текстовые описания в общее embedding-пространство, где семантически близкие элементы кластеризуются. Применение к anomaly detection прямое: описываете класс аномалии текстом («человек лезет через забор», «человек дерётся», «человек падает»), эмбеддите и текст, и видеоклип, и проводите threshold по cosine similarity. С нулём обучающих примеров целевого класса вы получаете credible детектор – не такой точный, как полностью обученная модель, но достаточно точный, чтобы запустить программу разметки или отгрузить v1 за неделю.

VadCLIP (AAAI 2024) – первый CLIP-based weakly-supervised VAD-метод, попавший на лидерборды. Интегрирует текстовые prior через text и visual prompts и обходит старый MIL-only SOTA на UCF-Crime на несколько пунктов. TPWNG (Text Prompt with Normality Guidance, CVPR 2024) фьюзит visual-признаки с CLIP text embeddings, чтобы выдавать pseudo-labels для тренировки, и закрывает разрыв с fully-supervised методами на классах длинного хвоста. VadCLIP++ (2025) вводит динамическую vision-language model, адаптирующую CLIP на inference. TrCLIP-VAD (2026) улучшает CLIP-тренировку text rewriting и сейчас near-SOTA для weakly-supervised UCF-Crime. WSVAD-CLIP (2025) добавляет temporal-aware prompt learning и frame-aware fusion. AVadCLIP (2025) расширяет подход на audio-visual collaboration, что правильно для XD-Violence-style детекции насилия.

Приход мультимодальных LLM в качестве anomaly-детекторов – второй сдвиг. Holmes-VAD (2024–2025) fine-tune-ит мультимодальный LLM на VAD-Instruct50k и выдаёт и точную temporal-локализацию, и связный нарратив. AnomalyRuler (ECCV 2024) трактует VAD как few-shot reasoning задачу: подаёт LLM несколько примеров нормального поведения, просит вывести правила и применить их к новой плёнке. Cerberus (2025) каскадирует меньшие и большие VLM, балансируя точность и frame rate – 97.2% точности, 57.68 fps на L40S.

Практический вопрос – когда тянуться за каким слоем. Правило, которым пользуемся в Фора Софт, простое. Если у вас меньше 100 размеченных примеров целевого класса аномалии – стартуйте с CLIP zero-shot – VadCLIP или TPWNG, в зависимости от доверия к текстовым промптам. Если у вас 100–1 000 примеров – тренируйте weakly-supervised MIL-слой поверх CLIP-признаков. Если у вас больше 10 000 примеров – тренируйте fully-supervised классификатор и используйте CLIP только как long-tail safety net. Если ваш продукт должен объяснить, почему событие было помечено – для суда, для регулятора, для очереди ревью аналитика безопасности – встройте frontier-VLM в слой объяснения. Если ваш продукт должен отвечать на ad-hoc запросы по архиву («оставлял ли кто-нибудь сумку у южного входа в прошлый вторник?») – встройте multimodal RAG поверх архива (см. урок про video RAG в Phase 4).

Подводный камень VLM-методов – стоимость. Frontier-VLM по $1.25 за миллион input-токенов, поглощающий 30-секундный клип на дефолтном медиа-разрешении (около 9 000 input-токенов), стоит примерно $0.011 на клип – назовём это центом. Помножьте на тысячу тревог в день – и получите $10 в день на камеру или $300 в месяц на камеру только за слой объяснения. Это больше, чем большинство SaaS surveillance-контрактов. Фикс – роутить только пограничные случаи (confidence между 0.4 и 0.7 из MIL-слоя) на frontier-VLM, а на остальные объяснения использовать маленький on-device VLM (Qwen-VL 7B, Llama 3.2 Vision 11B, Moondream 2B). Полную арифметику стоимости разбираем в уроке 1.4.

Решение edge-vs-cloud по топологии

Три топологии деплоя покрывают по сути любую production-систему anomaly detection в 2026 году. Выбор между ними – функция от бюджета латентности, числа камер, связности на площадке и регуляторного режима. Положите эти четыре числа перед собой – и выбор топологии становится механическим.

Только edge. Jetson Orin Nano Super ($249), Hailo-8 модуль ($150–300) или Google Coral Dev Board ($150) рядом с каждой камерой или один на группу из 4–16 камер. Orin Nano Super выдаёт примерно 67 TOPS под AI; Hailo-8 – 26 TOPS на 2.5 ватта. Inference-латентность квантованной SlowFast или I3D – 30–80 мс; end-to-end до локальной шины тревог уверенно меньше 200 мс. Стоимость железа – $200–600 за устройство плюс one-time integration cost. Плюс жёсткий: кадры не покидают площадку (сильнейшая privacy-история в регулируемых отраслях), нет WAN-зависимости, footprint под EU AI Act гораздо меньше. Минус операционный: каждое устройство – это сущность, которую надо поддерживать, мониторить, обновлять, заменять.

Только cloud. Стриминг каждой камеры на NVIDIA L4 ($1–1.50/час аренды), L40S ($1.80–2.20/час) или A100 ($1.30–2.50/час) в managed-регион. Каждый L4 держит 100+ 1080p потоков на 30 fps для object detection; L40S – около 60+ потоков для более тяжёлых 3D-CNN. Inference-латентность на самой GPU – 20–50 мс; end-to-end зависит целиком от WAN. Плюс операционный: одно место для деплоя, переобучения и мониторинга, hot swap моделей, центральный audit storage. Минусы – WAN round-trip (50 мс RTT + 30 мс inference + 30 мс alert fan-out – уже 110 мс и места под 200-мс SLA не остаётся) и стоимость bandwidth. Камера 1080p H.264 на 4 Mbps жрёт примерно 1.3 ТБ трафика в месяц; помножьте на 100 камер – и получите 130 ТБ в месяц, что доминирует уравнение стоимости при egress $0.05/ГБ.

Гибрид – дефолт 2026. Edge-устройства гоняют слой 1 (candidate filter) и слой 2 (MIL-классификатор) на высокой precision и умеренном recall. Пограничные события – обычно 5–20% кандидатов, в которых edge-модель не уверена, – эскалируются в облако, где слой 3 (CLIP rescore) и слой 4 (VLM-объяснение) уточняют вердикт и выдают audit trail. Команда Qdrant опубликовала прорабатываемый пример, где деплой на 50 камер генерирует 432 000 клипов в день; паттерн edge-to-cloud escalation срезает cloud-нагрузку примерно в 6 раз, ловя при этом 95% настоящих аномалий. Сплит правильный почти для любой production-системы выше 20 камер: латентность остаётся в бюджете на edge, длинный хвост обновлений моделей и слой объяснения живут в облаке.

Анти-паттерн, который мы видим чаще всего, – пуш сырых 1080p потоков в облако под latency-critical use case ради переиспользования имеющейся cloud GPU. Платите bandwidth-ом, латентностью, регуляторной экспозицией и обычно ломаете SLA на первом же стресс-тесте. Фикс – не добавить bandwidth, а перенести слой 1 на edge.

Прорабатываемый пример. Retail-деплой на 50 камер с бюджетом 300 мс и режимом EU AI Act. Edge: 50 Hailo-8 модулей по $200 = $10 000 capex, гоняющие квантованный SlowFast для детекции воровства на 30 fps, 70 мс на камеру. Локальная шина тревог на MQTT. Cloud: эскалация пограничных событий на один L40S с VadCLIP-rescore и вызов Gemini 2.5 Pro для объяснения на top-1% самых неоднозначных. End-to-end до тревоги персоналу: 180 мс медиана, 240 мс p95. Bandwidth: edge-only фильтрация режет cloud-upload до примерно 5% сырого объёма – 1.5 ТБ в месяц на всю площадку вместо 65 ТБ. Месячная стоимость: ~$1 100 cloud + ~$200 амортизированного edge-железа = $1 300 против $50/камера/мес SaaS-альтернативы в $2 500. Кастомная сборка выигрывает по цене, по латентности и по AI Act posture; SaaS выигрывает, только если деплой не вырастет выше 20 камер.

Рисунок 3. Гибридная edge+cloud топология, владеющая дефолтом 2026. Edge гонит candidate filter и классификатор; cloud владеет rescorer-ом, объяснением и audit trail-ом.

Протоколы интеграции – как детектор втыкается в остальной мир

Детекция без интеграции – это демо. Детектор обязан публиковать события в VMS, SIEM, мобильное приложение охраны, актуатор, систему уведомлений, тикетинг и audit log – всё по разным протоколам, на разных бюджетах задержки, с разными гарантиями надёжности. Четыре протокола покрывают production-стек 2026.

ONVIF Profile M – профиль метаданных и аналитики спецификации ONVIF, ратифицированный в 2022-м и широко принятый Milestone XProtect, Genetec Security Center, Avigilon Unity, Hikvision Bricks и Axis Communications Camera Station между 2023 и 2026. Если ваш детектор не умеет эмитить ONVIF-события, он не подключится к корпоративным VMS без per-vendor кастома. Profile M определяет JSON event payload, WS-BaseNotification subscription pattern и metadata XML schema; стоимость соответствия – one-time интеграция на 2–3 инженеро-недели и ежегодный ONVIF membership fee на conformance-тест.

RTSP по-прежнему дефолтный протокол потока камера→pipeline. Латентность 30–50 мс LAN, 100–300 мс WAN. Edge-box пуллит RTSP-поток, декодирует его (часто аппаратным декодером на том же NPU-модуле) и гонит inference. RTSP старше современного WebRTC-стека, но универсален на рынке IP-камер, и ONVIF определяет streaming-сторону как RTSP ради обратной совместимости.

WebRTC – более новый streaming-слой, 20–100 мс латентности, лучший firewall traversal, более сильное шифрование и adaptive bitrate. Принят более новыми cloud VMS и оператор-UI, которые мы шипим, когда sub-second доставка на удалённую консоль критична. Интеграция сложнее (нужен signalling, TURN, SFU при масштабе), но по латентности WebRTC однозначно лучше.

MQTT – шина тревог. Anomaly-детектор публикует топик типа event/shoplift/zone-5/conf-0.87 в broker; подписчики – SIEM, тикетинг, мобильное приложение, актуатор, audit log – поднимают событие и веером раздают. MQTT – де-факто стандарт IoT-уровня для тревог из-за низкого overhead и quality-of-service гарантий; правильный выбор поверх HTTP webhooks для любого деплоя выше дюжины камер.

Паттерн, который мы используем в проде: ONVIF Profile M наружу в клиентский VMS (потому что он уже есть, и любой другой выбор создаёт интеграционную боль), MQTT для высокочастотной шины тревог в on-site response-системы, и dedicated audit-log запись в immutable object storage (S3 Object Lock, Azure Blob WORM) под регуляторные доказательства. Сам детектор подключён к камере по RTSP или WebRTC, в зависимости от поколения камеры.

Цены вендоров и арифметика build-vs-buy в мае 2026

Решение build-vs-buy в anomaly detection – функция от числа камер, горизонта и ценности владения данными. Ниже 20 камер и 18 месяцев SaaS почти всегда выигрывает. Выше 100 камер и 3 лет горизонта почти всегда выигрывает custom. Середина действительно спорная.

Текущая SaaS-полоса цен на май 2026:

ВендорИндикативная ценаТиповая нишаНа что смотреть
BriefCam$50–200/камера/месEnterprise, investigation + liveFootprint под AI Act, vendor lock-in
Motorola Avigilon$30–150/камера/месГоссектор, большие кампусыПривязка к железу
Milestone XProtect + plugin$200–400/сервер/месVMS-led shopsКачество плагина варьируется
Verkada$25–75/камера/месSMB, cloud-firstПроприетарные камеры
Eagle Eye Networks$10–30/камера/месCloud VMS, базовая аналитикаОграниченный advanced AD
iOmniscient$40–120/камера/месТранспорт, плотная аналитикаМеньше интеграторов
Genetec Security Center + KiwiVision$40–150/камера/месEnterprise, large-scale opsAnnual maintenance ~20% list
AnyVision (Oosto)$50–200/камера/месIdentity-aware retail, venuesБиометрический режим
Custom build (Фора Софт)Проект + infra100+ камер, специфичные классы, regulator-grade auditTime-to-first-pilot vs SaaS

Цифры выше – list-price полосы мая 2026; согласованные enterprise-контракты на масштабе регулярно идут на 30–50% ниже list. Относитесь к таблице как к order-of-magnitude, не цитате.

Прорабатываемый анализ кроссовера. Деплой 100 камер, горизонт 3 года, EU AI Act-compliant. SaaS-путь (BriefCam средний по $100/камера/мес, включая часть AI Act paperwork): $100 × 100 × 36 = $360 000 за 3 года. Custom-путь: 12-недельный engineering build на mid-market service rate плюс $25 000 edge-железа плюс $30 000 в год cloud и ops. Итого custom за 3 года: примерно $200 000–280 000 в зависимости от агрессивности команды и переиспользования имеющегося VMS. Кроссовер ложится где-то на год 1.7–2.1 – после этой точки custom дешевле, и вы владеете данными, моделью, audit trail-ом и интеграцией. Ниже 18 месяцев горизонта правильный выбор – SaaS-контракт; у вас нет времени амортизировать сборку.

Контекст роста рынка. Рынок data anomaly detection при CAGR 19.5% – один из самых быстрорастущих сегментов в широком AI-tooling. Рынок intelligent video analytics – $14.65 млрд в 2026 году с прогнозом $41.39 млрд к 2031-му (CAGR 23.1%). Общий рынок video surveillance – $95 млрд в 2026 с прогнозом $261 млрд к 2034-му (CAGR 13.5%). Возможность anomaly detection – это дифференциатор, который мейджоры закладывают в новые контракты; через 24 месяца это станет table stakes, и продукты, отгружающиеся без неё, будут переплатформляться под давлением собственных клиентов.

EU AI Act, GDPR и compliance-инженерия, которую кодовая база обязана нести

EU AI Act (Регламент 2024/1689) – крупнейшее одно изменение в экономике video anomaly detection за десятилетие. Частично вступил в силу в августе 2025-го; обязательства по high-risk системам полностью входят в силу в августе 2026-го. Если ваш продукт в EU или у него есть EU-клиенты, релевантные секции теперь инженерный вход, а не юридическая постнаклейка.

Real-time биометрическая категоризация физических лиц в публично доступных пространствах сильно ограничена по статье 5 (статья о запрещённых практиках). Исключения узкие – поиск пропавших, предотвращение конкретной непосредственной террористической угрозы, идентификация виновного в тяжком преступлении – и требуют судебного разрешения. Live face-recognition-based anomaly detection – high-risk центр Акта; многие вендоры в 2025 году ушли с EU-рынка именно потому, что их продукты не могли удовлетворить статье 5.

Annex III перечисляет high-risk ИИ-системы. Surveillance критической инфраструктуры, биометрическая идентификация и law-enforcement-adjacent системы все попадают сюда. Под high-risk-систему обязательства статей 9–15 включают документированную систему управления рисками, dataset governance с документацией bias, техническую документацию по модели и тренировочному набору, автоматическое логирование, механизмы human oversight, требования к точности и устойчивости и conformity assessment. Это не артефакты legal-команды; это инженерные артефакты, которые обязана выдавать кодовая база. Model cards, data sheets, training logs, drift logs, alert audit trails – это deliverables, удовлетворяющие статьям 11 и 13.

Штрафы не символические. До 7% глобального годового оборота или €35 млн (что больше) за самые серьёзные нарушения запрещённых практик. До 3% или €15 млн за нарушение high-risk-системы. Маленький продукт, отгружающийся в EU без conformity assessment, экспонирован так, как ни один продукт в этой нише не был три года назад.

GDPR никуда не делся. Статья 9 по-прежнему трактует биометрические данные как special category, требующую явного правового основания. Статья 35 по-прежнему требует Data Protection Impact Assessment под любой осмысленный деплой. CCTV-специфичные гайды от European Data Protection Board (EDPB) и UK ICO планомерно ужесточались с 2022 года. Практическое следствие – face-based anomaly detection в EU крайне сложно отгрузить легально вне узких use cases; gait, posture, object и поведенческие методы сидят на гораздо более удобной правовой почве.

Инженерный паттерн, удовлетворяющий Акту, – тот же, что мы и так рекомендовали по техническим причинам. Предпочитайте gait и posture face-based, когда use case позволяет. Держите кадры on-site, когда латентность позволяет – edge-only inference – гораздо меньшая compliance-поверхность, чем cloud. Логируйте каждое срабатывание с confidence, reviewer ID, dispositions и версией модели – этот лог и есть audit trail, который запросит регулятор. Встройте human oversight в response workflow; Акт это требует. Держите model card и документацию тренировочных данных в том же репозитории, что и модель; не делайте из них отдельный артефакт.

Регуляторный слой полностью разбираем в уроке 8.5 по EU AI Act и Article 50 engineering. Короткая версия: в 2026 году compliance posture – это фича продукта, а не внешнее навязывание.

Двенадцать алгоритмов anomaly detection, между которыми вы реально выбираете

Следующая статья серии – 2.16 – Алгоритмы anomaly detection: 12 production-подходов – детально разбирает каждый алгоритм. Сводка ниже – короткая версия, достаточная, чтобы знать, какое имя использовать в RFP без претензии на глубину, которой пока нет.

One-class SVM – классический baseline. Тренируется на нормальных кадрах или признаках, threshold по расстоянию до границы на inference. Лёгкий, не требует примеров аномалий, правильный пол для use cases «есть ли движение в этом обычно-пустом пространстве».

Isolation Forest изолирует аномалии рекурсивным разбиением пространства признаков случайными бинарными деревьями. Аномалии изолируются за меньшее число сплитов, чем нормальные точки. Быстрый, масштабируется линейно, не требует примеров аномалий. Правильный инструмент для signal-level anomaly detection на инженерных признаках.

Local Outlier Factor (LOF) идентифицирует локальные плотностные аномалии – точки в регионе низкой плотности, окружённые более высокой. Лучше Isolation Forest, когда нормальное поведение по плотности варьируется по пространству признаков.

Autoencoder reconstruction тренирует encoder-decoder сжимать и реконструировать нормальные кадры; у аномалий высокая reconstruction error. Доминирующий unsupervised подход в video anomaly detection 2020–2024 годов и до сих пор правильный выбор, когда меток ноль.

ST-AE и MemAE – spatial-temporal автоэнкодеры, специализированные под видео. MemAE добавляет memory module, не дающий автоэнкодеру слишком хорошо обобщаться на аномалии; ST-AE добавляет temporal-моделирование. Оба бегают на edge-железе.

Variational Autoencoder (VAE) и GAN-based детекторы моделируют распределение нормальных данных и помечают сэмплы с низким likelihood. Стабильны в исследованиях, реже встречаются в проде из-за нестабильности тренировки.

3D-CNN (I3D, C3D, SlowFast) – рабочая лошадка поведенческой anomaly detection. Квантованная до INT8 – гонит 30 fps на Jetson Orin Nano Super. Правильная модель слоя 2 для прода.

Video transformers (TimeSformer, VideoSwin, VideoMAE, ViViT) – потолок точности. Доминируют на маленьких бенчмарках (Avenue, ShanghaiTech) и правильный выбор для cloud-side rescoring. Пока не real-time-feasible на edge для большинства вариантов в 2026.

Weakly-supervised MIL (RTFM, MGFN, AAMIL, Unbiased MIL, MTFL) – академический state of the art на UCF-Crime. Правильная модель слоя 2, когда есть video-level метки, но нет frame-level.

CLIP-based методы (VadCLIP, TPWNG, VadCLIP++, TrCLIP-VAD, WSVAD-CLIP, AVadCLIP) – семейство rescorer-ов слоя 3. Используйте при необходимости open-vocabulary детекции или маленьком бюджете разметки.

Мультимодальные LLM (Holmes-VAD, AnomalyRuler, Cerberus) – семейство объяснителей слоя 4. Используйте, когда тревога должна быть аудируема естественным языком для человека-ревьюера или регулятора.

LSTM и temporal CNN на инженерных признаках – инструменты сигнальной аномалии слоя 5. Применяйте на метаданных pipeline-а, чтобы ловить отказы, которые vision-слои пропускают.

Дефолтная архитектура Фора Софт связывает слои 1, 2, 3, 4 и 5 вместе – квантованный 3D-CNN на edge, MIL-классификатор сверху, CLIP-rescorer в облаке, frontier-VLM для объяснения на top-1% пограничных случаев и Isolation Forest, наблюдающий за pipeline-ом. Стоимость в полосе, описанной в прорабатываемом примере выше; точность на вершине поля; audit trail удовлетворяет AI Act. Другие архитектуры работают для более узких задач; эта работает на общий случай.

Типичная ошибка – относиться к anomaly detection как к object detection задаче

Самая дорогая архитектурная ошибка в этой нише – когда команда берёт работающий YOLO-pipeline, уже построенный под object detection, и прикручивает сверху anomaly-правило: «тревога, если человек в зоне X» или «тревога, если счётчик больше N». Выглядит дёшево, потому что переиспользует код. Это не так.

Причина провала в том, что аномалия – это редко «объект в месте», это «объект ведёт себя по-другому во времени в контексте, о котором модели не сказали». Человек, идущий через зону, нормален в 09:00 и аномален в 03:00; сумка у скамейки нормальна 2 минуты и аномальна после 10; человек бегущий нормален в коридоре и аномален на платформе. Ни одно из этих различий не живёт в выходе YOLO. Чтобы их получить, нужна либо темпоральная модель (3D-CNN, видео-трансформер, LSTM на object-треках), либо слой правил с расписанием и контекстом (что годится для простейших случаев и быстро становится неподдерживаемым).

Фикс – стартовать архитектуру со слоя 2 описанного выше стека (темпоральная модель, поглощающая несколько секунд видео) и подключать object-detector только тогда, когда аномалию нужно локализовать на конкретной сущности под downstream-действие. Обратный путь почти всегда заканчивается через год от старта проекта, в четырёх типах edge-кейсов глубиной, с клубком правил, который никто не может отладить.

Подводный камень обойдён: когда стейкхолдер говорит «у нас уже есть object detection, давайте просто добавим anomaly detection сверху», правильный ответ – «какой бюджет латентности, какой класс аномалии, какая длина темпорального контекста и какой бюджет разметки?» Эти четыре вопроса возвращают разговор к слою 2 стека, а не к слою 6 движка правил.

Где Фора Софт вписывается

Мы шипим production видеопродукты уже два десятилетия – surveillance с Netcam Studio, conferencing на WebRTC, телемедицина, e-learning, OTT, AR/VR. Слой anomaly detection – нагрузка, по которой мы наиболее активны в 2024–2026, и под greenfield surveillance-продукты, и под retrofit-проекты, где существующий видеопродукт получает эту способность без нарушения остального pipeline. Дефолтная архитектура – пятислойный стек из этой статьи; дефолтная топология – гибридный edge+cloud паттерн; дефолтная интеграция – ONVIF Profile M + MQTT + regulator-grade audit trail. Мы работали в ритейле, на транспорте, в индустриальной безопасности, в здравоохранении и в conferencing – разные классы аномалий, разные бюджеты задержки, та же инженерная дисциплина.

Ключевые выводы

  • Anomaly detection в 2026 – это слоистый pipeline, а не одна модель. Пять слоёв; пропущенный – типичная причина провала.
  • Назовите класс аномалии одним предложением до выбора модели. Класс задаёт все downstream-решения.
  • Бюджет латентности – первое число, которое вы согласовываете. Sub-200 мс заставляет edge; cloud нормально выше 500 мс.
  • CLIP-based и VLM-based методы – лифт 2026. Применяйте при дефиците меток или обязательности объяснения.
  • EU AI Act – инженерный вход. Model cards, audit logs и human oversight живут в кодовой базе.
  • Build-vs-buy кроссовер – примерно 18–24 месяца для 100+ камер. SaaS ниже, custom выше.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.