Содержание статьи +
- TL;DR
- Зачем это нужно
- Сито из четырёх чисел – как выбрать ещё до чтения
- Алгоритм 1 – One-Class SVM (классический baseline, который вы недооцените)
- Алгоритм 2 – Isolation Forest (дефолт для signal-level аномалий)
- Алгоритм 3 – Local Outlier Factor (когда плотность по feature-space реально разная)
- Алгоритм 4 – Autoencoder reconstruction (unsupervised-дефолт для сырого видео)
- Алгоритм 5 – ST-AE и MemAE (специализированные видео-autoencoder-ы)
- Алгоритм 6 – Variational Autoencoder и GAN-based детекторы
- Алгоритм 7 – 3D-CNN (I3D, C3D, SlowFast – рабочая лошадка Layer 2)
- Алгоритм 8 – Видео-трансформеры (TimeSformer, VideoSwin, VideoMAE, ViViT – потолок точности)
- Алгоритм 9 – Weakly-supervised MIL (RTFM, MGFN, MTFL – SOTA на UCF-Crime)
- Алгоритм 10 – Методы на CLIP (VadCLIP, TPWNG, VadCLIP++, TrCLIP-VAD, WSVAD-CLIP, AVadCLIP – лифт 2024–2026)
- Алгоритм 11 – Мультимодальные LLM (Holmes-VAD, AnomalyRuler, Cerberus, SlowFastVAD – слой объяснения)
- Алгоритм 12 – LSTM и temporal CNN на инженерных признаках (pipeline-watchdog)
- Production-готовый стек – как зашить двенадцать алгоритмов в один pipeline
- Выбор алгоритма – сравнительная таблица
- Типичная ошибка: брать самый тяжёлый алгоритм первым
- Где Фора Софт вписывается
- Ключевые выводы
- Что читать дальше
TL;DR
Двенадцать алгоритмов покрывают практически любой production-сервис обнаружения аномалий в видео в 2026 году, а правильный выбор для вашего продукта – функция четырёх чисел: число размеченных примеров, бюджет латентности, бюджет железа на камеру и требование к объяснению каждого срабатывания на человеческом языке. Классические статистические методы (one-class SVM, Isolation Forest, Local Outlier Factor) по-прежнему выигрывают на signal-level аномалиях и табличных признаках почти без стоимости обучения. Реконструкционные методы (vanilla autoencoder, ST-AE, MemAE, VAE/GAN) – unsupervised-дефолт, когда у вас ноль примеров класса аномалии. Глубокие темпоральные модели (3D-CNN вроде I3D и SlowFast, видео-трансформеры VideoSwin и VideoMAE) – рабочая лошадка layer-2-классификаторов для поведенческих аномалий. Weakly-supervised MIL-фреймворки (RTFM, MGFN, MTFL) – академический SOTA на UCF-Crime с 86–90% AUC на сырых признаках. Методы на CLIP (VadCLIP, TPWNG, VadCLIP++, TrCLIP-VAD, WSVAD-CLIP) – это лифт 2024–2026, позволяющий стартовать с двух примеров на класс и при этом получать 88% AUC. Мультимодальные LLM (Holmes-VAD, AnomalyRuler, Cerberus) – слой, объясняющий каждое срабатывание на человеческом языке. LSTM и temporal CNN на инженерных признаках следят за самим pipeline-ом. Эта статья проходит по каждому алгоритму с его сложностью, production-применимостью, реальным железом и failure mode, который удивит вас на третий месяц.
Зачем это нужно
Если вы прочитали playbook обнаружения аномалий 2026 года, вы уже знаете: поле – это слоистый стек, а не одна модель. Эта статья – глубокий проход по алгоритмам каждого слоя. Она написана для инженера, выбирающего между RTFM и MGFN для layer-2-классификатора и не понимающего из маркетинга, кто из них уложится в бюджет латентности на Hailo-8; для продакт-менеджера, защищающего CLIP-архитектуру перед бордом, который хочет «LLM, который делает всё»; для основателя, смотрящего в питч-деке вендора на двенадцать названий алгоритмов и не знающего, по каким трём задавать follow-up вопросы. К концу вы будете знать сито из четырёх чисел, которое выбирает правильный алгоритм для любого продукта, failure mode каждого алгоритма в проде и его стоимость на масштабе вашего деплоя. Статья предполагает, что вы прочитали урок 1.2 о латентности и топологии и урок 1.4 о стоимости ИИ в видеопродуктах, потому что любой выбор здесь сводится либо к миллисекундам, либо к долларам.
Сито из четырёх чисел – как выбрать ещё до чтения
Честный способ читать эту статью – нелинейный. Прежде чем взвешивать любой алгоритм, выпишите четыре числа о своём продукте. Это сито, которое превращает двенадцать кандидатов в два.
Первое число – количество размеченных примеров интересующего вас класса аномалии. Ноль примеров отправляет к unsupervised-семействам (autoencoder, VAE, Isolation Forest, one-class SVM). От двух до сотни примеров открывает CLIP-семейство и few-shot-методы (VadCLIP, AnomalyRuler). От сотни до тысячи – sweet spot weakly-supervised MIL поверх CLIP-фич. Десять тысяч и больше – это fully-supervised территория, и на production-видео это число встречается достаточно редко, чтобы быть отдельным фактом.
Второе число – end-to-end бюджет латентности в миллисекундах от события до тревоги. Меньше 200 мс заставляет крутить inference на edge и исключает всё, что требует cloud-round-trip. От 200 до 500 мс позволяет тонкую edge-plus-cloud-топологию. Выше 500 мс облако подходит. Выше десяти секунд у вас уже не real-time, а forensic, и frontier-VLM становятся экономичными.
Третье число – бюджет железа на камеру. Меньше $250 на камеру – это Hailo-8 или Coral Edge TPU и исключает всё, что не квантизуется в INT8. От $250 до $1000 – это Jetson Orin Nano Super или Orin NX, и открывается всё семейство глубоких темпоральных моделей. Выше $1000 – это cloud GPU, расшаренный между многими камерами, и выбор алгоритма отвязан от числа камер.
Четвёртое число – требование к объяснению. Если тревога может тихо упасть в очередь human-reviewer-у, вы экономите стоимость Layer 4 целиком. Если тревога должна сопровождаться natural-language объяснением, выдерживающим review регулятора или суда, придётся подключать VLM в стек – Holmes-VAD on-device для рутины и frontier-VLM в облаке на пограничный 1%.
Прогоните эти четыре числа – и поле из двенадцати сужается до шорт-листа из двух-трёх. Остальная часть статьи – это глубокий проход, выбирающий между ними.
Алгоритм 1 – One-Class SVM (классический baseline, который вы недооцените)
One-Class SVM (OCSVM) представили Schölkopf et al. в 2001 году как способ охарактеризовать носитель высокоразмерного распределения по сэмплам, из него взятым. На язык anomaly detection это переводится так: тренируете на примерах нормального поведения, модель учит границу в feature-space. На inference всё, что попадает за границу, помечается аномальным. Примеры самого класса аномалии не нужны – и это единственная причина, почему OCSVM всё ещё ездит в проде в 2026 году, потому что любая современная альтернатива точнее, когда метки есть.
Матчасть – quadratic program, ищущий наименьшую гиперплоскость, отделяющую данные обучения от начала координат в kernel-induced feature-space. С RBF-ядром и параметром nu по умолчанию 0.1 модель предполагает, что до 10% данных обучения – выбросы, и подстраивает границу. Сложность обучения – от O(n²) до O(n³) по числу сэмплов, что ограничивает практический train set где-то 50–100 тысячами кадров до того, как обучение становится проблемой. Inference – O(n_sv), где n_sv – число опорных векторов: типично несколько сотен для хорошо обученной модели, и этого достаточно для любого real-time-бюджета.
Причина, по которой OCSVM в 2026 ещё заслуживает места, – длинный хвост сценариев «есть ли движение в этом обычно пустом пространстве?». Подсобный коридор в 03:00. Закрытый складской проход вне рабочих часов. Серверная, где любое человеческое присутствие – аномалия по определению. У вас сотни часов «нормального» (пустая комната) и ноль примеров класса аномалии (взломщик). OCSVM, обученный на per-frame признаках, извлечённых предобученным ResNet-50 или маленьким ViT, надёжно срабатывает при появлении человека – без примеров аномалий и без fine-tuning. Стоит копейки и крутится 1000 кадров в секунду на CPU.
Production failure mode – проклятие размерности. По мере того как ваш feature-вектор растёт за пределы нескольких сотен размерностей, метрика расстояния, на которой держится ядро, теряет дискриминацию, и граница становится либо слишком слабой (помечает всё), либо слишком жёсткой (не помечает ничего). Лечится тем, что вы скармливаете OCSVM низкоразмерный embedding – 64- или 128-мерную проекцию предобученного энкодера, а не сырой 2048-мерный ResNet-выход. Второй failure mode – concept drift: OCSVM, обученный на «нормальном» весной, начнёт помечать «нормальное» осенью, когда листья сменят цвет и освещение поплывёт. Закладывайте retrain раз в квартал или повесьте сверху drift-детектор.
Рабочий пример. 16-камерный деплой охраны back room-ов сети банковских отделений. Часы нормального видео, ноль примеров вторжения. Извлекаем 128-мерный embedding на кадр квантизированным MobileNet-ViT на Raspberry Pi 5 ($80), стоящем рядом с каждой камерой. Обучаем RBF-OCSVM с nu=0.05, gamma=0.1 на 30 днях нормального видео с камеры. Inference-латентность – около 8 мс на кадр на Pi 5; тревога публикуется по MQTT в дежурный мобильный app. Total per-camera capex – около $100, включая Pi и PoE-сплиттер. Система ловит каждое вторжение в пилоте, ни разу не видев вторжения в обучении. Выше 20 камер вы перейдёте на Isolation Forest за линейное обучение; ниже двадцати OCSVM – самый простой правильный ответ.
Алгоритм 2 – Isolation Forest (дефолт для signal-level аномалий)
Isolation Forest (iForest) представили Liu, Ting и Zhou в 2008 году, и это один из немногих алгоритмов anomaly detection, который грациозно масштабируется. Интуиция обратная всему в этой статье. Вместо того чтобы учить, как выглядит нормальное, и помечать отклонения, iForest пытается изолировать каждую точку, рекурсивно разрезая feature-space случайными бинарными split-ами. Аномалии – статистически редкие и feature-wise другие – изолируются за меньшее число split-ов, чем нормальные точки, потому что у них меньше соседей, «защищающих» их. Anomaly score – средняя длина пути по ансамблю случайных деревьев, нормализованная ожидаемой длиной для размера датасета.
Сложность обучения – O(n log n), prediction – O(log n) на дерево; см. документацию scikit-learn как канонической реализации. Оба числа линейны по размеру датасета для практических целей, что делает iForest комфортным на десятках миллионов точек. Не нужна нормализация признаков, не нужны примеры аномалий, и поверхность гиперпараметров – по сути одна ручка (contamination, предполагаемая доля выбросов, по умолчанию auto).
Production-fit – это не сырые кадры, а инженерные признаки поверх pipeline-метаданных. Per-frame среднее значение пикселей – ловит замёрзший feed. Per-frame энтропия – ловит чёрный экран. Битрейт энкодера – ловит заклинивший энкодер. Магнитуда inter-frame difference – ловит замёрзшую камеру. Гистограмма confidence модели – ловит модель, схлопнувшуюся в одну метку. Dropped-packet rate на WebRTC-транспорте – ловит сетевую проблему. Скармливаете эти метрики – вектор из 20–60 чисел на кадр, агрегированных в скользящее окно в 1 минуту, – в iForest, и получаете Layer 5 пятислойного стека из playbook-а 2026 года. Это слой, который ловит камеру, тихо застывшую на стоп-кадре парковки на закате.
Failure mode в проде – тот же, что у любой модели на временных рядах: медленно дрейфующие признаки не помечаются, пока дрейф не завершится. Камера, чей фокус деградирует за полгода, не будет помечена iForest, если обучать на последних 30 днях её же данных, потому что каждый отдельный день выглядит нормально относительно предыдущего. Лечится фиксацией обучающих данных на «золотой» baseline (первый месяц после установки) и периодическими абсолютными сравнениями с ним, а не только rolling-сравнениями с недавней историей.
Рабочий пример. 500-камерный ритейл-surveillance-флот. Инженерный feature-вектор из 32 чисел на камеру в минуту (compression ratio, средняя luma, frame freeze count, motion energy, гистограмма confidence модели, alert rate и т.д.). Один iForest на камеру, переобучается еженощно на последних 30 днях golden-baseline-данных. Стоимость inference – ничтожна; iForest-ы всего флота крутятся секунды на одном ядре CPU. Пойманные failure-режимы в первый квартал: 7 замёрзших feed-ов, 14 камер, ушедших из фокуса, 3 камеры, которые кто-то повернул на 90° во время уборки, 2 случая, когда модель схлопнулась в один класс после неудачного деплоя. Ни одно из этого не было видно vision-слою сверху.
Алгоритм 3 – Local Outlier Factor (когда плотность по feature-space реально разная)
Local Outlier Factor (LOF) представили Breunig, Kriegel, Ng и Sander в 2000 году. Это старший кузен iForest и правильный выбор, когда feature-space имеет области реально разной плотности, которые модель должна уважать. LOF считает для каждой точки отношение её локальной плотности к локальным плотностям её k ближайших соседей; точка в области низкой плотности, окружённая соседями более высокой плотности, получает высокий скор и помечается аномальной.
Сложность – главная проблема. LOF нужны pairwise distances, чтобы найти ближайших соседей: O(n²) в наивной реализации. scikit-learn ускоряет это BallTree или KDTree до примерно O(n log n) на низкоразмерных данных, но константа всё равно больше, чем у iForest, а tree-структуры схлопываются в O(n²) на высокоразмерных данных. Правило: предпочитайте iForest для датасетов выше 100 000 сэмплов, и тянитесь к LOF, только когда интуиция локальной плотности реально соответствует форме данных.
Production-fit узкий. Классика – geographic anomaly detection: машина, остановившаяся посреди необычного сегмента дороги, где «середина сегмента» имеет разную нормальную плотность в зависимости от того, на автостраде вы или в городе. Интуиция LOF – «эта точка аномальна, потому что её локальная окрестность необычно разрежена» – обобщается лучше, чем глобальный порог iForest. Для большинства pipeline-метаданных глобальной перспективы iForest хватает, а LOF – overkill. Мы упоминаем его в production-двенадцати, потому что есть специализированные применения (urban analytics, mobility data, разреженные sensor-сети), где LOF действительно правильный инструмент.
Failure mode – настройка. Параметр n_neighbors – самый важный гиперпараметр и тот, у которого нет хорошего дефолта. Слишком низко – доминирует шум; слишком высоко – интуиция локальной плотности схлопывается в глобальную, и проще взять iForest. User guide scikit-learn рекомендует n_neighbors = 20 как стартовую точку и подбор в диапазоне 10–50 на валидационной выборке.
Алгоритм 4 – Autoencoder reconstruction (unsupervised-дефолт для сырого видео)
Vanilla-autoencoder – самый простой deep-learning метод, работающий на видео. Обучаете encoder-decoder свёрточную сеть сжимать кадр (или короткий клип) в низкоразмерный latent и реконструировать его обратно. Тренируете только на нормальных кадрах. На inference помечаете любой кадр, чья reconstruction error (обычно MSE на пикселях или perceptual loss на глубоких признаках) превышает выученный порог. Интуиция: сеть учится реконструировать паттерны, которые видела, и спотыкается на тех, которых не видела.
Первая волна работ – Hasan et al. 2016, Chong и Tay 2017, Luo et al. 2017 (ConvLSTM-AE) – закрепила семейство на датасетах Avenue и ShanghaiTech и показала, что даже маленький autoencoder бьёт классические статистические baseline-ы на сыром видео на 5–15 AUC-пунктов. Вторая волна (Liu et al. 2018, Park et al. 2020 – MemAE, Gong et al. 2019) уточнила архитектуру, чтобы адресовать доминирующий failure mode vanilla-autoencoder-а: сеть слишком хорошо обобщает и учится сносно реконструировать аномалии, размывая gap, который должен срабатывать.
В проде vanilla-autoencoder – правильный unsupervised-дефолт. Крутится 60+ fps на 224×224 на Jetson Orin Nano Super, не нуждается в anomaly-метках, настройка порога – однострочная операция на отложенной валидации. Где он падает – длинный хвост поведенческих аномалий: спокойно идущий человек реконструируется нормально, но и дерущийся реконструируется нормально, потому что encoder обобщает по «человек что-то делает». Для этих случаев переходите на ST-AE или MemAE.
Failure mode, к которому надо готовиться, – threshold drift. Распределение reconstruction error дрейфует с освещением, погодой, фокусом камеры, активностью сцены и сезоном. Поставили статический порог один раз – за два месяца он станет либо бесполезным (ноль тревог), либо невыносимым (сотни false alert). Лечится rolling per-camera порогом на основе перцентиля недавнего распределения reconstruction error (обычно 99.5-й перцентиль за последние 7 дней) плюс «novelty»-проверкой, обнаруживающей, что распределение целиком сместилось, и триггерящей retrain.
Алгоритм 5 – ST-AE и MemAE (специализированные видео-autoencoder-ы)
Spatial-Temporal Autoencoder (ST-AE) расширяет vanilla-autoencoder явным темпоральным моделированием. Вместо сжатия одного кадра за раз encoder заглатывает короткий клип (обычно 8–16 кадров), а decoder реконструирует его целиком. Темпоральную ось можно моделировать 3D-свёрткой, ConvLSTM или маленьким transformer-блоком. Выигрыш на видео-anomaly detection реальный: поведенческие аномалии, которые «нормальные покадрово, но неправильные в движении» – бегущий человек там, где бегать нельзя, машина, едущая против движения в one-way зоне, – ловятся по темпоральной оси там, где промахиваются per-frame-autoencoder-ы.
MemAE (Gong, Liu et al. 2019, ICCV) добавляет явный memory-модуль между encoder-ом и decoder-ом. Encoder выдаёт latent; latent используется для запроса памяти из K прототипных векторов (обычно K = 2000), ближайшие прототипы агрегируются, и из агрегата decoder реконструирует. Эффект: сеть может реконструировать только то, что близко к чему-то виденному; аномалии, дающие latent далеко от любого прототипа, реконструируются плохо, и тревога срабатывает. Опубликованные числа на Avenue и ShanghaiTech показали улучшение в 2–3 AUC-пункта над vanilla-autoencoder-ами без затрат на разметку.
В проде ST-AE и MemAE – правильный выбор для случая «у нас сотни часов нормального видео, ноль примеров аномалий, и аномалия темпоральная». Цена – размер модели (ST-AE с 3D-свёртками тяжелее per-frame autoencoder-а в 5–10 раз) и латентность (16-кадровое окно ingest добавляет полсекунды контекста – нормально для облака, маргинально для sub-200 мс edge). Обе квантизуются в INT8 на Jetson чисто, но inference-латентность на Jetson Orin Nano Super для типичного ST-AE-клипа – 80–150 мс, верхняя граница 200-мс-полосы.
Failure mode – overfit-to-recent. Если переобучать ST-AE или MemAE еженедельно на последних 7 днях видео, она быстро выучит, что текущие паттерны сцены нормальны, и потеряет способность помечать изменения. Лечится тем, что обучаете один раз на многомесячном «золотом» окне на камеру, и переобучаете, только когда drift-детектор скажет, что underlying-распределение существенно сместилось.
Алгоритм 6 – Variational Autoencoder и GAN-based детекторы
Variational Autoencoder (VAE) расширяет autoencoder вероятностным latent-ом – encoder выдаёт mean и variance вектор, latent сэмплится из соответствующего Gaussian-а, decoder реконструирует из сэмпла. Loss-обучения объединяет reconstruction error с KL-дивергенцией, толкающей распределение latent-а к unit-Gaussian. Anomaly-сигнал – log-likelihood под моделью: у аномалий низкая likelihood, и они помечаются.
GAN-based методы – AnoGAN (Schlegl et al. 2017), GANomaly (Akcay et al. 2018), Skip-GANomaly (Akcay et al. 2019) и их видео-специфичные потомки – обучают generator-а производить нормальные сэмплы, а discriminator-а отличать нормальные от сгенерированных, затем используют либо reconstruction error, либо confidence discriminator-а как anomaly-сигнал. Интуиция идентична VAE – модель знает, как выглядит нормальное, а аномалия – это то, с чем она не может справиться.
В академических бенчмарках VAE и GAN-based детекторы держатся в той же AUC-полосе, что и ST-AE – полезные и конкурентоспособные на маленьких бенчмарках (Avenue, ShanghaiTech), но редко на вершине leaderboard-а. В проде они гораздо менее распространены, потому что обучение тяжелее. VAE требует аккуратной балансировки reconstruction-члена и KL-члена с тенденцией схлопываться в posterior-mean-equals-prior (failure mode «posterior collapse»). GAN-обучение знаменито своей нестабильностью – mode collapse, vanishing gradients и осциллирующие losses – стандартные failure mode-ы, съедающие недели инженерного времени.
Наша практическая рекомендация – пропустить VAE и GAN для production-anomaly-detection, если у вас нет специалиста в команде. Vanilla-autoencoder-ы проще и конкурентны; ST-AE и MemAE конкурентны на темпоральных аномалиях с куда меньшей training-болью; CLIP и MIL семейства драматически лучше при любых метках. VAE и GAN остаются интересными в исследованиях и в узких industrial-inspection контекстах, где сами сгенерированные сэмплы полезны (для аугментации данных, для симуляции), но для обычного video anomaly detection это не то место, куда стоит тратить training-инженерное время в 2026 году.
Алгоритм 7 – 3D-CNN (I3D, C3D, SlowFast – рабочая лошадка Layer 2)
Семейство 3D-CNN – production-рабочая лошадка для поведенческого anomaly detection. C3D (Tran et al. 2015) первым показал, что добавление оси времени в свёртку даёт куда лучший видео-feature-extractor, чем 2D-CNN-плюс-LSTM. I3D (Carreira и Zisserman 2017) расширил 2D ImageNet-предобученную Inception-сеть до 3D, «надув» свёрточные ядра вдоль оси времени и засеяв результат 2D-весами, – и I3D стал первым реально сильным предобученным видео-feature-extractor-ом. SlowFast (Feichtenhofer et al. 2019, ICCV) ввёл two-pathway-архитектуру – slow-pathway на низкой темпоральной частоте, ловящий пространственную семантику, и fast-pathway на высокой темпоральной частоте, ловящий движение, – и остаётся лучшей точкой accuracy-per-FLOP в семействе.
Для anomaly detection семейство 3D-CNN редко end-to-end модель; это feature-extractor. Типичный паттерн: берёте предобученный I3D или SlowFast, прогоняете по клипу, чтобы получить 1024- или 2048-мерный feature-вектор на сегмент, и скармливаете эти признаки downstream-классификатору – MIL, MLP, transformer, CLIP-similarity, что бы ни требовала layer-2-архитектура. Причина – эффективность: 3D-CNN – дорогая часть, и заплатить её хочется один раз на клип; downstream-классификатор можно переобучить под новые классы аномалий без повторного извлечения признаков.
Квантизованные в INT8 I3D и SlowFast крутятся примерно на 30 fps на Jetson Orin Nano Super, с латентностью feature-вектора 25–40 мс на клип. Nano Super даёт около 67 TOPS INT8 sparse – достаточно запаса, чтобы крутить 3D-CNN плюс маленькую MIL-голову плюс тонкий candidate-filter-autoencoder на том же устройстве. На Orin NX (100 TOPS) помещается более тяжёлый вариант SlowFast или несколько инстансов модели для multi-camera shared-железа. Вариант ResNet50-I3D-NonLocal, часто используемый как feature-backbone для VAD, весит 34.6M параметров и 38.3 GFLOPs на клип – комфортно внутри edge-envelope Orin Nano.
Failure mode – clip-boundary effects. 3D-CNN заглатывает фиксированной длины клип (обычно 16, 32 или 64 кадра). Аномалия, пересекающая границу клипа, может быть разрезана пополам и видна каждым из двух клипов «наполовину», давая низкую confidence на обоих. Лечится прогоном с overlapping clips (sliding window с stride меньше длины клипа) и темпоральным сглаживанием per-clip-скоров. Цена – примерно 2× compute, что нужно закладывать в бюджет латентности.
Алгоритм 8 – Видео-трансформеры (TimeSformer, VideoSwin, VideoMAE, ViViT – потолок точности)
Семейство видео-трансформеров пришло между 2021 и 2023 годами и подняло потолок точности на большинстве action-recognition и anomaly-detection бенчмарков на 2–5 пунктов. TimeSformer (Bertasius et al. 2021) ввёл «divided attention» – attention по пространству внутри каждого кадра, затем attention по времени между кадрами – как способ сделать видео-трансформеры tractable. ViViT (Arnab et al. 2021) исследовал семейство factorisation-ов spatial-temporal attention. VideoSwin (Liu et al. 2022) принёс Swin Transformer-овский hierarchical shifted-window attention в видео, драматически снизив compute-цену с сохранением точности. VideoMAE (Tong et al. 2022, NeurIPS) ввёл masked-autoencoder-предобучение для видео – случайно маскируете 90% видео-токенов, обучаете на реконструкции, и в результате – сильный self-supervised предобученный видео-трансформер, требующий меньше размеченных данных для fine-tuning, чем supervised-аналоги.
Для anomaly detection видео-трансформеры стабильно бьют 3D-CNN на маленьких бенчмарках (Avenue, ShanghaiTech) и конкурентны на UCF-Crime под MIL-головой. Заголовочное число – VideoSwin-B или VideoMAE-L backbone с обученной MIL-головой даёт 95%+ AUC на UCF-Crime – существенный лифт над SlowFast-backbone-ом с той же MIL-головой.
Цена – compute. Вариант VideoSwin-B крутится 5–15 fps на Jetson Orin Nano Super даже в INT8 – слишком медленно для live edge-inference на 30 fps. VideoMAE-L ещё тяжелее. Семейство видео-трансформеров – правильный выбор для cloud-side re-scoring в гибридной топологии – edge крутит квантизованный SlowFast на 30 fps для candidate-filtering, облако крутит VideoMAE на кандидатах, помеченных edge-моделью, для high-accuracy second opinion. На cloud L40S VideoMAE крутится на 30+ fps на десятках потоков параллельно; на edge-кремнии в 2026-м – пока нет.
Failure mode – transformer hyperparameter sensitivity. Видео-трансформеры более чувствительны к learning-rate warmup, weight decay, drop-path rate и patch-size, чем 3D-CNN. Команда, никогда не обучавшая видео-трансформер, должна закладывать 4–8 недель ramp-up до воспроизведения опубликованных чисел. Лечится тем, что вы стартуете от опубликованных предобученных весов и fine-tune скромно (один learning-rate 1e-5, weight decay 0.05, drop-path 0.1), а не обучаете с нуля.
Алгоритм 9 – Weakly-supervised MIL (RTFM, MGFN, MTFL – SOTA на UCF-Crime)
Семейство Multiple Instance Learning (MIL) – класс алгоритмов, сделавший weakly-supervised video anomaly detection практичным. Проблема, которую решает MIL, – стоимость разметки. Frame-level метки аномалий – «вот этот конкретный кадр содержит драку» – непосильно дорого собирать в масштабе; video-level метки – «этот 10-минутный клип содержит драку где-то» – дёшевы. MIL-фреймворки мостят эту пропасть: обучаются на video-level метках и учатся локализовать аномалию до клипа или кадра на inference.
Фреймворк. Каждое видео – это «bag» клипов; каждый клип – это «instance» в bag-е. Positive (аномальные) bag-и содержат хотя бы один аномальный instance; negative (нормальные) bag-и – ни одного. Нейросеть скорит каждый instance; bag-скор – какая-то агрегация (обычно max или top-k mean). Ranking loss толкает top-k clip-скоры positive bag-ов выше top-k clip-скоров negative bag-ов. На inference per-clip скор – это локализация.
Линейка SOTA на UCF-Crime рассказывает историю. RTFM (Tian et al. 2021) ввёл Robust Temporal Feature Magnitude learning и достиг 84.30% AUC на UCF-Crime. MGFN (Chen et al. 2023, AAAI) ввёл Magnitude-Contrastive Glance-and-Focus Network и поднял планку до 86.98% AUC на UCF-Crime и 80.11% AP на XD-Violence на I3D-фичах; с VST-RGB-фичами в более поздних сравнениях MGFN – около 85.80% AUC на UCF-Crime. MTFL (Karim et al. 2024) ввёл Multi-Timescale Feature Learning и отчитался о 89.78% AUC на UCF-Crime на VST-RGB-фичах – лифт на 5.48 пункта над RTFM и чистый обгон MGFN на том же feature-backbone. Unbiased MIL (Lv et al. 2023, CVPR) адресовал class-imbalance-смещение в более ранних MIL-фреймворках и правильный выбор, когда класс аномалии очень редкий в train set.
В проде MIL-семейство – правильный layer-2-классификатор, когда у вас video-level метки, но не frame-level, – что, по сути, любой реальный surveillance-датасет. MIL-голова маленькая (несколько MLP-слоёв поверх feature-backbone-а) и крутится за миллисекунды даже на Jetson; стоимость доминируется feature-extractor-ом снизу – вашим выбором 3D-CNN или видео-трансформера из алгоритмов 7 и 8. Картина 2025-го – примерно 86–90% AUC на UCF-Crime на сырых фичах и 95%+ AUC, когда сверху стэкается правильный CLIP-augmented Layer 3.
Failure mode – bag-level confusion. MIL обучается дискриминировать «есть аномалия где-то в bag-е» от «нет аномалии нигде». Длинное нормальное видео с краткой мягкой аномалией обучает слабый градиент; короткий bag с краткой сильной аномалией обучает сильный градиент. Результат: MIL надёжен на ярких аномалиях и неравномерен на тонких – драка или арест ловятся надёжно, медленный паттерн loitering промахивается. Лечение двойное: курирование датасета для балансировки длины bag-а и плотности аномалий и использование темпоральной сегментации (например, 32-сегментного чанкинга из оригинальной работы Sultani et al. 2018) для контроля длины bag-а. MTFL-multi-timescale-архитектура явно адресует это, представляя каждый клип на нескольких временных шкалах вместо одного фиксированного окна.
Рабочий production-паттерн. SlowFast-R50 INT8 feature-extractor на Jetson Orin Nano Super выдаёт 2048-мерный feature на 32-кадровый клип. MTFL-голова (маленький трансформер по темпоральной оси с multi-scale-головами) сверху выдаёт per-clip anomaly-скоры. Total edge-inference-бюджет – 60 мс на клип, комфортно внутри 200-мс envelope. Бюджет разметки – video-level метки на 1000 часах видео с 50 камер за 6 недель in-house аннотации. Результирующий AUC на customer site-validation-set – 91%, в пределах 2 пунктов от опубликованного UCF-Crime-числа, что и есть тот gap, который надо закладывать при переносе research-чисел на production-данные.
Алгоритм 10 – Методы на CLIP (VadCLIP, TPWNG, VadCLIP++, TrCLIP-VAD, WSVAD-CLIP, AVadCLIP – лифт 2024–2026)
CLIP-based weakly-supervised VAD – самый большой инженерный сдвиг в поле между 2024 и 2026 годом. CLIP (Radford et al. 2021) – contrastive vision-language model, обученная на image-text парах из открытого веба. Она маппит изображения и короткие текстовые описания в shared embedding space, где семантически похожие элементы кластеризуются. Применение к anomaly detection прямое: описываете класс аномалии текстом («человек, лезущий через забор», «дерущиеся люди»), embed-ите текст и видеоклип, threshold-ите по cosine similarity. С нулём training-примеров целевого класса получаете правдоподобный детектор. С горстью примеров делаете fine-tune к customer site-распределению. С CLIP-equipped MIL-головой достигаете published-SOTA-чисел при доле labelling-стоимости, требуемой старым MIL-семейством.
Линейка. VadCLIP (Wu et al. 2024, AAAI) первым CLIP-based weakly-supervised VAD-методом приземлился на leaderboard-ы. Использует dual-branch архитектуру: одна ветвь делает coarse-grained binary-классификацию на визуальных фичах, другая – fine-grained language-image alignment, и две сливаются. Опубликованные числа: 88.02% AUC на UCF-Crime и 84.51% AP на XD-Violence. TPWNG (Text Prompt with Normality Guidance, Yang et al. CVPR 2024) – pseudo-label generation и self-training фреймворк, сливающий визуальные фичи с CLIP-text-embedding-ами, достигший SOTA на UCF-Crime и XD-Violence в 2024 году. WSVAD-CLIP (Lin et al. 2025) добавляет temporally-aware prompt-learning и frame-aware fusion, используя CLIP cross-modal знание для моста семантического gap-а. VadCLIP++ (2025) вводит dynamic vision-language model, адаптирующую CLIP на inference. TrCLIP-VAD (vpsg-research, 2026) улучшает CLIP-обучение text-rewriting-ом и сейчас близок к SOTA – 88.59% AUC на UCF-Crime и 86.38% AP на XD-Violence. AVadCLIP (2025) расширяет подход на audio-visual collaboration – правильный выбор для violence detection в стиле XD-Violence.
Production-fit – open-vocabulary и few-shot режим. Если клиент хочет добавить новый класс аномалии – «человек, несущий длинный предмет», «человек в high-visibility жилете в no-go зоне», – описываете его текстом, embed-ите описание, threshold-ите cosine similarity против входящих клипов, и у вас v1-детектор за один час без переобучения чего-либо. Если потом собираете 50 примеров нового класса, fine-tune CLIP-text-ветви или обучите маленькую MIL-голову сверху, чтобы добавить 5–15 AUC-пунктов. Обе операции на порядки быстрее, чем старый workflow «соберите 5000 размеченных примеров, потом переобучите весь pipeline», которого требовали 3D-CNN-only архитектуры.
Цена – inference-стоимость самого CLIP. CLIP-ViT-L/14 даёт 768-мерный image-embedding примерно за 15 мс на изображение на A100 (гораздо выше на edge-кремнии). 32-кадровому клипу нужно 32 forward-pass-а (или один с 3D-адаптацией), поэтому per-clip-латентность – 50–100 мс на cloud GPU и 200–500 мс на edge-кремнии. Правильный production-паттерн – использовать CLIP в облаке как layer-3 re-scorer для кандидатов, которые edge layer-2-детектор уже отфильтровал, а не крутить CLIP на каждом кадре.
Failure mode – prompt brittleness. CLIP чувствителен к точной формулировке текстового prompt-а. «Человек дерётся» и «двое людей дерутся» дают разные similarity-скоры на том же клипе, а небольшие переформулировки prompt-а сдвигают AUC на несколько пунктов. Лечение двойное: ансамбль по нескольким prompt-вариантам (трюк, поднявший CLIP zero-shot ImageNet-accuracy на 1.4 пункта в оригинальной работе) и использование learned prompt-tuning-слоя (CoOp, CoCoOp, MaPLe) вместо hand-crafted prompt-ов.
Алгоритм 11 – Мультимодальные LLM (Holmes-VAD, AnomalyRuler, Cerberus, SlowFastVAD – слой объяснения)
Приход мультимодальных LLM как anomaly-детекторов – второй сдвиг 2024–2026 годов. Где CLIP-методы дают similarity-скор, мультимодальные LLM дают natural-language объяснение, – и в 2026 году именно объяснение отличает продукт, проходящий регуляторный аудит, от того, который не проходит.
Линейка. Holmes-VAD (Zhang et al. 2024) делает fine-tune мультимодального LLM на новом бенчмарке VAD-Instruct50k – 50 000 instruction-response-пар для video anomaly detection – и выдаёт и точную темпоральную локализацию, и связное natural-language объяснение. Архитектура: frozen video-encoder, лёгкий темпоральный sampler, выбирающий anomaly-relevant кадры, LLM, заглатывающий кадры и выдающий структурированный ответ. AnomalyRuler (Yang et al. ECCV 2024) трактует VAD как few-shot reasoning задачу: скармливаете LLM несколько примеров нормального поведения, просите вывести правила, потом применяете правила к новому видео. Опубликованные числа показали первый VLM-based метод, побивший старые fully-supervised baseline-ы на маленьких unsupervised бенчмарках. Cerberus (Liu et al. 2025) каскадирует меньшие и большие VLM, чтобы балансировать accuracy и frame rate, достигая 97.2% accuracy на UCF-Crime на 57.68 fps на NVIDIA L40S – в зоне real-time, наконец, для VLM-класса методов. SlowFastVAD (Wang et al. 2025) интегрирует быстрый детектор с RAG-enhanced VLM, ретривая релевантный контекст из видео-knowledge-base перед выдачей объяснения.
В проде сегодня практический паттерн – слоистый. Маленький on-device VLM (Qwen-VL 7B, Llama 3.2 Vision 11B, Moondream 2B) обрабатывает рутинные объяснения на камере. Frontier-VLM (Gemini 2.5 Pro, Claude Opus 4.7, GPT-5) обрабатывает пограничные 1–5% случаев, в которых меньшая модель не уверена, вызываемый из облака через API. Этот split удерживает стоимость управляемой, сохраняя потолок качества объяснения для случаев, где он нужен больше всего.
Cost-арифметика – ловушка. Frontier-VLM по $1.25 за миллион input-токенов, заглатывающий 30-секундный клип на default media-resolution (около 9000 input-токенов) плюс 200 output-токенов, стоит примерно $0.012 за клип – назовём центом. Умножьте на тысячу тревог в день на камеру – получите $12 в день на камеру, или $360 в месяц на камеру, – больше любого SaaS-surveillance-контракта на рынке. Лечение – слоистый паттерн выше плюс агрессивный routing: только тревоги с confidence от 0.4 до 0.7 из MIL-слоя (обычно 1–5% всех тревог) идут к frontier-VLM. Полную арифметику стоимости разбираем в уроке 1.4 о реальной стоимости ИИ в видеопродуктах.
Failure mode – hallucination. Frontier-VLM выдаст уверенные, бегло написанные, неправильные объяснения на out-of-distribution-видео. Лечение – structured-output prompt-инг (заставьте модель заполнять JSON-схему вместо свободной прозы), confidence-threshold на структурированных полях и confirm-with-CLIP-score sanity-check, отбрасывающий объяснения, противоречащие upstream-слоям. В high-stakes деплоях VLM-output – всегда draft, который подписывает human-reviewer, никогда не fully-automated решение.
Алгоритм 12 – LSTM и temporal CNN на инженерных признаках (pipeline-watchdog)
Последний алгоритм – тот, который почти каждая архитектура забывает, и который ловит в проде больше silent-сбоев, чем остальные одиннадцать вместе взятые. Он следит за самим pipeline-ом, не за содержимым видео. LSTM или 1D-temporal-CNN на векторе инженерных признаков по скользящему временному окну ловит failure-режимы, недоступные vision-слоям.
Инженерный feature-вектор – сердце подхода. Per-second метрики: frame freeze duration; encoder bitrate; encoder QP; decoded-frame mean luma; decoded-frame entropy; magnitude inter-frame difference; ONVIF event rate; alert rate; rolling MIL-confidence histogram; CLIP-score distribution; VLM cost-spike. Агрегируете в 60-секундное окно с 30-секундным stride; скармливаете в LSTM или temporal-CNN; обучаете против исторических нормальных паттернов. Аномалия – любое окно, чья reconstruction error или дистанция до предсказанного следующего окна превышает порог.
Failure-режимы, которые это ловит, – те, через которые рано или поздно проходит каждая surveillance-команда. Камера тихо замёрзла, а pipeline продолжает выдавать предсказания на последнем хорошем кадре. Энкодер перезапустился и выдаёт повреждённый bitstream, декодирующийся в кажущееся видео с деградированными признаками. MIL-модель схлопнулась в один класс после неудачного деплоя. Frontier-VLM-API начал возвращать пустые ответы, потому что API-ключ ротировался, а failover не перехватил. Cloud-GPU-queue забит, и inference-латентность за час уползла с 50 мс до 1500 мс. Падение upstream RTSP-доставки тихо заполнено локальным jitter-буфером, маскируя развивающуюся сетевую проблему.
Ничего из этого не видно vision-слою. Всё это видно 60-feature LSTM, следящему за pipeline-ом. Стоимость ничтожна – модель крутится за микросекунды на CPU-sidecar-е. Выгода – разница между системой, которой доверяют, и системой, иногда тихо ломающейся.
Isolation-Forest-версия той же идеи (алгоритм 2) работает для самых простых случаев. LSTM или temporal-CNN-версия – правильный выбор, когда динамика признаков имеет значение: когда «низкий битрейт» нормален ночью, но аномален днём, когда «высокая alert rate» нормальна на спортивном событии, но аномальна в утро вторника. Темпоральная модель учит эти паттерны; iForest трактует каждую минуту как независимую и промахивается.
Рабочий пример. 200-камерный transit-деплой. 60 инженерных признаков на минуту на камеру. Маленький (2-слойный, 128-hidden) LSTM на камеру, обученный на последних 90 днях нормальных pipeline-паттернов. Стоимость inference – около 5 микросекунд на окно на одном CPU-ядре; LSTM-ы всего флота крутятся секунды в минуту. Пойманное за первый месяц: 11 камер с развивающимися проблемами фокуса, 4 камеры, чей битрейт ушёл из spec, 3 ночи, когда cloud-inference-queue превысила latency-SLA, 1 случай схлопывания модели после деплоя, 2 случая upstream packet-loss, маскированного WebRTC-jitter-буфером. Ни одно из этого не было видно vision-слою сверху.
Production-готовый стек – как зашить двенадцать алгоритмов в один pipeline
Дефолтная архитектура Фора Софт 2026 зашивает несколько из двенадцати алгоритмов в один pipeline. Форма – пятислойный стек из playbook-а 2026 года; конкретные выборы алгоритмов ниже – то, что мы шипим, когда клиентское ограничение не диктует обратное.
Layer 1, candidate filter на edge: vanilla autoencoder или MemAE, квантизованный в INT8, на 30 fps на камеру на Jetson Orin Nano Super или Hailo-8. Задача – surface окна, заслуживающие второго взгляда; precision не важен, recall должен быть высоким. Порог настроен на 5–10% candidate rate против исторического нормального видео.
Layer 2, классификатор на edge или thin-edge tier: SlowFast INT8 feature-extractor плюс MTFL или RTFM MIL-голова, выдающая per-clip anomaly-скоры и метки классов. Inference-бюджет – 60 мс на клип на Orin Nano Super. Выход – per-clip скор и class probability vector.
Layer 3, re-scorer в облаке: VadCLIP или TPWNG, крутящийся на расшаренной cloud GPU (L4 или L40S), вызываемый только на кандидатах, которые edge layer 2 пометил mid-range confidence. Open-vocabulary anomaly detection живёт здесь. Выход – уточнённый per-clip скор и метка класса, которая может включать классы, которым layer-2-MIL никогда не обучался.
Layer 4, объяснение в облаке: маленький VLM (Qwen-VL 7B) на каждой тревоге, требующей human review, плюс frontier-VLM (Gemini 2.5 Pro, Claude Opus 4.7) на топ-1% пограничных. Выход – structured-JSON-narrative события, пригодный для суда, регулятора или security-аналитика.
Layer 5, pipeline-watchdog как sidecar: LSTM на 60 инженерных pipeline-health признаках на минуту на камеру. Крутится везде – на edge-боксе как отдельный процесс или в облаке как per-camera-sidecar. Выход – тревоги о silent pipeline-сбоях.
Классические статистические алгоритмы (1, 2, 3) живут внутри Layer 5 как простейшая версия pipeline-watchdog-а и внутри Layer 1 для специальных случаев, где use case – «есть ли движение в этой пустой комнате». VAE и GAN-семейство (6) по сути не используется в нашей дефолтной архитектуре; мы держим их в production-двенадцати для полноты, потому что они появляются в питч-деках вендоров, и вы должны знать, что это.
Выбор алгоритма – сравнительная таблица
Таблица ниже сводит двенадцать алгоритмов к четырём числам из сита, к слою, к которому они принадлежат, к типичному железу, на котором они крутятся, и к однострочной заметке о failure mode, к которой надо готовиться.
| # | Алгоритм | Метки | Латентность (edge) | Лучший слой | Типичное HW | Следить за |
|---|---|---|---|---|---|---|
| 1 | One-Class SVM | 0 аномалий | <10 мс | 5 (empty-room L1) | CPU | Concept drift; retrain раз в квартал |
| 2 | Isolation Forest | 0 аномалий | <1 мс | 5 | CPU | Медленный дрейф не ловится; anchor к baseline |
| 3 | Local Outlier Factor | 0 аномалий | 10–50 мс | 5 (специалист) | CPU | O(n²) обучение; iForest выше 100k |
| 4 | Vanilla autoencoder | 0 аномалий | 15–25 мс | 1 | Edge NPU | Threshold drift; rolling per-camera перцентиль |
| 5 | ST-AE / MemAE | 0 аномалий | 80–150 мс | 1 (темпорально) | Edge NPU | Overfit-to-recent; обучайте на многомесячном окне |
| 6 | VAE / GAN | 0 аномалий | 30–100 мс | 1 (редко) | GPU | Training instability; обычно пропускаем |
| 7 | 3D-CNN (I3D, SlowFast) | 100+ | 25–40 мс | 2 (feature) | Edge NPU | Clip-boundary effects; используйте overlap |
| 8 | Видео-трансформер | 1k+ | 60–200 мс | 2 (cloud) | Cloud GPU | HP-чувствительность; стартуйте от предобученного |
| 9 | Weakly-supervised MIL | video-level | 5–15 мс | 2 (голова) | Edge или cloud | Bag-level confusion; балансируйте bag-и |
| 10 | CLIP-based | 0–100 | 50–500 мс | 3 | Cloud GPU | Prompt brittleness; ансамбль prompt-ов |
| 11 | Multimodal LLM | 0 (zero-shot) | 200 мс–10 с | 4 | Cloud (через API) | Hallucination; structured-output |
| 12 | LSTM на инженерных признаках | 0 | <1 мс | 5 | CPU sidecar | Feature engineering – это работа; модель маленькая |
Рисунок 3. Двенадцать алгоритмов, сведённые в координаты сита из четырёх чисел и пятислойного стека.
Паттерн в таблице – паттерн поля. Классические методы дёшевы, label-free и узки. Реконструкционные – unsupervised-дефолт для сырого видео. Глубокие темпоральные – рабочая лошадка layer-2-классификаторов. CLIP-семейство – лифт для режимов с малыми метками и open-vocabulary. Мультимодальные LLM – слой объяснения. Алгоритмы-сигнальные-watchdog ловят сбои, недоступные vision-слоям. Production-система использует шесть-семь из них совместно; ни одна шипящая система не использует только один.
Типичная ошибка: брать самый тяжёлый алгоритм первым
Самая дорогая архитектурная ошибка, которую делают команды в этом поле, – стартовать с самого тяжёлого алгоритма. Разговор начинается с «давайте возьмём мультимодальный LLM, это же SOTA», и через три месяца команда смотрит на $400-на-камеру-в-месяц inference-счёт без возможности его опустить, потому что весь pipeline построен на допущении, что каждый кадр проходит через VLM.
Обратное направление правильное. Стартуйте с самого лёгкого алгоритма, который мог бы правдоподобно решить задачу. One-Class SVM для empty-room-вторжения. Isolation Forest для pipeline-health. Vanilla autoencoder для novelty на сыром видео. SlowFast плюс MTFL-голова для основной массы поведенческих аномалий. Эскалируйте к CLIP-методам только когда стоимость разметки MIL упрётся в потолок. Эскалируйте к мультимодальным LLM только когда объяснение – жёсткое требование, и даже тогда – только на пограничных случаях.
Причина, по которой это важно в долларах, – кривая стоимости нелинейная. Алгоритмы 1, 2, 3 и 12 крутятся практически бесплатно на CPU. Алгоритмы 4, 5, 7 и 9 крутятся на $250-долларовом edge-железе. Алгоритм 8 требует расшаренной cloud GPU. Алгоритм 10 требует cloud GPU плюс bandwidth для отправки candidate-клипов. Алгоритм 11 требует frontier-VLM-API-контракта и дисциплинированного routing-а. Каждый шаг вверх по cost-лестнице – это скачок 5–10×. Pipeline, построенный снизу вверх, достигает правильной архитектуры и останавливается; pipeline, построенный сверху вниз, достигает правильной архитектуры и тащит каждый лишний слой над ней, платя за них вечно.
Pitfall, которого избегаете: когда stakeholder говорит «давайте используем GPT-5 / Claude / Gemini для anomaly detection», правильный ответ – «каков bag размеченных примеров, каков бюджет латентности, каков бюджет железа и каково требование к объяснению?». Эти четыре вопроса возвращают разговор к ситу, а сито выбирает правильный слой.
Где Фора Софт вписывается
Мы шипим видеопродукты два десятилетия – surveillance с Netcam Studio, WebRTC-conferencing, телемедицину, e-learning, OTT, AR/VR. Слой anomaly detection – наш самый активный workload в 2024–2026, через greenfield surveillance, retrofit-проекты на существующих видео-pipeline-ах и embedded-аналитику на intelligent video analytics платформах. Дефолтная архитектура, которую мы шипим, зашивает алгоритмы 4 или 5, 7, 9, 10, 11 и 12 в пятислойный стек из playbook-а. История интеграции – ONVIF Profile M в любой VMS, который уже есть у клиента, MQTT как high-frequency event bus, и regulator-grade audit log в immutable storage. Вертикали, в которых мы работали, – ритейл, transit, индустриальная безопасность, здравоохранение, conferencing – различаются меньше в архитектуре, чем сходятся; выбор алгоритма внутри архитектуры – это то, что делает каждую из них шипящей.
Ключевые выводы
- Двенадцать алгоритмов покрывают каждую шипящую систему. Выбирайте по меткам, латентности, железу и потребности в объяснении.
- Стартуйте с самого лёгкого алгоритма, который мог бы сработать; эскалируйте только когда вынуждены.
- Isolation Forest и LSTM на инженерных признаках – non-negotiable как pipeline-watchdog.
- CLIP-методы – лифт 2024–2026; они схлопывают стоимость разметки на длинном хвосте.
- Мультимодальные LLM объясняют тревоги; не позволяйте им крутиться на каждом кадре или стоимость взорвётся.
- Production-система использует шесть-семь из двенадцати совместно; ни одна шипящая система не использует только один.
Что читать дальше
- Обнаружение аномалий в видео – playbook 2026 года – архитектурная рамка, которую эта статья расширяет.
- Computer vision в ритейле, индустрии и intelligent video analytics – вертикальные playbook-и для крупнейших коммерческих use case-ов.
- Модель стоимости – что ИИ в видео реально стоит на масштабе – долларовая арифметика за каждым алгоритмом.