Агент-исследователь видео – кейс видеонаблюдения

Автор: Николай СапуновОбновлено: август 202622 мин чтения
Содержание статьи +

Коротко

Агент-исследователь видео – это ИИ-система, которая берёт вопрос об уже записанной съёмке на обычном языке («кто-нибудь заходил в зону погрузки после 22:00 прошлой ночью?») и отвечает на него: планирует расследование, вызывает инструменты компьютерного зрения и поиска и возвращает конкретные клипы с таймкодами. Работает он так: вокруг знакомого по прошлым урокам цикла агента оборачивается небольшой «пояс инструментов» – детектор, чтобы находить события, трекер, чтобы вести человека между камерами, поисковый индекс, чтобы доставать клипы по описанию, и vision-language-модель, чтобы прочитать эти клипы и написать вывод. Инженерный трюк, который делает это доступным по деньгам, – никогда не запускать дорогую модель на каждом кадре: дешёвый детектор и индекс сужают миллионы кадров до горстки клипов, и только они доходят до дорогого «читателя». В 2026 году это уже не теория – паттерн вышел в реальные продукты (Eeva от Brivo, Eagle Eye Smart Video Search, Conntour, Ambient.ai), – но та же схема несёт и жёсткие юридические границы: в Европе распознавание лиц в реальном времени в публичном пространстве запрещено, а пост-фактум идентификация по биометрии относится к высокому риску.

Почему это важно

Видеонаблюдение – тот сценарий, где агент быстрее всего себя окупает, потому что работу, которую он заменяет (человек, вручную перематывающий часы записи), делать медленно, дорого и легко ошибиться. Если вы ведёте видеопродукт для физической безопасности, ретейл-аналитики, охраны труда на производстве или умного здания, этот урок показывает, что такое агент-исследователь на самом деле, из каких частей он состоит и где прячутся стоимость и юридический риск. Писать конвейер самому вам не нужно, но нужно понимать достаточно, чтобы отличить грамотный дизайн от безрассудного – спросить, читает ли агент каждый кадр или достаёт нужные, и подписывает ли человек итог, прежде чем что-то произойдёт. Это ещё и первый из трёх прикладных уроков про агентов: агент-копилот встречи и агент асинхронного разбора используют тот же скелет на другой съёмке.

Что такое агент-исследователь – и чем он не является

Начнём с картинки, которая у большинства в голове, потому что она неверна. Агент-исследователь – это не робот, который смотрит на стену мониторов и жмёт тревогу. Это софт, который сидит поверх записей, уже сделанных вашими камерами и вашей системой видеоменеджмента – программой, которую называют VMS и которая пишет и хранит потоки с камер, – и по запросу отвечает на вопросы об этой записи. Вы спрашиваете на обычном языке; он сам выполняет «просмотр».

Ключевое слово здесь – исследователь, и оно указывает на конкретную работу: смотреть назад по записанному видео, чтобы восстановить, что произошло. В индустрии безопасности это называют криминалистическим (forensic) поиском – поиском по хранилищу записей после события, чтобы найти клип, объясняющий его. Классический вариант – человек, который кликает по двенадцати часам записи с шестнадцати камер, чтобы найти те девяносто секунд, что важны. Именно эту задачу агент и забирает на себя. В 2026 году индустрия безопасности сделала это осязаемым: Brivo и Eagle Eye Networks выпустили агента Eeva, который следит за камерами по запросу на обычном языке, а стартап Conntour в марте 2026 года привлёк семь миллионов долларов на то, что они сами называют «поисковиком по охранному видео». Паттерн больше не гипотетический.

Полезно зафиксировать границу относительно двух соседей. Агент-исследователь – это не то же самое, что живое правило оповещения («пингуй меня, когда детектор видит человека в этой зоне»), которое представляет собой более простой постоянно работающий триггер из обычной видеоаналитики. И это не оператор живого мониторинга, который смотрит потоки в реальном времени, чтобы вмешаться по ходу событий. Исследователь работает в основном в прошедшем времени: приходит вопрос – он исследует архив – он отчитывается. Некоторые продукты размывают границу, позволяя одному агенту и смотреть вживую, и искать по истории, но и инженерия, и закон относятся к «отреагировать на лицо вживую» и «поискать вчерашнюю запись» совершенно по-разному, и в голове их стоит держать раздельно.

Рисунок 1. Три разные задачи, которые часто сваливают в одну. Оповещение – постоянный триггер; живой мониторинг смотрит на настоящее; агент-исследователь отвечает на вопросы о прошлом. Этот урок – про третье.

Цикл исследователя

Каждый агент крутит цикл – воспринять, рассудить, действовать, наблюдать – и этот цикл мы нарисовали в уроке про цикл агента. Агент-исследователь – это тот же цикл, наведённый на конкретную цель: ответить на вопрос о съёмке. Пройдём одно расследование медленно – и цикл станет конкретным.

Приходит вопрос: «Кто-нибудь заходил в зону погрузки после 22:00 прошлой ночью?» Сначала агент декомпозирует цель – разбивает большой вопрос на меньшие, на которые можно ответить. Какие камеры покрывают зону погрузки? Что считать «входом»? Каково временное окно? Эта декомпозиция – навык планирования из урока про примитивы агента, и именно она отделяет настоящего агента от одной поисковой строки.

Затем цикл поворачивается. Агент выбирает первый шаг – «перечислить камеры, покрывающие зону» – и отвечает на него, обращаясь к своей памяти с картой камер объекта. Выбирает следующий шаг – «найти события движения-и-человека в этих потоках между 22:00 и 06:00» – и выполняет его, вызывая инструмент: детектор людей, в чью структурированную форму вписаны ID камер и временное окно. Детектор возвращает три кандидатных клипа. Они приземляются обратно в рабочую память агента как новое наблюдение. Агент снова рассуждает: это настоящие входы или ложные срабатывания на качающуюся тень? Он вызывает второй инструмент – vision-language-«читателя», – чтобы посмотреть каждый кандидатный клип и описать его. Два – тени; один – человек, несущий коробку. Цикл крутится, пока на вопрос не будет дан ответ, и тогда агент пишет вывод – с приложенным клипом, камерой и таймкодом в качестве доказательства.

Заметьте, что понадобилось на каждом обороте. Понадобилось планирование, чтобы выбрать следующий шаг, использование инструментов, чтобы его выполнить, и память, чтобы держать цель и вспомнить карту камер. Это ровно три примитива из прошлого урока; агент-исследователь – то место, где они перестают быть абстракцией. Индустрия безопасности описывает ту же форму своими словами – увидеть, затем подумать об увиденном во времени, затем оценить, насколько это серьёзно, затем действовать, – и это четырёхтактное описание от вендоров вроде Ambient.ai есть тот же цикл агента в форме охранника.

Рисунок 2. Одно расследование как цикл. Планирование выбирает шаг, инструмент его выполняет, память держит состояние и карту камер, и цикл повторяется, пока агент не напишет вывод – который человек проверяет, прежде чем что-то произойдёт.

Пояс инструментов – что агент реально умеет

Агент настолько способен, насколько способны данные ему инструменты, и искусство в том, чтобы дать немного острых, а не много тупых. Исследователю видеонаблюдения нужен небольшой, хорошо подобранный пояс. Каждый инструмент отвечает на один тип вопроса, и большинство из них – модели компьютерного зрения, которые мы разбирали раньше в этом разделе.

Первый инструмент – детектор, модель, которая находит объекты и людей в кадре и обводит каждого рамкой. Рабочая лошадка в проде – семейство YOLO из урока про линейку YOLO; оно отвечает «что и где» дёшево и достаточно быстро, чтобы просканировать целую ночь записи. Детектор – широкая сеть агента: он превращает сырое видео в поток фактов «в 23:14 на камере 3 есть человек», над которыми агент может рассуждать.

Второй инструмент – трекер, модель, которая связывает один и тот же объект между соседними кадрами и между камерами, чтобы он стал одной устойчивой идентичностью, а не новым детектом на каждом кадре. Трекеры вроде ByteTrack из урока про многообъектный трекинг позволяют агенту ответить «куда пошёл этот человек после зоны?», ведя трек от камеры к камере. Без трекинга агент видит тысячу разрозненных рамок; с ним – путь одного человека.

Третий инструмент – сегментатор, модель, которая обводит объект точно, по пикселям, а не свободной рамкой, и может вести этот контур через клип. Здесь инструмент – SAM 2 из урока про SAM 2 для видео; агент использует его, чтобы выделить конкретный объект – оставленную сумку, машину – и подтвердить, что во времени это один и тот же.

Четвёртый инструмент – индекс криминалистического поиска, способ доставать клипы, описывая их словами, а не перематывая таймлайн. Это сердце поиска по видео на обычном языке, и это та же машинерия выборки, что и в мультимодальном RAG по видеоархиву. Как он работает, мы разберём в следующем разделе, потому что именно эта часть делает всего агента доступным по деньгам.

Пятый инструмент – vision-language-читатель, модель, которая смотрит на клип и описывает происходящее на обычном языке: открытые и закрытые VLM из урока про открытые VLM. Это внимательный глаз агента. Он медленный и дорогой, поэтому используется последним и реже всего: только на той горстке кандидатных клипов, которые уже подняли более дешёвые инструменты. Читатель – то, что превращает «три рамки, отмеченные детектором» в «мужчина в тёмной куртке внёс коробку в зону в 23:14».

Шестой инструмент – составитель отчёта: агент собирает находки, опорные клипы и таймкоды в короткое, читаемое человеком резюме со связанными доказательствами. Это вообще не инструмент зрения; это агент, использующий родную силу языковой модели, чтобы донести результат, по которому человек может действовать.

ИнструментНа что отвечаетСтоимость запускаПример из видео
Детектор (YOLO)«Что и где в этом кадре?»Очень низкая – сканирует целые ночиНайти всех людей в зоне за ночь
Трекер (ByteTrack)«Куда дальше пошёл объект?»НизкаяПровести человека через четыре камеры
Сегментатор (SAM 2)«Это ровно тот же объект?»Низкая–средняяПодтвердить одну сумку через клип
Индекс поиска«Какие клипы подходят под описание?»Низкая на запросе (строится раз)«Человек в красной куртке у ворот»
VLM-читатель«Что здесь на самом деле происходит?»Высокая – экономноОписать 3 кандидатных клипа словами
Составитель отчёта«Резюмировать находку с доказательствами»НизкаяАбзац + 3 связанных клипа + таймкоды

Частая и дорогая ошибка – перегруз инструментами: дать агенту тридцать инструментов, потому что каждый показался полезным. Чем больше инструментов на выбор, тем чаще агент берёт не тот или зависает, решая, и точность выбора инструмента падает с ростом меню. Начните с шести выше и добавляйте седьмой, только когда реальное расследование докажет, что его не хватает.

Рисунок 3. Пояс инструментов исследователя, упорядоченный от дешёвого-и-широкого (детектор, гоняемый по всему) к дорогому-и-точному (VLM-читатель, запускаемый на нескольких клипах). Этот порядок и есть стратегия контроля стоимости.

Как работает криминалистический поиск на обычном языке

Самая важная мысль этого урока – что дорогую модель никогда не запускают на всей записи. Понять почему и что делать вместо – это и есть то, что отделяет систему за пару долларов в ночь от системы за тысячи.

Сделайте арифметику один раз – и проблема очевидна. Возьмём скромный объект: шестнадцать камер, каждая пишет на пятнадцати кадрах в секунду, в течение двенадцати тёмных часов, когда случается большинство расследований. Кадров с одной камеры за одну ночь – 15 × 3 600 × 12 = 648 000. На шестнадцать камер это 648 000 × 16 = 10 368 000 кадров – около десяти миллионов картинок каждую ночь. Теперь представьте, что вы пытаетесь отвечать на вопросы, отправляя каждый кадр в vision-language-модель по, скажем, $0,0005 за изображение. Это 10 368 000 × $0,0005 = $5 184 за ночь, или больше $155 000 в месяц, для одного небольшого объекта – и вы платили бы это вне зависимости от того, спросил ли кто-нибудь хоть раз. Читать всё умной моделью не масштабируется. Проверить ценовую сторону можно по реальной стоимости ИИ в видеопродуктах; урок там тот же, что подсказывает и эта арифметика.

Выход из положения состоит из двух фаз, и разделение между ними – это и есть весь дизайн. Первая фаза происходит однажды, на этапе индексации (ingest), по мере записи. Дешёвый детектор гоняется по потоку и записывает компактную пометку для каждого значимого момента – «человек, камера 3, 23:14, у двери зоны». Одновременно система берёт репрезентативный стоп-кадр через определённые интервалы (вам не нужны все пятнадцать в секунду; один в секунду-две схватывает сцену) и превращает каждый выбранный кадр в короткую строку чисел – эмбеддинг, числовой отпечаток, который располагает похожие изображения рядом в математическом пространстве. Кадры «снимают отпечатком» image-text-моделью вроде CLIP или SigLIP – то же семейство из введения в CLIP; аудиодорожку, если есть, переводят в текст; а камеру, время и зону прикрепляют как метаданные. Всё это – пометки детектора, отпечатки кадров, расшифровка, метаданные – складывается в поисковый индекс. Индекс строится непрерывно и тихо в фоне, и он дёшев, потому что детектор и модель эмбеддингов небольшие.

Вторая фаза происходит только когда задан вопрос, на этапе запроса (query), и она быстрая и дешёвая, потому что тяжёлая работа уже сделана. Вопрос – «человек в красной куртке у ворот около полуночи» – превращают в такой же числовой отпечаток, и индекс возвращает горстку клипов, чьи отпечатки лежат к нему ближе всего, отфильтрованных по времени и камере, которые подразумевал вопрос. Поскольку визуальный, текстовый индексы и индекс метаданных ищутся вместе, а их результаты сливаются, система может совпадать по внешнему виду, по сказанным словам и по «где-и-когда» одновременно. Шаг переранжирования затем пересортировывает этот короткий список по релевантности. И только теперь – на пяти-десяти выживших клипах – дорогой vision-language-читатель действительно смотрит, подтверждает совпадение и описывает его. Умная модель касается десяти клипов вместо десяти миллионов кадров. Это и есть разница между парой центов и пятью тысячами долларов.

Читать всё (наивно)Детект-затем-выборка (прод)
Когда работает VLMНа каждом кадре, всю ночьНа ~10 кандидатных клипах на запрос
Кадров видит VLM~10 000 000 / ночь~10 / запрос
Примерная стоимость модели за ночь~$5 000 на один объектОт центов до пары долларов
Стоимость, когда никто не спрашиваетПлатите всё равноПочти ноль
Кто делает широкое сканированиеДорогая модельДешёвый детектор + индекс эмбеддингов

Эта двухфазная форма – индексировать дёшево и непрерывно, доставать и читать дорого, но редко – есть прод-паттерн за каждым продуктом поиска по видео на обычном языке, выходящим в 2026 году, от Eagle Eye Smart Video Search до Conntour и edge-модели Ambient.ai. Когда оцениваете любой инструмент «ИИ-поиска по видео», первый вопрос – где работает тяжёлая модель. Если ответ «на каждом кадре», счёт это выдаст.

Рисунок 4. Криминалистический поиск в две фазы. Индексация (сверху) дёшева и непрерывна: индексируем всё маленькими моделями. Запрос (снизу) – где работает дорогой читатель, но только на тех немногих клипах, что подняла выборка. Это разделение и есть контроль стоимости.

Память – почему агенту приходится помнить

Исследователь, который забывает всё между вопросами, – это поисковая строка, а не агент. Разница в памяти, и агенту видеонаблюдения нужны все четыре вида, которые мы назвали в уроке про примитивы агента.

Его рабочая память – текущее расследование (этот вопрос, найденные пока клипы, текущий план), – живёт в контекстном окне модели на время одной задачи. Его семантическая память – постоянное знание об объекте: карта камер, какой поток покрывает какую зону, список нормальных машин, планировка площадки. Его эпизодическая память – запись конкретных прошлых событий («камера зоны погрузки давала ложные срабатывания на фары в прошлый вторник»), чтобы агент не отмечал одну и ту же тень ночь за ночью. Его процедурная память – плейбук расследования: постоянные шаги, которым агент всегда следует, получив вопрос про «вход после часов». Первые два делают агента компетентным с первого дня; третья – то, что заставляет его становиться лучше со временем, а не повторять вчерашние ошибки.

Эпизодическую память команды чаще всего пропускают, и именно её пропуск делает столько аналитических систем изматывающими: они «кричат волки» каждую ночь, потому что ничто не помнит, что вчерашний волк был деревом. Агент, который пишет «камера 3 ложно срабатывает на блик фар после 23:00» в свою память и считывает это в следующем расследовании, делает то единственное, что делал бы неутомимый живой охранник, – изучает объект.

Сложная часть – что закон агенту не позволит

Видеонаблюдение – там, где инженерия агентов встречается с самыми острыми юридическими границами, и в Европе эти границы не рекомендательные. EU AI Act сортирует применения ИИ по полосам риска, и видеонаблюдение задевает две самые строгие полосы напрямую. Ошибиться здесь – не баг; это штраф до €35 миллионов или 7% мирового оборота.

Самая яркая линия – удалённая биометрическая идентификация в реальном времени в публично доступных пространствах: сканирование лиц в живой публичной толпе, чтобы установить, кто эти люди. Для большинства акторов это прямо запрещено статьёй 5 AI Act – запрет действует с февраля 2025 года, с узкими исключениями для правоохраны (поиск пропавшего ребёнка, неминуемая террористическая угроза), которые требуют предварительной авторизации. Для коммерческого видеопродукта считайте живую идентификацию лиц в публичном пространстве недопустимой. Агент-исследователь должен быть спроектирован так, чтобы он этого не мог – не «настроен не делать», а построен без такой способности.

Более мягкая, но всё ещё серьёзная линия – пост-фактум биометрическая идентификация: запуск распознавания лиц на вчерашней записи, чтобы установить личность задним числом. Это не запрещено, но отнесено к высокому риску, что несёт тяжёлые обязанности: документирование, логирование, надзор человека, оценка соответствия. Из-за этих обязанностей безопасный дефолт для большинства продуктов – держать агента на уровне объектов, событий и описаний («человек в красной куртке», «машина у ворот», «вход после часов») и никогда на уровне личности («это Иван Петров»). Искать что произошло – обычная аналитика; искать кто это – переход в биометрическую территорию. Ту же границу подробно проводит урок про распознавание лиц под EU AI Act; агент-исследователь должен уважать её по дизайну.

Одна дата важна для планирования, и в 2026 году она изменилась. Обязанности по высокому риску изначально должны были применяться с 2 августа 2026 года. В мае 2026 года институты ЕС достигли предварительного политического согласия – «Digital Omnibus» – об их переносе: автономные системы высокого риска (полоса, покрывающая правоохранительные и биометрические инструменты) теперь применяются с 2 декабря 2027 года, а высокорисковый ИИ, встроенный в регулируемые продукты, – со 2 августа 2028 года. Запреты статьи 5, включая запрет на биометрию в реальном времени, перенесены не были и остаются в силе. Перенос даёт инженерное время; красную линию он не сдвигает.

Есть и принцип дизайна, который стоит выше закона и облегчает его соблюдение: держите человека в петле на каждом значимом действии. Агент расследует и предлагает; решает человек. Агент может вывести «вероятный взлом у зоны, вот три клипа», но он не запирает дверь, не отправляет охранника и не подаёт заявление в полицию сам. Это одновременно ответственный дизайн и соответствующий требованиям – надзор человека ровно то, чего требуют правила высокого риска, – и поэтому Рисунок 2 заканчивается воротами проверки, а не действием.

Применение агентаПолоса EU AI ActПрактическое правило для продукта
Живая идентификация лиц в публичном пространствеЗапрещено (ст. 5, с фев. 2025)Не строить такую способность вообще
Установление личности пост-фактумВысокий риск (применяется 2 дек. 2027)Избегать по умолчанию; тяжёлые обязанности при использовании
Поиск объектов, событий, описанийОбычная аналитикаБезопасный дефолтный объём для агента
Авто-действие по совпадению (запор, вызов)Убирает надзор человекаВсегда за решением человека

Сквозное расследование, от начала до конца

Свяжем части одним прогоном. Вопрос приходит в 07:00: «Что-нибудь необычное в зоне погрузки за ночь?» Агент декомпозирует его в «найти человеческую активность вне рабочих часов в потоках зоны между 22:00 и 06:00». Сверяется с семантической памятью, какие две камеры покрывают зону. Вызывает детектор, уже отработавший на индексации, и достаёт все события-с-человеком в этих потоках в окне – их четырнадцать. Проверяет эпизодическую память: камера 3 ложно срабатывает на блик фар после 23:00, поэтому понижает вес шести событий, подходящих под этот паттерн. Оставшиеся восемь кандидатных клипов – не десять миллионов кадров за ночь – отправляет vision-language-читателю, который описывает каждый: шесть – сотрудник на известной смене, один – лиса, один – человек в тёмной одежде, несущий коробку к двери зоны в 23:14 и которого нет ни в одном графике. Агент использует трекер, чтобы провести путь этого человека через ещё две камеры до забора по периметру. Пишет отчёт: абзац, три связанных клипа, таймкоды, путь по камерам. Затем останавливается – и решает человек, руководитель безопасности, а не агент. Сработал каждый примитив; дорогая модель коснулась восьми клипов; ни одно лицо не было идентифицировано; решение принял человек.

Строить, купить или обернуть

У вас три честных варианта, и правильный зависит от того, насколько ваш продукт про эту функцию. Можно купить готового агента – Eeva, Conntour, развёртывание Ambient.ai – и интегрировать его, что быстрее всего и верно, когда расследование – функция, а не ваш продукт. Можно обернуть существующую VMS: вендоры теперь добавляют слой агента поверх платформ вроде Milestone XProtect, так что вы сохраняете запись и хранение, что уже есть, и прикручиваете агента сверху. Или можно построить конвейер из открытых примитивов этого раздела – детектор, трекер, сегментатор, эмбеддинги, VLM, фреймворк агента из урока про фреймворки, – что верно, когда логика расследования и есть ваш продукт, а готовые агенты не подходят под ваш домен. Большинству команд стоит начать с покупки или обёртки, чтобы понять, какие вопросы пользователи реально задают, и строить только те части, которые рыночные инструменты делают плохо для вашей вертикали.

Где здесь Фора Софт

Мы делаем видеопродукты в видеонаблюдении, видеоаналитике, видеосвязи, стриминге, OTT, e-learning, телемедицине и AR/VR, и агент-исследователь – прямо в той работе по наблюдению и аналитике, которую мы поставляем. Когда клиенту нужен криминалистический поиск, наша дисциплина дизайна – та, что в этом уроке: индексировать дёшево и непрерывно, доставать и читать дорого, но редко, давать агенту небольшой острый набор инструментов и ставить человека на каждое значимое действие. Мы по умолчанию держим агента на уровне объектов и событий, а не личности, чтобы продукт проходил яркие линии EU AI Act по дизайну, а не по настройке. В аналитико-ёмких вертикалях – ретейл, охрана труда, умные здания – тот же скелет служит работе по интеллектуальной видеоаналитике, не пересобирая агента под каждый объект.

Ключевые выводы

  • Агент-исследователь отвечает на вопросы об уже записанной съёмке, с клипами как доказательством.
  • Это цикл агента плюс пояс из шести инструментов: детект, трек, сегмент, поиск, чтение, отчёт.
  • Никогда не гоняйте дорогой VLM по каждому кадру – индексируйте дёшево, доставайте, потом читайте.
  • Эпизодическая память не даёт агенту отмечать одну и ту же тень каждую ночь.
  • В ЕС живая идентификация лиц в публике запрещена; пост-фактум личность – высокий риск; держитесь объектов и событий.
  • Человек в петле на каждом значимом действии; агент предлагает, решает человек.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.