Содержание статьи +
- Коротко
- Почему это важно
- Что такое агент-исследователь – и чем он не является
- Цикл исследователя
- Пояс инструментов – что агент реально умеет
- Как работает криминалистический поиск на обычном языке
- Память – почему агенту приходится помнить
- Сложная часть – что закон агенту не позволит
- Сквозное расследование, от начала до конца
- Строить, купить или обернуть
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Коротко
Агент-исследователь видео – это ИИ-система, которая берёт вопрос об уже записанной съёмке на обычном языке («кто-нибудь заходил в зону погрузки после 22:00 прошлой ночью?») и отвечает на него: планирует расследование, вызывает инструменты компьютерного зрения и поиска и возвращает конкретные клипы с таймкодами. Работает он так: вокруг знакомого по прошлым урокам цикла агента оборачивается небольшой «пояс инструментов» – детектор, чтобы находить события, трекер, чтобы вести человека между камерами, поисковый индекс, чтобы доставать клипы по описанию, и vision-language-модель, чтобы прочитать эти клипы и написать вывод. Инженерный трюк, который делает это доступным по деньгам, – никогда не запускать дорогую модель на каждом кадре: дешёвый детектор и индекс сужают миллионы кадров до горстки клипов, и только они доходят до дорогого «читателя». В 2026 году это уже не теория – паттерн вышел в реальные продукты (Eeva от Brivo, Eagle Eye Smart Video Search, Conntour, Ambient.ai), – но та же схема несёт и жёсткие юридические границы: в Европе распознавание лиц в реальном времени в публичном пространстве запрещено, а пост-фактум идентификация по биометрии относится к высокому риску.
Почему это важно
Видеонаблюдение – тот сценарий, где агент быстрее всего себя окупает, потому что работу, которую он заменяет (человек, вручную перематывающий часы записи), делать медленно, дорого и легко ошибиться. Если вы ведёте видеопродукт для физической безопасности, ретейл-аналитики, охраны труда на производстве или умного здания, этот урок показывает, что такое агент-исследователь на самом деле, из каких частей он состоит и где прячутся стоимость и юридический риск. Писать конвейер самому вам не нужно, но нужно понимать достаточно, чтобы отличить грамотный дизайн от безрассудного – спросить, читает ли агент каждый кадр или достаёт нужные, и подписывает ли человек итог, прежде чем что-то произойдёт. Это ещё и первый из трёх прикладных уроков про агентов: агент-копилот встречи и агент асинхронного разбора используют тот же скелет на другой съёмке.
Что такое агент-исследователь – и чем он не является
Начнём с картинки, которая у большинства в голове, потому что она неверна. Агент-исследователь – это не робот, который смотрит на стену мониторов и жмёт тревогу. Это софт, который сидит поверх записей, уже сделанных вашими камерами и вашей системой видеоменеджмента – программой, которую называют VMS и которая пишет и хранит потоки с камер, – и по запросу отвечает на вопросы об этой записи. Вы спрашиваете на обычном языке; он сам выполняет «просмотр».
Ключевое слово здесь – исследователь, и оно указывает на конкретную работу: смотреть назад по записанному видео, чтобы восстановить, что произошло. В индустрии безопасности это называют криминалистическим (forensic) поиском – поиском по хранилищу записей после события, чтобы найти клип, объясняющий его. Классический вариант – человек, который кликает по двенадцати часам записи с шестнадцати камер, чтобы найти те девяносто секунд, что важны. Именно эту задачу агент и забирает на себя. В 2026 году индустрия безопасности сделала это осязаемым: Brivo и Eagle Eye Networks выпустили агента Eeva, который следит за камерами по запросу на обычном языке, а стартап Conntour в марте 2026 года привлёк семь миллионов долларов на то, что они сами называют «поисковиком по охранному видео». Паттерн больше не гипотетический.
Полезно зафиксировать границу относительно двух соседей. Агент-исследователь – это не то же самое, что живое правило оповещения («пингуй меня, когда детектор видит человека в этой зоне»), которое представляет собой более простой постоянно работающий триггер из обычной видеоаналитики. И это не оператор живого мониторинга, который смотрит потоки в реальном времени, чтобы вмешаться по ходу событий. Исследователь работает в основном в прошедшем времени: приходит вопрос – он исследует архив – он отчитывается. Некоторые продукты размывают границу, позволяя одному агенту и смотреть вживую, и искать по истории, но и инженерия, и закон относятся к «отреагировать на лицо вживую» и «поискать вчерашнюю запись» совершенно по-разному, и в голове их стоит держать раздельно.
Цикл исследователя
Каждый агент крутит цикл – воспринять, рассудить, действовать, наблюдать – и этот цикл мы нарисовали в уроке про цикл агента. Агент-исследователь – это тот же цикл, наведённый на конкретную цель: ответить на вопрос о съёмке. Пройдём одно расследование медленно – и цикл станет конкретным.
Приходит вопрос: «Кто-нибудь заходил в зону погрузки после 22:00 прошлой ночью?» Сначала агент декомпозирует цель – разбивает большой вопрос на меньшие, на которые можно ответить. Какие камеры покрывают зону погрузки? Что считать «входом»? Каково временное окно? Эта декомпозиция – навык планирования из урока про примитивы агента, и именно она отделяет настоящего агента от одной поисковой строки.
Затем цикл поворачивается. Агент выбирает первый шаг – «перечислить камеры, покрывающие зону» – и отвечает на него, обращаясь к своей памяти с картой камер объекта. Выбирает следующий шаг – «найти события движения-и-человека в этих потоках между 22:00 и 06:00» – и выполняет его, вызывая инструмент: детектор людей, в чью структурированную форму вписаны ID камер и временное окно. Детектор возвращает три кандидатных клипа. Они приземляются обратно в рабочую память агента как новое наблюдение. Агент снова рассуждает: это настоящие входы или ложные срабатывания на качающуюся тень? Он вызывает второй инструмент – vision-language-«читателя», – чтобы посмотреть каждый кандидатный клип и описать его. Два – тени; один – человек, несущий коробку. Цикл крутится, пока на вопрос не будет дан ответ, и тогда агент пишет вывод – с приложенным клипом, камерой и таймкодом в качестве доказательства.
Заметьте, что понадобилось на каждом обороте. Понадобилось планирование, чтобы выбрать следующий шаг, использование инструментов, чтобы его выполнить, и память, чтобы держать цель и вспомнить карту камер. Это ровно три примитива из прошлого урока; агент-исследователь – то место, где они перестают быть абстракцией. Индустрия безопасности описывает ту же форму своими словами – увидеть, затем подумать об увиденном во времени, затем оценить, насколько это серьёзно, затем действовать, – и это четырёхтактное описание от вендоров вроде Ambient.ai есть тот же цикл агента в форме охранника.
Пояс инструментов – что агент реально умеет
Агент настолько способен, насколько способны данные ему инструменты, и искусство в том, чтобы дать немного острых, а не много тупых. Исследователю видеонаблюдения нужен небольшой, хорошо подобранный пояс. Каждый инструмент отвечает на один тип вопроса, и большинство из них – модели компьютерного зрения, которые мы разбирали раньше в этом разделе.
Первый инструмент – детектор, модель, которая находит объекты и людей в кадре и обводит каждого рамкой. Рабочая лошадка в проде – семейство YOLO из урока про линейку YOLO; оно отвечает «что и где» дёшево и достаточно быстро, чтобы просканировать целую ночь записи. Детектор – широкая сеть агента: он превращает сырое видео в поток фактов «в 23:14 на камере 3 есть человек», над которыми агент может рассуждать.
Второй инструмент – трекер, модель, которая связывает один и тот же объект между соседними кадрами и между камерами, чтобы он стал одной устойчивой идентичностью, а не новым детектом на каждом кадре. Трекеры вроде ByteTrack из урока про многообъектный трекинг позволяют агенту ответить «куда пошёл этот человек после зоны?», ведя трек от камеры к камере. Без трекинга агент видит тысячу разрозненных рамок; с ним – путь одного человека.
Третий инструмент – сегментатор, модель, которая обводит объект точно, по пикселям, а не свободной рамкой, и может вести этот контур через клип. Здесь инструмент – SAM 2 из урока про SAM 2 для видео; агент использует его, чтобы выделить конкретный объект – оставленную сумку, машину – и подтвердить, что во времени это один и тот же.
Четвёртый инструмент – индекс криминалистического поиска, способ доставать клипы, описывая их словами, а не перематывая таймлайн. Это сердце поиска по видео на обычном языке, и это та же машинерия выборки, что и в мультимодальном RAG по видеоархиву. Как он работает, мы разберём в следующем разделе, потому что именно эта часть делает всего агента доступным по деньгам.
Пятый инструмент – vision-language-читатель, модель, которая смотрит на клип и описывает происходящее на обычном языке: открытые и закрытые VLM из урока про открытые VLM. Это внимательный глаз агента. Он медленный и дорогой, поэтому используется последним и реже всего: только на той горстке кандидатных клипов, которые уже подняли более дешёвые инструменты. Читатель – то, что превращает «три рамки, отмеченные детектором» в «мужчина в тёмной куртке внёс коробку в зону в 23:14».
Шестой инструмент – составитель отчёта: агент собирает находки, опорные клипы и таймкоды в короткое, читаемое человеком резюме со связанными доказательствами. Это вообще не инструмент зрения; это агент, использующий родную силу языковой модели, чтобы донести результат, по которому человек может действовать.
| Инструмент | На что отвечает | Стоимость запуска | Пример из видео |
|---|---|---|---|
| Детектор (YOLO) | «Что и где в этом кадре?» | Очень низкая – сканирует целые ночи | Найти всех людей в зоне за ночь |
| Трекер (ByteTrack) | «Куда дальше пошёл объект?» | Низкая | Провести человека через четыре камеры |
| Сегментатор (SAM 2) | «Это ровно тот же объект?» | Низкая–средняя | Подтвердить одну сумку через клип |
| Индекс поиска | «Какие клипы подходят под описание?» | Низкая на запросе (строится раз) | «Человек в красной куртке у ворот» |
| VLM-читатель | «Что здесь на самом деле происходит?» | Высокая – экономно | Описать 3 кандидатных клипа словами |
| Составитель отчёта | «Резюмировать находку с доказательствами» | Низкая | Абзац + 3 связанных клипа + таймкоды |
Частая и дорогая ошибка – перегруз инструментами: дать агенту тридцать инструментов, потому что каждый показался полезным. Чем больше инструментов на выбор, тем чаще агент берёт не тот или зависает, решая, и точность выбора инструмента падает с ростом меню. Начните с шести выше и добавляйте седьмой, только когда реальное расследование докажет, что его не хватает.
Как работает криминалистический поиск на обычном языке
Самая важная мысль этого урока – что дорогую модель никогда не запускают на всей записи. Понять почему и что делать вместо – это и есть то, что отделяет систему за пару долларов в ночь от системы за тысячи.
Сделайте арифметику один раз – и проблема очевидна. Возьмём скромный объект: шестнадцать камер, каждая пишет на пятнадцати кадрах в секунду, в течение двенадцати тёмных часов, когда случается большинство расследований. Кадров с одной камеры за одну ночь – 15 × 3 600 × 12 = 648 000. На шестнадцать камер это 648 000 × 16 = 10 368 000 кадров – около десяти миллионов картинок каждую ночь. Теперь представьте, что вы пытаетесь отвечать на вопросы, отправляя каждый кадр в vision-language-модель по, скажем, $0,0005 за изображение. Это 10 368 000 × $0,0005 = $5 184 за ночь, или больше $155 000 в месяц, для одного небольшого объекта – и вы платили бы это вне зависимости от того, спросил ли кто-нибудь хоть раз. Читать всё умной моделью не масштабируется. Проверить ценовую сторону можно по реальной стоимости ИИ в видеопродуктах; урок там тот же, что подсказывает и эта арифметика.
Выход из положения состоит из двух фаз, и разделение между ними – это и есть весь дизайн. Первая фаза происходит однажды, на этапе индексации (ingest), по мере записи. Дешёвый детектор гоняется по потоку и записывает компактную пометку для каждого значимого момента – «человек, камера 3, 23:14, у двери зоны». Одновременно система берёт репрезентативный стоп-кадр через определённые интервалы (вам не нужны все пятнадцать в секунду; один в секунду-две схватывает сцену) и превращает каждый выбранный кадр в короткую строку чисел – эмбеддинг, числовой отпечаток, который располагает похожие изображения рядом в математическом пространстве. Кадры «снимают отпечатком» image-text-моделью вроде CLIP или SigLIP – то же семейство из введения в CLIP; аудиодорожку, если есть, переводят в текст; а камеру, время и зону прикрепляют как метаданные. Всё это – пометки детектора, отпечатки кадров, расшифровка, метаданные – складывается в поисковый индекс. Индекс строится непрерывно и тихо в фоне, и он дёшев, потому что детектор и модель эмбеддингов небольшие.
Вторая фаза происходит только когда задан вопрос, на этапе запроса (query), и она быстрая и дешёвая, потому что тяжёлая работа уже сделана. Вопрос – «человек в красной куртке у ворот около полуночи» – превращают в такой же числовой отпечаток, и индекс возвращает горстку клипов, чьи отпечатки лежат к нему ближе всего, отфильтрованных по времени и камере, которые подразумевал вопрос. Поскольку визуальный, текстовый индексы и индекс метаданных ищутся вместе, а их результаты сливаются, система может совпадать по внешнему виду, по сказанным словам и по «где-и-когда» одновременно. Шаг переранжирования затем пересортировывает этот короткий список по релевантности. И только теперь – на пяти-десяти выживших клипах – дорогой vision-language-читатель действительно смотрит, подтверждает совпадение и описывает его. Умная модель касается десяти клипов вместо десяти миллионов кадров. Это и есть разница между парой центов и пятью тысячами долларов.
| Читать всё (наивно) | Детект-затем-выборка (прод) | |
|---|---|---|
| Когда работает VLM | На каждом кадре, всю ночь | На ~10 кандидатных клипах на запрос |
| Кадров видит VLM | ~10 000 000 / ночь | ~10 / запрос |
| Примерная стоимость модели за ночь | ~$5 000 на один объект | От центов до пары долларов |
| Стоимость, когда никто не спрашивает | Платите всё равно | Почти ноль |
| Кто делает широкое сканирование | Дорогая модель | Дешёвый детектор + индекс эмбеддингов |
Эта двухфазная форма – индексировать дёшево и непрерывно, доставать и читать дорого, но редко – есть прод-паттерн за каждым продуктом поиска по видео на обычном языке, выходящим в 2026 году, от Eagle Eye Smart Video Search до Conntour и edge-модели Ambient.ai. Когда оцениваете любой инструмент «ИИ-поиска по видео», первый вопрос – где работает тяжёлая модель. Если ответ «на каждом кадре», счёт это выдаст.
Память – почему агенту приходится помнить
Исследователь, который забывает всё между вопросами, – это поисковая строка, а не агент. Разница в памяти, и агенту видеонаблюдения нужны все четыре вида, которые мы назвали в уроке про примитивы агента.
Его рабочая память – текущее расследование (этот вопрос, найденные пока клипы, текущий план), – живёт в контекстном окне модели на время одной задачи. Его семантическая память – постоянное знание об объекте: карта камер, какой поток покрывает какую зону, список нормальных машин, планировка площадки. Его эпизодическая память – запись конкретных прошлых событий («камера зоны погрузки давала ложные срабатывания на фары в прошлый вторник»), чтобы агент не отмечал одну и ту же тень ночь за ночью. Его процедурная память – плейбук расследования: постоянные шаги, которым агент всегда следует, получив вопрос про «вход после часов». Первые два делают агента компетентным с первого дня; третья – то, что заставляет его становиться лучше со временем, а не повторять вчерашние ошибки.
Эпизодическую память команды чаще всего пропускают, и именно её пропуск делает столько аналитических систем изматывающими: они «кричат волки» каждую ночь, потому что ничто не помнит, что вчерашний волк был деревом. Агент, который пишет «камера 3 ложно срабатывает на блик фар после 23:00» в свою память и считывает это в следующем расследовании, делает то единственное, что делал бы неутомимый живой охранник, – изучает объект.
Сложная часть – что закон агенту не позволит
Видеонаблюдение – там, где инженерия агентов встречается с самыми острыми юридическими границами, и в Европе эти границы не рекомендательные. EU AI Act сортирует применения ИИ по полосам риска, и видеонаблюдение задевает две самые строгие полосы напрямую. Ошибиться здесь – не баг; это штраф до €35 миллионов или 7% мирового оборота.
Самая яркая линия – удалённая биометрическая идентификация в реальном времени в публично доступных пространствах: сканирование лиц в живой публичной толпе, чтобы установить, кто эти люди. Для большинства акторов это прямо запрещено статьёй 5 AI Act – запрет действует с февраля 2025 года, с узкими исключениями для правоохраны (поиск пропавшего ребёнка, неминуемая террористическая угроза), которые требуют предварительной авторизации. Для коммерческого видеопродукта считайте живую идентификацию лиц в публичном пространстве недопустимой. Агент-исследователь должен быть спроектирован так, чтобы он этого не мог – не «настроен не делать», а построен без такой способности.
Более мягкая, но всё ещё серьёзная линия – пост-фактум биометрическая идентификация: запуск распознавания лиц на вчерашней записи, чтобы установить личность задним числом. Это не запрещено, но отнесено к высокому риску, что несёт тяжёлые обязанности: документирование, логирование, надзор человека, оценка соответствия. Из-за этих обязанностей безопасный дефолт для большинства продуктов – держать агента на уровне объектов, событий и описаний («человек в красной куртке», «машина у ворот», «вход после часов») и никогда на уровне личности («это Иван Петров»). Искать что произошло – обычная аналитика; искать кто это – переход в биометрическую территорию. Ту же границу подробно проводит урок про распознавание лиц под EU AI Act; агент-исследователь должен уважать её по дизайну.
Одна дата важна для планирования, и в 2026 году она изменилась. Обязанности по высокому риску изначально должны были применяться с 2 августа 2026 года. В мае 2026 года институты ЕС достигли предварительного политического согласия – «Digital Omnibus» – об их переносе: автономные системы высокого риска (полоса, покрывающая правоохранительные и биометрические инструменты) теперь применяются с 2 декабря 2027 года, а высокорисковый ИИ, встроенный в регулируемые продукты, – со 2 августа 2028 года. Запреты статьи 5, включая запрет на биометрию в реальном времени, перенесены не были и остаются в силе. Перенос даёт инженерное время; красную линию он не сдвигает.
Есть и принцип дизайна, который стоит выше закона и облегчает его соблюдение: держите человека в петле на каждом значимом действии. Агент расследует и предлагает; решает человек. Агент может вывести «вероятный взлом у зоны, вот три клипа», но он не запирает дверь, не отправляет охранника и не подаёт заявление в полицию сам. Это одновременно ответственный дизайн и соответствующий требованиям – надзор человека ровно то, чего требуют правила высокого риска, – и поэтому Рисунок 2 заканчивается воротами проверки, а не действием.
| Применение агента | Полоса EU AI Act | Практическое правило для продукта |
|---|---|---|
| Живая идентификация лиц в публичном пространстве | Запрещено (ст. 5, с фев. 2025) | Не строить такую способность вообще |
| Установление личности пост-фактум | Высокий риск (применяется 2 дек. 2027) | Избегать по умолчанию; тяжёлые обязанности при использовании |
| Поиск объектов, событий, описаний | Обычная аналитика | Безопасный дефолтный объём для агента |
| Авто-действие по совпадению (запор, вызов) | Убирает надзор человека | Всегда за решением человека |
Сквозное расследование, от начала до конца
Свяжем части одним прогоном. Вопрос приходит в 07:00: «Что-нибудь необычное в зоне погрузки за ночь?» Агент декомпозирует его в «найти человеческую активность вне рабочих часов в потоках зоны между 22:00 и 06:00». Сверяется с семантической памятью, какие две камеры покрывают зону. Вызывает детектор, уже отработавший на индексации, и достаёт все события-с-человеком в этих потоках в окне – их четырнадцать. Проверяет эпизодическую память: камера 3 ложно срабатывает на блик фар после 23:00, поэтому понижает вес шести событий, подходящих под этот паттерн. Оставшиеся восемь кандидатных клипов – не десять миллионов кадров за ночь – отправляет vision-language-читателю, который описывает каждый: шесть – сотрудник на известной смене, один – лиса, один – человек в тёмной одежде, несущий коробку к двери зоны в 23:14 и которого нет ни в одном графике. Агент использует трекер, чтобы провести путь этого человека через ещё две камеры до забора по периметру. Пишет отчёт: абзац, три связанных клипа, таймкоды, путь по камерам. Затем останавливается – и решает человек, руководитель безопасности, а не агент. Сработал каждый примитив; дорогая модель коснулась восьми клипов; ни одно лицо не было идентифицировано; решение принял человек.
Строить, купить или обернуть
У вас три честных варианта, и правильный зависит от того, насколько ваш продукт про эту функцию. Можно купить готового агента – Eeva, Conntour, развёртывание Ambient.ai – и интегрировать его, что быстрее всего и верно, когда расследование – функция, а не ваш продукт. Можно обернуть существующую VMS: вендоры теперь добавляют слой агента поверх платформ вроде Milestone XProtect, так что вы сохраняете запись и хранение, что уже есть, и прикручиваете агента сверху. Или можно построить конвейер из открытых примитивов этого раздела – детектор, трекер, сегментатор, эмбеддинги, VLM, фреймворк агента из урока про фреймворки, – что верно, когда логика расследования и есть ваш продукт, а готовые агенты не подходят под ваш домен. Большинству команд стоит начать с покупки или обёртки, чтобы понять, какие вопросы пользователи реально задают, и строить только те части, которые рыночные инструменты делают плохо для вашей вертикали.
Где здесь Фора Софт
Мы делаем видеопродукты в видеонаблюдении, видеоаналитике, видеосвязи, стриминге, OTT, e-learning, телемедицине и AR/VR, и агент-исследователь – прямо в той работе по наблюдению и аналитике, которую мы поставляем. Когда клиенту нужен криминалистический поиск, наша дисциплина дизайна – та, что в этом уроке: индексировать дёшево и непрерывно, доставать и читать дорого, но редко, давать агенту небольшой острый набор инструментов и ставить человека на каждое значимое действие. Мы по умолчанию держим агента на уровне объектов и событий, а не личности, чтобы продукт проходил яркие линии EU AI Act по дизайну, а не по настройке. В аналитико-ёмких вертикалях – ретейл, охрана труда, умные здания – тот же скелет служит работе по интеллектуальной видеоаналитике, не пересобирая агента под каждый объект.
Ключевые выводы
- Агент-исследователь отвечает на вопросы об уже записанной съёмке, с клипами как доказательством.
- Это цикл агента плюс пояс из шести инструментов: детект, трек, сегмент, поиск, чтение, отчёт.
- Никогда не гоняйте дорогой VLM по каждому кадру – индексируйте дёшево, доставайте, потом читайте.
- Эпизодическая память не даёт агенту отмечать одну и ту же тень каждую ночь.
- В ЕС живая идентификация лиц в публике запрещена; пост-фактум личность – высокий риск; держитесь объектов и событий.
- Человек в петле на каждом значимом действии; агент предлагает, решает человек.