Содержание статьи +
- Коротко
- Почему это важно
- Что такое агент-исследователь – и чем он не является
- Цикл исследователя
- Пояс инструментов – что умеет агент на самом деле
- Как работает криминалистический поиск на обычном языке
- Память – почему агенту приходится помнить
- Сложная часть – что закон не позволит агенту
- Сквозное расследование, от начала до конца
- Строить, покупать или обёртывать
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Коротко
Агент-исследователь видео – это ИИ-система, которая на естественном языке отвечает на вопросы о ранее записанных видеозаписях (например: «Кто-нибудь заходил в зону погрузки после 22:00 прошлой ночью?»). Она планирует расследование, использует инструменты компьютерного зрения и поиска, а затем возвращает конкретные видеофрагменты с таймкодами.
Система работает так: вокруг знакомого по предыдущим урокам цикла агента добавляется небольшой «пояс инструментов» – детектор событий, трекер для отслеживания людей между камерами, поисковый индекс для извлечения клипов по описанию и vision-language-модель, которая анализирует эти фрагменты и формулирует вывод.
Ключевой инженерный приём, делающий решение экономически эффективным, – избегать запуска дорогой модели на каждом кадре. Дешёвые детектор и индекс сокращают миллионы кадров до нескольких десятков релевантных клипов, и только они поступают на обработку к «читателю» – мощной, но ресурсоёмкой модели.
К 2026 году это уже не теория – описанный паттерн реализован в реальных продуктах (Eeva от Brivo, Eagle Eye Smart Video Search, Conntour, Ambient.ai), однако та же архитектура сталкивается с жёсткими юридическими ограничениями: в Европе распознавание лиц в реальном времени в общественных местах запрещено, а постфактумная идентификация по биометрическим данным относится к категории высокорисковых операций.
Почему это важно
Видеонаблюдение – сценарий, в котором агент окупается быстрее всего, потому что работу, которую он заменяет (человек, вручную просматривающий часы записи), выполнять медленно, дорого и легко ошибиться. Если вы работаете с видеопродуктом для физической безопасности, ретейл-аналитики, охраны труда на производстве или умного здания, этот урок объясняет, что такое агент-исследователь на самом деле, из каких компонентов он состоит и где скрываются стоимость и юридические риски. Вам не нужно писать конвейер самостоятельно, но важно понимать достаточно, чтобы отличить грамотный дизайн от безрассудного – например, уточнять, анализирует ли агент каждый кадр или выбирает нужные, и подписывает ли человек итоговый результат перед тем, как что-либо произойдёт. Это также первый из трёх прикладных уроков об агентах: агенты-копилоты встреч и асинхронного разбора используют ту же базовую структуру, но в других условиях.
Что такое агент-исследователь – и чем он не является
Начнём с картинки, которая у большинства людей в голове – и она неверна. Агент-исследователь – это не робот, который смотрит на стену мониторов и нажимает тревогу. Это программное обеспечение, которое работает поверх уже сделанных вашими камерами записей и вашей системы видеоменеджмента – программы, известной как VMS, которая записывает и хранит видеопотоки с камер, – и по запросу отвечает на вопросы об этих записях. Вы задаёте вопрос на обычном языке; он сам выполняет «просмотр».
Ключевое слово здесь – исследователь, и оно указывает на конкретную задачу: просматривать архивные записи, чтобы восстановить, что произошло. В индустрии безопасности это называют криминалистическим (forensic) поиском – анализом видеозаписей после инцидента с целью найти фрагмент, объясняющий произошедшее. Классический пример – человек, который просматривает двенадцать часов записи с шестнадцати камер, чтобы найти те девяносто секунд, которые имеют значение. Именно эту работу берёт на себя агент. В 2026 году индустрия безопасности сделала это реальным: компании Brivo и Eagle Eye Networks представили агента Eeva, способного отслеживать камеры по запросу на естественном языке, а стартап Conntour в марте 2026 года привлёк семь миллионов долларов на проект, который сами основатели называют «поисковиком по охранному видео». Паттерн больше не гипотетический.
Полезно чётко обозначить границы между двумя соседними ролями. Агент-исследователь – это не то же самое, что живое правило оповещения («пингуй меня, когда детектор видит человека в этой зоне»), представляющее собой более простой, постоянно действующий триггер на основе обычной видеоаналитики. И это не оператор живого мониторинга, который наблюдает за потоками в реальном времени, чтобы вмешаться при необходимости. Исследователь работает преимущественно с прошлым: приходит запрос – он изучает архив – составляет отчёт. Некоторые продукты стирают эту границу, позволяя одному агенту одновременно смотреть в реальном времени и искать в истории, но и с точки зрения инженерии, и с юридической точки зрения действия «отреагировать на лицо вживую» и «найти запись за вчерашний день» принципиально различаются, и их стоит держать в голове отдельно.
Цикл исследователя
Каждый агент проходит цикл – воспринять, рассудить, действовать, наблюдать – и этот цикл мы уже рассматривали в уроке про цикл агента. Агент-исследователь – это тот же цикл, направленный на конкретную цель: ответить на вопрос о съёмке. Пройдём одно расследование шаг за шагом – и цикл станет наглядным.
Приходит вопрос: «Кто-нибудь заходил в зону погрузки после 22:00 прошлой ночью?» Сначала агент декомпозирует цель – разбивает большой вопрос на более мелкие, на которые можно ответить. Какие камеры охватывают зону погрузки? Что считать «входом»? Какое временнóе окно учитывать? Эта декомпозиция – навык планирования из урока про примитивы агента, и именно он отличает настоящего агента от простой поисковой строки.
Затем цикл продолжается. Агент выбирает первый шаг – «перечислить камеры, покрывающие зону» – и отвечает на него, обращаясь к своей памяти с картой камер объекта. Далее он выбирает следующий шаг – «найти события движения и присутствия человека в этих потоках между 22:00 и 06:00» – и выполняет его, вызывая инструмент: детектор людей, в параметры которого переданы ID камер и временной интервал. Детектор возвращает три кандидатных клипа. Они попадают обратно в рабочую память агента как новое наблюдение. Агент снова рассуждает: это реальные входы или ложные срабатывания на качающуюся тень? Он вызывает второй инструмент – vision-language-«читатель», – чтобы проанализировать каждый кандидатный клип и описать его. Два оказываются тенями; один – человеком, несущим коробку. Цикл продолжается, пока на вопрос не будет дан ответ, после чего агент формирует вывод – с приложенным клипом, указанием камеры и таймкодом в качестве доказательства.
Обратите внимание, что на каждом обороте требовалось три вещи: планирование – чтобы выбрать следующий шаг, использование инструментов – чтобы его выполнить, и память – чтобы помнить цель и вспомнить карту камер. Это ровно те три примитива, о которых шла речь в прошлом уроке; агент-исследователь – это как раз место, где они перестают быть абстракцией. Индустрия безопасности описывает ту же логику своими словами: сначала увидеть, затем проанализировать увиденное во времени, потом оценить степень серьёзности и, наконец, действовать. Четырёхтактная модель от вендоров вроде Ambient.ai – это по сути тот же цикл агента, только в образе охранника.
Пояс инструментов – что умеет агент на самом деле
Агент настолько силён, насколько сильны данные ему инструменты, и искусство заключается в том, чтобы дать немного острых, а не много тупых. Исследователю видеонаблюдения нужен небольшой, но хорошо подобранный набор инструментов. Каждый инструмент отвечает на один тип вопросов, и большинство из них – модели компьютерного зрения, которые мы уже рассматривали в этом разделе.
Первый инструмент – детектор, модель, которая находит объекты и людей в кадре и обводит каждого рамкой. Рабочая лошадка в продакшене – семейство YOLO из урока про линейку YOLO: оно отвечает на вопрос «что и где» дёшево и достаточно быстро, чтобы просканировать всю запись за ночь. Детектор – это широкая сеть агента: он превращает сырое видео в поток фактов вроде «в 23:14 на камере 3 есть человек», над которыми агент может рассуждать.
Второй инструмент – трекер, модель, которая связывает один и тот же объект между соседними кадрами и между камерами, превращая его в единую устойчивую идентичность, а не в новый детект на каждом кадре. Трекеры вроде ByteTrack из урока про многообъектный трекинг позволяют агенту ответить на вопрос: «Куда пошёл этот человек после зоны?» – отслеживая его путь от камеры к камере. Без трекинга агент видит тысячу разрозненных рамок; с ним – путь одного человека.
Третий инструмент – сегментатор, модель, которая точно обводит объект по пикселям, а не свободной рамкой, и может отслеживать этот контур на протяжении всего клипа. В данном случае используется SAM 2 из урока про SAM 2 для видео; агент применяет его, чтобы выделить конкретный объект – оставленную сумку, автомобиль – и убедиться, что это один и тот же объект во времени.
Четвёртый инструмент – индекс криминалистического поиска, позволяющий находить клипы по словесным описаниям, а не просматривая таймлайн вручную. Это основа поиска по видео на естественном языке и та же технология выборки, что используется в мультимодальном RAG по видеоархиву. Как он работает, мы разберём в следующем разделе – именно эта часть делает всего агента доступным по деньгам.
Пятый инструмент – vision-language-читатель, модель, которая анализирует клип и описывает происходящее на естественном языке: открытые и закрытые VLM из урока про открытые VLM. Это «внимательный глаз» агента. Он медленный и дорогой, поэтому используется последним и реже всего – только на той горстке кандидатных клипов, которые уже отобрали более дешёвые инструменты. Именно читатель превращает «три рамки, выделенные детектором» в «мужчина в тёмной куртке принёс коробку в зону в 23:14».
Шестой инструмент – составитель отчёта: агент собирает находки, опорные клипы и таймкоды в краткое, понятное человеку резюме с прикреплёнными доказательствами. Это вовсе не инструмент для восприятия – это агент, использующий встроенные возможности языковой модели, чтобы представить результат, по которому человек может принять решение.
| Инструмент | На что отвечает | Стоимость запуска | Пример из видео |
|---|---|---|---|
| Детектор (YOLO) | «Что и где в этом кадре?» | Очень низкая – сканирует целые ночи | Найти всех людей в зоне за ночь |
| Трекер (ByteTrack) | «Куда дальше пошёл объект?» | Низкая | Провести человека через четыре камеры |
| Сегментатор (SAM 2) | «Это ровно тот же объект?» | Низкая–средняя | Подтвердить одну сумку через клип |
| Индекс поиска | «Какие клипы подходят под описание?» | Низкая на запросе (строится раз) | «Человек в красной куртке у ворот» |
| VLM-читатель | «Что здесь на самом деле происходит?» | Высокая – экономно | Описать 3 кандидатных клипа словами |
| Составитель отчёта | «Резюмировать находку с доказательствами» | Низкая | Абзац + 3 связанных клипа + таймкоды |
Частая и дорогая ошибка – перегрузка инструментами: дать агенту тридцать инструментов, потому что каждый показался полезным. Чем больше инструментов на выбор, тем чаще агент берёт не тот или зависает, пытаясь решить, какой использовать, – и точность выбора падает по мере роста меню. Начните с шести, и добавляйте седьмой только тогда, когда реальное расследование покажет, что он действительно необходим.
Как работает криминалистический поиск на обычном языке
Самая важная мысль этого урока – дорогую модель никогда не запускают на всей записи. Понять, почему это так и что делать вместо этого, – вот что отличает систему, стоящую пару долларов в сутки, от системы, обходящейся в тысячи.
Сделайте простую арифметику – и проблема станет очевидной. Возьмём скромный объект: шестнадцать камер, каждая снимает со скоростью пятнадцать кадров в секунду, в течение двенадцати тёмных часов – времени, когда происходит большинство инцидентов. За одну ночь одна камера делает 15 × 3600 × 12 = 648 000 кадров. На шестнадцать камер – 648 000 × 16 = 10 368 000 кадров, то есть около десяти миллионов изображений каждую ночь.
Теперь представьте, что вы пытаетесь отвечать на вопросы, отправляя каждый кадр в vision-language-модель, скажем, по $0,0005 за изображение. Это даёт 10 368 000 × $0,0005 = $5 184 в сутки, или более $155 000 в месяц – и это только для одного небольшого объекта. При этом вы платите вне зависимости от того, задавали ли вообще кто-то вопросы. Обработка всех данных умной моделью не масштабируется.
Проверить экономическую сторону можно по реальной стоимости ИИ в видеопродуктах; вывод там тот же, что и у этой арифметики.
Выход из положения состоит из двух фаз, и граница между ними – это и есть весь дизайн. Первая фаза происходит один раз, на этапе индексации (ingest), в момент записи. Дешёвый детектор проходит по потоку и для каждого значимого момента оставляет компактную пометку – «человек, камера 3, 23:14, у двери зоны». Одновременно система берёт репрезентативные кадры через определённые интервалы (не нужны все пятнадцать в секунду – достаточно одного раза в секунду-другую, чтобы зафиксировать сцену) и преобразует каждый выбранный кадр в короткую числовую строку – эмбеддинг, числовой отпечаток, который располагает похожие изображения рядом в математическом пространстве. Кадры «снимают отпечаток» с помощью image-text-модели вроде CLIP или SigLIP – той же серии, что и в введении в CLIP; аудиодорожку, если она есть, преобразуют в текст, а камеру, время и зону добавляют как метаданные. Всё это – пометки детектора, эмбеддинги кадров, расшифровка и метаданные – собирается в поисковый индекс. Индекс формируется непрерывно и незаметно в фоне, и он недорог, потому что и детектор, и модель эмбеддингов – небольшие.
Вторая фаза запускается только при постановке вопроса – на этапе запроса (query) – и она быстрая и недорогая, потому что основная работа уже выполнена. Вопрос: «человек в красной куртке у ворот около полуночи» – преобразуется в числовой отпечаток, и индекс возвращает несколько клипов, чьи отпечатки находятся ближе всего к нему, отфильтрованных по времени и камере, которые подразумевает вопрос. Поскольку визуальный, текстовый и метаданный индексы ищутся одновременно, а их результаты объединяются, система может сопоставлять по внешнему виду, по произнесённым словам и по «где и когда» – всё сразу. Затем этап переранжирования пересортирует этот короткий список по релевантности. И только теперь – на пяти-десяти оставшихся клипах – дорогой vision-language-читатель действительно анализирует, подтверждает совпадение и описывает его. Умная модель обрабатывает десять клипов вместо десяти миллионов кадров. Вот в чём разница между парой центов и пятью тысячами долларов.
| Читать всё (наивно) | Детект-затем-выборка (прод) | |
|---|---|---|
| Когда работает VLM | На каждом кадре, всю ночь | На ~10 кандидатных клипах на запрос |
| Кадров видит VLM | ~10 000 000 / ночь | ~10 / запрос |
| Примерная стоимость модели за ночь | ~$5 000 на один объект | От центов до пары долларов |
| Стоимость, когда никто не спрашивает | Платите всё равно | Почти ноль |
| Кто делает широкое сканирование | Дорогая модель | Дешёвый детектор + индекс эмбеддингов |
Эта двухфазная модель – индексировать дешево и непрерывно, извлекать и читать дорого, но редко – лежит в основе каждого продукта поиска по видео на естественном языке, выходящего в 2026 году, от Eagle Eye Smart Video Search до Conntour и edge-решения Ambient.ai. Оценивая любой инструмент «ИИ-поиска по видео», задайте себе первый вопрос: где работает тяжёлая модель. Если ответ – «на каждом кадре», счёт будет высоким.
Память – почему агенту приходится помнить
Исследователь, который забывает всё между вопросами, – это поисковая строка, а не агент. Разница в памяти: агенту видеонаблюдения нужны все четыре вида, которые мы назвали в уроке про примитивы агента.
Его рабочая память – текущее расследование (этот вопрос, найденные пока клипы, текущий план) – хранится в контекстном окне модели на время выполнения одной задачи. Его семантическая память – постоянное знание об объекте: карта камер, зоны покрытия потоков, список нормальных машин, планировка площадки. Его эпизодическая память – запись конкретных прошлых событий («камера зоны погрузки давала ложные срабатывания на фары в прошлый вторник»), чтобы агент не отмечал одну и ту же тень ночь за ночью. Его процедурная память – плейбук расследования: стандартные шаги, которым агент всегда следует, получив вопрос про «вход после часов». Первые два типа памяти делают агента компетентным с первого дня; третий позволяет ему становиться лучше со временем, а не повторять вчерашние ошибки.
Эпизодическую память команды чаще всего игнорируют, и именно это делает многие аналитические системы изматывающими: они «кричат о волках» каждую ночь, потому что никто не помнит, что вчерашний волк был всего лишь деревом. Агент, который записывает в свою память: «камера 3 ложно срабатывает на блик фар после 23:00» – и вспоминает об этом при следующем расследовании, – делает то, что делал бы неутомимый живой охранник: он изучает объект.
Сложная часть – что закон не позволит агенту
Видеонаблюдение – сфера, где инженерия агентов сталкивается с самыми жёсткими юридическими границами, и в Европе эти границы не носят рекомендательный характер. EU AI Act классифицирует применения ИИ по уровням риска, и видеонаблюдение напрямую затрагивает две самые строгие категории. Ошибиться здесь – не ошибка; это штраф до 35 миллионов евро или 7% мирового оборота компании.
Самая яркая линия – удалённая биометрическая идентификация в реальном времени в публично доступных пространствах: сканирование лиц в живой толпе на улице, чтобы установить, кто эти люди. Для большинства субъектов такая деятельность прямо запрещена статьёй 5 AI Act – запрет вступает в силу с февраля 2025 года с узкими исключениями для правоохранительных органов (поиск пропавшего ребёнка, неминуемая террористическая угроза), которые требуют предварительной авторизации. Для коммерческого видеопродукта следует считать живую идентификацию лиц в публичных пространствах недопустимой. Агент-исследователь должен быть спроектирован так, чтобы он вообще не мог это делать – не просто «настроен не делать», а лишён такой способности изначально.
Более мягкая, но всё ещё серьёзная мера – пост-фактум биометрическая идентификация: распознавание лиц на записи с прошлого дня с целью установления личности задним числом. Это не запрещено, но отнесено к категории высокого риска, что влечёт за собой серьёзные обязательства: документирование, ведение логов, человеческий надзор, оценка соответствия. Из-за этих требований безопасный вариант по умолчанию для большинства продуктов – ограничиваться уровнем объектов, событий и описаний («человек в красной куртке», «машина у ворот», «вход после рабочего времени») и никогда не переходить к уровню личности («это Иван Петров»). Анализ чего произошло – обычная аналитика; установление кто это – уже биометрическая идентификация. Та же граница подробно описана в уроке про распознавание лиц под EU AI Act; исследовательский агент должен уважать её по принципу проектирования.
Одна дата важна для планирования, и в 2026 году она изменилась. Обязанности по высокому риску изначально должны были вступить в силу 2 августа 2026 года. В мае 2026 года институты ЕС достигли предварительного политического соглашения – «Digital Omnibus» – о переносе сроков: автономные системы высокого риска (включая правоохранительные и биометрические инструменты) теперь будут применяться с 2 декабря 2027 года, а высокорисковый ИИ, встроенный в регулируемые продукты, – со 2 августа 2028 года. Запреты, предусмотренные статьёй 5, включая запрет на биометрию в реальном времени, перенесены не были и остаются в силе. Перенос даёт дополнительное время для подготовки; красную линию он не сдвигает.
Есть и принцип дизайна, который стоит выше закона и облегчает его соблюдение: держите человека в петле на каждом значимом действии. Агент анализирует и предлагает; решение принимает человек. Он может показать: «вероятный взлом в зоне, вот три клипа», но не запирает дверь, не отправляет охранника и не подаёт заявление в полицию сам. Такой подход одновременно является ответственным дизайном и соответствует требованиям – человеческий контроль как раз то, что предписывают правила для высокорисковых ситуаций. Поэтому Рисунок 2 заканчивается воротами проверки, а не действием.
| Применение агента | Полоса EU AI Act | Практическое правило для продукта |
|---|---|---|
| Живая идентификация лиц в публичном пространстве | Запрещено (ст. 5, с фев. 2025) | Не строить такую способность вообще |
| Установление личности пост-фактум | Высокий риск (применяется 2 дек. 2027) | Избегать по умолчанию; тяжёлые обязанности при использовании |
| Поиск объектов, событий, описаний | Обычная аналитика | Безопасный дефолтный объём для агента |
| Авто-действие по совпадению (запор, вызов) | Убирает надзор человека | Всегда за решением человека |
Сквозное расследование, от начала до конца
Свяжем части одним прогоном. Вопрос поступает в 07:00: «Что-то необычное было в зоне погрузки за ночь?» Агент разбивает его на задачу: «обнаружить человеческую активность вне рабочего времени в потоках с зоной между 22:00 и 06:00». Сверяется с семантической памятью, чтобы определить, какие две камеры охватывают эту зону. Вызывает детектор, уже обученный на индексации, и извлекает все события с участием человека в этих потоках за указанный период – их четырнадцать. Проверяет эпизодическую память: камера 3 часто ложно срабатывает на блики фар после 23:00, поэтому снижает вес шести событий, соответствующих этому шаблону. Из оставшихся восьми кандидатных клипов – а не из десяти миллионов кадров за ночь – агент отправляет материал vision-language-читателю, который описывает каждый: шесть – сотрудник на известной смене, один – лиса, один – человек в тёмной одежде, несущий коробку к двери зоны в 23:14, которого нет ни в одном графике. Агент использует трекер, чтобы проследить путь этого человека через ещё две камеры до периметра. Пишет отчёт: абзац, три связанных клипа, таймкоды, маршрут по камерам. Затем останавливается – и решение принимает человек, руководитель безопасности, а не агент. Сработал каждый примитив; дорогая модель обработала восемь клипов; ни одно лицо не было идентифицировано; решение принял человек.
Строить, покупать или обёртывать
У вас есть три честных варианта, и правильный выбор зависит от того, насколько ваша функция про продукт. Можно купить готового агента – Eeva, Conntour, развёртывание Ambient.ai – и интегрировать его. Это самый быстрый и правильный путь, если расследование – это функция, а не ваш основной продукт. Можно обернуть существующую VMS: вендоры теперь добавляют слой агента поверх платформ вроде Milestone XProtect, так что вы сохраняете уже имеющуюся запись и хранение данных, а сверху подключаете агента. Или можно построить конвейер из открытых примитивов из этого раздела – детектор, трекер, сегментатор, эмбеддинги, VLM, фреймворк агента из урока про фреймворки – и это оправдано, когда логика расследования и есть ваш продукт, а готовые решения не подходят под ваш домен. Большинству команд стоит начать с покупки или обёртки, чтобы понять, какие вопросы реально задают пользователи, и строить только те части, которые рыночные инструменты плохо решают в вашей вертикали.
Где здесь Фора Софт
Мы разрабатываем видеопродукты для систем видеонаблюдения, видеоаналитики, видеосвязи, стриминга, OTT, e-learning, телемедицины и AR/VR, и наш агент-исследователь – это прямое продолжение той аналитики и наблюдения, которые мы поставляем. Когда клиенту нужен криминалистический поиск, наша дизайнерская дисциплина – как раз та, что описана в этом уроке: индексировать данные дёшево и непрерывно, извлекать и обрабатывать дорого, но редко, предоставлять агенту компактный, но эффективный набор инструментов и оставлять человека ответственным за каждое значимое решение. По умолчанию мы работаем с агентом на уровне объектов и событий, а не личностей, чтобы продукт соответствовал строгим требованиям EU AI Act по умолчанию – без дополнительной настройки. В аналитически насыщенных сферах – розничная торговля, охрана труда, умные здания – тот же подход лежит в основе работы с интеллектуальной видеоаналитикой, не требуя пересоздания агента под каждый конкретный объект.
Ключевые выводы
- Агент-исследователь отвечает на вопросы о ранее записанной съёмке, используя видеофрагменты в качестве доказательств.
- Это цикл агента, дополненный набором из шести инструментов: детект, трек, сегмент, поиск, чтение, отчёт.
- Не запускайте дорогой VLM на каждом кадре – сначала индексируйте дешево, потом извлекайте и только затем анализируйте.
- Эпизодическая память не позволяет агенту каждый раз реагировать на одну и ту же тень.
- В ЕС распознавание лиц в общественных местах запрещено; идентификация личности задним числом – высокий риск; фокусируйтесь на объектах и событиях.
- Человек участвует в каждом значимом действии; агент предлагает, решение принимает человек.