Содержание статьи +
- Кратко
- Зачем это важно
- Что «Open-Vocabulary» на самом деле означает в 2026
- Grounding DINO – Предел точности
- Florence-2 – Мультизадачный универсальный
- OWLv2 – Zero-Shot Baseline от Google
- RT-DETR – Real-Time End-to-End Трансформер (закрытый словарь, но близко)
- RF-DETR – Real-Time Detection Transformer 2026 года
- Сравнение пяти моделей в продакшене
- Рабочий пример – ритейл loss prevention с открытым класс-листом
- Типичные ошибки – три самых частых
- Где лежит Фора Софт
- Что Запомнить
- Что читать дальше
Кратко
Классический детектор объектов, обученный на 80 классах бенчмарка COCO – person, car, bottle и так далее – способен распознавать только эти 80 классов. Если продукту нужно обнаруживать «оставленный чемодан», «жёлтый сигнальный жилет» или «пролитую жидкость на полу», детектор придётся либо переобучать с нуля на новом датасете, либо заменить на модель, принимающую текст на этапе инференса. Open-vocabulary detection – это второй путь: семейство моделей, которые на вход получают произвольный текстовый промпт вместе с изображением и возвращают bounding box’ы для объектов, соответствующих описанию в промпте, даже если такой класс не встречался в обучающей выборке. В 2026 году выделяются пять ключевых моделей – Grounding DINO (максимальная точность), Florence-2 (мультизадачный универсальный инструмент), OWLv2 (zero-shot baseline от Google), RT-DETR (реального времени end-to-end трансформер из закрытой ветки того же пайплайна) и RF-DETR (модель 2026 года, впервые достигшая 60 AP на COCO в реальном времени). Выбор между ними зависит от четырёх факторов: бюджет латентности, максимальная точность, интерфейс промптов и лицензия. Статья рассматривает эти пять моделей и помогает принять решение по этим критериям.
Зачем это важно
Если вы запускаете фичу, где список объектов для детекции заранее неизвестен на этапе обучения – open-vocabulary detection и есть то, что делает такую фичу возможной. Типичные сценарии в видеопродуктах: ритейл-лосс-профилактика, где у каждого магазина свой список «что отслеживать на полке»; системы видеонаблюдения, где служба безопасности добавляет новую категорию оповещений (например, «оранжевый дорожный конус на парковке») и ожидает, что система начнёт отслеживать её уже через минуту; телемедицина, где врач просит пациента показать упаковку и дозировку таблеток, а система должна распознать нужную этикетку, не имея обучающих данных; и модерация OTT/UGC, где политика меняется быстрее, чем можно провести переобучение. Статья предполагает, что вы уже читали урок 2.2 про YOLO в продакшене – потому что в 2026 году почти все решения сводятся к выбору: расширять ли YOLO-пайплайн или заменить его моделью с открытым словарём – и урок 1.2 про латентность и топологию деплоя, потому что большинство open-vocabulary моделей слишком тяжеловесны для edge-устройств и работают либо в облаке, либо на мощных серверах. К концу статьи вы сможете прочитать заявку конкурента «AI-powered search», сопоставить её с пятью моделями ниже и объяснить инженерам, какая из них подойдёт для продукта и почему.
Что «Open-Vocabulary» на самом деле означает в 2026
Фраза «open-vocabulary detection» в маркетинговых материалах вендоров и презентациях употребляется небрежно, и эта путаница отнимает время на разработку. Три понятия располагаются на спектре от наименьшей к наибольшей гибкости, и различия между ними чёткие.
Closed-vocabulary detection – это то, что делает любая версия YOLO. В финальный классификационный слой модели «запечён» фиксированный список имён классов – 80 для стандартных чекпойнтов COCO, больше или меньше – для кастомных. На этапе инференса нельзя запросить класс, на котором модель не обучалась. Нужен новый класс – придётся переобучать. Быстро, точно, понятно: именно так в 2026 году работает почти каждый продукт в продакшене, использующий основную детекцию видео.
Zero-shot detection – термин из академических статей, описывающий модель, способную обнаруживать классы, на которых она явно не обучалась, за счёт переноса знаний из родственного vision-language предобучения. На этапе инференса модель по-прежнему требует дискретный список имён классов, но этот список можно передать текстом и он не обязан совпадать с метками, использовавшимися при обучении. К таким моделям относятся OWL-ViT и OWLv2 от Google. «Zero» в «zero-shot» означает отсутствие примеров целевого класса в размеченном обучающем наборе для детекции, а не отсутствие контакта с визуальным понятием на этапе предобучения.
Open-vocabulary detection – это широкая концепция. Модель принимает произвольный естественный язык: название категории «жёлтый жилет», фразу «человек с рюкзаком» или даже описательный запрос «самая левая машина» – и выдаёт ограничивающие рамки (bounding box’ы) для объектов, соответствующих описанию. Входной сигнал – промпт, а не заранее заданный список классов. К таким моделям относятся Grounding DINO, Florence-2 (в режиме детекции) и YOLO-World. На практике большинство команд используют термин «open-vocabulary» как общий, включающий zero-shot подходы, поскольку логика внедрения одинакова: на вход подаётся текст, на выходе – рамки, без необходимости переобучения.
Ещё четыре вещи, которые вы услышите и которые нельзя путать с open-vocabulary detection: prompt-тюнинг (небольшой адаптер, управляемый текстом, для модели с закрытым словарём – всё ещё требует дообучения при значительных изменениях), понимание реферирующих выражений (найти единственный объект, описанный в промпте, а не все экземпляры категории), привязка фраз (отнести каждое существительное в предложении к соответствующему ограничивающему прямоугольнику – задача шире, чем детекция), а также визуальный вопросно-ответный интерфейс (модель отвечает на вопросы об изображении, не выдавая ограничивающие рамки – полезно для описания, но бесполезно для детекции).
Для продуктовой команды практический вывод такой: если в дорожной карте есть «пусть пользователи печатают, что искать камерой», или «пусть безопасность добавляет новые alert-категории без переобучения», или «поддержать 200 кастомерских класс-листов без 200 ретрейнов» – вы покупаете open-vocabulary detection. Пять моделей ниже – реалистичные варианты.
Grounding DINO – Предел точности
Grounding DINO – модель, которая превратила open-vocabulary detection из исследовательской демонстрации в решение для продакшена. Представлена в марте 2023 года Шилонгом Лю и соавторами из IDEA Research, опубликована в статье «Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection» (arXiv:2303.05499) и позже принята на ECCV 2024. Исходный код доступен в репозитории IDEA-Research/GroundingDINO на GitHub.
Архитектурная идея проста в формулировке, но сложна в реализации. Grounding DINO берёт за основу DINO – мощный трансформер-детектор с закрытым словарём от той же команды – и интегрирует текст на трёх этапах сети, а не только на финальной стадии классификации. Изображение обрабатывается через Swin Transformer, извлекающий мультимасштабные визуальные признаки; текстовый промпт кодируется с помощью BERT (до 256 токенов). Два потока объединяются тремя механизмами: feature enhancer с деформируемым самовниманием для изображений и обычным самовниманием для текста, двусторонним кросс-вниманием, language-guided query selection (выбирает токены областей изображения, наиболее релевантные тексту) и кросс-модальным декодером, выдающим финальные bounding box’ы с учётом обоих потоков. Тесная интеграция на трёх уровнях – ключ к повышению точности Grounding DINO; предыдущие open-vocabulary детекторы соединяли текст только на выходе, оставляя ранние визуальные слои «слепыми» к промпту.
Числа точности – вот что сделало модель референсом. Оригинальный Grounding DINO показал 52,5 AP на COCO при zero-shot transfer, не видя ни одного обучающего изображения COCO – в то время как лучшие детекторы с закрытым словарём, обученные напрямую на COCO, достигали около 58 AP. Закрыть большую часть шестипунктового разрыва на COCO, оставаясь в режиме zero-shot, – серьёзный результат. На LVIS – более сложном бенчмарке с 1200 классами, включая множество редких – Grounding DINO значительно превзошёл все предыдущие zero-shot baseline’ы, а версия на базе Swin-L побила все предыдущие open-set детекторы.
Эволюция версий важна для продуктовой команды 2026 года. IDEA Research представили Grounding DINO 1.5 в мае 2024 года в двух вариантах: 1.5 Pro – более крупная модель на базе ViT-L с глубокой early-fusion, обученная на более чем 20 миллионах изображений с grounding-аннотациями и ориентированная на достижение максимальной точности, и 1.5 Edge – более компактная модель с архитектурой EfficientViT-L1, single-scale early fusion и feature enhancer, который cross-attend’ит только к самым глубоким фичам изображения – разработана специально для edge-ускорителей. Grounding DINO 1.6 Pro вышел в начале 2025 года и ещё сильнее приблизил модель к передовым результатам: 55,4 AP на COCO zero-shot transfer, 57,7 AP на LVIS-минвал и 51,1 AP на LVIS-val, с заметным приростом на LVIS-rare классах – категориях с крайне малым количеством обучающих примеров, которые особенно важны для индустрии, поскольку именно объекты, наиболее нужные для детекции, чаще всего представлены в данных в минимальном объёме. DINO-X, продолжение 2024 года, объединяющее детекцию, сегментацию и оценку позы в единую open-world модель, продолжает ту же линейку и расширяет семейство.
Главная слабость Grounding DINO – латентность. В оригинале обработка одного кадра занимает около 100–200 мс на GPU A100 при стандартном разрешении входа – в зависимости от выбранной версии и длины промпта. Это приемлемо для облачных API, поисковых задач и асинхронной модерации, но слишком медленно для пайплайнов в реальном времени при 30 кадрах в секунду. Edge-версия снижает задержку до ~21,7 мс на кадр на Jetson Orin Nano в режиме INT8 – это уже примерно соответствует real-time на одном потоке, однако остаётся тяжёлой для развёртывания с несколькими камерами. Вторая проблема – лицензия: исходный код открыт под Apache 2.0, а веса выпущены только для исследовательского использования. Модели версий 1.5 и 1.6 Pro доступны через платное API от IDEA Research – что логично для сценариев, где важна точность, но с коммерческой точки зрения отличается от локального запуска чекпоинта.
В 2026 Grounding DINO – правильный выбор, когда продукт может либо гонять инференс в облаке (поиск, batch-обработка, асинхронная модерация), либо принять Edge-латентность на устройстве с одним потоком. Это также модель, по которой меряют точность всем остальным open-vocab детекторам – когда читаете заявку конкурента «мы построили свой zero-shot детектор», следующий вопрос: «как он сравнивается с Grounding DINO 1.6 Pro на LVIS-rare?».
Florence-2 – Мультизадачный универсальный
Florence-2 представлен Microsoft Research на CVPR 2024 как open-source vision-language foundation model. Релиз сделал одну инженерную ставку: вместо отдельных моделей для детекции, сегментации, генерации описаний и OCR Microsoft построил единый seq-2-seq трансформер, обрабатывающий все задачи через унифицированный интерфейс промптов. Попросите детекцию через <OD>, dense captioning через <DENSE_REGION_CAPTION>, visual grounding через <CAPTION_TO_PHRASE_GROUNDING>, OCR через <OCR> и ещё дюжину задач – всё это работает через одну модель и единый API-интерфейс.
Модель доступна в двух размерах – Florence-2-base (~230 миллионов параметров) и Florence-2-large (~770 миллионов) – и обучена на датасете FLD-5B, включающем около 126 миллионов изображений и 5,4 миллиарда аннотаций по различным поддерживаемым задачам. Благодаря унифицированному обучению Florence-2 обеспечивает мультизадачный охват при относительно небольшом числе параметров по сравнению с узкоспециализированными моделями.
Числа детекции – не заголовок. На COCO в режиме zero-shot transfer Florence-2 показывает около 34,7 mAP, что заметно ниже 50+ AP, которых достигают специализированные модели вроде UNINEXT или Grounding DINO. Команда Microsoft прямо говорит о компромиссе: Florence-2 – универсальная модель, и для систем, где требуется детекция уровня state-of-the-art, правильным решением будет дообучение Florence-2 на целевом домене или использование специализированного детектора. Статья по Florence-2 показала, что дообучение на конкретной задаче быстро сокращает разрыв: Florence-2-large, дообученная на COCO, повторяет или превосходит DINO по качеству детекции, оставаясь при этом мультизадачной после файнтюна.
Причина, по которой продуктовой команде стоит рассмотреть Florence-2, – её эффективность и универсальность. Модели требуется всего около 862 МБ VRAM на RTX A5000 для выполнения инференса – этого достаточно, чтобы делить GPU с другими моделями. Унифицированный prompt-интерфейс позволяет одной модели выполнять четыре задачи: детекцию объектов, OCR, dense captioning и visual grounding – всё в одном развертывании. Для видеопродукта, которому необходимы все четыре функции (например, OTT-пайплайн модерации с детекцией объектов, распознаванием текста на экране, генерацией описаний для доступности и привязкой фраз для соответствия требованиям), Florence-2 объединяет четыре модели в одну, упрощая интеграцию, мониторинг и снижая стоимость инференса.
Лицензия Florence-2 необычно дружелюбна для продакшена: модель выпущена под MIT на Hugging Face (microsoft/Florence-2-base, microsoft/Florence-2-large, а также -ft варианты), что позволяет использовать её в коммерческих целях без каких-либо контрактных обязательств. Это выделяет Florence-2 в отдельную коммерческую категорию по сравнению с YOLO от Ultralytics или API Grounding DINO 1.5 / 1.6 Pro.
В 2026 году Florence-2 – правильный выбор, когда продукту нужна не просто детекция и планка точности «хватит», а не «state of the art». OTT-модерация, пайплайны captioning для доступности, document-ai workflow по кадрам видео и любая мультизадачная фича, где стоимость эксплуатации четырёх моделей превысит стоимость одного файнтюна – канонические кейсы.
OWLv2 – Zero-Shot Baseline от Google
OWLv2 (от Open-World Localization, version 2) представлен Маттиасом Миндерером, Алексеем Гриценко и Нилом Хоулсби в статье «Scaling Open-Vocabulary Object Detection». OWLv2 – наследник OWL-ViT, оригинального open-vocab детектора Google 2022 года, и та версия, к которой стоит стремиться, если ваша стратегия предобучения соответствует подходу Google на основе CLIP и псевдо-меток.
Архитектура прямая. OWLv2 использует CLIP в качестве мульти-модальной основы – ViT-стильный трансформер кодирует изображение, а causal LM обрабатывает текст. Финальный слой токен-пулинга в image-трансформере исключён, и вместо него к каждому выходному токену подключены лёгкая голова классификации и голова для определения границ (box-голова). Открытая классификация по словарю реализуется заменой фиксированных весов финального классификатора на текстовые эмбеддинги, полученные из строковых запросов: модель «узнаёт» класс, когда эмбеддинг его названия совпадает с визуальными признаками региона. OWLv2 добавил к OWL-ViT классификатор objectness – голову, предсказывающую вероятность наличия объекта в боксе, – что повысило точность, подавив высокорекольный шум предыдущей модели.
Стратегия обучения – вторая отличительная черта OWLv2. Модель обучалась на датасете веб-масштаба, содержащем более миллиарда пар «изображение–текст», причём OWL-ViT v1 генерировал псевдометки на более обширном корпусе – название статьи «scaling open-vocabulary object detection» в данном случае буквально отражает суть. В результате получилась модель, видевшая значительно более широкий спектр визуальных понятий, чем мог бы охватить любой обучающий набор, ориентированный исключительно на детекцию.
Hugging Face Hub хостит пять доступных моделей: google/owlv2-base-patch16 и google/owlv2-large-patch14 (стандартные zero-shot модели), google/owlv2-base-patch16-ensemble и google/owlv2-large-patch14-ensemble (ансамблевые модели для повышения точности), а также google/owlv2-base-patch16-finetuned (дообученная под конкретные задачи). На все модели распространяется лицензия Apache 2.0.
Слабость OWLv2 в 2026 году – более низкий предел точности по сравнению с Grounding DINO. Если Grounding DINO 1.6 Pro показывает 55,4 AP в zero-shot режиме на COCO, то OWLv2 даёт около 30–40 AP в зависимости от конфигурации. В проектах, где критична максимальная точность, предпочтение отдают Grounding DINO. Вторая проблема – пользовательский опыт: ввод в OWLv2 представляет собой список строк (по одной на класс), а не свободную фразу, поэтому возможность «просто описать, что нужно» – такой удобный UX, который работает из коробки в Grounding DINO, – здесь недоступна в той же степени.
В 2026 году OWLv2 – правильный выбор, если нужен permissively-лицензированный zero-shot детектор, работающий быстрее Grounding DINO за счёт некоторой потери точности; если предпочтительна философия предобучения от Google; или если промпты – это короткие noun-phrase названия классов, а не сложные referring expressions. Кроме того, это самая удобная модель для дообучения на домен: её архитектура проще трёхстадийного фьюжна Grounding DINO, а обучающий пайплайн – более доступный.
RT-DETR – Real-Time End-to-End Трансформер (закрытый словарь, но близко)
В этой статье RT-DETR представлен рядом с open-vocab моделями, а не как их часть, но оценить open-vocab стек в 2026 году без упоминания RT-DETR невозможно – это та модель, которая доказала, что детекция на основе трансформеров в принципе может работать в реальном времени. До появления RT-DETR любая команда, сравнивающая подходы к детекции, сталкивалась с жёстким выбором: свёрточные детекторы (семья YOLO) – быстрые, трансформерные детекторы (семья DETR) – точные или гибкие, но медленные. RT-DETR этот барьер преодолел.
Оригинальный RT-DETR был представлен в 2023 году как первый real-time end-to-end детектор на основе трансформеров. Архитектура использовала эффективный гибридный энкодер, выбор запросов с учётом IoU и многоуровневое слияние признаков, чтобы достичь точности на уровне DETR при скорости, сопоставимой с YOLO. RT-DETRv2 (середина 2024 года) добавил «bag of freebies» – инкрементальные улучшения на этапах обучения и инференса – повысив точность без изменения истории развёртывания. RT-DETRv3 (WACV 2025, устная презентация, статья arXiv:2409.08475) обратился к проблеме несоответствия плотности супервизии в детекции на основе трансформеров: семейство DETR использует однозначное двудольное сопоставление при обучении, что даёт каждому объекту из ground truth ровно один положительный пример, тогда как свёрточные детекторы применяют метки на основе якорей с отношением один-ко-многим, обеспечивая модели более сильный сигнал супервизии на каждом шаге обучения. RT-DETRv3 ввёл иерархическую плотную положительную супервизию, восстановив этот сигнал без нарушения end-to-end свойств модели.
Числа бенчмарков на 2025 год впечатляют. RT-DETR-R50 показывает 53,1% AP при 108 FPS на GPU T4, обгоняя YOLOv8-L и по точности, и по скорости. RT-DETRv3-R18 (самый компактный вариант v3) – 48,1% AP, что на 1,6 пункта выше, чем у эквивалентного RT-DETR-R18, и на 1,4 пункта выше, чем у RT-DETRv2-R18 – при той же задержке. Последний follow-up, RT-DETRv4, вводит Deep Semantic Injector, подающий семантику от vision-language foundation model в глубокий CNN-бэкенд на этапе обучения – что повышает AP без дополнительных затрат на развертывание: модель v4 экспортируется в тот же ONNX/TensorRT-рантайм, что и v3, но при этом точнее.
Пакет Ultralytics поддерживает RT-DETR через тот же пайплайн обучения и экспорта, что и YOLO – то есть командам, уже использующим инструментарий Ultralytics, не нужно осваивать вторую систему инструментов ради детекции на основе трансформеров. Лицензия сохраняет ту же двойную модель – AGPL-3.0 open-source и enterprise-версия – что применяется в семействе YOLO через Ultralytics.
Релевантность RT-DETR для open-vocab статей – двойная. Во-первых, RT-DETR является closed-vocab baseline, против которого в продакшене оценивают open-vocab модели: если у вас уже работает RT-DETR в рамках заданного бюджета латентности, а список классов достаточно мал, чтобы переобучать модель при изменениях, переход на open-vocab решение приведёт к регрессии по скорости и, скорее всего, по точности. Во-вторых, линейки open-vocab моделей и RT-DETR теперь пересекаются: новейшие гибридные архитектуры расширяют real-time трансформер-архитектуру RT-DETR с помощью text-conditioned голов – так RF-DETR (следующая секция) достигает показателей 2026 года.
RF-DETR – Real-Time Detection Transformer 2026 года
RF-DETR – модель 2026 года, которая наконец превратила утверждение «реальное время детекции на основе трансформеров со скоростью YOLO» из исследовательской мечты в обязательство для внедрения. Релиз от Roboflow, вышедший в начале 2025 года, был принят на ICLR 2026, а статья «RF-DETR: Neural Architecture Search for Real-Time Detection Transformers» (arXiv:2511.09554) описывает архитектуру и процедуру поиска, в результате которой была получена линейка моделей.
Архитектурная основа – использование DINOv2 vision transformer backbone, self-supervised ViT от Meta, одной из самых сильных открытых vision-foundation моделей в 2026 году, – в сочетании с декодером детекции, оптимизированным с помощью neural architecture search (NAS) под режим реального времени. Поиск по пространству архитектур NAS проводил подбор по ширине бэкбона, его глубине, глубине декодера и структуре агрегации признаков – с целью найти комбинацию, максимизирующую точность при фиксированном ограничении по задержке. Результат – семейство моделей RF-DETR-Nano, Small, Medium, Base (29M параметров), Large (128M параметров), XLarge и 2XLarge, охватывающее тот же диапазон развёртываний – от edge до cloud – что и линейка YOLO, но с более высокой точностью на миллисекунду.
Числа бенчмарков – почему модель важна в 2026 году. RF-DETR-Nano – 48,0 AP на COCO, опережает D-FINE-Nano на 5,3 AP при сопоставимой латентности – преимущество, которое не появляется в бенчмарках инкрементальных релизов и указывает на архитектурный прорыв. RF-DETR-Large – 56,5 AP при 6,8 мс на NVIDIA T4 GPU с TensorRT FP16. RF-DETR-2XLarge – 60,1 AP на COCO – первая модель в реальном времени, преодолевшая порог в 60 AP, значение, которое два года назад было закрытым для open-vocab задач и считалось недостижимым.
История domain-adaptation – где RF-DETR занимает своё место в open-vocab-диалоге. На бенчмарке RF100-VL – собственном тесте Roboflow, оценивающем переносимость детектора с предобучения на COCO на 100 разнообразных доменов, включая аэрофото, микроскопию, документы и медицинские изображения, – RF-DETR-2XLarge опережает Grounding DINO-Tiny на 1,2 AP и при этом работает в 20 раз быстрее. Сам по себе RF-DETR не является open-vocab-детектором (не принимает текстовые промпты на вход), но Roboflow позиционирует его как closed-vocab-бэкенд, который дообучают на целевом домене после использования open-vocab-детектора для автоматической разметки обучающих данных – workflow, ставший каноническим шаблоном 2026 года для быстрой разработки кастомных детекторов.
Структура лицензирования заслуживает внимания. Core-модели (Nano до Large) и весь код выпущены под Apache 2.0 – одной из самых пермиссивных лицензий среди real-time детекторов, что даёт существенное коммерческое преимущество перед AGPL-3.0 у Ultralytics YOLO. Модели XLarge и 2XLarge требуют пакет rfdetr[plus] и распространяются под лицензией PML 1.0 – более ограничительной для самых точных вариантов. Такой подход с разделённой лицензией позволяет команде начать с пермиссивной Large-модели и оценить, оправдывают ли дополнительные 3–4 AP апгрейд до 2XLarge-варианта.
В 2026 году RF-DETR – правильный выбор с закрытым словарём для нового проекта, которому нужна точность выше, чем у YOLO при той же латентности, требуется лицензия Apache 2.0 для модели в продакшене, а также используется инструментарий Roboflow (Roboflow Train, Roboflow Workspace, Supervision для аннотации). Это также модель, замыкающая канонический пайплайн 2026 года: Grounding DINO на входе (автоматическая разметка новых данных по текстовым промптам), RF-DETR на выходе (быстрый детектор с закрытым словарём на размеченных данных).
Сравнение пяти моделей в продакшене
Таблица ниже объединяет четыре детектора с открытым словарём, а также RT-DETR и RF-DETR, в единую схему принятия решений. Анализируйте по строкам – та, что соответствует самым жёстким ограничениям проекта, определяет окончательный выбор.
| Decision-ось | Grounding DINO 1.6 Pro | Florence-2 | OWLv2 | RT-DETRv3 | RF-DETR |
|---|---|---|---|---|---|
| Тип | Open-vocab | Multi-task VLM (incl. OVD) | Zero-shot OVD | Closed-vocab | Closed-vocab |
| Автор | IDEA Research | Microsoft Research | Google Research | Baidu (PaddlePaddle) | Roboflow |
| Первый релиз | Март 2023 (1.0); янв 2025 (1.6 Pro) | Июнь 2024 | Июнь 2023 (v1: янв 2022) | Июль 2023; v3 в 2024 | Март 2025 |
| Backbone | Swin-T / Swin-L / ViT-L | DaViT (B: 230M, L: 770M) | CLIP ViT-B/16, ViT-L/14 | ResNet-18/50/101 | DINOv2 ViT |
| Prompt-интерфейс | Свободный текст + referring expressions | Task-токены + текст | Список noun-фраз | Нет (класс-лист на обучении) | Нет (класс-лист на обучении) |
| COCO AP (zero-shot или trained) | 55.4 (zero-shot, 1.6 Pro) | ~34.7 (zero-shot) | ~30–40 | 53.1 (trained, R50) | 60.1 (trained, 2XL) |
| LVIS | 57.7 minival / 51.1 val (1.6 Pro) | Ниже специалистов | Сильный zero-shot | N/A | N/A (closed-vocab) |
| Типичная латентность | 100–200 мс (A100) | ~30–60 мс (RTX A5000) | ~50–80 мс (T4) | ~9 мс (T4, R50) | 6.8 мс (T4, FP16, Large) |
| Мульти-задачи | Detection + grounding | 10+ задач | Только детекция | Только детекция | Detection + segmentation |
| Open-source лицензия | Apache 2.0 (1.0 веса – research-use) | MIT | Apache 2.0 | Apache 2.0 | Apache 2.0 (core); PML 1.0 (XL/2XL) |
| API / hosted | IDEA Research API | Hugging Face + Azure | Hugging Face | Ultralytics / PaddlePaddle | Roboflow Inference |
| Дефолт 2026 для | Авто-разметка + cloud-поиск | Мульти-задачный универсал | Пермиссивный zero-shot baseline | Real-time, Apache 2.0, зрелый toolchain | Real-time, max точность, Apache 2.0 |
Рисунок 3. Матрица решений для пяти моделей. Значения латентности взяты из официальной документации или рецензируемых статей для стандартного разрешения входных данных и batch=1; абсолютные значения зависят от версии TensorRT, размера изображения и уровня квантизации.
Рабочий пример – ритейл loss prevention с открытым класс-листом
Чтобы сделать выбор модели конкретным, рассмотрим проект по снижению потерь в ритейле, где система безопасности должна еженедельно создавать новые категории оповещений без переобучения. Нагрузка – 50 магазинов, по 4 камеры в каждом (вход, две камеры в проходе, выход), с видео 1080p в формате H.264, 30 кадров в секунду. Инференс запускается со скоростью 4 кадра в секунду на камеру при обнаружении движения. Пиковая нагрузка составляет 50 × 4 × 4 = 800 инференсов в секунду по всему парку камер, снижаясь до примерно 100 в секунду в нерабочее время.
Список категорий растёт каждый месяц: «человек с открытым чемоданом», «человек у холодильника без корзины», «пролитая жидкость в проходе», «битое стекло». Базовая модель с закрытым словарём – YOLOv11, дообученная на первые 12 категорий, – работает первые шесть недель, но выходит из строя, когда служба безопасности добавляет три новые категории, для которых пока нет размеченных обучающих данных. Переобучение YOLOv11 заняло бы 4–6 недель на сбор данных, разметку и обучение, а новые категории нужны службе безопасности уже в ту же неделю.
Продакшен-пайплайн 2026 года – двухуровневый деплой. Tier 1 (real-time, на каждом кадре) запускает RF-DETR-Large на тех же 12 категориях, дообученных на данных клиента. На четырёх GPU NVIDIA L4 ($1,10/час на AWS в 2026 году) RF-DETR-Large в режиме FP16 обрабатывает около 250 инференсов в секунду на GPU при разрешении 1080p, легко справляясь с пиковыми нагрузками до 800 инференсов в секунду. Месячная стоимость: 4 × $1,10 × 24 × 30 = $3 168.
Tier 2 (отложенный, на каждое motion-событие) запускает Grounding DINO 1.6 Edge на новых категориях, которые система безопасности обнаружила за эту неделю. Edge-версия тяжёлая – около 80 мс на изображение в режиме INT8 на той же L4 – но она работает только на кадрах, сработавших по motion-триггеру, что составляет около 5–10% от общего числа кадров. Один дополнительный L4 покрывает Tier 2, добавляя $792 в месяц и давая флоту суммарно $3 960/месяц.
Неочевидное преимущество этого дизайна – Tier 2 автоматически размечает обучающие данные для Tier 1. Каждая детекция Grounding DINO по новой категории сохраняется вместе с кадром; как только для категории накапливается 500–1 000 размеченных примеров, автоматическая задача ретрейна добавляет её в следующий fine-tune RF-DETR. Система обучается непрерывно, новые категории становятся доступны для безопасности в режиме реального времени – буквально через несколько минут после ввода, – при этом стоимость инференса на кадр остаётся на уровне закрытого словаря: Grounding DINO не работает на критическом пути.
Команда, решавшая ту же задачу с использованием Grounding DINO 1.6 Pro на каждом кадре, потребовала бы около 8–10 GPU L4, чтобы уложиться в задержку модели более 100 мс – это обошлось бы в $7 920–$9 900 в месяц, что в два-три раза дороже двухуровневой архитектуры при существенно худшей задержке.
Типичные ошибки – три самых частых
Ловушка 1: Считать «open-vocabulary» универсальной заменой closed-vocab. Команды, только что представившие Grounding DINO, иногда предлагают заменить YOLOv11-пайплайн на Grounding DINO для каждого кадра, чтобы «защитить систему от будущего». Это почти всегда ошибка. Модели с открытым словарём в 10–20 раз медленнее на кадр и на 5–15 AP уступают по точности на классах, с которыми они эффективно сталкивались при предобучении. Правильная архитектура – двухуровневая, как в приведённом выше примере: closed-vocab на горячем пути, open-vocab – как резервный вариант и инструмент автоматической разметки.
Ловушка 2: Недооценить prompt engineering. Grounding DINO чувствителен к формулировке промпта. Фразы «человек с чемоданом», «человек, несущий чемодан» и «кто-то с чемоданом» на одном и том же кадре дают разные результаты детекции. Команды, продающие продукт, в котором промпты вводит конечный пользователь, обязаны использовать слой шаблонов промптов, который преобразует пользовательский ввод в формулировки, лучше воспринимаемые моделью, а также настроить порог уверенности (confidence threshold) для каждого шаблона. Без такого слоя поведение продукта будет казаться пользователю случайным: категория, введённая два месяца назад, «работает», а похожая, введённая сегодня – нет, потому что формулировка перешла невидимый для пользователя порог.
Ловушка 3: Игнорировать колонку «лицензия». Пять моделей в этой статье распространяются по четырём разным лицензионным режимам – Apache 2.0, MIT, AGPL-3.0 / Enterprise и коммерческому IDEA Research API – и разница становится ощутимой, когда продукт переходит от прототипа к коммерческому использованию. Многие команды запускают демо на основе Grounding DINO 1.0, используя open-source веса, и спустя полгода обнаруживают, что эти веса предназначены исключительно для исследовательских целей, а версии 1.5 / 1.6 Pro требуют заключения контракта с IDEA Research, на оформление которого уходит до шести недель. Колонку «лицензия» нужно читать с первого дня, а не в день запуска.
Где лежит Фора Софт
Фора Софт поставляет видеопродукты с 2005 года – в системах видеонаблюдения, ритейл-аналитики, телемедицины, e-learning и OTT-модерации – тех самых отраслях, где open-vocabulary detection кардинально меняет границы возможного. В нескольких наших недавних проектах мы заменили закрытый YOLO-пайплайн на двухуровневую архитектуру из этой статьи, используя Grounding DINO или Florence-2 на втором уровне, чтобы обрабатывать запросы на изменение списка классов за минуты, а не за недели. Интеграционная работа – создание шаблонов промптов, настройка порога уверенности, автоматическая разметка, ритм переобучения – сосредоточена на большей части инженерных рисков, и именно эту работу мы выполняем при внедрении таких архитектур у клиентов. Если в дорожной карте продукта стоит задача «позволить оператору добавлять новые категории без переобучения» – open-vocabulary детектор и есть то, что превращает эту цель в реальность.
Что Запомнить
- Open-vocabulary detection – текст на вход, боксы на выходе, без переобучения на новые классы; к 2026 году это уже готовый к продакшену паттерн, а не исследовательская демонстрация.
- Grounding DINO 1.6 Pro – достиг предела точности (55,4 AP в zero-shot режиме на COCO) и является оптимальным выбором для облачных решений, автоматической разметки и поисковых сценариев.
- Florence-2 – универсальный мультизадачный инструмент (обнаружение, сегментация, OCR, генерация описаний, grounding), работающий с меньшей точностью по отдельным задачам, но объединённый в одну модель с лицензией MIT.
- OWLv2 – zero-shot baseline с лицензией Apache 2.0; его точность ниже, чем у Grounding DINO, но он лучше подходит для файнтюна и быстрее разворачивается в продакшене.
- RT-DETRv3 и RF-DETR – детекторы с фиксированным словарём для реального времени; RF-DETR-2XL показал 60,1 AP на COCO, впервые в истории преодолев порог в 60 для реального времени.
- Канонический паттерн 2026 года – двухуровневый: на «горячем» пути используется детектор с фиксированным словарём (YOLO / RT-DETR / RF-DETR), а open-vocabulary решения (Grounding DINO / Florence-2) применяются как fallback и для автоматической разметки.