Содержание статьи +
- Кратко
- Зачем Это Важно
- Что «Open-Vocabulary» Реально Означает В 2026
- Grounding DINO – Потолок Точности
- Florence-2 – Мульти-Задачный Универсал
- OWLv2 – Zero-Shot Baseline От Google
- RT-DETR – Real-Time End-to-End Трансформер (Closed-Vocab, Но Рядом)
- RF-DETR – Real-Time Detection Transformer 2026 Года
- Сравнение Пяти Моделей В Продакшене
- Рабочий Пример – Ритейл Loss Prevention С Открытым Класс-Листом
- Типичные Ошибки – Три Самых Частых
- Где Лежит Фора Софт
- Что Запомнить
- Что Читать Дальше
Кратко
Классический детектор объектов, обученный на 80 классах бенчмарка COCO – person, car, bottle и так далее – может детектировать только эти 80 классов. Если продукту нужно находить «оставленный чемодан», «жёлтый сигнальный жилет» или «пролитую жидкость на полу», детектор приходится либо переобучать с нуля на новом датасете, либо менять на модель, принимающую текст на инференсе. Open-vocabulary detection – это второй путь: семейство моделей, которые берут произвольный текстовый промпт вместе с изображением и возвращают bounding box'ы для того, что промпт описывает, ни разу не видя этого конкретного класс-лейбла на обучении. В 2026 году значимы пять моделей – Grounding DINO (потолок точности), Florence-2 (мульти-задачный универсал), OWLv2 (zero-shot baseline от Google), RT-DETR (real-time end-to-end трансформер закрытой стороны того же пайплайна) и RF-DETR (модель 2026 года, которая впервые взяла 60 AP на COCO в реальном времени). Выбор между ними – это решение по четырём осям (бюджет латентности, потолок точности, prompt-интерфейс, лицензия), и статья проходит пять моделей и это решение.
Зачем Это Важно
Если вы запускаете фичу, где список объектов на детекцию неизвестен на обучении – open-vocabulary detection и есть то, что делает фичу возможной. Типичные сценарии в видео-продуктах: ритейл-loss prevention, где у каждого магазина свой список «что отслеживать на полке»; системы видеонаблюдения, где безопасность набирает новую alert-категорию («оранжевый дорожный конус на парковке») и ожидает, что система начнёт следить через минуту; телемедицина, где врач просит пациента «покажите упаковку и дозу таблеток», а система должна найти ту самую этикетку с дозой, не имея для неё обучающих данных; и OTT/UGC-модерация, где политика-лист меняется быстрее любого ритма ретрейна. Статья предполагает, что вы уже читали урок 2.2 про YOLO в продакшене – потому что решение в 2026 почти всегда сводится к «расширять ли YOLO-пайплайн или заменить его моделью с открытым словарём» – и урок 1.2 про латентность и топологию деплоя, потому что большинство open-vocabulary моделей слишком тяжёлые для edge и живут в облаке либо на жирном сервере. К концу статьи вы сможете прочитать заявку конкурента «AI-powered search», сопоставить её с пятью моделями ниже и сказать инженерам, какая ложится в продукт и почему.
Что «Open-Vocabulary» Реально Означает В 2026
Фраза «open-vocabulary detection» в вендорском маркетинге и слайдах используется небрежно, и эта путаница съедает проектное время. Три понятия лежат на спектре от наименьшей к наибольшей гибкости, и различия чёткие.
Closed-vocabulary detection – это то, что делает любая версия YOLO. У модели в финальный классификационный слой запечён фиксированный список class names – 80 для стандартных COCO-чекпойнтов, больше или меньше для кастомных. На инференсе нельзя попросить класс, на котором модель не училась. Нужен новый класс – переобучаем. Быстро, точно, понятно; это то, что в 2026 году делает почти каждый продакшен видео-продукт на основной детекции.
Zero-shot detection – термин из академических статей про модель, способную детектировать классы, на которых её явно не обучали, за счёт переноса знаний из родственного vision-language предобучения. Модель всё ещё ждёт дискретный список class names на инференсе, но список можно подать текстом, и он не обязан совпадать с обучающими лейблами. Сюда лежат OWL-ViT и OWLv2 от Google. «Zero» в «zero-shot» – это про нуль примеров целевого класса в размеченном детекционном обучающем наборе, а не про нуль контакта с визуальным понятием на предобучении.
Open-vocabulary detection – широкая рамка. Модель берёт произвольный естественный язык – имя категории «жёлтый жилет», фразу «человек с рюкзаком» или даже referring expression «самая левая машина» – и выдаёт bounding box'ы для того, что описано. Контракт – промпт, а не классовый список. Сюда – Grounding DINO, Florence-2 (в режиме детекции) и YOLO-World. На практике большинство команд используют «open-vocabulary» как зонтичный термин, включающий zero-shot, потому что история деплоя одинаковая: текст вход, боксы выход, без переобучения.
Ещё четыре вещи, которые услышите и которые с open-vocabulary detection путать нельзя: prompt-tuning (маленький text-conditioned адаптер на closed-vocab модели – всё ещё требует переобучения при крупных изменениях), referring expression comprehension (найти единственный экземпляр, описанный промптом, а не все экземпляры категории), phrase grounding (привязать каждое существительное в предложении к боксу – задача богаче детекции) и visual question answering (модель отвечает на вопросы об изображении, не выдавая боксов – полезно для описания, бесполезно для детекции).
Для продуктовой команды практический вывод такой: если в дорожной карте есть «пусть пользователи печатают, что искать камерой», или «пусть безопасность добавляет новые alert-категории без переобучения», или «поддержать 200 кастомерских класс-листов без 200 ретрейнов» – вы покупаете open-vocabulary detection. Пять моделей ниже – реалистичные варианты.
Grounding DINO – Потолок Точности
Grounding DINO – модель, которая превратила open-vocabulary detection из исследовательской демки в продакшен-вариант. Представлена в марте 2023-го Шилонгом Лю с соавторами из IDEA Research, опубликована как статья «Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection» (arXiv:2303.05499) и позже принята на ECCV 2024. Open-source код – IDEA-Research/GroundingDINO на GitHub.
Архитектурная идея проста в формулировке и сложна в продакшен-реализации. Grounding DINO взяли DINO – сильный closed-vocab трансформер-детектор той же группы – и слили его с текстом на трёх разных стадиях сети, а не только на финальной голове классификации. Изображение обрабатывается Swin Transformer backbone, который извлекает multi-scale визуальные фичи; текстовый промпт обрабатывается BERT text encoder (максимум 256 токенов); и два потока сливаются через три механизма: feature enhancer с deformable self-attention для изображения и vanilla self-attention для текста плюс cross-attention в обе стороны, language-guided query selection (выбирает image-region токены, наиболее релевантные тексту), и cross-modality decoder, который выдаёт финальные боксы с учётом обоих потоков. Тесная фьюжн на трёх стадиях – то, что дало Grounding DINO перевес в точности; предыдущие open-vocab детекторы сливали текст только на голове, оставляя ранние визуальные слои слепыми к промпту.
Числа точности – то, почему модель стала референсом. Оригинальный Grounding DINO взял 52.5 AP на COCO zero-shot transfer, не видя ни одного COCO-обучающего изображения – лучшие closed-vocab детекторы, обученные на COCO напрямую, тогда показывали около 58 AP. Закрыть большую часть шестипунктового разрыва на COCO, оставаясь zero-shot, – крупный результат. На LVIS – более сложном бенчмарке с 1200 классами, включая много редких – Grounding DINO заметно опередил все предыдущие zero-shot baseline'ы, а вариант на Swin-L побил все предыдущие open-set детекторы.
Эволюция версий важна для продуктовой команды 2026 года. IDEA Research выпустили Grounding DINO 1.5 в мае 2024-го в двух вариациях: 1.5 Pro (более крупный ViT-L backbone с глубокой early-fusion, обучен на больше чем 20 миллионах grounding-аннотированных изображений и целится в потолок точности) и 1.5 Edge (более стройная модель с EfficientViT-L1 backbone, single-scale early fusion и feature enhancer, который cross-attend'ит только к самым глубоким image-фичам – спроектирована под edge-ускорители). Grounding DINO 1.6 Pro вышел в начале 2025-го и подтянул state of the art ещё дальше: 55.4 AP на COCO zero-shot transfer, 57.7 AP на LVIS-minival и 51.1 AP на LVIS-val, с заметным улучшением на LVIS-rare классах – категориях с очень малым числом обучающих примеров, которые как раз и интересуют индустрию, потому что объекты, которые нужнее всего детектировать, чаще всего и имеют меньше всего обучающих данных. DINO-X, follow-up 2024-го, объединяющий детекцию, сегментацию и pose под единой open-world моделью, лежит в той же линейке и расширяет семейство.
Главная слабость Grounding DINO – латентность. Оригинал – около 100–200 мс на кадр на A100 GPU на стандартном разрешении входа, в зависимости от варианта и длины промпта. Это нормально для облачных API, поисковых сценариев и асинхронной модерации, но слишком медленно для real-time пайплайна на 30 fps. Edge-вариант сводит число к ~21.7 мс на кадр на Jetson Orin Nano в INT8 – это уже примерно real-time на одном потоке, но всё ещё тяжело для многокамерных деплоев. Вторая слабость – лицензия: оригинальный open-source код под Apache 2.0, веса выпущены под research use; модели 1.5 / 1.6 Pro доступны через платное API IDEA Research, что правильно для точно-зависимых сценариев, но коммерчески иное, чем гонять чекпойнт локально.
В 2026 Grounding DINO – правильный выбор, когда продукт может либо гонять инференс в облаке (поиск, batch-обработка, асинхронная модерация), либо принять Edge-латентность на устройстве с одним потоком. Это также модель, по которой меряют точность всем остальным open-vocab детекторам – когда читаете заявку конкурента «мы построили свой zero-shot детектор», следующий вопрос: «как он сравнивается с Grounding DINO 1.6 Pro на LVIS-rare?».
Florence-2 – Мульти-Задачный Универсал
Florence-2 представлен Microsoft Research на CVPR 2024 как open-source vision-language foundation model. Релиз сделал одну инженерную ставку: вместо отдельной модели на детекцию, сегментацию, captioning и OCR, Microsoft построил единый seq-to-seq трансформер, обрабатывающий каждую задачу через унифицированный prompt-интерфейс. Просите детекцию через <OD>, dense captioning через <DENSE_REGION_CAPTION>, visual grounding через <CAPTION_TO_PHRASE_GROUNDING>, OCR через <OCR> и ещё дюжину задач – всё через одну модель и одну API-поверхность.
Модель в двух размерах – Florence-2-base на ~230 миллионов параметров и Florence-2-large на ~770 миллионов – и обучена на FLD-5B, большом датасете из ~126 миллионов изображений и ~5.4 миллиардов аннотаций по разным поддерживаемым задачам. Унифицированное обучение и даёт Florence-2 мульти-задачный охват при низком числе параметров по сравнению со специалистами-одиночками.
Числа детекции – не заголовок. На COCO zero-shot transfer Florence-2 даёт ~34.7 mAP, заметно ниже 50+ AP, которые показывают специалисты типа UNINEXT или Grounding DINO. Команда Microsoft проговаривает трейд-офф прямо: Florence-2 – универсал, и для систем, требующих state-of-the-art детекции, правильный ход – дотюнить Florence-2 на целевом домене или взять детектор-специалиста. Статья Florence-2 показала, что fine-tune на downstream-задаче закрывает разрыв быстро – Florence-2-large, дотюненная на COCO, повторяет или обгоняет DINO на детекции, оставаясь мульти-задачной после файнтюна.
Причина, по которой продуктовая команда всё же должна Florence-2 рассмотреть – эффективность и широта. Модели нужно лишь около 862 МБ VRAM на RTX A5000, чтобы крутить инференс – это достаточно мало, чтобы делить GPU с другими моделями; унифицированный prompt-интерфейс означает, что одна модель заменяет четыре – детекцию, OCR, dense captioning, visual grounding – в одном деплое. Для видео-продукта, которому нужны все четыре (OTT-модерация-пайплайн с детекцией объектов, чтением экранного текста, dense-captions для accessibility и phrase-grounding для compliance), Florence-2 свёртывает четыре модели в одну по интеграции, мониторингу и стоимости инференса.
Лицензия необычно дружелюбна для продакшена: Florence-2 выпущена под MIT на Hugging Face (microsoft/Florence-2-base, microsoft/Florence-2-large, плюс -ft варианты), что значит коммерческий деплой без контрактных обременений. Это ставит Florence-2 в другую коммерческую корзину, чем любая Ultralytics-распространяемая YOLO или Grounding DINO 1.5 / 1.6 Pro API.
В 2026 Florence-2 – правильный выбор, когда продукту нужна не только детекция и планка точности «хватит», а не «state of the art». OTT-модерация-пайплайны, captioning для accessibility, document-AI workflow по кадрам видео и любая мульти-задачная фича, где стоимость эксплуатации четырёх моделей превысит стоимость одного файнтюна – канонические юзкейсы.
OWLv2 – Zero-Shot Baseline От Google
OWLv2 (от Open-World Localization, version 2) предложен Маттиасом Миндерером, Алексеем Гриценко и Нилом Хоулсби в статье «Scaling Open-Vocabulary Object Detection». OWLv2 – наследник OWL-ViT, оригинального open-vocab детектора Google 2022 года, и версия, к которой стоит тянуться, если ваша философия предобучения совпадает с подходом Google на CLIP-плюс-pseudo-labels.
Архитектура прямая. OWLv2 использует CLIP как мульти-модальный backbone – ViT-style трансформер кодирует изображение, causal LM кодирует текст. Финальный token-pooling слой image-трансформера убран, и вместо него на каждый выходной токен повешены лёгкая голова классификации и box-голова. Open-vocab классификация работает заменой весов фиксированного финального классификатора на text-embedding вектора, выведенные из строк-запросов: модель «знает» класс, когда text-embedding имени класса совпадает с визуальными фичами региона. OWLv2 добавил поверх OWL-ViT objectness-классификатор – голову, предсказывающую вероятность того, что бокс содержит хоть какой-то объект – что подняло precision, подавив высокорекольный шум прежней модели.
Стратегия обучения – вторая отличительная черта OWLv2. Модель училась на web-scale датасете из больше чем миллиарда image-text примеров, причём OWL-ViT v1 генерировал pseudo-labels на большем корпусе – «scaling open-vocabulary object detection» в заголовке статьи буквальное. Результат – модель, видевшая куда более широкий диапазон визуальных понятий, чем мог бы вместить любой detection-only обучающий набор.
Hugging Face hub хостит пять распространяемых вариантов: google/owlv2-base-patch16 и google/owlv2-large-patch14 (стандартные zero-shot модели), google/owlv2-base-patch16-ensemble и google/owlv2-large-patch14-ensemble (ансамблевое обучение для большей точности), а также google/owlv2-base-patch16-finetuned (дотюнен под конкретные downstream-улучшения). Лицензия Apache 2.0 на всех.
Слабость OWLv2 в 2026 – потолок точности ниже, чем у Grounding DINO. Где Grounding DINO 1.6 Pro даёт 55.4 AP zero-shot на COCO, OWLv2 – ~30–40 AP в зависимости от варианта. Для проектов, где абсолютная точность – ограничение, выбор уходит к Grounding DINO. Вторая слабость – UX: prompting OWLv2 – это список строк (по строке на класс), а не свободная фраза, так что «опишите, что нужно» – UX, который из коробки работает у Grounding DINO – здесь не работает так же.
В 2026 OWLv2 – правильный выбор, когда нужен permissively-лицензированный zero-shot детектор, работающий быстрее Grounding DINO ценой части точности; когда предпочтительна Google-философия предобучения; или когда промпты – короткие noun-phrase имена классов, а не referring expressions. Также это самая чистая модель для файнтюна на домен – архитектура проще трёхстадийной фьюжн Grounding DINO, обучающий пайплайн доступнее.
RT-DETR – Real-Time End-to-End Трансформер (Closed-Vocab, Но Рядом)
RT-DETR в этой статье лежит рядом с open-vocab моделями, а не внутри них, но оценить open-vocab стек в 2026 году без названия RT-DETR невозможно – это та модель, которая доказала, что трансформер-детекция в принципе может работать в real time. До RT-DETR любая команда, сравнивающая варианты детекции, имела жёсткий разрез: свёрточные детекторы (YOLO-семья) – быстрые, трансформер-детекторы (DETR-семья) – точные-или-гибкие, но медленные. RT-DETR этот разрез разрушил.
Оригинальный RT-DETR представлен в 2023 как первый real-time end-to-end transformer-based детектор. Архитектура использовала efficient hybrid encoder, IoU-aware query selection и multi-scale feature fusion, чтобы дать точность уровня DETR на скорости уровня YOLO. RT-DETRv2 (середина 2024) добавил «bag of freebies» – инкрементальные training-time и inference-time улучшения – толкнув точность дальше без смены deployment-истории. RT-DETRv3 (WACV 2025 Oral, статья arXiv:2409.08475) взялся за несоответствие плотности supervision в transformer-based детекции: DETR-семья использует one-to-one bipartite matching на обучении, что даёт каждому ground-truth объекту ровно один positive sample, а свёрточные детекторы используют one-to-many anchor-based label assignment, что даёт модели больше supervision-сигнала на шаг обучения. RT-DETRv3 ввёл иерархическую плотную positive supervision, восстановив сигнал без поломки end-to-end свойства.
Числа бенчмарков на 2025-й впечатляющие. RT-DETR-R50 – 53.1% AP при 108 FPS на T4 GPU, обгоняя YOLOv8-L и по точности, и по скорости. RT-DETRv3-R18 (самый маленький вариант v3) – 48.1% AP, на 1.6 пункта выше эквивалентного RT-DETR-R18 и на 1.4 пункта выше RT-DETRv2-R18 – при той же латентности. Последний follow-up, RT-DETRv4, вводит Deep Semantic Injector, подающий семантику от vision-language foundation model в глубокий CNN-backbone на обучении – что поднимает AP при нулевом deployment-overhead – модель v4 экспортируется в тот же ONNX/TensorRT-рантайм, что и v3, но точнее.
Пакет Ultralytics поддерживает RT-DETR через тот же training и export пайплайн, что и YOLO – то есть команде, уже инвестировавшей в инструментарий Ultralytics, не нужно учить второй toolchain ради трансформер-детекции. Лицензия наследует тот же дуальный трек – AGPL-3.0 open-source плюс enterprise – что использует YOLO-семья через Ultralytics.
Релевантность RT-DETR для open-vocab статьи – двойная. Во-первых, RT-DETR – closed-vocab baseline, против которого open-vocab модели меряют в продакшене: если у вас уже крутится RT-DETR в бюджете латентности и класс-лист достаточно мал, чтобы переобучать при изменениях, перейти на open-vocab – регрессия по скорости и, скорее всего, по точности. Во-вторых, линейки open-vocab и RT-DETR теперь пересекаются: новейшие гибридные модели расширяют real-time трансформер-архитектуру RT-DETR text-conditioned головами – так RF-DETR (следующая секция) достигает чисел 2026 года.
RF-DETR – Real-Time Detection Transformer 2026 Года
RF-DETR – модель 2026 года, которая наконец сделала так, что заявление «real-time трансформер-детекция на скоростях YOLO» перестало быть исследовательской аспирацией и стало deployment-обязательством. Релиз Roboflow начала 2025-го, принят на ICLR 2026, и статья «RF-DETR: Neural Architecture Search for Real-Time Detection Transformers» (arXiv:2511.09554) документирует архитектуру и поисковую процедуру, выдавшую линейку моделей.
Архитектурная основа – использование DINOv2 vision transformer backbone – self-supervised ViT от Meta, один из самых сильных открытых vision-foundation моделей в 2026 году – в комбинации с decoder-ом детекции, оптимизированным neural architecture search (NAS) под режим real-time инференса. NAS-прогон искал по ширине backbone, глубине, глубине decoder-а и структуре feature aggregation – комбинацию, максимизирующую точность при фиксированном бюджете латентности. Результат – семья моделей RF-DETR-Nano, Small, Medium, Base (29M параметров), Large (128M параметров), XLarge и 2XLarge – покрывающая тот же диапазон edge-to-cloud деплоев, что и линейка YOLO, но при большей точности на миллисекунду.
Числа бенчмарков – почему модель важна в 2026 году. RF-DETR-Nano – 48.0 AP на COCO, выигрыш у D-FINE-Nano на 5.3 AP при сопоставимой латентности – маржа, не появляющаяся в бенчмарках инкрементальных релизов и сигнализирующая архитектурный сдвиг. RF-DETR-Large – 56.5 AP при 6.8 мс на NVIDIA T4 GPU с TensorRT FP16. RF-DETR-2XLarge – 60.1 AP на COCO – первая real-time модель, перешагнувшая 60 AP вообще, число, которое два года было closed-vocab аспирационным потолком.
История domain-adaptation – где RF-DETR ложится в open-vocab разговор. На бенчмарке RF100-VL – собственном бенчмарке Roboflow на диверсный набор доменов, проверяющий, как детектор переносится из COCO-предобучения на 100 разных доменов, включая аэрофото, микроскопию, документы и медицинские изображения – RF-DETR-2XLarge обогнал Grounding DINO-Tiny на 1.2 AP и при этом работал в 20 раз быстрее. RF-DETR сам по себе не open-vocab детектор (не принимает текстовый промпт на вход), но Roboflow позиционирует его как closed-vocab backbone, который вы дотюниваете на домене после того, как использовали open-vocab детектор для авто-разметки обучающих данных – workflow, ставший каноническим паттерном 2026 года для быстрой разработки кастомного детектора.
Структура лицензирования заслуживает внимания. Core-модели (Nano до Large) и весь код выпущены под Apache 2.0 – одна из самых пермиссивных лицензий среди real-time детекторов и материальное коммерческое преимущество над AGPL-3.0 у Ultralytics YOLO. XLarge и 2XLarge детекционные модели требуют пакет rfdetr[plus] и выпущены под PML 1.0 – более ограничительная лицензия для самых точных вариантов. Расщеплённая лицензия даёт команде стартануть с пермиссивно-лицензированной Large-модели и решить, оправдывает ли дополнительные 3–4 AP 2XLarge-варианта апгрейд лицензии.
В 2026 RF-DETR – правильный closed-vocab выбор для нового проекта, которому нужна точность выше, чем даёт YOLO при той же латентности, нужна Apache 2.0 для продакшен-модели, и который стандартизировался на Roboflow-инструментарии (Roboflow Train, Roboflow Workspace, Supervision для аннотации). Это также модель, замыкающая канонический пайплайн 2026 года: Grounding DINO на входе (авто-разметка новых данных по текстовым промптам), RF-DETR на выходе (быстрый closed-vocab детектор на размеченных данных).
Сравнение Пяти Моделей В Продакшене
Таблица ниже свёртывает четыре open-vocab детектора плюс RT-DETR / RF-DETR в один decision-вид. Читайте по строкам – строка, совпадающая с самым жёстким ограничением проекта, и определяет выбор.
| Decision-ось | Grounding DINO 1.6 Pro | Florence-2 | OWLv2 | RT-DETRv3 | RF-DETR |
|---|---|---|---|---|---|
| Тип | Open-vocab | Multi-task VLM (incl. OVD) | Zero-shot OVD | Closed-vocab | Closed-vocab |
| Автор | IDEA Research | Microsoft Research | Google Research | Baidu (PaddlePaddle) | Roboflow |
| Первый релиз | Март 2023 (1.0); янв 2025 (1.6 Pro) | Июнь 2024 | Июнь 2023 (v1: янв 2022) | Июль 2023; v3 в 2024 | Март 2025 |
| Backbone | Swin-T / Swin-L / ViT-L | DaViT (B: 230M, L: 770M) | CLIP ViT-B/16, ViT-L/14 | ResNet-18/50/101 | DINOv2 ViT |
| Prompt-интерфейс | Свободный текст + referring expressions | Task-токены + текст | Список noun-фраз | Нет (класс-лист на обучении) | Нет (класс-лист на обучении) |
| COCO AP (zero-shot или trained) | 55.4 (zero-shot, 1.6 Pro) | ~34.7 (zero-shot) | ~30–40 | 53.1 (trained, R50) | 60.1 (trained, 2XL) |
| LVIS | 57.7 minival / 51.1 val (1.6 Pro) | Ниже специалистов | Сильный zero-shot | N/A | N/A (closed-vocab) |
| Типичная латентность | 100–200 мс (A100) | ~30–60 мс (RTX A5000) | ~50–80 мс (T4) | ~9 мс (T4, R50) | 6.8 мс (T4, FP16, Large) |
| Мульти-задачи | Detection + grounding | 10+ задач | Только детекция | Только детекция | Detection + segmentation |
| Open-source лицензия | Apache 2.0 (1.0 веса – research-use) | MIT | Apache 2.0 | Apache 2.0 | Apache 2.0 (core); PML 1.0 (XL/2XL) |
| API / hosted | IDEA Research API | Hugging Face + Azure | Hugging Face | Ultralytics / PaddlePaddle | Roboflow Inference |
| Дефолт 2026 для | Авто-разметка + cloud-поиск | Мульти-задачный универсал | Пермиссивный zero-shot baseline | Real-time, Apache 2.0, зрелый toolchain | Real-time, max точность, Apache 2.0 |
Рисунок 3. Decision-матрица на пять моделей. Числа латентности взяты из официальной документации каждой модели или peer-reviewed статьи на дефолтном разрешении входа и batch=1; абсолютные значения меняются с версией TensorRT, размером изображения и уровнем квантизации.
Рабочий Пример – Ритейл Loss Prevention С Открытым Класс-Листом
Чтобы сделать выбор модели конкретным, представьте проект loss prevention в ритейле, где безопасность должна задавать новые alert-категории каждую неделю без переобучения. Нагрузка – 50 магазинов, по 4 камеры в магазине (вход, две камеры в проходе, выход), 1080p H.264 на 30 fps, инференс срабатывает на 4 fps на камеру при обнаружении движения. Пик-нагрузка – 50 × 4 × 4 = 800 инференсов в секунду по всему флоту, падая до ~100 в секунду в нерабочие часы.
Список категорий растёт каждый месяц: «человек с открытым чемоданом», «человек у холодильника без корзины», «пролитая жидкость в проходе», «битое стекло». Closed-vocab baseline – YOLOv11, дотюненный на первые 12 категорий – работает первые шесть недель и ломается, когда безопасность добавляет три новые категории, для которых ещё нет размеченных обучающих данных. Переобучение YOLOv11 заняло бы 4–6 недель сбора данных, разметки и обучения; безопасности новые категории нужны live на той же неделе.
Продакшен-пайплайн 2026 года – двухуровневый деплой. Tier 1 (real-time, на каждом кадре) запускает RF-DETR-Large на тех самых 12 категориях, дотюненных на данных клиента. На четырёх NVIDIA L4 GPU ($1.10/час на AWS в 2026 году) RF-DETR-Large в FP16 обрабатывает ~250 инференсов в секунду на GPU при 1080p, спокойно держа пик в 800/с. Месячная стоимость: 4 × $1.10 × 24 × 30 = $3 168.
Tier 2 (отложенный, на каждое motion-событие) запускает Grounding DINO 1.6 Edge на новых категориях, которые безопасность набрала на этой неделе. Edge-вариант тяжёлый – ~80 мс на изображение на той же L4 в INT8 – но он работает только на motion-triggered кадрах, что составляет ~5–10% общего объёма кадров. Один дополнительный L4 покрывает Tier 2, добавляя $792/месяц, давая флоту суммарно $3 960/месяц.
Неочевидный выигрыш этого дизайна – Tier 2 ещё и авто-размечает обучающие данные для Tier 1. Каждая детекция Grounding DINO на новой категории сохраняется с кадром; как только для категории накопилось 500–1 000 размеченных примеров, автоматический job ретрейна добавляет категорию в следующий fine-tune RF-DETR. Флот учится непрерывно, безопасность получает новые категории live через минуты после ввода, а per-frame стоимость инференса остаётся на closed-vocab уровне – потому что Grounding DINO не крутится на хот-пути.
Команда, пытающаяся решить эту же задачу с Grounding DINO 1.6 Pro на каждом кадре, потребовала бы ~8–10 L4 GPU, чтобы вытянуть нагрузку на 100+ мс латентности модели, что обошлось бы в $7 920–$9 900/месяц – в два-три раза дороже двухуровневого дизайна при материально худшей латентности.
Типичные Ошибки – Три Самых Частых
Ловушка 1: Считать «open-vocabulary» универсальной заменой closed-vocab. Команды, только что открывшие Grounding DINO, иногда предлагают заменить YOLOv11-пайплайн на Grounding DINO на каждом кадре, чтобы «защитить систему от будущего». Это почти всегда ошибка. Open-vocab модели – в 10–20 раз медленнее на кадр и на 5–15 AP менее точны на классах, которые они эффективно видели на предобучении. Правильная архитектура – двухуровневая, как в рабочем примере выше: closed-vocab на хот-пути, open-vocab как fallback и авто-разметчик.
Ловушка 2: Недооценить prompt engineering. Grounding DINO чувствителен к формулировке промпта. «Человек с чемоданом», «человек, несущий чемодан» и «кто-то с чемоданом» дают на одном кадре разные множества детекций. Команды, продающие продукт, где промпты пишет конечный пользователь, обязаны иметь слой prompt-шаблонов, переписывающий ввод пользователя в формулировки, которые модель обрабатывает лучше всего, плюс шаг тюнинга confidence-threshold на каждый шаблон. Без этого слоя поведение продукта будет выглядеть для пользователя стохастически: категория, набранная два месяца назад, «работает», а похожая, набранная сегодня – нет, потому что формулировка пересекла порог, которого пользователь не видит.
Ловушка 3: Игнорировать колонку «лицензия». Пять моделей в этой статье идут под четырьмя разными лицензионными режимами – Apache 2.0, MIT, AGPL-3.0 / Enterprise и коммерческое IDEA Research API – и разница становится материальной в момент, когда продукт переходит из прототипа в выручку. Многие команды отгружают demo на Grounding DINO 1.0, собранный из open-source весов, и через полгода обнаруживают, что веса 1.0 – research-use only, 1.5 / 1.6 Pro требуют контракт IDEA Research, а внутренний процесс закупок на этот контракт – шесть недель. Читайте колонку лицензии в день один, не в день запуска.
Где Лежит Фора Софт
Фора Софт отгружает видео-продукты с 2005 года – в видеонаблюдении, ритейл-аналитике, телемедицине, e-learning и OTT-модерации – тех самых вертикалях, где open-vocabulary detection меняет, что в принципе возможно. В нескольких наших недавних проектах мы переводили closed-vocab YOLO-пайплайн на двухуровневую архитектуру из этой статьи, используя Grounding DINO или Florence-2 на Tier 2, чтобы обрабатывать запросы на изменение класс-листа за минуты, а не за недели. Интеграционная работа – слой prompt-шаблонов, тюнинг confidence-threshold, авто-разметка, ритм ретрейна – где живёт большая часть инженерного риска, и это та работа, которую мы делаем, когда отгружаем такие архитектуры клиентам. Если в дорожной карте продукта есть «дайте оператору добавлять новые категории без ретрейна» – open-vocab детектор и есть то, что превращает эту строку в реальность.
Что Запомнить
- Open-vocabulary detection – текст вход / боксы выход, без переобучения на новые классы; в 2026 это продакшен-готовый паттерн, не исследовательская демка.
- Grounding DINO 1.6 Pro – потолок точности (55.4 AP zero-shot на COCO) и правильный выбор для cloud / авто-разметки / поисковых сценариев.
- Florence-2 – мульти-задачный универсал (детекция, сегментация, OCR, captioning, grounding) при меньшей точности на задачу, но в одной MIT-лицензированной модели.
- OWLv2 – Apache 2.0 zero-shot baseline; потолок точности ниже Grounding DINO, но чище для файнтюна и быстрее в деплой.
- RT-DETRv3 и RF-DETR – closed-vocab real-time трансформеры; RF-DETR-2XL – 60.1 AP на COCO, впервые в истории real-time детектор перешагнул 60.
- Канонический паттерн 2026 – двухуровневый: closed-vocab детектор (YOLO / RT-DETR / RF-DETR) на хот-пути, open-vocab (Grounding DINO / Florence-2) как fallback и авто-разметчик.