SAM 2 Для Видео – Memory Module, Propagation, Rotoscoping/ROI

Автор: Николай СапуновОбновлено: август 202624 мин чтения
Содержание статьи +

Кратко

Segment Anything Model 2, или SAM 2, – это foundation-модель компьютерного зрения от Meta (2024), которая берёт один клик, box или маску на одном кадре видео и возвращает пиксельно точную маску этого объекта на каждом другом кадре – без переобучения, без ручной анимации по ключевым кадрам и почти в реальном времени. Модель расширяет оригинальный Segment Anything (image-only сегментатор 2023 года) streaming memory-модулем, который помнит, как объект выглядел на предыдущих кадрах, и пропагирует маску вперёд – это то, что превратило promptable video segmentation из исследовательского демо в продакшен-фичу. Четыре варианта модели поставляются под Apache 2.0 – Tiny (38.9M параметров, 91 FPS на A100), Small, Base+ и Large (224.4M параметров, ~30 FPS); датасет SA-V (51K видео, 643K масклетов) – крупнейший открытый корпус для видео-сегментации. Эта статья проходит, как SAM 2 устроена внутри, когда её брать под rotoscoping, ROI-кроппинг, surveillance, телемедицину и OTT-модерацию, и как обходить три известные failure-режима – дрейф на длинных видео, путаница с distractor'ами и потеря качества на волосах и тонких структурах.

Зачем Это Важно

Если ваш видео-продукт должен изолировать конкретный объект на множестве кадров – человека на видеонаблюдении, контур опухоли на хирургической записи, продакт-плейсмент на UGC-клипе, лицо для анонимизации в архиве – у вас два варианта. Первый – классический CV-пайплайн: детектор находит объект, трекер удерживает ID между кадрами, сегментатор (Mask R-CNN, DeepLab) рисует полигон. На сборку такого пайплайна под одну задачу уходят недели, и он ломается ровно в тот момент, когда заказчик просит класс, которого вы не обучали. Второй вариант – SAM 2: один клик на кадре ноль, маски на всех остальных, без обучения, без классового списка, без цикла ретрейна. Выбор не всегда очевиден – SAM 2 тяжелее на кадр, чем YOLO + tracker, и промпт надо откуда-то взять – но для любого продукта, где человек или vision-language модель говорят «трекать вот это конкретно», SAM 2 стала дефолтным строительным блоком. Статья предполагает, что вы уже читали урок 2.2 про YOLO в продакшене – потому что канонический 2026-паттерн это detect-then-segment – и урок 2.3 про open-vocabulary детекцию, потому что Grounding DINO – самый распространённый front-end, поставляющий SAM 2 начальный промпт. К концу статьи вы сможете спроектировать интеграцию SAM 2, выбрать правильный чекпойнт, продумать стратегию propagation на длинном видео и избежать типичных ошибок, которые мы видим в первых интеграциях.

Что SAM 2 Реально Из Себя Представляет

SAM 2 – сокращение от Segment Anything Model 2 – выпущена группой FAIR (Fundamental AI Research) внутри Meta 29 июля 2024 года вместе со статьёй «SAM 2: Segment Anything in Images and Videos» (arXiv:2408.00714) авторства Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu и соавторов. Статья, репозиторий кода facebookresearch/sam2 на GitHub, четыре предобученных чекпойнта, интерактивное веб-демо и обучающий датасет SA-V – всё это выложили в один день под лицензией Apache 2.0. Патч-релиз SAM 2.1 вышел 30 сентября 2024 года с улучшенными чекпойнтами и обновлёнными developer-tools.

Модель делает одну работу и делает её хорошо: берёт видео и prompt – один point click, box или нарисованную от руки маску – поданный на одном произвольном кадре этого видео, и выдаёт пиксельно точную сегментационную маску того же объекта на каждом кадре, в обоих временных направлениях. Та же модель работает и на стилл-картинках; когда вход – одно изображение, memory-модуль пустой и модель ведёт себя ровно как оригинальный SAM. Это и есть контракт: один промпт на вход, маски на каждом кадре на выход, без классового списка и без переобучения.

Почему это не инкрементальное улучшение по сравнению с прежними VOS (video object segmentation) моделями, а ступенька – из-за слова promptable. Старые VOS-системы – XMem, AOT, DeAOT, STCN – тоже пропагировали маску по видео, но пользователю надо было сначала вручную нарисовать маску на первом кадре. SAM 2 принимает один клик, и человеческая работа сокращается с минут до секунд; модель также принимает дополнительные клики посреди видео для коррекции – значит человек в петле, но без кисточки в руке. Эта разница – promptable propagation против initialised propagation – превратила технологию из ниши в инструмент, идущий в rotoscoping-софт, surveillance-investigation tools и системы просмотра медицинского видео.

Рисунок 1. Контракт promptable-сегментации SAM 2. Один клик на кадре N даёт маски на каждом кадре видео; correction-клик на любом кадре обновляет propagation в обоих направлениях.

Как Устроен Memory Module (И Почему Это Важно)

Единственный кусок архитектуры, отличающий SAM 2 от SAM, – memory module. Все остальные части модели – image encoder, prompt encoder, mask decoder – структурно похожи на SAM с косметическими улучшениями. Memory-модуль – это новая идея, и именно в нём прячется инженерная работа.

Пайплайн работает так. Каждый кадр видео обрабатывается иерархическим vision-трансформером – Hiera, сокращение от hierarchical masked autoencoder, – выдающим многомасштабные image embeddings (фичи со страйдами 4, 8, 16 и 32). Stride-16 и stride-32 фичи идут в слой memory attention; stride-4 и stride-8 минуют память и попадают в mask decoder как high-resolution skip-связи – именно это позволяет декодеру чисто прорисовывать края на тонких объектах.

Слой memory attention – это трансформер-блок, который берёт image embedding текущего кадра как query, а буфер хранимых object-фич с предыдущих кадров – как keys и values. Буфер содержит два типа записей. Первый – стек recent-frame memories: семь самых свежих эмбеддингов кадров плюс предсказанные ими маски, слитые memory-энкодером в per-frame тензоры памяти. Второй – стек prompted-frame memories: эмбеддинги тех кадров, на которые пользователь активно кликал, рисовал box или scribble, хранимые отдельно и с большим весом. Это разделение намеренное – prompted-кадры якорят модель к тому, что имел в виду пользователь; recent-кадры дают модели адаптироваться к изменениям внешности (поворот объекта, смена освещения, частичная окклюзия).

Cross-attention между текущим кадром и этим буфером памяти – это и есть тот сигнал, который говорит mask decoder, какой именно объект сегментировать на текущем кадре. Без памяти модель могла бы сегментировать только то, на что явно указывал промпт – а промпт существует на одном кадре. С памятью модель несёт идентичность объекта вперёд (и назад, потому что буфер наполняется прогоном модели в обоих направлениях от prompted-кадра). Поэтому же correction-клик на кадре 200 обновляет маску на кадре 50: исправленный кадр становится prompted-кадром в памяти, и модель перезапускает propagation от нового якоря.

Image encoder – самая дорогая часть пайплайна с большим отрывом, примерно 70–80% всего compute. Memory attention добавляет, может, 10%. Mask decoder лёгкий. У такого профиля стоимости практические следствия: если вы кликаете один раз на видео и даёте модели пропагировать, стоимость image encoder вы платите по одному разу на кадр независимо от размера модели, а memory attention – единственное место, где длина видео тащит за собой стоимость. Для очень длинных видео (10K+ кадров) почти-квадратичный рост буфера памяти становится боттлнеком – именно это мотивирует follow-up'ы SAM2Long и distractor-aware memory, обсуждаемые ниже.

Рисунок 2. Видео-пайплайн SAM 2. Слой memory attention – это cross-attention между текущим кадром и буфером recent + prompted memories – то, чего не было в SAM 1.

Mask Propagation На Практике

Пользовательское поведение SAM 2 – то, ради чего стоит знать архитектуру. Цикл взаимодействия, упрощённый до базового действия:

  1. Пользователь (или upstream-детектор) ставит промпт – point, box или mask – на любом кадре клипа.
  2. SAM 2 сегментирует этот кадр и формирует маску плюс внутреннюю память «вот этот объект, тут, в таком освещении, в такой позе».
  3. Модель прогоняется вперёд и назад по видео, на каждом другом кадре, обусловливая декодер буфером памяти. Каждый кадр получает маску.
  4. Пользователь просматривает. Если маска на каком-то кадре кривая – допустим, модель прыгнула на не того человека на кадре 240 – пользователь делает один correction-клик. Исправленный кадр становится новым prompted-кадром в памяти; модель перепропагирует от этого якоря.
  5. Повторять до тех пор, пока маски не станут правильными. На практике 2–3 correction-клика на минуту материала – типичная норма для кооперативных сцен.

Фраза «correction click» делает больше работы, чем кажется. В прежнем мире XMem / DeAOT фикс ошибки propagation означал вернуться к первому кадру, нарисовать новую маску и заново запустить propagation с нуля – что само по себе часто вносило новые ошибки. В SAM 2 один point на кадре 240 чинит и прямой проход после кадра 240, и обратный к кадру 0, потому что буфер памяти переоценивает prompted-кадр и модель прогоняется end-to-end по новому набору промптов. На длинных клипах с простыми объектами модель можно оставить без присмотра и вмешиваться только в кадры с низкой уверенностью.

Модель также выдаёт несколько кандидатных масок на кадр и occlusion score – выученный сигнал «объекта на этом кадре не видно». Продакшен-пайплайны используют occlusion score, чтобы решить, выдавать ли вообще маску – это лекарство от failure-режима, когда propagation залипает на похожем distractor'е после ухода исходного объекта из сцены.

Четыре Размера Модели – Какой Чекпойнт Брать

SAM 2 поставляется в четырёх размерах, и версии 2.1 (выпущенные в сентябре 2024) – рекомендованный дефолт. Цифры ниже – это публикуемые Meta'ой замеры на NVIDIA A100 при PyTorch 2.3.1, CUDA 12.1 и bfloat16 mixed precision.

ЧекпойнтПараметрыFPS на A100 (видео, вход 1024²)Качество маски (SA-V val J&F)Типичное применение
sam2.1_hiera_tiny38.9M~91НижеEdge / Jetson / cost-sensitive cloud
sam2.1_hiera_small46M~85Ниже-среднеEdge с чуть лучшим качеством
sam2.1_hiera_base_plus80.8M~64Средне-высокоеБольшинство облачных продакшен-нагрузок
sam2.1_hiera_large224.4M~30Самое высокоеAccuracy-bound: rotoscoping, медицина, архив

Рисунок 3. Варианты SAM 2.1. Цифры FPS – single-stream видео-propagation на A100; реальная пропускная зависит от входного разрешения, batch size и интеграции с TensorRT.

Простое правило выбора, выдержавшее проверку на дюжине наших проектов:

  • Если продукт живёт в облаке, потоков меньше тысячи и качество – это headline-фича (rotoscoping для VFX, просмотр медицинского видео) – берите Hiera-Large.
  • Если продукт в облаке с большей concurrency, а качество «нормальное» – берите Hiera-Base+. Это sweet spot по соотношению качество/доллар.
  • Если продукт на edge-железе (Jetson Orin, робототехника, on-device blur) или у вас бюджет под цент за минуту потока – берите Hiera-Tiny и принимайте просадку по качеству. И Roboflow Inference, и Ultralytics SAM 2 wrapper умеют Tiny на Jetson напрямую.

Продакшен-команды публиковали TensorRT-интеграции, у которых инференс Hiera-Large падает с ~5,000 мс на кадр в прототипе до ~123 мс на кадр в продакшене на consumer-GPU (RTX 3070 Ti) – за счёт FP16, Tensor Core acceleration и кастомных memory-оптимизаций. Эта цифра – ~8 FPS на карте за 600 долларов – то, что делает SAM 2 деплоябельной за пределами облака вообще.

Датасет SA-V – Почему Цифры Стоят На Ногах

Модель ровно настолько хороша, насколько хороши данные, на которых её учили – и SAM 2 обучена на крупнейшем открытом датасете видео-сегментации в мире. Датасет Segment Anything Video (SA-V), опубликованный вместе с SAM 2, содержит 50.9K видео и 642.6K масклетов – пространственно-временных треков масок по видео – снятых в 47 странах для визуального разнообразия. Раскладка такая: 190.9K масклетов размечены вручную и 451.7K – model-assisted, сгенерированные dual-stream аннотационным движком (сама SAM 2 в петле плюс ручная верификация). Для сравнения: предыдущий крупнейший открытый VOS-датасет (DAVIS + YouTube-VOS + MOSE) был примерно в 50 раз меньше по числу масок.

Mix обучающих данных, использованный Meta, – примерно 49.5% SA-V, 15.5% SA-1B (оригинальный image-датасет SAM), 15.1% внутренние данные Meta, 9.4% MOSE, 9.2% YouTube-VOS и 1.3% DAVIS. Почему это важно в 2026: когда вы читаете заявку конкурента «мы построили свой VOS», следующий вопрос – «на чём обучали?». Baseline SAM 2 побить сложно, потому что 643K масклетов больше ни у кого нет.

Сам датасет выложен под лицензией Creative Commons Attribution-Share Alike (CC BY-SA) – это строже, чем Apache 2.0 на модель. Большинство продакшен-деплоев используют модель и не трогают датасет; но если ваша команда дообучает на специализированном домене (медицина, промышленный инспектор, хирургия), условия лицензии SA-V имеют значение – fine-tuned веса наследуют copyleft-обязательства на той части, что обучена на изображениях SA-V.

Реальные Кейсы – Где SAM 2 Уже Едет

Rotoscoping И VFX

Rotoscoping – выделение объекта в видео кадр за кадром – классический кейс под SAM 2 и тот, что ближе всего к завершённому product-fit. Профессиональный rotoscoper делает маску за 2–4 часа на секунду материала для сложного объекта (кудрявые волосы, быстрое движение, полупрозрачная ткань). SAM 2 на тот же план выдаёт сопоставимую маску меньше чем за минуту с 2–3 correction-кликами. Open-source инструменты Sammie-Roto и Sammie-Roto 2 – это бесплатные GUI-обёртки поверх SAM 2, повторяющие workflow Adobe Roto Brush и DaVinci Resolve Magic Mask – оба теперь под капотом используют модель из SAM-семейства.

Публикуемый трейд-офф из продакшен-VFX-студий: SAM 2 выигрывает по скорости и проигрывает по edge-fidelity на самых сложных планах. Студия Electric Sheep публично сравнила SAM 2 с собственным пайплайном и резюмировала чисто: SAM 2 – правильный инструмент, когда приоритет – скорость или бюджет; ручной пайплайн всё ещё прав там, где план должен держаться на кинопоказе в 4K. Сложившийся паттерн – двухуровневый: SAM 2 на previz, dailies и проекты меньшего бюджета; ручной roto – на hero-планы.

ROI-Кроппинг Для Генеративного Видео И ASR

Второй крупный кейс менее эффектный, но более частый: вырезать регион видео для подачи в downstream-модель. Генеративный видео-пайплайн (text-to-video, инпейнт, видео-перевод) часто должен работать только по субъекту, а не по фону. ASR-пайплайн с lip-reading нуждается в кропе рта. Авто-зум в видео-редакторе должен забоксить и трекать голову спикера. SAM 2 поставляет пространственную маску; downstream-модель получает чистый, temporally-consistent ROI.

Этот паттерн стоит за продуктами вроде Opus Clip, Submagic и аналогичных «AI video editor», которые предлагают фичу «автоматически переформатировать 16:9 в 9:16, удерживая спикера в центре». Спикера находит face-детектор; SAM 2 пропагирует bounding-маску спикера; область кропа – bounding box этой маски. Пользователь видит «система следует за мной по мере движения» – инженерия это SAM 2 плюс Kalman-фильтр на сглаживание кропа.

Surveillance Investigation

Surveillance – третий канонический fit и тот, где SAM 2 открывает фичи, ранее недоступные. Паттерн: человек-аналитик (или, всё чаще, агент на vision-language модели) просматривает запись в поисках конкретного человека, машины или объекта. Кликает один раз на цель на кадре 1500. SAM 2 выдаёт маски этой цели по всему архиву – минуты, иногда часы материала – которые далее идут в re-identification, motion-analysis или экспорт evidence-пакета.

Follow-up 2025 года SAM2.1++, вводящий distractor-aware memory, был мотивирован именно этим кейсом. Baseline SAM 2 иногда путает похожие объекты (двух людей в одинаковой форме, две машины одного цвета); SAM2.1++ улучшает robustness на multi-object distractor-бенчмарках на 6–8 пунктов за счёт изменения композиции буфера памяти. Для команд surveillance это разница между «система залипла не на ту машину на кадре 200» и «система удержала ту самую машину десять минут».

Телемедицина И Хирургическое Видео

Четвёртый кейс – медицинский: сегментировать орган, образование или хирургический инструмент по кадрам процедуры или диагностической записи. Сама статья SAM 2 рапортует сильный zero-shot перформанс на медицинских видео-бенчмарках, а follow-up работы (SAM2-SGP для medical image segmentation, Q-SAM2 для квантизованного медицинского деплоя, SAM2S для хирургического видео с долгосрочным трекингом) расширили модель в этот домен за счёт task-specific промптинга и квантизации.

В наших проектах по телемедицинским платформам деплой SAM 2 обычно гибридный: модель работает на стороне врача как часть review-инструмента, позволяя кликнуть один раз на регион интереса (узел щитовидной железы, полип, рану) и получить пропагированный контур по записанному видео. Роль врача – верифицировать и корректировать; роль модели – снять рутину. Планка точности высока – мы всегда выбираем Hiera-Large, даже на cloud cost.

Рабочий Пример – Surveillance Re-Identification На SAM 2

Чтобы деплой стал предметным, представьте продукт видеонаблюдения, где аналитик безопасности печатает описание вида «чёрный хэтчбэк у восточного входа», получает список кандидатов-кадров из последних 24 часов и чистый mask-трек подходящей машины для экспорта в evidence-пакет. Нагрузка: 20 камер 1080p, H.264 25 fps, около 2 TB материала в сутки.

Продакшен-пайплайн 2026 года – три стадии.

Стадия 1 – Open-vocabulary детекция (gated). Grounding DINO 1.6 Pro прогоняется на каждом кадре в низком cadence (один кадр на две секунды, ~12 кадров/мин/камера) и выдаёт box'ы по промпту аналитика. Эта стадия не real-time; она крутится batch'ом в Spot GPU пуле и формирует список candidate-events (timestamp + bounding box + similarity score). Стоимость: примерно 0.6 кадр/сек на GPU × 20 камер × Spot $0.40/час ≈ $200/сутки.

Стадия 2 – Propagation SAM 2 (по запросу). Когда аналитик кликает кандидат-событие, SAM 2 Hiera-Base+ прогоняет propagation по окружающей минуте материала (1,500 кадров) на одной L4 GPU. С TensorRT FP16 propagation завершается за ~25 секунд на полную минуту. Каждый on-demand прогон стоит ~$0.008. Аналитик в реальном времени видит клип с маской машины на всех 1,500 кадрах.

Стадия 3 – Re-ID и экспорт evidence. Маскированные кадры идут в CLIP-style re-identification модель, которая выдаёт fingerprint машины, далее матчится по списку candidate-events для поиска всех других появлений той же машины в 24-часовом окне. Совпавшие клипы экспортируются с прожжёнными масками SAM 2 в evidence-пакет.

Полный флот работает на ~$250/сутки в GPU-стоимости – это сильно меньше цента за аналитический запрос – и выдаёт качество вывода (per-pixel маски по минутам материала, та самая машина на нескольких камерах), которое ручной workflow не дал бы и за день на запрос.

Неочевидная инженерная работа в стадии 2. Буфер памяти SAM 2 рассчитан на клипы максимум в несколько сотен кадров; для минуты в 1,500 кадров пайплайн команды ресетит память каждые 300 кадров и re-prompt'ит из последней high-confidence маски предыдущего сегмента. Без такой стратегии ресета propagation начинает дрейфить в районе 500-го кадра – канонический «long-video drift» SAM 2, разбираемый ниже.

Три Типичные Ошибки – Подводные Камни Из Практики

Подводный камень 1: Считать SAM 2 детектором. Команды, впервые встречающие модель, иногда полагают, что SAM 2 можно дать всё видео и сказать «найди всех людей». Нельзя. SAM 2 требует промпт – point, box или mask, – говорящий какой объект сегментировать. Если сперва нужно найти объекты на кадре – нужен детектор перед SAM 2: YOLO для closed-vocabulary, Grounding DINO или Florence-2 для open-vocabulary. Паттерн detect-then-segment – канон 2026 для фич «найти и обвести», и детектор стоит перед SAM 2, а не внутри неё.

Подводный камень 2: Недооценить long-video drift. Буфер памяти SAM 2 держит семь самых свежих кадров плюс prompted-кадры. На видео длиннее нескольких сотен кадров буфер полностью прокручивается и единственным якорем остаётся prompted-кадр; модель постепенно может уплыть на похожий distractor. Решение – либо SAM2Long (training-free memory tree расширение для long-video robustness, выпущено в октябре 2024), либо ручная стратегия ресета: разрезать длинное видео на чанки по 300 кадров, пропагировать каждый чанк независимо, re-prompt'ить на границе чанка из последней high-confidence маски предыдущего. Дрейф чинится; это подводный камень только если команда не знает о нём до деплоя.

Подводный камень 3: Игнорировать occlusion score. SAM 2 выдаёт occlusion score на каждый кадр – выученную вероятность того, что prompted-объект не виден. Команды, потребляющие только маску и игнорирующие occlusion score, генерируют false-positive маски на кадрах, где объект ушёл из сцены. Маска обычно маленькая и неоднозначная, но всё равно рендерится, и downstream-потребитель (модель re-ID, alarm-система) трактует её как реальную детекцию. Лечится одной строкой: если occlusion_score > 0.7 – не выдавать маску на этом кадре. Видели, как одна эта строка чинит жалобу заказчика «система продолжает трекать воздух там, где раньше стоял человек», которую три раза эскалировали.

Где SAM 2 Сидит Относительно Mask R-CNN, XMem И SAM 3

Командам, выбирающим между вариантами, важны три сравнения.

Mask R-CNN – классический baseline instance-сегментации, two-stage детектор (Faster R-CNN) с параллельной mask-головой. Closed-vocabulary, требует переобучения на каждый класс, выдаёт per-frame маски без временной согласованности. Правильный выбор, когда у вас фиксированный классовый список, размеченный обучающий сет и нужна сырая пропускная по маске на отдельный кадр. SAM 2 – правильный выбор, когда классового списка и обучающего сета нет и нужна temporal consistency.

XMem, AOT, DeAOT и остальная pre-SAM-2 VOS-семья берут руками нарисованную маску на первом кадре и пропагируют. Точные, но медленные и не promptable; пользователь даёт начальную маску, а не клик. SAM 2 доминирует над ними по каждому бенчмарку и UX.

SAM 3, выпущенная Meta 19 ноября 2025 года, – принципиально другая модель. SAM 3 вводит Promptable Concept Segmentation: получает фразу-существительное вроде «жёлтое такси» или image exemplar – и сегментирует и трекает каждое появление этого концепта в видео. SAM 3 берётся под вопрос «найти и сегментировать все X», а не «трекать вот этот конкретный экземпляр Y». SAM 2 остаётся правильным выбором под контракт трекай это одно. В 2026 две модели используют вместе: SAM 3 – на find-all-instances проход, SAM 2 (или per-instance голова самой SAM 3) – на per-instance refinement. Adoption SAM 3 будет быстро расти через 2026; эта статья – про SAM 2, потому что это deployed-everywhere baseline, который продуктовая команда должна понимать первым.

Где Здесь Фора Софт

Фора Софт с 2005 года поставляет видео-продукты в видеоконференциях, видеостриминге, OTT, видеонаблюдении, телемедицине и AR/VR – это ровно те вертикали, где SAM 2 переписывает возможное. Мы интегрировали SAM 2 в surveillance-investigation инструменты, где аналитик безопасности кликает один раз на человеке и получает пропагированные маски по минутам материала; в телемедицинские review-системы, где врачи обводят регионы интереса на хранящихся записях; в видео-редакторные фичи, авто-переформатирующие портреты и трекающие спикеров. Инженерная работа интеграции – выбор правильного чекпойнта, размер cadence ресета памяти на длинных видео, проводка occlusion-порогов в downstream-потребителей, проектирование источника промпта (клик человека, handoff детектора, vision-language агент) – это то, где живёт основной риск, и это то, что мы делаем, когда поставляем SAM 2-архитектуры клиентам.

Ключевые Выводы

  • SAM 2 берёт один промпт – клик, box или mask – на любом кадре и возвращает пиксельно точные маски на каждом другом.
  • Memory-модуль – новая идея: буфер recent и prompted кадров, якорящий модель к идентичности целевого объекта во времени.
  • Четыре чекпойнта под Apache 2.0: Tiny (38.9M, 91 FPS), Small (46M), Base+ (80.8M), Large (224.4M, 30 FPS) – выбирать по соотношению качество/цена.
  • SA-V – обучающий датасет на 51K видео и 643K масклетов; открытого конкурента такого масштаба в 2026 нет.
  • Паттерн detect-then-segment доминирует в проде: YOLO или Grounding DINO даёт промпт, SAM 2 даёт маску.
  • Long-video drift, путаница с distractor'ами и обработка окклюзий – три инженерные границы, которые надо продумать до деплоя.

Что Читать Дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.