Содержание статьи +
- Кратко
- Зачем это важно
- Что на самом деле представляет собой SAM 2
- Как устроен Memory Module (и почему это важно)
- Mask Propagation на практике
- Четыре размера модели – какой чекпойнт выбрать
- Датасет SA-V – Почему цифры стоят на ногах
- Реальные кейсы – где SAM 2 уже работает
- Рабочий пример – Re-идентификация в системах видеонаблюдения на SAM 2
- Три типичные ошибки – подводные камни из практики
- Где SAM 2 находится по отношению к Mask R-CNN, XMem и SAM 3
- Где здесь Фора Софт
- Ключевые выводы
- Что читать дальше
Кратко
Segment Anything Model 2, или SAM 2, – это foundation-модель компьютерного зрения от Meta (2024), которая по одному клику, ограничивающему прямоугольнику или маске на одном кадре видео выдаёт пиксельно точную маску этого объекта на всех последующих кадрах – без переобучения, без ручной анимации по ключевым кадрам и почти в реальном времени. Модель развивает оригинальный Segment Anything (изображение-ориентированный сегментатор 2023 года), добавив streaming memory-модуль, который запоминает, как объект выглядел на предыдущих кадрах, и распространяет маску вперёд. Именно это превратило promptable video segmentation из исследовательского демо в готовую к использованию в продакшене функцию.
Четыре варианта модели доступны под лицензией Apache 2.0: Tiny (38,9 млн параметров, 91 FPS на A100), Small, Base+ и Large (224,4 млн параметров, около 30 FPS); датасет SA-1B (51 тыс. видео, 643 тыс. маслеток) – крупнейший открытый корпус для видео-сегментации. В этой статье объясняется, как устроена SAM 2 изнутри, когда её стоит использовать для rotoscoping, ROI-обрезки, видеонаблюдения, телемедицины и модерации OTT-контента, а также как обойти три известных режима сбоев – дрейф маски на длинных видео, путаницу с отвлекающими объектами и потерю качества на волосах и тонких структурах.
Зачем это важно
Если ваш видео-продукт должен выделить конкретный объект на множестве кадров – человека на записи с камер видеонаблюдения, контур опухоли на хирургической съёмке, товар в UGC-видео или лицо для анонимизации в архиве – у вас есть два варианта. Первый – классический пайплайн компьютерного зрения: детектор находит объект, трекер сохраняет его идентификатор между кадрами, сегментатор (например, Mask R-CNN или DeepLab) строит полигон. На настройку такого решения под одну задачу уходят недели, а оно ломается в тот момент, когда заказчик просит выделить класс, которого вы не обучали. Второй вариант – SAM 2: один клик на первом кадре – и маски автоматически появляются на всех остальных, без обучения, без списка классов, без необходимости переобучать модель. Выбор не всегда очевиден: SAM 2 требует больше ресурсов на кадр, чем YOLO + трекер, а промпт нужно как-то получить – но для любого продукта, где человек или vision-language модель указывают: «отслеживай именно этот объект», SAM 2 становится стандартным строительным блоком. Статья предполагает, что вы уже читали урок 2.2 про YOLO в продакшене – ведь каноничный паттерн 2026 года – это detect-then-segment – и урок 2.3 про open-vocabulary детекцию, потому что Grounding DINO – самый распространённый front-end, подающий SAM 2 начальный промпт. К концу статьи вы сможете спроектировать интеграцию SAM 2, выбрать подходящий чекпоинт, продумать стратегию распространения масок на длинном видео и избежать типичных ошибок, с которыми сталкиваются при первых интеграциях.
Что на самом деле представляет собой SAM 2
SAM 2 – сокращение от Segment Anything Model 2 – была выпущена группой FAIR (Fundamental AI Research) внутри Meta 29 июля 2024 года вместе со статьёй «SAM 2: Segment Anything in Images and Videos» (arXiv:2408.00714), авторства Nikhila Ravi, Valentin Gabeur, Yuan-ting Hu и соавторов. В один день с публикацией статьи на GitHub был выложен репозиторий кода facebookresearch/sam2, четыре предобученных чекпоинта, интерактивное веб-демо и обучающий датасет SA-1B – всё это под лицензией Apache 2.0. Патч-релиз SAM 2.1 вышел 30 сентября 2024 года с улучшенными чекпоинтами и обновлёнными инструментами для разработчиков.
Модель выполняет одну задачу и делает её хорошо: она принимает видео и prompt – один клик, рамку или нарисованную от руки маску – заданный на произвольном кадре, и выдаёт пиксельно точную сегментационную маску этого же объекта на каждом кадре, как вперёд, так и назад во времени. Та же модель работает и со статичными изображениями: если на вход подаётся одно фото, модуль памяти пуст, и модель ведёт себя точно так же, как оригинальный SAM. Вот и весь контракт: один промпт на входе, маски на каждом кадре на выходе – без необходимости указывать классы объектов и без переобучения.
Почему это не просто инкрементальное улучшение по сравнению с предыдущими моделями VOS (video object segmentation), а настоящий скачок – из-за слова promptable. Раньше, в системах вроде XMem, AOT, DeAOT и STCN, маска тоже распространялась по видео, но пользователю сначала нужно было вручную нарисовать её на первом кадре. SAM 2 требует всего один клик – и объём ручной работы сокращается с минут до секунд. Кроме того, модель позволяет делать дополнительные клики в середине видео для коррекции: человек остаётся в петле, но без кисти в руке. Эта разница – promptable propagation против initialised propagation – превратила технологию из узкоспециализированной ниши в полноценный инструмент, который уже внедряется в софт для ротоскопии, системы анализа видеонаблюдения и программы просмотра медицинского видео.
Как устроен Memory Module (и почему это важно)
Единственный архитектурный элемент, отличающий SAM 2 от SAM, – memory module. Все остальные компоненты модели – image encoder, prompt encoder, mask decoder – структурно схожи с SAM и отличаются лишь косметическими улучшениями. Memory-модуль – это новая идея, и именно в нём сосредоточена основная инженерная работа.
Пайплайн работает следующим образом. Каждый кадр видео обрабатывается иерархическим vision-трансформером – Hiera, сокращение от hierarchical masked autoencoder, – который генерирует многомасштабные image embeddings (фичи со страйдами 4, 8, 16 и 32). Фичи со страйдами 16 и 32 поступают в слой memory attention, а фичи со страйдами 4 и 8 обходят память и передаются в mask decoder в качестве high-resolution skip-связей – именно это позволяет декодеру чётко прорисовывать границы тонких объектов.
Слой memory attention – это трансформер-блок, который использует эмбеддинг изображения текущего кадра в качестве query, а буфер сохранённых фич объектов с предыдущих кадров – в качестве keys и values. В буфере хранятся два типа записей. Первый – стек recent-frame memories: семь самых свежих эмбеддингов кадров вместе с предсказанными масками, объединённые memory-энкодером в тензоры памяти на кадр. Второй – стек prompted-frame memories: эмбеддинги кадров, на которых пользователь активно взаимодействовал – кликал, рисовал рамки или наброски, – хранящиеся отдельно и с повышенным весом. Такое разделение сделано намеренно: prompted-кадры привязывают модель к тому, что имел в виду пользователь, а recent-кадры позволяют модели адаптироваться к изменениям внешнего вида объекта – поворотам, изменению освещения или частичной закрытости.
Cross-attention между текущим кадром и буфером памяти – это и есть сигнал, который сообщает mask decoder, какой именно объект сегментировать на текущем кадре. Без памяти модель могла бы сегментировать только то, на что явно указывает промпт – а промпт действует только в одном кадре. Благодаря памяти модель сохраняет идентичность объекта во времени (и вперёд, и назад, поскольку буфер заполняется при проходе модели в обоих направлениях от промптового кадра). Именно поэтому correction-клик на кадре 200 обновляет маску на кадре 50: исправленный кадр становится промптовым в памяти, и модель перезапускает распространение от нового якоря.
Image encoder – самая дорогая часть пайплайна с большим отрывом: он занимает около 70–80% всех вычислительных затрат. Memory attention добавляет, пожалуй, 10%. Mask decoder – лёгкий. Такой профиль стоимости имеет важные практические последствия: если вы кликаете один раз на видео и позволяете модели распространять результат, стоимость image encoder вы платите всего один раз на кадр – независимо от размера модели. А вот memory attention – единственное место, где длина видео напрямую влияет на стоимость. Для очень длинных видео (10K+ кадров) почти квадратичный рост объёма памяти становится узким местом – именно это и мотивирует появление follow-up’ов SAM2Long и distractor-aware memory, которые обсуждаются ниже.
Mask Propagation на практике
Пользовательское поведение SAM 2 – то, ради чего стоит знать архитектуру. Цикл взаимодействия, упрощённый до базового действия:
- Пользователь (или upstream-детектор) ставит промпт – point, box или mask – на любом кадре клипа.
- SAM 2 сегментирует этот кадр и формирует маску плюс внутреннюю память «вот этот объект, тут, в таком освещении, в такой позе».
- Модель прогоняется вперёд и назад по видео, на каждом другом кадре, обусловливая декодер буфером памяти. Каждый кадр получает маску.
- Пользователь просматривает. Если маска на каком-то кадре кривая – допустим, модель прыгнула на не того человека на кадре 240 – пользователь делает один correction-клик. Исправленный кадр становится новым prompted-кадром в памяти; модель перепропагирует от этого якоря.
- Повторять до тех пор, пока маски не станут правильными. На практике 2–3 correction-клика на минуту материала – типичная норма для кооперативных сцен.
Фраза «correction click» делает больше работы, чем кажется. В прежнем мире XMem / DeAOT исправление ошибок propagation означало возврат к первому кадру, рисование новой маски и повторный запуск propagation с нуля – что само по себе часто вносило новые ошибки. В SAM 2 один point на кадре 240 исправляет и прямой проход после кадра 240, и обратный – к кадру 0, потому что буфер памяти переоценивает prompted-кадр, а модель проходит end-to-end по новому набору промптов. На длинных клипах с простыми объектами модель можно оставить без присмотра и вмешиваться только в кадры с низкой уверенностью.
Модель также выдаёт несколько кандидатных масок на кадр и occlusion score – обученный сигнал о том, что объект на этом кадре не виден. В продакшен-пайплайнах occlusion score используется для решения, стоит ли вообще выдавать маску – это своего рода «лекарство» от режима сбоев, когда распространение маски «залипает» на похожем отвлекающем объекте после того, как исходный объект покидает сцену.
Четыре размера модели – какой чекпойнт выбрать
SAM 2 доступен в четырёх размерах, и версия 2.1 (выпущенная в сентябре 2024 года) – рекомендуемая по умолчанию. Приведённые ниже цифры – это результаты, опубликованные Meta, полученные на NVIDIA A100 при использовании PyTorch 2.3.1, CUDA 12.1 и смешанной точности bfloat16.
| Чекпойнт | Параметры | FPS на A100 (видео, вход 1024²) | Качество маски (SA-V val J&F) | Типичное применение |
|---|---|---|---|---|
| sam2.1_hiera_tiny | 38.9M | ~91 | Ниже | Edge / Jetson / cost-sensitive cloud |
| sam2.1_hiera_small | 46M | ~85 | Ниже-средне | Edge с чуть лучшим качеством |
| sam2.1_hiera_base_plus | 80.8M | ~64 | Средне-высокое | Большинство облачных продакшен-нагрузок |
| sam2.1_hiera_large | 224.4M | ~30 | Самое высокое | Accuracy-bound: rotoscoping, медицина, архив |
Рисунок 3. Варианты SAM 2.1. Цифры FPS – результат single-stream видео-пропагации на A100; реальная пропускная способность зависит от разрешения входных данных, размера пакета и интеграции с TensorRT.
Простое правило выбора, проверенное на дюжине наших проектов:
- Если продукт работает в облаке, количество потоков не превышает тысячи, а качество – ключевая фича (например, ротоскопинг для VFX или просмотр медицинского видео), выбирайте Hiera-Large.
- Если продукт в облаке с высокой нагрузкой, а качество «нормальное» – выбирайте Hiera-Base+. Это оптимальный баланс качества и стоимости.
- Если продукт работает на edge-устройствах (Jetson Orin, робототехника, размытие на устройстве) или ваш бюджет – до цента за минуту обработки потока, выбирайте Hiera-Tiny и будьте готовы к снижению качества. И Roboflow Inference, и обёртка Ultralytics SAM 2 поддерживают Hiera-Tiny на Jetson напрямую.
Продакшен-команды опубликовали интеграции с TensorRT, в которых время инференса Hiera-Large падает с ~5000 мс на кадр в прототипе до ~123 мс на кадр в продакшене на потребительской GPU (RTX 3070 Ti) – благодаря использованию FP16, ускорению через Tensor Core и кастомным оптимизациям памяти. Эта производительность – около 8 кадров в секунду на видеокарте за 600 долларов – и делает SAM 2 реально применимой вне облачной инфраструктуры.
Датасет SA-V – Почему цифры стоят на ногах
Модель настолько хороша, насколько хороши данные, на которых её обучали – и SAM 2 обучена на крупнейшем в мире открытом датасете видео-сегментации. Датасет Segment Anything Video (SA-V), представленный вместе с SAM 2, включает 50,9 тыс. видео и 642,6 тыс. масклетов – пространственно-временных треков масок по видео, снятых в 47 странах для обеспечения визуального разнообразия. Из них 190,9 тыс. масклетов размечены вручную, а 451,7 тыс. – с помощью модели (сгенерированы dual-stream аннотационным движком: сама SAM 2 в петле плюс ручная верификация). Для сравнения: предыдущий крупнейший открытый датасет для задач видео-сегментации (DAVIS + YouTube-VOS + MOSE) был примерно в 50 раз меньше по количеству масок.
Смешанный набор обучающих данных, использованный Meta, состоит примерно из 49,5% SA-Video, 15,5% SA-1B (оригинальный датасет изображений SAM), 15,1% внутренних данных Meta, 9,4% MOSE, 9,2% YouTube-Video Object Segmentation (YouTube-VOS) и 1,3% DAVIS. Почему это важно в 2026 году: когда вы читаете заявку конкурента с формулировкой «мы построили свой VOS», следующий естественный вопрос – «на каких данных обучали?». Превзойти базовый SAM 2 сложно, потому что у других команд нет 643 тысяч маслеток, которыми располагает Meta.
Сам датасет выложен под лицензией Creative Commons Attribution-Share Alike (CC BY-SA) – она строже, чем Apache 2.0, под которой распространяется модель. Большинство продакшен-репозиториев используют модель, не затрагивая датасет; однако если ваша команда дообучает модель на специализированном домене (медицина, промышленный инспектор, хирургия), условия лицензии SA-variant имеют значение: веса, полученные в результате дообучения, наследуют copyleft-обязанности в той части, которая обучена на изображениях из SA-variant.
Реальные кейсы – где SAM 2 уже работает
Rotoscoping и VFX
Rotoscoping – выделение объекта в видео кадр за кадром – классический пример применения SAM 2 и один из самых близких к завершённому product-fit. Профессиональный ротоскопист тратит 2–4 часа на создание маски для одной секунды сложного материала (например, кудрявые волосы, быстрое движение, полупрозрачная ткань). SAM 2 генерирует сопоставимую маску менее чем за минуту с 2–3 правками. Открытые инструменты Sammie-Roto и Sammie-Roto 2 – это бесплатные графические оболочки над SAM 2, повторяющие рабочий процесс Adobe Roto Brush и Magic Mask в DaVinci Resolve. Обе системы теперь используют модель из семейства SAM.
Публикуемый трейд-офф из продакшен-студий VFX: SAM 2 выигрывает в скорости, но проигрывает по чёткости границ на самых сложных кадрах. Студия Electric Sheep публично сравнила SAM 2 со своим внутренним пайплайном и сделала простой вывод: SAM 2 – правильный выбор, когда приоритет – скорость или бюджет; ручной пайплайн остаётся лучшим решением, когда кадр должен держаться на кинопоказе в 4K. Сформировавшийся подход – двухуровневый: SAM 2 используется на превизе, дайли и проектах с меньшим бюджетом; ручной ротоскоп – на ключевых кадрах.
ROI-кроппинг для генеративного видео и ASR
Второй крупный кейс менее эффектный, но более распространённый: вырезание региона видео для передачи в downstream-модель. Генеративный видео-пайплайн (text-to-video, инпейнтинг, видео-перевод) часто должен работать только с объектом, а не с фоном. ASR-пайплайн с lip-reading требует обрезки области рта. Авто-зум в видео-редакторе должен выделить и отслеживать голову спикера. SAM 2 предоставляет пространственную маску; downstream-модель получает чистый, временно согласованный ROI.
Этот паттерн лежит в основе продуктов вроде Opus Clip, Submagic и других «AI video editor», которые предлагают функцию «автоматически переформатировать 16:9 в 9:16, удерживая спикера в центре». Спикера определяет face-детектор; SAM 2 распространяет bounding-маску спикера; область обрезки – это bounding box этой маски. Пользователь видит эффект «система следует за мной по мере движения» – за этим стоит комбинация SAM 2 и Kalman-фильтра для сглаживания обрезки.
Расследование в сфере наблюдения
Surveillance – третий канонический fit и тот, где SAM 2 открывает ранее недоступные возможности. Паттерн: человек-аналитик (или, всё чаще, агент на vision-language модели) просматривает запись в поисках конкретного человека, машины или объекта. Кликает один раз на цель на кадре 1500. SAM 2 выдаёт маски этой цели по всему архиву – минуты, иногда часы материала – которые далее идут в re-identification, motion-analysis или экспорт evidence-пакета.
Follow-up 2025 года SAM2.1++, вводящий distractor-aware memory, был мотивирован именно этим кейсом. Базовая версия SAM 2 иногда путает похожие объекты (двух людей в одинаковой форме, две машины одного цвета); SAM2.1++ повышает устойчивость на бенчмарках с множеством объектов и отвлекающими элементами на 6–8 пунктов за счёт изменения структуры буфера памяти. Для систем видеонаблюдения это разница между «система зафиксировалась не на той машине на кадре 200» и «система отслеживала нужную машину в течение десяти минут».
Телемедицина и хирургическое видео
Четвёртый кейс – медицинский: сегментировать орган, образование или хирургический инструмент по кадрам хирургической процедуры или диагностической записи. Сама статья SAM 2 демонстрирует высокую эффективность в zero-shot режиме на медицинских видео-бенчмарках, а последующие работы (SAM2-SGP для сегментации медицинских изображений, Q-SAM2 для квантизованного медицинского развертывания, SAM2S для хирургических видео с долгосрочным трекингом) расширили применимость модели в этом направлении за счёт использования промптов, специфичных для задачи, и квантизации.
В наших проектах по телемедицинским платформам развертывание SAM 2 обычно гибридное: модель работает на стороне врача как часть инструмента для анализа, позволяя одним кликом выделить регион интереса – узел щитовидной железы, полип или рану – и получить автоматически пропаганированный контур по записанному видео. Задача врача – проверить и при необходимости скорректировать результат; задача модели – снять рутинную нагрузку. Планка точности высока – мы всегда выбираем Hiera-Large, даже если это увеличивает затраты на облачные вычисления.
Рабочий пример – Re-идентификация в системах видеонаблюдения на SAM 2
Чтобы деплой стал конкретным, представьте продукт видеонаблюдения, где аналитик безопасности вводит описание вида «чёрный хэтчбэк у восточного входа», получает список подходящих кадров из последних 24 часов и чистый mask-трек нужной машины для экспорта в evidence-пакет. Нагрузка: 20 камер 1080p, H.264, 25 fps, около 2 ТБ материала в сутки.
Продакшен-пайплайн 2026 года – три стадии.
Стадия 1 – Open-vocabulary детекция (gated). Grounding DINO 1.6 Pro запускается на каждом кадре с низкой частотой (один кадр каждые две секунды, около 12 кадров в минуту на камеру) и выдаёт bounding box’ы по промпту аналитика. Эта стадия не работает в реальном времени – она обрабатывается пакетно в GPU-пуле Spot и формирует список candidate-events (timestamp + bounding box + similarity score). Стоимость: примерно 0.6 кадра в секунду на GPU × 20 камер × Spot $0.40/час ≈ $200 в сутки.
Стадия 2 – Propagation SAM 2 (по запросу). Когда аналитик кликает по кандидат-событию, SAM 2 Hiera-Base+ запускает распространение маски по минутному фрагменту видео (1500 кадров) на одной GPU уровня L4. С использованием TensorRT в режиме FP16 обработка занимает около 25 секунд на полную минуту. Каждый запуск по требованию обходится примерно в 0,008 доллара. Аналитик в реальном времени видит клип с наложенной маской автомобиля на всех 1500 кадрах.
Стадия 3 – Re-ID и экспорт evidence. Маскированные кадры поступают в модель re-идентификации в стиле Clip, которая генерирует «отпечаток» автомобиля. Затем этот отпечаток сопоставляется со списком candidate-событий для поиска всех других появлений той же машины в течение 24-часового окна. Совпадающие клипы экспортируются в evidence-пакет с нанесёнными поверх масками SAM 2.
Полный флот работает на уровне ~250 долларов в сутки в расчёте на GPU – это значительно меньше цента за аналитический запрос – и обеспечивает качество вывода (маски по пикселям за минуты обработки видео, например, машина, зафиксированная на нескольких камерах), которого ручной workflow не достиг бы даже за день на один запрос.
Неочевидная инженерная работа на этапе 2. Буфер памяти SAM 2 рассчитан на клипы длиной не более нескольких сотен кадров; для минуты видео в 1500 кадров пайплайн команды сбрасывает память каждые 300 кадров и повторно инициализирует процесс на основе последней маски с высокой степенью уверенности из предыдущего сегмента. Без такой стратегии сброса распространение маски начинает дрейфовать примерно к 500-му кадру – классический «long-video drift» в SAM 2, подробно разбираемый ниже.
Три типичные ошибки – подводные камни из практики
Подводный камень 1: Считать SAM 2 детектором. Команды, впервые сталкивающиеся с моделью, иногда полагают, что SAM 2 можно подать всё видео и сказать: «найди всех людей». Так нельзя. SAM 2 требует промпта – точки, рамки или маски, – который указывает, какой именно объект сегментировать. Если сначала нужно обнаружить объекты на кадре, нужен детектор перед SAM 2: YOLO для закрытого словаря, Grounding DINO или Florence-2 для открытого. Паттерн «detect-then-segment» стал каноническим в 2026 году для задач «найти и обвести»: детектор должен стоять перед SAM 2, а не быть встроенным в неё.
Подводный камень 2: Недооценить long-video drift. Буфер памяти SAM 2 хранит семь самых свежих кадров плюс prompted-кадры. На видео длиной более нескольких сотен кадров буфер полностью заполняется, и единственным опорным кадром остаётся prompted-кадр; в результате модель может постепенно «уплыть» на похожий distractor. Решение – либо SAM2Long (training-free memory tree расширение для устойчивости к long-видео, выпущено в октябре 2024), либо ручная стратегия сброса: разрезать длинное видео на чанки по 300 кадров, обрабатывать каждый чанк независимо и при переходе между ними повторно задавать промпт на основе последней маски с высокой степенью уверенности из предыдущего чанка. Дрейф устраняется; это подводный камень только в том случае, если команда не знает о нём до запуска.
Подводный камень 3: Игнорировать occlusion score. SAM 2 выдаёт occlusion score для каждого кадра – это выученная вероятность того, что объект, заданный подсказкой, не виден. Команды, использующие только маску и игнорирующие occlusion score, создают ложные положительные маски на кадрах, где объект вышел из сцены. Маска обычно мала и неоднозначна, но всё равно отображается, и потребители ниже по цепочке (например, модель re-ID или система оповещений) трактуют её как реальную детекцию. Проблема решается одной строкой кода: если occlusion_score > 0.7 – не выдавать маску на этом кадре. Видели, как одна эта строка устранила жалобу клиента на то, что «система продолжает отслеживать воздух там, где раньше стоял человек», которую трижды эскалировали.
Где SAM 2 находится по отношению к Mask R-CNN, XMem и SAM 3
Командам, стоящим перед выбором между вариантами, важны три сравнения.
Mask R-CNN – классический базовый метод instance-сегментации, двухэтапный детектор (на основе Faster R-CNN) с параллельной головкой для масок. Закрытый словарь: требует переобучения на каждый новый класс, выдаёт маски по кадрам без временной согласованности. Это подходящий выбор, если у вас фиксированный набор классов, размеченный обучающий датасет и важна высокая пропускная способность по маскам на кадр. SAM 2 – правильный выбор, когда нет заранее заданного списка классов и обучающего набора, а требуется временная согласованность.
XMem, AOT, DeAOT и остальные методы VOS до появления SAM-2 используют вручную нарисованную маску на первом кадре и распространяют её далее. Они точны, но медленны и не поддерживают интерактивные подсказки: пользователь должен задать начальную маску, а не кликнуть. SAM 2 превосходит их по всем бенчмаркам и удобству использования.
SAM 3, выпущенная Meta 19 ноября 2025 года, – принципиально новая модель. Она вводит Promptable Concept Segmentation: по фразе-существительному вроде «жёлтое такси» или по изображению-примеру она сегментирует и отслеживает каждое появление этого концепта в видео. SAM 3 отвечает на задачу «найти и сегментировать все X», а не «отслеживать конкретный экземпляр Y». SAM 2 остаётся оптимальным выбором для задачи трекай это одно. В 2026 году обе модели будут использоваться совместно: SAM 3 – на этапе поиска всех экземпляров, SAM 2 (или головка per-instance внутри самой SAM 3) – для уточнения каждого отдельного объекта. Распространение SAM 3 будет быстро расти в 2026 году; однако эта статья посвящена SAM 2, потому что это базовая модель, развернутая повсеместно, которую продуктовая команда должна понять в первую очередь.
Где здесь Фора Софт
Фора Софт с 2005 года поставляет видео-решения для видеоконференций, видеостриминга, OTT-платформ, систем видеонаблюдения, телемедицины и AR/VR – именно в этих направлениях SAM 2 меняет представимые границы возможного. Мы интегрировали SAM 2 в инструменты расследования инцидентов в системах видеонаблюдения, где аналитик безопасности одним кликом выделяет человека и получает маски, пропагированные по минутам видеозаписи; в телемедицинские системы анализа записей, где врачи обводят области интереса на сохранённых материалах; а также в функции видеоредакторов – автоматическое переформатирование портретов и отслеживание спикеров. Инженерная работа по интеграции включает выбор подходящего чекпоинта, определение оптимального интервала сброса памяти при обработке длинных видео, настройку порогов обнаружения скрытых участков для конечных потребителей и проектирование источников промптов (например, клик по объекту, передача от детектора или агент на основе визуального языка). Именно здесь сосредоточены основные риски – и именно это мы выполняем, внедряя архитектуры SAM 2 у клиентов.
Ключевые выводы
- SAM 2 принимает один промпт – клик, рамку или маску – на любом кадре и выдаёт пиксельно точные маски для всех остальных.
- Модуль памяти – новая концепция: буфер недавних и промптовых кадров, который привязывает модель к идентичности целевого объекта во времени.
- Четыре чекпоинта под лицензией Apache 2.0: Tiny (38,9 М, 91 FPS), Small (46 М), Base+ (80,8 М), Large (224,4 М, 30 FPS) – выбирайте в зависимости от соотношения качества и стоимости.
- SA-V – обучающий датасет из 51 тыс. видео и 643 тыс. масок; открытого аналога такого масштаба в 2026 году не предвидится.
- Паттерн «обнаружение, затем сегментация» доминирует в продакшене: YOLO или Grounding DINO генерируют промпт, а SAM 2 строит маску.
- Дрейф в длинных видео, путаница с отвлекающими объектами и обработка окклюзий – три инженерных проблемы, которые нужно решить перед запуском в эксплуатацию.