Skip to content
21 / 25

SAM / SAM 2 (Segment Anything) — как устроена promptable segmentation для image+video, какие prompts использовать (точки/боксы/маски) и для какой задачи продакшен реально подходит?

SAM (Kirillov et al. ICCV 2023, Meta) — это promptable segmentation model: ViT image encoder + lightweight mask decoder, который принимает prompts (точки, bbox, маски, текст в проекте) и выдаёт несколько mask hypotheses. Обучен на SA-1B (11M images, 1.1B masks) — самом большом segmentation dataset. SAM 2 (Ravi et al. Meta 2024) расширяет на video: memory attention позволяет tracking объекта через кадры с минимальным дрейфом. Production-сценарии: dataset labeling acceleration (Roboflow, CVAT, Encord используют SAM как auto-annotator), interactive editing (Photoshop generative fill), medical adaptation (MedSAM), video object segmentation. Реальные ограничения: SAM не знает классы (class-agnostic) — нужен внешний classifier поверх масок.

SAM / SAM 2 (Segment Anything) — как устроена promptable segmentation для image+video, какие prompts использовать (точки/боксы/маски) и для какой задачи продакшен реально подходит? | JScriptiser