Перейти к содержимому
21 / 25

Как устроено семейство Segment Anything (SAM, SAM 2, SAM 3): сегментация по подсказке для картинок и видео, какие подсказки бывают — и где это реально применимо в проде?

SAM (Kirillov et al., ICCV 2023, Meta) — модель сегментации по подсказке: кодировщик изображения на ViT плюс лёгкий декодер масок, который принимает подсказку (точку, рамку, маску) и выдаёт несколько вариантов маски. Обучена на SA-1B (11 млн изображений, 1.1 млрд масок) — крупнейшем наборе для сегментации. SAM 2 (Ravi et al., Meta, 2024) добавил видео: память внимания позволяет вести объект по кадрам почти без сноса. SAM 3 (Meta, конец 2025 — ICLR 2026) научился работать по текстовому описанию понятия: находит и ведёт сразу все экземпляры, например «каждая красная бейсболка» в длинном видео, одной моделью — zero-shot mask AP на LVIS 48.8 против прежних лучших 38.5. Обновление SAM 3.1 (март 2026) ускорило совместное отслеживание нескольких объектов за счёт общей памяти. Production-сценарии: dataset labeling acceleration (Roboflow, CVAT, Encord используют SAM как auto-annotator), interactive editing (Photoshop generative fill), medical adaptation (MedSAM), video object segmentation. Реальные ограничения: SAM (до третьей версии) не знает классов — он просто выделяет объект, а какой это класс, должен решать отдельный классификатор поверх масок. Именно эту дыру и закрывает SAM 3 с текстовыми подсказками.

Как устроено семейство Segment Anything (SAM, SAM 2, SAM 3): сегментация по подсказке для картинок и видео, какие подсказки бывают — и где это реально применимо в проде? | JScriptiser