Какую основу (backbone) выбрать для задач компьютерного зрения: ConvNeXt v2, EfficientNetV2, Swin Transformer v2, MaxViT — и когда всё ещё хватит классических ResNet и ViT?
Классический ResNet-50 и обычный ViT-B/16 уже не оптимальны — современные модели обгоняют их по точности, числу параметров и задержке. Основа (backbone) — это та часть сети, что извлекает признаки из картинки; поверх неё навешивается «голова» под конкретную задачу. Главные кандидаты: ConvNeXt v2 (полностью свёрточный, 88.9% top-1 у версии V2-Huge, предобучен методом FCMAE), EfficientNetV2 (блоки FusedMBConv + постепенное наращивание разрешения при обучении; лучшее соотношение «размер модели / точность» среди свёрточных), Swin Transformer v2 (внимание внутри окон, собранное в иерархию; отличная основа для детекции и сегментации), MaxViT (гибрид свёрток и трансформера, внимание сразу по нескольким осям). Все грузятся через timm одной строкой. Для устройств на краю сети — MobileNetV3 / EfficientNet-Lite.