17 / 25
Зачем нужны DINOv2 / MAE / BEiT / EVA: как self-supervised vision модели используют в transfer learning и для image embeddings?
Self-supervised vision (SSL) — pretrain без меток: модель учится визуальным представлениям из самих картинок (через masked reconstruction, contrastive learning, или teacher-student distillation). Результат: backbone, который выдаёт универсальные image embeddings для downstream tasks без необходимости в больших размеченных датасетах. DINOv2 (Meta 2023) — teacher-student distillation, отличные frozen features для linear probe. MAE (Meta 2022) — Masked Autoencoder, mask 75% патчей, reconstruct pixels. BEiT v2 (Microsoft 2022) — masked image modeling с VQ-VAE токенайзером. EVA (BAAI 2023) — масштабный SSL на CLIP features.