Перейти к содержимому
17 / 25

Зачем нужны DINOv2, MAE, BEiT и EVA: как модели, обученные без разметки, применяют для переноса обучения и для векторных представлений картинок?

Обучение без разметки (self-supervised learning, SSL) — предобучение без меток: модель учится понимать картинки по самим картинкам — восстанавливая закрытые куски, сравнивая пары изображений или перенимая знания у модели-учителя. На выходе — основа, которая выдаёт универсальные векторные представления картинок для дальнейших задач, и для этого не нужен большой размеченный набор. DINOv2 (Meta, 2023) — ученик перенимает знания у учителя; даёт отличные признаки даже без дообучения — достаточно навесить сверху простой линейный классификатор. MAE (Meta, 2022) — маскирующий автокодировщик: прячем 75% кусочков картинки и заставляем модель восстановить их по остатку. BEiT v2 (Microsoft, 2022) — то же восстановление скрытого, но предсказываются не пиксели, а токены от отдельного кодировщика (VQ-VAE). EVA (BAAI, 2023) — масштабное обучение без разметки поверх признаков CLIP.