Перейти к содержимому
14 / 25

Что такое Vision Transformer (ViT) и чем он отличается от CNN?

Vision Transformer (ViT) — применяет архитектуру Transformer к изображениям, разбивая их на патчи (16x16 пикселей) как токены. В отличие от CNN с локальным receptive field, ViT использует self-attention для глобальных связей с первого слоя. Требует больших датасетов (JFT-300M) для обучения, но при transfer learning превосходит CNN на ImageNet. Текущие SOTA модели: ViT, Swin Transformer, DeiT.

Что такое Vision Transformer (ViT) и чем он отличается от CNN? | JScriptiser