Skip to content
24 / 25

Image embeddings 2024-2025: CLIP / OpenCLIP / SigLIP / SigLIP 2 / DINOv2 / EVA-CLIP — какую модель выбрать для text↔image и image↔image поиска и как интегрировать с FAISS/Qdrant?

Image embeddings — это плотные векторы, в которые модель кодирует картинку (и опционально текст). В 2024–2025 production-standard набор: CLIP (OpenAI ViT-L/14) — original baseline; OpenCLIP (LAION ViT-bigG-14, ViT-H-14) — открытые веса, лучше CLIP на ImageNet zero-shot; SigLIP / SigLIP 2 (Google, ICCV 2023) — sigmoid loss вместо softmax, превосходит CLIP на text↔image retrieval; DINOv2 (Meta) — self-supervised, чемпион для image↔image без текста; EVA-CLIP (BAAI) — SOTA fine-tune. Правило выбора: text↔image production → SigLIP 2; image↔image / near-dup → DINOv2; budget single-GPU → OpenCLIP ViT-B-32. Интеграция: open_clip / transformers SiglipModel → L2-normalize → FAISS IndexFlatIP или Qdrant с cosine distance.

Image embeddings 2024-2025: CLIP / OpenCLIP / SigLIP / SigLIP 2 / DINOv2 / EVA-CLIP — какую модель выбрать для text↔image и image↔image поиска и как интегрировать с FAISS/Qdrant? | JScriptiser