Skip to content
17 / 20

Что такое multimodal AI и какие основные мультимодальные модели существуют?

Multimodal AI — модели, которые принимают и/или генерируют несколько типов данных (текст, картинка, аудио, видео). Внутри модальности проецируются в общее эмбеддинг-пространство. Главные семейства: CLIP (image-text), GPT-4V/Claude/Gemini (text+image вход), DALL-E/SD (text→image), Whisper (audio→text), Sora/Veo (text→video).

Что такое multimodal AI и какие основные мультимодальные модели существуют? | JScriptiser