Multimodal
Modèles capables de comprendre et de générer plusieurs types de données : texte, images, audio, vidéo.
Par exemple, montrez-lui une capture d’écran et demandez le code de cette interface, ou donnez-lui un graphique à analyser. GPT et Gemini comptent parmi les modèles multimodaux les plus utilisés.