Multimodal
Modelle, die mehrere Datentypen wie Text, Bilder, Audio und Video verstehen und erzeugen.
Du kannst dem Modell etwa einen Screenshot zeigen und den Code für genau diese Oberfläche verlangen – oder ein Diagramm übergeben und eine Analyse erbitten. GPT und Gemini sind weit verbreitete multimodale Modelle.