Zum Inhalt springen

Multimodal

Modelle, die mehrere Datentypen wie Text, Bilder, Audio und Video verstehen und erzeugen.

Du kannst dem Modell etwa einen Screenshot zeigen und den Code für genau diese Oberfläche verlangen – oder ein Diagramm übergeben und eine Analyse erbitten. GPT und Gemini sind weit verbreitete multimodale Modelle.

Verwandte Ressourcen