コンテンツへスキップ

マルチモーダル

テキスト、画像、音声、動画など複数のデータ種別を理解・生成できるモデル。

例えば、スクリーンショットを見せて「この UI のコードを書いて」と頼んだり、グラフを渡して分析させたりできる。GPT や Gemini が広く使われるマルチモーダルモデル。

関連リソース