マルチモーダル
テキスト、画像、音声、動画など複数のデータ種別を理解・生成できるモデル。
例えば、スクリーンショットを見せて「この UI のコードを書いて」と頼んだり、グラフを渡して分析させたりできる。GPT や Gemini が広く使われるマルチモーダルモデル。
テキスト、画像、音声、動画など複数のデータ種別を理解・生成できるモデル。
例えば、スクリーンショットを見せて「この UI のコードを書いて」と頼んだり、グラフを渡して分析させたりできる。GPT や Gemini が広く使われるマルチモーダルモデル。