視覚言語モデルとは?

視覚言語モデル(VLM)は画像とテキストを同時に理解できます。

主要モデル

  • GPT-5: 文書理解、チャート分析に優れます。
  • Gemini 3: 複数画像の推論に強いです。
  • LLaVA: オープンソースのセルフホストオプションです。

一般的なユースケース

  • ドキュメントOCR: 請求書から構造化データを抽出します。
  • 商品分析: 商品写真から説明を生成します。
  • チャート理解: チャートからデータポイントを抽出します。

Tips

  • 画像は最大1024pxにリサイズしてください。
  • 写真はJPEGを使用してください。

適切なVLMの選択

文書理解とOCRではGPT-5とClaude Sonnetが正確度でリードします。画像キャプションと視覚的QAではGemini 3 Proが大規模コンテキストで優秀です。オープンソースではLLaVA-NeXTとQwen2-VLがコンシューマーGPUで動作します。

実践的なヒント

  • 画像前処理: モデルの期待入力サイズにリサイズしてください。224–1024pxが最適です。
  • 複数画像プロンプト: GPT-5とGeminiは複数画像対応です。比較タスクに活用してください。
  • 構造化出力: JSONで出力を要求してください。プロンプトでスキーマを指定してください。
  • コスト管理: ビジョントークンはテキストの2–10倍です。画像をリサイズし関心領域をクロップしてください。