視覚言語モデルとは?
視覚言語モデル(VLM)は画像とテキストを同時に理解できます。
主要モデル
- GPT-5: 文書理解、チャート分析に優れます。
- Gemini 3: 複数画像の推論に強いです。
- LLaVA: オープンソースのセルフホストオプションです。
一般的なユースケース
- ドキュメントOCR: 請求書から構造化データを抽出します。
- 商品分析: 商品写真から説明を生成します。
- チャート理解: チャートからデータポイントを抽出します。
Tips
- 画像は最大1024pxにリサイズしてください。
- 写真はJPEGを使用してください。
適切なVLMの選択
文書理解とOCRではGPT-5とClaude Sonnetが正確度でリードします。画像キャプションと視覚的QAではGemini 3 Proが大規模コンテキストで優秀です。オープンソースではLLaVA-NeXTとQwen2-VLがコンシューマーGPUで動作します。
実践的なヒント
- 画像前処理: モデルの期待入力サイズにリサイズしてください。224–1024pxが最適です。
- 複数画像プロンプト: GPT-5とGeminiは複数画像対応です。比較タスクに活用してください。
- 構造化出力: JSONで出力を要求してください。プロンプトでスキーマを指定してください。
- コスト管理: ビジョントークンはテキストの2–10倍です。画像をリサイズし関心領域をクロップしてください。