RAGが重要な理由
RAGはLLMの応答を自分のデータに接地させる最も実用的な方法です。
チャンキング戦略
- 固定サイズ: シンプルだが意味単位を分割する可能性。
- セマンティック: 埋め込み類似度による意味ベース分割。
- 再帰的: 見出し、段落、文で段階的に分割。
ハイブリッド検索
_dense_ベクトル検索と_sparse_キーワード検索(BM25)を組み合わせます。
リランキング
初期検索後、クロスエンコーダーモデルで結果を再スコアリング。
評価
- 忠実性: 回答は検索コンテキストに忠実か?
- 関連性: 検索チャンクは実際に有用か?
- 正解性: 最終回答は事実的に正しいか?
高度なチャンキング戦略
- セマンティックチャンキング: LLMでトピック境界を識別。
- 再帰的分割: 見出し > 段落 > 文。
- オーバーラップ: 10–20%の重複。
- メタデータ充実: 各チャンクにタグ付け。
評価フレームワーク
- 検索精度 / 忠実度 / 回答関連性 / レイテンシ。
本番チェックリスト
- ハイブリッド検索、リランキング、モニタリング、フィードバックループ。
高度なチャンキング戦略
- セマンティックチャンキング: LLMでトピック境界を識別。
- 再帰的分割: 見出し > 段落 > 文。
- オーバーラップ: 10–20%の重複。
- メタデータ充実: 各チャンクにタグ付け。
評価フレームワーク
- 検索精度 / 忠実度 / 回答関連性 / レイテンシ。
本番チェックリスト
- ハイブリッド検索、リランキング、モニタリング、フィードバックループ。