データ分析の進化
LLMによりデータ分析が変革されます。自然言語で質問してチャートやインサイトを得られます。
ツール
- PandasAI: DataFrameへの自然言語クエリです。
- LangChain Pandas Agent: LLMがPandasコードを生成・実行します。
ワークフロー
1. DataFrameにデータを読み込んでください。
2. 自然言語で質問してください。
3. LLMがPythonコードを生成します。
4. コードを実行し結果を返します。
ベストプラクティス
- 実行前に生成コードを必ず検証してください。
- 従来のEDAと組み合わせて徹底分析してください。
セキュリティとサンドボックス
本番データでLLM生成コードをサンドボックスなしで実行しないでください。Dockerコンテナまたはサブプロセス分離を使用してください。メモリ上限(2GB)とタイムアウト(30秒)を設定してください。
大規模データセットへの対応
- サンプリング: 1000行の代表サンプルでスキーマを理解させ、生成コードを全データに適用してください。
- チャンク処理: データを分割し逐次分析、結果を集約してください。
- DuckDB + PandasAI: DuckDBでPandas DataFrameを直接SQLクエリします。
よくある落とし穴
- 幻の列名: LLMが存在しない列名を生成します。実行前にdf.columnsで検証してください。
- 型ミスマッチ: 日付が文字列だとサイレント失敗します。dtypeを明示的に設定してください。
- 集計エラー: 歪んだデータに.mean()を使用します。プロンプトで統計手法を指定してください。