コスト問題
LLM APIコストはすぐに膨らみます。1万ユーザーのアプリで月額$500-2000です。
1. 積極的キャッシュ
2. 簡単なタスクに小さいモデル
3. プロンプト最適化
4. バッチリクエスト
5. コンテキストウィンドウ制限
6-10. 監視、ファインチューン、ストリーミング、セルフホスト、企業プラン交渉
クイックウィン:セマンティックキャッシュ
API呼び出しの多くは重複または近似重複です。セマンティックキャッシュは過去の入力とレスポンスの埋め込みを保存します。新リクエスト時に埋め込みを計算しキャッシュと照合します。コサイン類似度が0.95超ならキャッシュを返します。これだけで30–60%コスト削減可能です。
モデルルーティング:80/20の法則
すべてのリクエストにGPT-5は不要です。シンプルなリクエストをGPT-5-miniやClaude Haikuにルーティングします。複雑な推論のみ高価モデルを使用してください。
バッチと非同期処理
リアルタイム不要ならバッチ処理してください。OpenAIのバッチAPIは50%割引です。オフピーク時間ならさらにお得です。