サーバーレスAIの理由
従来のGPUサーバーは高価でほとんどの時間アイドル状態です。サーバーレス推論は実際の使用量に対してのみ課金します。
プラットフォーム
- Modal: Pythonネイティブです。GPUアクセスが簡単です。
- Replicate: APIでオープンソースモデルを実行します。
- Cloudflare Workers AI: グローバルエッジデプロイです。
向いていないケース
- 一貫した高スループットワークロードです。
- 利用可能なGPUメモリを超える大型モデルです。
- 50ms未満の応答が必要なレイテンシ重視アプリです。
アーキテクチャパターン
最も一般的なパターンはAPI Gateway→Lambda/Cloud Function→モデルエンドポイントです。GPU推論にはModal、Replicate、またはAWS Lambda with GPUを使用してください。
コールドスタート最適化
- プロビジョンド並行性: ウォームインスタンスを維持してください(AWS)。
- モデルキャッシング: /tmpまたはEFSにモデルを保存してください。
- 小さいモデル: 100MBモデルは~200msでロードします。量子化モデルでサイズ最小化してください。
- SnapStart: Javaベースの推論サーバーのコールドスタートを90%削減します。