Pourquoi l’IA sans serveur ?
Les serveurs GPU traditionnels sont chers et inactifs la plupart du temps. L’inférence sans serveur vous permet de payer uniquement pour l’utilisation réelle.
Plateformes
### Modal
- Cloud serverless natif Python.
- Accès au GPU avec modifications de code.
- Parfait pour les pipelines ML et l’inférence batch.
- Tarification : facturation GPU par seconde.
### Replicate
- Exécuter des modèles open source via API.
- Pas de gestion d’infrastructure.
- Énorme bibliothèque de modèles (Llama, Stable Diffusion, Whisper).
- Tarif : temps GPU par seconde.
### Cloudflare Workers AI
- Des modèles déployés en bordure à l’échelle mondiale.
- Faible latence pour les utilisateurs finaux.
- Sélection de modèles limitée mais en croissance.
- Tarif : par demande.
### Banana / Together AI
- Spécialisé en inférence LLM.
- Mise à l’échelle automatique de zéro à des milliers de requêtes.
- Tarifs compétitifs pour les charges de travail à fort volume.
Motifs architecturaux
- Atténuation du démarrage à froid : Utilisez la mise en cache et le préchauffage du modèle.
- File d’attente des requêtes : Mettez les requêtes en attente pendant la mise à l’échelle.
- Edge + Cloud : Modèles simples en edge, complexes en cloud.
Quand ne PAS utiliser le sans-serveur (serverless)
- Charges de travail constantes à haut débit (>80 % d’utilisation du GPU).
- Modèles trop volumineux pour la mémoire GPU serverless disponible.
- Applications sensibles à la latence nécessitant une réponse de <50 ms.