¿Por qué IA sin servidor?
Los servidores GPU tradicionales son caros y están inactivos la mayor parte del tiempo. La inferencia sin servidor te permite pagar solo por el uso real.
Plataformas
### Modal
- Nube serverless nativa de Python.
- Acceso a la GPU con cambios de código.
- Ideal para pipelines de ML e inferencia por lotes.
- Precio: facturación por segundo de GPU.
### Replicate
- Ejecutar modelos de código abierto mediante API.
- Sin gestión de infraestructuras.
- Enorme biblioteca de modelos (Llama, Stable Diffusion, Whisper).
- Precio: tiempo GPU por segundo.
### Cloudflare Workers AI
- Modelos desplegados en el borde a nivel global.
- Baja latencia para los usuarios finales.
- Selección limitada de modelos pero en crecimiento.
- Precios: por solicitud.
### Banana / Together AI
- Especializada en inferencia de LLM.
- Escalado automático de cero a miles de solicitudes.
- Precios competitivos para cargas de trabajo de alto volumen.
Patrones arquitectónicos
- Mitigación de arranque en frío: Utiliza caché de modelos y precalentamiento.
- Pon en búfer las solicitudes durante el escalado.
- Borde + Nube: Modelos simples en el borde, complejos en la nube.
Cuándo NO usar serverless
- Cargas de trabajo consistentes y de alto rendimiento (>80% de utilización de GPU).
- Modelos demasiado grandes para la memoria GPU serverless disponible.
- Aplicaciones sensibles a la latencia que requieren una respuesta de <50 ms.