¿Por qué IA sin servidor?

Los servidores GPU tradicionales son caros y están inactivos la mayor parte del tiempo. La inferencia sin servidor te permite pagar solo por el uso real.

Plataformas

### Modal

  • Nube serverless nativa de Python.
  • Acceso a la GPU con cambios de código.
  • Ideal para pipelines de ML e inferencia por lotes.
  • Precio: facturación por segundo de GPU.

### Replicate

  • Ejecutar modelos de código abierto mediante API.
  • Sin gestión de infraestructuras.
  • Enorme biblioteca de modelos (Llama, Stable Diffusion, Whisper).
  • Precio: tiempo GPU por segundo.

### Cloudflare Workers AI

  • Modelos desplegados en el borde a nivel global.
  • Baja latencia para los usuarios finales.
  • Selección limitada de modelos pero en crecimiento.
  • Precios: por solicitud.

### Banana / Together AI

  • Especializada en inferencia de LLM.
  • Escalado automático de cero a miles de solicitudes.
  • Precios competitivos para cargas de trabajo de alto volumen.

Patrones arquitectónicos

  • Mitigación de arranque en frío: Utiliza caché de modelos y precalentamiento.
  • Pon en búfer las solicitudes durante el escalado.
  • Borde + Nube: Modelos simples en el borde, complejos en la nube.

Cuándo NO usar serverless

  • Cargas de trabajo consistentes y de alto rendimiento (>80% de utilización de GPU).
  • Modelos demasiado grandes para la memoria GPU serverless disponible.
  • Aplicaciones sensibles a la latencia que requieren una respuesta de <50 ms.