¿Por qué ejecutar LLMs en local?

  • Privacidad: Tus datos nunca salen de tu máquina.
  • Coste: Cero costes por token tras la configuración.
  • Velocidad: Sin latencia de red para inferencia.
  • Desconectado: Funciona sin conexión a internet.

Instalando a Ollama

  • Descargar desde [ollama.com](https://ollama.com) — disponible para macOS, Linux y Windows.
  • Ejecuta 'ollama pull llama3' para descargar un modelo.
  • Corre 'ollama run llama3' para empezar a charlar.

Modelos populares

  • Llama 3 8B: Buen modelo de uso general, funciona con 8GB de RAM.
  • Llama 3 70B: Mucho más inteligente, necesita 48GB+ de RAM.
  • Qwen 2.5: Excelente para tareas en chino y multilingües.
  • Mistral 7B: Rápido y eficiente para tareas de codificación.
  • Phi-3 Mini: El modelo pequeño pero capaz de Microsoft.

Usando la API

Ollama proporciona una API REST local en 'http://localhost:11434'.

  • 'POST /api/generate' — generación de texto.
  • 'POST /api/chat' — completaciones de chat.
  • Compatible con OpenAI SDK mediante anulación de URL base.

Consejos de integración

  • Uso con LangChain mediante la clase 'OllamaLLM'.
  • Usar con OpenWebUI para una interfaz similar a ChatGPT.
  • Aceleración por GPU: Funciona con NVIDIA (CUDA) y Apple Silicon (Metal).

Expectativas de rendimiento

  • Modelo 7B en MacBook M2: ~30 tokens/segundo.
  • Modelo 7B en RTX 4090: ~60 tokens/segundo.
  • Modelo 70B en 48 GB de RAM (CPU): ~3 tokens/segundo.