¿Por qué ejecutar LLMs en local?
- Privacidad: Tus datos nunca salen de tu máquina.
- Coste: Cero costes por token tras la configuración.
- Velocidad: Sin latencia de red para inferencia.
- Desconectado: Funciona sin conexión a internet.
Instalando a Ollama
- Descargar desde [ollama.com](https://ollama.com) — disponible para macOS, Linux y Windows.
- Ejecuta 'ollama pull llama3' para descargar un modelo.
- Corre 'ollama run llama3' para empezar a charlar.
Modelos populares
- Llama 3 8B: Buen modelo de uso general, funciona con 8GB de RAM.
- Llama 3 70B: Mucho más inteligente, necesita 48GB+ de RAM.
- Qwen 2.5: Excelente para tareas en chino y multilingües.
- Mistral 7B: Rápido y eficiente para tareas de codificación.
- Phi-3 Mini: El modelo pequeño pero capaz de Microsoft.
Usando la API
Ollama proporciona una API REST local en 'http://localhost:11434'.
- 'POST /api/generate' — generación de texto.
- 'POST /api/chat' — completaciones de chat.
- Compatible con OpenAI SDK mediante anulación de URL base.
Consejos de integración
- Uso con LangChain mediante la clase 'OllamaLLM'.
- Usar con OpenWebUI para una interfaz similar a ChatGPT.
- Aceleración por GPU: Funciona con NVIDIA (CUDA) y Apple Silicon (Metal).
Expectativas de rendimiento
- Modelo 7B en MacBook M2: ~30 tokens/segundo.
- Modelo 7B en RTX 4090: ~60 tokens/segundo.
- Modelo 70B en 48 GB de RAM (CPU): ~3 tokens/segundo.