PrincipianteTiempo de lectura 8 min·

Despliega LLMs open source en local: Ollama en la práctica

Ejecutar grandes modelos en tu propia máquina protege la privacidad de los datos y facilita desarrollar y experimentar sin conexión. Con Ollama, todo esto es tan sencillo como instalar una app.

PorAI Resource Hub

Por qué elegir el despliegue local

Con el despliegue local los datos nunca salen de tu máquina, ideal para material sensible. Además no hay tarifas de API, así que puedes experimentar sin límite e integrarlo en tus flujos de trabajo locales.

Instala y ejecuta tu primer modelo

Tras instalar Ollama desde la web oficial, un solo comando descarga y ejecuta un modelo. La primera ejecución baja los pesos automáticamente.

# Pull and chat directly
ollama run llama3.2

# Or just download the model
ollama pull qwen2.5

Accede por la API

Una vez arrancado, Ollama expone una interfaz HTTP en el puerto local 11434, que puedes integrar en tu app igual que si llamaras a una API en la nube.

curl http://localhost:11434/api/chat -d '{
  "model": "llama3.2",
  "messages": [{ "role": "user", "content": "Hi, please introduce yourself" }],
  "stream": false
}'

Cómo elegir el modelo adecuado

Los modelos grandes rinden mejor, pero exigen más VRAM y memoria. Elige primero un tamaño de parámetros acorde a tu máquina (7B/8B, por ejemplo) y después equilibra velocidad y calidad.

En la biblioteca de modelos de Ollama encontrarás muchos modelos open source como Llama, Qwen, Mistral o Gemma, y podrás cambiar de uno a otro según lo necesites.

Ajuste de rendimiento y consejos de GPU

Ollama usa aceleración por GPU automáticamente cuando está disponible. En Mac con Apple Silicon, Metal se usa de inmediato. En Linux con NVIDIA, asegúrate de tener los controladores CUDA y la compilación CUDA de Ollama. Si te quedas sin VRAM, prueba una cuantización menor (por ejemplo, Q4_K_M en lugar de Q8_0) o una familia de modelos más pequeña. Configurar OLLAMA_NUM_PARALLEL te permite manejar solicitudes concurrentes en máquinas con suficiente memoria.

Integración con tu aplicación

La API de Ollama es compatible con el formato de completado de chat de OpenAI. Puedes reutilizar el mismo código simplemente cambiando la URL base a http://localhost:11434/v1 y usando cualquier cadena como clave de API. Librerías como LangChain y LlamaIndex también tienen integraciones nativas con Ollama, lo que facilita intercambiar un modelo en la nube por uno local en tu pipeline RAG o de agentes.

OllamaDespliegue localOpen sourcePrivacidad

Tutoriales relacionados