Despliega LLMs open source en local: Ollama en la práctica
Ejecutar grandes modelos en tu propia máquina protege la privacidad de los datos y facilita desarrollar y experimentar sin conexión. Con Ollama, todo esto es tan sencillo como instalar una app.
PorAI Resource Hub
Por qué elegir el despliegue local
Con el despliegue local los datos nunca salen de tu máquina, ideal para material sensible. Además no hay tarifas de API, así que puedes experimentar sin límite e integrarlo en tus flujos de trabajo locales.
Instala y ejecuta tu primer modelo
Tras instalar Ollama desde la web oficial, un solo comando descarga y ejecuta un modelo. La primera ejecución baja los pesos automáticamente.
# Pull and chat directly
ollama run llama3.2
# Or just download the model
ollama pull qwen2.5Accede por la API
Una vez arrancado, Ollama expone una interfaz HTTP en el puerto local 11434, que puedes integrar en tu app igual que si llamaras a una API en la nube.
curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [{ "role": "user", "content": "Hi, please introduce yourself" }],
"stream": false
}'Cómo elegir el modelo adecuado
Los modelos grandes rinden mejor, pero exigen más VRAM y memoria. Elige primero un tamaño de parámetros acorde a tu máquina (7B/8B, por ejemplo) y después equilibra velocidad y calidad.
En la biblioteca de modelos de Ollama encontrarás muchos modelos open source como Llama, Qwen, Mistral o Gemma, y podrás cambiar de uno a otro según lo necesites.
Ajuste de rendimiento y consejos de GPU
Ollama usa aceleración por GPU automáticamente cuando está disponible. En Mac con Apple Silicon, Metal se usa de inmediato. En Linux con NVIDIA, asegúrate de tener los controladores CUDA y la compilación CUDA de Ollama. Si te quedas sin VRAM, prueba una cuantización menor (por ejemplo, Q4_K_M en lugar de Q8_0) o una familia de modelos más pequeña. Configurar OLLAMA_NUM_PARALLEL te permite manejar solicitudes concurrentes en máquinas con suficiente memoria.
Integración con tu aplicación
La API de Ollama es compatible con el formato de completado de chat de OpenAI. Puedes reutilizar el mismo código simplemente cambiando la URL base a http://localhost:11434/v1 y usando cualquier cadena como clave de API. Librerías como LangChain y LlamaIndex también tienen integraciones nativas con Ollama, lo que facilita intercambiar un modelo en la nube por uno local en tu pipeline RAG o de agentes.