Déployer des LLM open source en local : Ollama en pratique
Faire tourner de grands modèles sur sa propre machine protège la confidentialité des données et facilite le développement et l’expérimentation hors ligne. Avec Ollama, tout cela devient aussi simple qu’installer une application.
ParAI Resource Hub
Pourquoi choisir le déploiement local ?
Avec le déploiement local, les données ne quittent jamais votre machine — idéal pour les contenus sensibles. Et sans frais d’API, on peut expérimenter à volonté et l’intégrer à ses workflows locaux.
Installez et lancez votre premier modèle
Une fois Ollama installé depuis le site officiel, une seule commande télécharge et lance un modèle. Le premier lancement récupère automatiquement les poids.
# Pull and chat directly
ollama run llama3.2
# Or just download the model
ollama pull qwen2.5Accédez via l’API
Une fois démarré, Ollama expose une interface HTTP sur le port local 11434, à intégrer dans votre app exactement comme un appel d’API cloud.
curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [{ "role": "user", "content": "Hi, please introduce yourself" }],
"stream": false
}'Réglage des performances et conseils GPU
Ollama utilise automatiquement l’accélération GPU quand elle est disponible. Sur les Mac Apple Silicon, Metal est utilisé d’emblée. Sous Linux avec NVIDIA, assurez-vous que les pilotes CUDA et la build CUDA d’Ollama sont installés. Si la VRAM manque, essayez une quantification plus petite (Q4_K_M au lieu de Q8_0, par exemple) ou une famille de modèles réduite. Régler OLLAMA_NUM_PARALLEL permet de traiter des requêtes concurrentes sur les machines avec assez de mémoire.
Intégration avec votre application
L’API d’Ollama est compatible avec le format de complétion de chat OpenAI. Vous pouvez réutiliser le même code en changeant simplement l’URL de base pour http://localhost:11434/v1 et en utilisant n’importe quelle chaîne comme clé API. Des bibliothèques comme LangChain et LlamaIndex ont aussi des intégrations natives Ollama, ce qui rend facile le remplacement d’un modèle cloud par un modèle local dans votre pipeline RAG ou agent.
Comment choisir le bon modèle ?
Les grands modèles sont plus performants, mais réclament plus de VRAM et de mémoire. Choisissez d’abord une taille de paramètres adaptée à votre machine (7B/8B, par exemple), puis arbitrez entre vitesse et qualité.
La bibliothèque de modèles d’Ollama regorge de modèles open source — Llama, Qwen, Mistral, Gemma… — que vous pouvez alterner selon vos besoins.