Pourquoi gérer des LLM localement ?
- Confidentialité : Vos données ne quittent jamais votre machine.
- Coût : Zéro coût par token après configuration.
- Vitesse : Pas de latence réseau pour l’inférence.
- Hors ligne : Fonctionne sans connexion internet.
Installation d’Ollama
- Téléchargement depuis [ollama.com](https://ollama.com) — disponible pour macOS, Linux et Windows.
- Exécutez 'ollama pull llama3' pour télécharger un modèle.
- Exécutez 'ollama run llama3' pour commencer à discuter.
Modèles populaires
- Llama 3 8B : Bon modèle polyvalent, tourne sur 8 Go de RAM.
- Llama 3 70B : Beaucoup plus intelligent, nécessite 48 Go+ de RAM.
- Qwen 2.5 : Excellent pour le chinois et les tâches multilingues.
- Mistral 7B : Rapide et efficace pour les tâches de codage.
- Phi-3 Mini : le modèle petit mais performant de Microsoft.
Utilisation de l’API
Ollama fournit une API REST locale à l’adresse « http://localhost:11434 ».
- « POST /api/generate » — génération de texte.
- « POST /api/chat » — complétions de chat.
- Compatible avec OpenAI SDK via une URL de base.
Conseils d’intégration
- Utilisation avec LangChain via la classe 'OllamaLLM'.
- Utilisation avec Open WebUI pour une interface de type ChatGPT.
- Accélération GPU : Fonctionne avec NVIDIA (CUDA) et Apple Silicon (Metal).
Attentes de performance
- Modèle 7B sur MacBook M2 : ~30 tokens/seconde.
- Modèle 7B sur RTX 4090 : ~60 tokens/seconde.
- Modèle 70B sur 48 Go de RAM (CPU) : ~3 tokens/seconde.