Pourquoi gérer des LLM localement ?

  • Confidentialité : Vos données ne quittent jamais votre machine.
  • Coût : Zéro coût par token après configuration.
  • Vitesse : Pas de latence réseau pour l’inférence.
  • Hors ligne : Fonctionne sans connexion internet.

Installation d’Ollama

  • Téléchargement depuis [ollama.com](https://ollama.com) — disponible pour macOS, Linux et Windows.
  • Exécutez 'ollama pull llama3' pour télécharger un modèle.
  • Exécutez 'ollama run llama3' pour commencer à discuter.

Modèles populaires

  • Llama 3 8B : Bon modèle polyvalent, tourne sur 8 Go de RAM.
  • Llama 3 70B : Beaucoup plus intelligent, nécessite 48 Go+ de RAM.
  • Qwen 2.5 : Excellent pour le chinois et les tâches multilingues.
  • Mistral 7B : Rapide et efficace pour les tâches de codage.
  • Phi-3 Mini : le modèle petit mais performant de Microsoft.

Utilisation de l’API

Ollama fournit une API REST locale à l’adresse « http://localhost:11434 ».

  • « POST /api/generate » — génération de texte.
  • « POST /api/chat » — complétions de chat.
  • Compatible avec OpenAI SDK via une URL de base.

Conseils d’intégration

  • Utilisation avec LangChain via la classe 'OllamaLLM'.
  • Utilisation avec Open WebUI pour une interface de type ChatGPT.
  • Accélération GPU : Fonctionne avec NVIDIA (CUDA) et Apple Silicon (Metal).

Attentes de performance

  • Modèle 7B sur MacBook M2 : ~30 tokens/seconde.
  • Modèle 7B sur RTX 4090 : ~60 tokens/seconde.
  • Modèle 70B sur 48 Go de RAM (CPU) : ~3 tokens/seconde.