Aller au contenu
Open sourceAvancé

llama.cpp

llama.cpp est le moteur d'inférence léger en C/C++ qui exécute efficacement les LLM ouverts sur CPU et GPU grand public, servant de fondation à de nombreux outils locaux comme Ollama et LM Studio. Ses formats de quantification GGUF permettent aux grands modèles de tenir sur du matériel modeste, sans accélérateurs dédiés.

Aperçu

« llama.cpp » est une ressource de type « Open source » sélectionnée par AI Resource Hub, classée dans la catégorie Outils et adaptée aux apprenants de niveau Avancé. Elle est fournie par ggml community, a été mise à jour pour la dernière fois le 2026-07-24 et affiche une note éditoriale de 4.8/5 attribuée par notre équipe. Cliquez sur « Visiter la ressource » à droite pour ouvrir la page d’origine.

Étiquettes

Local LLMInférenceGGUF

Fonctionnalités clés

  • Une inférence CPU/GPU efficace pour les modèles GGUF
  • Quantification pour tenir sur du matériel modeste
  • Mode serveur avec API compatible OpenAI

Avantages

  • +Tourne presque partout, sans Python
  • +Le moteur de référence sur lequel s’appuient nombre d’outils
  • +Le moteur de référence sur lequel reposent de nombreux outils locaux

Inconvénients

  • Ligne de commande d’abord ; les GUI vivent ailleurs
  • Ligne de commande d’abord : l’interface, vous l’assemblez
  • Les modèles quantifiés troquent de la qualité contre la taille

FAQ