Aller au contenu
Open sourceAvancé

llama.cpp

The lightweight C/C++ inference engine that runs open LLMs efficiently on CPUs and GPUs — the foundation beneath many local AI tools.

Aperçu

« llama.cpp » est une ressource de type « Open source » sélectionnée par AI Resource Hub, classée dans la catégorie Open-Source Tools et adaptée aux apprenants de niveau Avancé. Elle est fournie par ggml community, a été mise à jour pour la dernière fois le 2026-07-24 et affiche une note éditoriale de 4.8/5 attribuée par notre équipe. Cliquez sur « Visiter la ressource » à droite pour ouvrir la page d’origine.

Étiquettes

Local LLMInferenceGGUF

Fonctionnalités clés

  • Efficient CPU/GPU inference for GGUF models
  • Quantization to fit models on modest hardware
  • Server mode with an OpenAI-compatible API

Avantages

  • +Runs almost anywhere, no Python required
  • +The reference engine many tools build on

Inconvénients

  • Command-line first; GUIs live elsewhere

FAQ

llama.cpp or Ollama?

Ollama wraps llama.cpp with easy model management; use llama.cpp directly for maximum control and minimal footprint.