Zum Inhalt springen
Open SourceExperte

llama.cpp

llama.cpp ist die leichte C/C++-Inferenz-Engine, die offene LLMs effizient auf CPUs und Consumer-GPUs ausführt – das Fundament vieler lokaler KI-Tools wie Ollama und LM Studio. Die GGUF-Quantisierungsformate lassen große Modelle auf bescheidener Hardware ohne dedizierte Beschleuniger laufen.

Überblick

„llama.cpp“ ist eine Ressource vom Typ „Open Source“, kuratiert von AI Resource Hub, eingeordnet in die Kategorie Tools und geeignet für Lernende der Stufe Experte. Sie wird von ggml community bereitgestellt, wurde zuletzt am 2026-07-24 aktualisiert und hat eine redaktionelle Wertung von 4.8/5 von unserem Team. Klicke rechts auf „Ressource besuchen“, um die Originalseite zu öffnen.

Tags

Lokales LLMSchlussfolgerungGGUF

Hauptfunktionen

  • Effiziente CPU-/GPU-Inferenz für GGUF-Modelle
  • Quantisierung für bescheidene Hardware
  • Servermodus mit OpenAI-kompatibler API

Vorteile

  • +Läuft fast überall – ganz ohne Python
  • +Die Referenz-Engine, auf der viele Tools aufbauen
  • +Die Referenz-Engine, auf der viele lokale Tools aufbauen

Nachteile

  • Kommandozeile zuerst – GUIs gibt es anderswo
  • Command-Line first – die UI baust du selbst
  • Quantisierte Modelle tauschen etwas Qualität gegen Größe

FAQ