Warum LLMs lokal betreiben?

  • Privatsphäre: Deine Daten verlassen deinen Rechner nie.
  • Kosten: Keine Kosten pro Token nach der Einrichtung.
  • Geschwindigkeit: Keine Netzwerklatenz für Inferenz.
  • Offline: Funktioniert ohne Internetverbindung.

Ollama installieren

  • Download von [ollama.com](https://ollama.com) — verfügbar für macOS, Linux und Windows.
  • Führe 'ollama pull llama3' aus, um ein Modell herunterzuladen.
  • Lauf 'ollama run llama3', um mit dem Chatten anzufangen.

Beliebte Modelle

  • Llama 3 8B: Gutes Allzweckmodell, läuft mit 8 GB RAM.
  • Llama 3 70B: Viel intelligenter, benötigt 48 GB+ RAM.
  • Qwen 2.5: Ausgezeichnet für chinesische und mehrsprachige Aufgaben.
  • Mistral 7B: Schnell und effizient für Codierungsaufgaben.
  • Phi-3 Mini: Microsofts kleines, aber leistungsfähiges Modell.

Nutzung der API

Ollama stellt unter 'http://localhost:11434' eine lokale REST-API bereit.

  • 'POST /api/generate' — Textgenerierung.
  • 'POST /api/chat' — Chat-Abschlüsse.
  • Kompatibel mit dem OpenAI SDK über Basis-URL-Überschreibung.

Integrationstipps

  • Verwendung mit LangChain über die 'OllamaLLM'-Klasse.
  • Verwendung mit Open WebUI für eine ChatGPT-ähnliche Oberfläche.
  • GPU-Beschleunigung: Funktioniert mit NVIDIA (CUDA) und Apple Silicon (Metal).

Leistungserwartungen

  • 7B-Modell auf dem M2 MacBook: ~30 Token/Sekunde.
  • 7B-Modell auf RTX 4090: ~60 Token/Sekunde.
  • 70B-Modell mit 48GB RAM (CPU): ~3 Token/Sekunde.