Warum LLMs lokal betreiben?
- Privatsphäre: Deine Daten verlassen deinen Rechner nie.
- Kosten: Keine Kosten pro Token nach der Einrichtung.
- Geschwindigkeit: Keine Netzwerklatenz für Inferenz.
- Offline: Funktioniert ohne Internetverbindung.
Ollama installieren
- Download von [ollama.com](https://ollama.com) — verfügbar für macOS, Linux und Windows.
- Führe 'ollama pull llama3' aus, um ein Modell herunterzuladen.
- Lauf 'ollama run llama3', um mit dem Chatten anzufangen.
Beliebte Modelle
- Llama 3 8B: Gutes Allzweckmodell, läuft mit 8 GB RAM.
- Llama 3 70B: Viel intelligenter, benötigt 48 GB+ RAM.
- Qwen 2.5: Ausgezeichnet für chinesische und mehrsprachige Aufgaben.
- Mistral 7B: Schnell und effizient für Codierungsaufgaben.
- Phi-3 Mini: Microsofts kleines, aber leistungsfähiges Modell.
Nutzung der API
Ollama stellt unter 'http://localhost:11434' eine lokale REST-API bereit.
- 'POST /api/generate' — Textgenerierung.
- 'POST /api/chat' — Chat-Abschlüsse.
- Kompatibel mit dem OpenAI SDK über Basis-URL-Überschreibung.
Integrationstipps
- Verwendung mit LangChain über die 'OllamaLLM'-Klasse.
- Verwendung mit Open WebUI für eine ChatGPT-ähnliche Oberfläche.
- GPU-Beschleunigung: Funktioniert mit NVIDIA (CUDA) und Apple Silicon (Metal).
Leistungserwartungen
- 7B-Modell auf dem M2 MacBook: ~30 Token/Sekunde.
- 7B-Modell auf RTX 4090: ~60 Token/Sekunde.
- 70B-Modell mit 48GB RAM (CPU): ~3 Token/Sekunde.