AnfängerLesezeit 8 Min.·

Open-Source-LLMs lokal betreiben: Ollama in der Praxis

Große Modelle auf dem eigenen Rechner zu betreiben schützt die Datenprivatsphäre und macht Offline-Entwicklung und Experimente einfach. Mit Ollama ist das alles so leicht wie das Installieren einer App.

VonAI Resource Hub

Warum lokal deployen?

Beim lokalen Deployment verlassen die Daten nie deinen Rechner – ideal für sensibles Material. Ohne API-Gebühren kannst du zudem beliebig oft experimentieren und alles in lokale Workflows einbinden.

Erstes Modell installieren und starten

Nach der Installation von der offiziellen Seite genügt ein einziger Befehl, um ein Modell zu laden und zu starten. Beim ersten Lauf werden die Gewichte automatisch heruntergeladen.

# Pull and chat directly
ollama run llama3.2

# Or just download the model
ollama pull qwen2.5

Zugriff über die API

Einmal gestartet, stellt Ollama auf dem lokalen Port 11434 eine HTTP-Schnittstelle bereit – die du in deine App einbindest wie einen Cloud-API-Aufruf.

curl http://localhost:11434/api/chat -d '{
  "model": "llama3.2",
  "messages": [{ "role": "user", "content": "Hi, please introduce yourself" }],
  "stream": false
}'

Das passende Modell wählen

Größere Modelle liefern meist bessere Ergebnisse, brauchen aber mehr VRAM und Arbeitsspeicher. Wähle zuerst eine Parametergröße, die zu deinem Rechner passt (etwa 7B/8B), und wäge dann Tempo gegen Qualität ab.

In der Ollama-Modellbibliothek findest du viele Open-Source-Modelle wie Llama, Qwen, Mistral oder Gemma – und wechselst je nach Bedarf.

Performance-Tuning und GPU-Tipps

Ollama nutzt automatisch GPU-Beschleunigung, wenn verfügbar. Auf Apple-Silicon-Macs wird Metal sofort verwendet. Unter Linux mit NVIDIA stelle sicher, dass CUDA-Treiber und der Ollama-CUDA-Build installiert sind. Bei VRAM-Mangel probiere eine kleinere Quantisierung (z. B. Q4_K_M statt Q8_0) oder eine kleinere Modellfamilie. Mit OLLAMA_NUM_PARALLEL bearbeitest du auf Maschinen mit genug Speicher gleichzeitige Anfragen.

Integration in deine Anwendung

Ollamas API ist mit dem OpenAI-Chat-Completions-Format kompatibel. Du kannst denselben Code wiederverwenden, indem du einfach die Basis-URL auf http://localhost:11434/v1 änderst und eine beliebige Zeichenfolge als API-Key verwendest. Bibliotheken wie LangChain und LlamaIndex haben ebenfalls native Ollama-Integration, wodurch es unkompliziert ist, ein Cloud-Modell gegen ein lokales in deiner RAG- oder Agent-Pipeline auszutauschen.

OllamaLokales DeploymentOpen SourceDatenschutz

Verwandte Tutorials