Zum Inhalt springen

Inferenz

Das Ausführen eines trainierten Modells zur Erzeugung von Ausgaben – im Gegensatz zum Training.

Die Inferenzgeschwindigkeit wird in Tokens pro Sekunde gemessen, und die Latenz entscheidet über das Chat-Erlebnis. Serving-Engines wie vLLM und Hardware wie Groq sind genau darauf ausgelegt, Durchsatz und Kosten der Inferenz zu optimieren.

Verwandte Ressourcen