Aller au contenu

Inférence

Le fait d’exécuter un modèle entraîné pour produire des sorties, par opposition à son entraînement.

La vitesse d’inférence se mesure en tokens par seconde, et la latence fait toute l’expérience d’un chat. Des moteurs comme vLLM et du matériel comme Groq existent précisément pour maximiser le débit et réduire le coût de l’inférence.

Ressources associées