Inferencia
El proceso de ejecutar un modelo ya entrenado para producir resultados, a diferencia de entrenarlo.
La velocidad de inferencia se mide en tokens por segundo, y la latencia marca la experiencia de un chat. Motores de servicio como vLLM y hardware como Groq existen precisamente para exprimir el rendimiento y abaratar la inferencia.