Cuantización
Reducir la precisión numérica de los pesos (p. ej., a 4 bits) para achicar el modelo y ejecutarlo en hardware modesto.
Un modelo cuantizado a 4 bits ocupa aproximadamente una cuarta parte del original en 16 bits, lo que permite correr un 7B–8B en un portátil con una pérdida de calidad pequeña y normalmente asumible.