Saltar al contenido

RLHF

Técnica de entrenamiento que alinea los modelos con las preferencias humanas mediante un modelo de recompensa aprendido de valoraciones humanas.

El RLHF es gran parte del motivo por el que los chatbots resultan útiles y educados en vez de limitarse a predecir texto probable. Variantes más recientes como DPO logran una alineación similar con un entrenamiento más sencillo.

Recursos relacionados