Zum Inhalt springen

RLHF

Eine Trainingstechnik, die Modelle über ein aus menschlichen Bewertungen gelerntes Reward-Modell an menschliche Präferenzen anpasst.

RLHF ist ein Hauptgrund, warum Chatbots hilfreich und höflich wirken, statt bloß wahrscheinlichen Text vorherzusagen. Neuere Varianten wie DPO erreichen ähnliche Ausrichtung mit deutlich einfacherem Training.

Verwandte Ressourcen