KI-Sicherheit & Alignment
Das Feld, das sicherstellen soll, dass KI-Systeme im Einklang mit menschlichen Werten und Zielen handeln.
In der Praxis umfasst das Techniken wie RLHF, Red-Teaming, Guardrails und Refusal-Training, die Modelle hilfreich, ehrlich und harmlos halten. Je mehr autonome Agenten real handeln, desto wichtiger wird es.