Zum Inhalt springen

KI-Sicherheit & Alignment

Das Feld, das sicherstellen soll, dass KI-Systeme im Einklang mit menschlichen Werten und Zielen handeln.

In der Praxis umfasst das Techniken wie RLHF, Red-Teaming, Guardrails und Refusal-Training, die Modelle hilfreich, ehrlich und harmlos halten. Je mehr autonome Agenten real handeln, desto wichtiger wird es.

Verwandte Ressourcen