Sécurité et alignement de l’IA
Domaine visant à garantir que les systèmes d’IA se comportent selon les valeurs humaines et les objectifs prévus.
Concrètement, cela couvre le RLHF, le red-teaming, les garde-fous et l’entraînement au refus — tout ce qui garde les modèles utiles, honnêtes et inoffensifs. L’enjeu grandit à mesure que des agents autonomes agissent dans le monde réel.