Seguridad y alineación de la IA
Campo dedicado a garantizar que los sistemas de IA se comporten conforme a los valores humanos y los objetivos previstos.
En la práctica abarca técnicas como RLHF, red-teaming, guardarraíles y entrenamiento de rechazo, que mantienen a los modelos útiles, honestos e inofensivos. Cobra aún más importancia a medida que los agentes autónomos actúan en el mundo real.