Saltar al contenido

Seguridad y alineación de la IA

Campo dedicado a garantizar que los sistemas de IA se comporten conforme a los valores humanos y los objetivos previstos.

En la práctica abarca técnicas como RLHF, red-teaming, guardarraíles y entrenamiento de rechazo, que mantienen a los modelos útiles, honestos e inofensivos. Cobra aún más importancia a medida que los agentes autónomos actúan en el mundo real.

Recursos relacionados