Transformer
La arquitectura de red neuronal detrás de los LLM modernos, que usa autoatención para procesar todos los tokens en paralelo.
Nació en el artículo de 2017 «Attention Is All You Need», desbancó a las redes recurrentes e hizo posible entrenar a escala masiva. Prácticamente todos los LLM conocidos de hoy son variantes del Transformer.