Transformer
Die Netzarchitektur hinter modernen LLMs, die mit Self-Attention alle Tokens parallel verarbeitet.
Vorgestellt im 2017er-Paper „Attention Is All You Need“, verdrängte sie rekurrente Netze und machte Training im ganz großen Maßstab möglich. Praktisch jedes bekannte LLM ist heute eine Transformer-Variante.