跳到内容

Transformer 架构

现代大模型背后的神经网络架构,通过自注意力并行处理所有词元。

源自 2017 年论文《Attention Is All You Need》,它取代了循环网络并使超大规模训练成为可能。如今几乎所有知名大模型都是 Transformer 的变体。

相关资源