大语言模型:Transformer 与注意力机制

搞懂 Transformer 靠自注意力如何让序列里的词互相关联,建立对大模型底层结构的直觉。

已连载 4

为什么需要注意力:RNN 的瓶颈与「每个词直接看见彼此」的直觉

从 RNN 串行处理、长程衰减、信息瓶颈三个痛点,引出注意力机制的核心动机——让序列里每个词直接看见所有其他词。

自注意力核心运算:QKV 与缩放点积

Query/Key/Value 三个向量各是什么角色,缩放点积注意力如何算出每个词该从其他词身上聚合多少信息

多头注意力与位置编码:Transformer 的两块基础拼图

为什么需要多个注意力头(多视角关注不同关系),以及自注意力本身不含顺序、如何用正弦波位置编码把词的先后位置信息喂进去

Encoder/Decoder 堆叠、残差连接与 LayerNorm:Transformer 为什么能堆到很深

把前几篇拆解的组件拼回完整架构,理解残差连接、层归一化和前馈网络如何让 Transformer 堆到 96 层以上