Wiki
开始
Transformer 的注意力机制
从序列建模的难点出发,理解自注意力、QKV、多头注意力与位置编码如何协作,建立对大语言模型底层结构的直觉。
01
为什么需要注意力机制:RNN 的瓶颈与「每个词直接看见彼此」的直觉
02
自注意力核心运算:QKV 与缩放点积
03
多头注意力与位置编码:Transformer 的两块基础拼图
04
Encoder/Decoder 堆叠、残差连接与 LayerNorm:Transformer 为什么能堆到很深
相关专题
AI Agent 开发
为什么智能体在无人值守时格外危险,以及怎么给它装护栏
为什么复杂任务撑不住:记忆与规划
深入 ReAct 循环内部:每一步到底是怎么转的
从机器人行动理解具身智能
VLA(视觉-语言-动作)模型:大模型怎样进入身体
让机器人动起来:从“算出来”到“练出来”
机器人如何“看懂”世界:从传感器信号到内部地图
光线追踪怎样让画面更真实
从数小时到实时:光线追踪是怎么跑进游戏的
为什么Whitted光线追踪还不够:全局光照与路径追踪的诞生
一条光线的旅程:光线追踪凭什么让画面“突然变真”
从前端开发到做出能用的网页
元素在页面上到底占多大:content、padding、border、margin 与 box-sizing
CSS 是怎么落到元素上的:样式引入、选择器与层叠优先级
HTML 是怎么搭出网页骨架的:从最小文档到元素、属性和嵌套