- Transformer - Transformer Decoder
实现 masked self-attention、cross-attention、前馈网络,并组合完整 Encoder-Decoder 模型。
6 min read - Transformer - Transformer 的输入嵌入与位置编码
解释 Token Embedding、正弦余弦位置编码及其 PyTorch 实现与张量形状。
5 min read - Transformer - Transformer Encoder
拆解 Pre-LN Encoder Block、自注意力、前馈网络、残差连接与多层堆叠。
5 min read - Transformer - 从 Additive Attention 到 Multi-Head Attention
从 Bahdanau Attention 出发,推导缩放点积注意力、多头机制以及 padding 和 causal mask。
16 min read - LoRA: Low-Rank Adaptation
从 LoRA 的 low-rank update 出发,理解 rank 约束、训练与推理实现,以及它和 intrinsic dimension 的关系。
12 min read