2026
9 posts
- Transformer - Transformer Decoder
- Transformer - Transformer 的输入嵌入与位置编码
- Transformer - Transformer Encoder
- Transformer - 从 Additive Attention 到 Multi-Head Attention
- 深度学习中的权重初始化
- Batch Normalization 与 Layer Normalization
- LoRA: Low-Rank Adaptation
- Before LoRA: Measuring the Intrinsic Dimension
- Before LoRA 2: Sparse Projection, Fastfood, and SAID