- Transformer - 从 Additive Attention 到 Multi-Head Attention
从 Bahdanau Attention 出发,推导缩放点积注意力、多头机制以及 padding 和 causal mask。
16 min read - 深度学习中的权重初始化
从零初始化和小随机数出发,通过激活分布理解 Xavier 与 Kaiming 初始化。
6 min read - Batch Normalization 与 Layer Normalization
从统计维度、训练推理行为和应用场景理解 BatchNorm 与 LayerNorm 的区别。
4 min read - Before LoRA: Measuring the Intrinsic Dimension
通过 random subspace training,理解完成一个任务所需的 degrees of freedom 为什么可能远低于模型参数量。
9 min read