第 1 页,当前显示 9 篇,共 9 篇文章 按年份查看全部文章 →
- Transformer - Transformer Decoder
实现 masked self-attention、cross-attention、前馈网络,并组合完整 Encoder-Decoder 模型。
6 min read - Transformer - Transformer 的输入嵌入与位置编码
解释 Token Embedding、正弦余弦位置编码及其 PyTorch 实现与张量形状。
5 min read - Transformer - Transformer Encoder
拆解 Pre-LN Encoder Block、自注意力、前馈网络、残差连接与多层堆叠。
5 min read - Transformer - 从 Additive Attention 到 Multi-Head Attention
从 Bahdanau Attention 出发,推导缩放点积注意力、多头机制以及 padding 和 causal mask。
16 min read - 深度学习中的权重初始化
从零初始化和小随机数出发,通过激活分布理解 Xavier 与 Kaiming 初始化。
6 min read - Batch Normalization 与 Layer Normalization
从统计维度、训练推理行为和应用场景理解 BatchNorm 与 LayerNorm 的区别。
4 min read - LoRA: Low-Rank Adaptation
从 LoRA 的 low-rank update 出发,理解 rank 约束、训练与推理实现,以及它和 intrinsic dimension 的关系。
12 min read - Before LoRA: Measuring the Intrinsic Dimension
通过 random subspace training,理解完成一个任务所需的 degrees of freedom 为什么可能远低于模型参数量。
9 min read - Before LoRA 2: Sparse Projection, Fastfood, and SAID
从 dense Gaussian projection 的存储问题出发,理解 Sparse projection、Fastfood 和 SAID。
10 min read