Back
从 Bahdanau Attention 出发,推导缩放点积注意力、多头机制以及 padding 和 causal mask。
attention
transformer
deep-learning