第 11 讲:Decoder-only vs Encoder-Decoder
第 9 讲的自注意力默认允许任意位置互相看,但第 1 讲的任务是「预测下一个词」——如果预测第 t+1 个词时能直接看到第 t+1 个词本身,训练时就是在抄答案,推理时更是不可能。这一讲用因果掩码堵上这个漏洞,梳理 Encoder(双向理解)、Decoder-only(自回归生成)、Encoder-Decoder(两者都要)三种宏观架构,并说明为什么今天几乎所有生成式大模型都收敛到了 Decoder-only 这一种。