第 11 讲:Decoder-only vs Encoder-Decoder

第 9 讲的自注意力默认允许任意位置互相看,但第 1 讲的任务是「预测下一个词」——如果预测第 t+1 个词时能直接看到第 t+1 个词本身,训练时就是在抄答案,推理时更是不可能。这一讲用因果掩码堵上这个漏洞,梳理 Encoder(双向理解)、Decoder-only(自回归生成)、Encoder-Decoder(两者都要)三种宏观架构,并说明为什么今天几乎所有生成式大模型都收敛到了 Decoder-only 这一种。

2026-09-23 · ifcalm

第 12 讲:MoE——参数量和计算量的解耦

第 10 讲的前馈层,每次处理一个 token 都要激活它全部的参数——想让模型「知道更多」,就必须让每个 token 的计算成本跟着等比例上涨,两者被死死绑在一起。MoE 把一个前馈层换成一组并行的「专家」,用一个小小的路由器给每个 token 挑出最相关的少数几个专家参与计算,其余专家的参数完全按兵不动。模型的总参数量可以很大,但每个 token 实际付出的计算量只取决于被选中的那几个专家——这一讲用一个可以手算的路由过程,验证这句话具体是怎么做到的。

2026-09-23 · ifcalm

第 13 讲:预训练目标与自监督学习

把第 9–12 讲拼好的 Decoder-only Transformer,和第 6 讲的训练循环放在一起,在海量文本上反复运行——这就是预训练。这一讲正式定义自监督学习和自回归建模这两个从第 1、4 讲起就被预告的术语,并讲清楚一个经常被忽略、却是理解后面推理阶段代价的关键细节:靠着因果掩码和「教师强制」,训练时的前向传播是完全并行的,尽管这个模型骨子里是「自回归」的——为什么生成时却必须一步步来,这个不对称性会在第 21–24 讲反复出现。

2026-09-23 · ifcalm

第 14 讲:数据——规模、质量、去重、合成数据与多阶段训练

第 13 讲说预训练是在海量文本上跑训练循环,但没说这些文本从哪来、长什么样——这一讲打开这个黑箱。互联网文本质量参差不齐,需要过滤;同一段内容会被大量重复,需要去重;纯天然数据在某些稀缺能力上供给不足,催生了用模型生成训练数据的合成数据;训练不是一次性把所有数据混在一起,而是分阶段、有策略地安排数据配比。核心结论只有一句话:模型的全部知识和倾向,都来自训练数据,没有任何独立于数据之外的信息来源。

2026-09-23 · ifcalm

第 15 讲:Scaling Laws

第 1 讲留了一个赌注:把「猜下一个词」这件事,用更大的模型、更多的数据、更多的算力去做,会发生什么。这一讲给出定量的回答——损失随参数量、数据量、计算量的增长,遵循一种平滑、可预测的幂律关系,但收益是递减的:每多买一个数量级的资源,买到的是恒定的相对改善,不是恒定的绝对改善。这条规律最大的实际价值,是让研究者能用一系列便宜的小模型实验,提前预测一次昂贵的大规模训练会得到什么效果。

2026-09-23 · ifcalm

第 16 讲:SFT——指令微调

预训练只教会模型「续写统计上合理的文本」,没有教会它「像一个助手一样回答问题」——一个刚训练完的基础模型,收到一个问题时,最可能的续写往往不是一个直接的回答。SFT 用人工准备的指令-回答范例,在预训练模型的基础上继续训练——机制和第 13 讲的训练循环完全相同,唯一的区别是数据换成了人工示范,损失只在「助手该说的部分」计算。这一讲把第 11 讲预告的「拼接输入输出、只在输出部分算损失」这套思路,变成具体可操作的做法。

2026-09-23 · ifcalm

第 17 讲:RLHF——原理与代价

第 16 讲的 SFT 只能模仿单一示范,没法表达「这个回答比那个更好」。RLHF 利用一个关键事实:人类写不出满分答案,却能相当稳定地判断两个答案哪个更好。这一讲拆开 RLHF 的三步——收集成对偏好、训练一个给回答打分的奖励模型、用强化学习把模型往高分方向推——手算奖励模型的损失和策略梯度的加权方式,兑现第 6 讲关于「奖励怎么变成梯度」的承诺,最后讲清楚它最大的隐患:模型优化的是奖励模型的打分,不是人类真正想要的东西。

2026-09-23 · ifcalm

第 18 讲:DPO 等更新对齐方法

第 17 讲的 RLHF 要先训练一个奖励模型,再用强化学习追着它的分数跑,内存里同时塞着好几个大模型,又贵又不稳定。DPO 发现了一个数学上的捷径:RLHF 那个带 KL 绳子的目标,最优解可以直接写出来,把它倒过来代进偏好概率里,奖励模型会被整个消掉——剩下的,是一个只需要当前模型和参考模型、形式上和普通分类损失差不多的式子。这一讲一步步推出这个式子,手算它的损失,然后讲清楚省掉的那两步到底丢掉了什么。

2026-09-23 · ifcalm

第 19 讲:推理模型与 RLVR——测试时计算

模型每生成一个 token,做的计算量是固定的——层数就那么多。如果答案必须脱口而出,模型只有一次前向传播的时间来想。推理模型的核心发现是:让模型先写下一长串中间步骤再给答案,等于把「想」的时间拉长,而写下的每一步都会被后面的步骤通过注意力读到,变成一张草稿纸。怎么教会模型写好这张草稿纸?RLVR 回到第 17 讲的强化学习,但把奖励换成可以被程序客观验证的对错。这一讲手算这种训练在一道题上具体怎么分配奖励,并讲清楚一个被称为「测试时计算」的新扩展方向。

2026-09-23 · ifcalm

第 20 讲:对齐解决了什么问题、留下什么隐患

把 SFT、RLHF、DPO、RLVR 四种方法放在一起看,它们有一个共同的数学本质:在预训练模型已有的概率分布上重新分配概率,而不是凭空创造新东西。第 18 讲推出的最优解公式把这件事写得清清楚楚——参考模型给了零概率的回答,乘上多大的奖励都还是零;被压低的回答,概率变小了但没有归零。这一讲用一个四选一的手算例子把这两条后果算出来,再从它们出发,逐条梳理对齐留下的隐患:被压下去的行为可以被重新唤起、输出多样性和校准的损失、迎合,以及「对齐到什么」这个问题本身没有答案。

2026-09-23 · ifcalm