这是一门系统原理向的 LLM 课程。它回答的问题只有一个:
一个大语言模型是怎么被造出来的?每一个设计决策在解决什么问题,代价是什么?
组织方式延续 CS 251:区块链系统原理 的做法:每一个机制都先给出它要解决的问题,再给出设计,最后给出这个设计放弃了什么。
课程信息
| 项目 | 内容 |
|---|---|
| 课程层次 | 不需要机器学习背景——第二单元从零讲起,只假设你会读一点代码 |
| 代码语言 | 纯 Python + NumPy,不引入 PyTorch/TensorFlow 等深度学习框架。反向传播、注意力机制、mini-Transformer 全部手写实现,逼自己看清楚每一步在算什么 |
| 组织方式 | 每讲固定六节:场景引入 → 直觉类比 → 机制细节 → 代价与局限 → 和其他机制的关系 → 小结与思考题 |
这门课不讲什么
不讲怎么调用某个模型的 API,不讲 prompt 技巧合集,不对比哪个产品更好用。
这些东西的半衰期以月计,而且到处都是。这门课讲的是不会过期的那一层:为什么自注意力是 $O(n^2)$、为什么 RLHF 有效但代价是什么、为什么长上下文是工程难题而不只是"调个参数"。
⚠️ 关于时效性:这个领域变化比区块链更快——具体模型的参数规模、context window 长度、某个 benchmark 的分数,六个月就可能过时。本课的处理方式是把「设计约束」和「当前取值」分开写:比如讲上下文长度会讲清楚它的工程瓶颈由什么决定,具体的"多少 token"只作为当前实例出现。模型换了,正文的推理仍然成立。
课程结构
课程分为八个单元,共 31 讲。
Unit 1 · 问题与历史(第 1–2 讲)
在讲任何架构之前,先把问题定义清楚:语言模型到底在解决什么,以及为什么早期方案会遇到瓶颈。
Unit 2 · 数学与机器学习基础(第 3–6 讲)
不假设任何机器学习背景,从零讲起:表示、概率、神经网络、反向传播。
Unit 3 · Transformer 架构(第 7–12 讲)
全课最核心的单元:从分词到自注意力,把一个 Transformer 拆到能自己实现的程度。
- 第 7 讲:分词——BPE 为什么不按字/词切
- 第 8 讲:词嵌入与位置编码
- 第 9 讲:自注意力——Q/K/V 到底在算什么
- 第 10 讲:多头注意力、前馈层、残差与 LayerNorm
- 第 11 讲:Decoder-only vs Encoder-Decoder
- 第 12 讲:MoE——参数量和计算量的解耦
Unit 4 · 预训练(第 13–15 讲)
模型怎么从一堆文本里学出语言能力,以及"更大更好"这条经验规律的真实代价。
Unit 5 · 对齐与微调(第 16–20 讲)
预训练模型和一个"能对话、听指令"的模型之间还差什么,以及这中间每一步在用什么换什么。
- 第 16 讲:SFT——指令微调
- 第 17 讲:RLHF——原理与代价
- 第 18 讲:DPO 等更新对齐方法
- 第 19 讲:推理模型与 RLVR——测试时计算
- 第 20 讲:对齐解决了什么问题、留下什么隐患
Unit 6 · 推理与部署(第 21–24 讲)
模型训好之后,怎么把它跑起来、跑得快、跑得便宜。
- 第 21 讲:采样策略——temperature/top-p/top-k
- 第 22 讲:KV Cache、量化、批处理
- 第 23 讲:上下文长度——工程瓶颈
- 第 24 讲:测试时计算的代价——延迟与成本
Unit 7 · 检索、Agent 与系统集成(第 25–28 讲)
单个模型调用之外,怎么把外部知识和工具接进来,让模型完成多步任务。
- 第 25 讲:RAG 原理——模型知道的为什么不够
- 第 26 讲:Embedding 与向量检索
- 第 27 讲:Function calling——工具调用机制
- 第 28 讲:多步推理与规划——ReAct 等范式
Unit 8 · 局限与安全(第 29–31 讲)
这个系统在结构上做不到什么,以及它的攻击面在哪。
实验
六个实验,全部用纯 Python + NumPy,不依赖任何深度学习框架。
- 实验 1:手写反向传播(标量/小型 MLP)
- 实验 2:手写 BPE tokenizer
- 实验 3:手写自注意力机制
- 实验 4:mini-Transformer 完整前向传播
- 实验 5:采样策略 + KV cache 模拟
- 实验 6:mini-RAG(embedding + 余弦检索)
习题
每套习题都附完整解答,不是"答案略"。
- 习题集 1:数学、神经网络与 Transformer 架构(第 1–12 讲)
- 习题集 2:预训练与对齐(第 13–20 讲)
- 习题集 3:推理与部署(第 21–24 讲)
- 习题集 4:检索、Agent 与安全(第 25–31 讲)