这是一门系统原理向的 LLM 课程。它回答的问题只有一个:

一个大语言模型是怎么被造出来的?每一个设计决策在解决什么问题,代价是什么?

组织方式延续 CS 251:区块链系统原理 的做法:每一个机制都先给出它要解决的问题,再给出设计,最后给出这个设计放弃了什么。

课程信息

项目 内容
课程层次 不需要机器学习背景——第二单元从零讲起,只假设你会读一点代码
代码语言 纯 Python + NumPy,不引入 PyTorch/TensorFlow 等深度学习框架。反向传播、注意力机制、mini-Transformer 全部手写实现,逼自己看清楚每一步在算什么
组织方式 每讲固定六节:场景引入 → 直觉类比 → 机制细节 → 代价与局限 → 和其他机制的关系 → 小结与思考题

这门课不讲什么

不讲怎么调用某个模型的 API,不讲 prompt 技巧合集,不对比哪个产品更好用。

这些东西的半衰期以月计,而且到处都是。这门课讲的是不会过期的那一层:为什么自注意力是 $O(n^2)$、为什么 RLHF 有效但代价是什么、为什么长上下文是工程难题而不只是"调个参数"。

⚠️ 关于时效性:这个领域变化比区块链更快——具体模型的参数规模、context window 长度、某个 benchmark 的分数,六个月就可能过时。本课的处理方式是把「设计约束」和「当前取值」分开写:比如讲上下文长度会讲清楚它的工程瓶颈由什么决定,具体的"多少 token"只作为当前实例出现。模型换了,正文的推理仍然成立。

课程结构

课程分为八个单元,共 31 讲。

Unit 1 · 问题与历史(第 1–2 讲)

在讲任何架构之前,先把问题定义清楚:语言模型到底在解决什么,以及为什么早期方案会遇到瓶颈。

Unit 2 · 数学与机器学习基础(第 3–6 讲)

不假设任何机器学习背景,从零讲起:表示、概率、神经网络、反向传播。

Unit 3 · Transformer 架构(第 7–12 讲)

全课最核心的单元:从分词到自注意力,把一个 Transformer 拆到能自己实现的程度。

Unit 4 · 预训练(第 13–15 讲)

模型怎么从一堆文本里学出语言能力,以及"更大更好"这条经验规律的真实代价。

Unit 5 · 对齐与微调(第 16–20 讲)

预训练模型和一个"能对话、听指令"的模型之间还差什么,以及这中间每一步在用什么换什么。

Unit 6 · 推理与部署(第 21–24 讲)

模型训好之后,怎么把它跑起来、跑得快、跑得便宜。

Unit 7 · 检索、Agent 与系统集成(第 25–28 讲)

单个模型调用之外,怎么把外部知识和工具接进来,让模型完成多步任务。

Unit 8 · 局限与安全(第 29–31 讲)

这个系统在结构上做不到什么,以及它的攻击面在哪。

实验

六个实验,全部用纯 Python + NumPy,不依赖任何深度学习框架。

习题

每套习题都附完整解答,不是"答案略"。

参考