第 31 讲:可解释性的现状边界

前面有九讲把同一类问题留给了这一讲:注意力权重算不算模型的推理过程、写下的思考是否忠实、模型内部有没有「我不确定」的痕迹、行为对齐之后我们能不能知道它为什么这样做。这一讲先说清楚为什么难——我们能读到模型内部每一个数字,却看不懂它们;再逐一介绍现在的几类方法:注意力权重为什么会误导(手算两层之后「位置 1」里只剩 56% 来自第 1 个词)、探针怎么在内部找一个方向、为什么必须动手改它才算证据、怎么把叠在一起的概念拆开。最后把九个问题逐条对照现状,并给全课收尾。

2026-09-23 · ifcalm

实验 1:手写反向传播(标量/小型 MLP)

占位中,内容正在编写。

2026-09-23 · ifcalm

实验 2:手写 BPE tokenizer

占位中,内容正在编写。

2026-09-23 · ifcalm

实验 3:手写自注意力机制

占位中,内容正在编写。

2026-09-23 · ifcalm

实验 4:mini-Transformer 完整前向传播

占位中,内容正在编写。

2026-09-23 · ifcalm

实验 5:采样策略 + KV cache 模拟

占位中,内容正在编写。

2026-09-23 · ifcalm

实验 6:mini-RAG(embedding + 余弦检索)

占位中,内容正在编写。

2026-09-23 · ifcalm

习题集 1:数学、神经网络与 Transformer 架构(第 1–12 讲)

占位中,内容正在编写。

2026-09-23 · ifcalm

习题集 2:预训练与对齐(第 13–20 讲)

占位中,内容正在编写。

2026-09-23 · ifcalm

习题集 3:推理与部署(第 21–24 讲)

占位中,内容正在编写。

2026-09-23 · ifcalm