第 31 讲:可解释性的现状边界
前面有九讲把同一类问题留给了这一讲:注意力权重算不算模型的推理过程、写下的思考是否忠实、模型内部有没有「我不确定」的痕迹、行为对齐之后我们能不能知道它为什么这样做。这一讲先说清楚为什么难——我们能读到模型内部每一个数字,却看不懂它们;再逐一介绍现在的几类方法:注意力权重为什么会误导(手算两层之后「位置 1」里只剩 56% 来自第 1 个词)、探针怎么在内部找一个方向、为什么必须动手改它才算证据、怎么把叠在一起的概念拆开。最后把九个问题逐条对照现状,并给全课收尾。