第 21 讲:采样策略——temperature/top-p/top-k
模型每一步输出的是一个概率分布,不是一个词。从分布里挑出一个词,这一步不属于模型,是模型外面一段独立的、不需要训练的小算法——同一个模型,换一种挑法,行为可以判若两人。这一讲从最朴素的「永远挑最大的」讲起,手算它为什么会错过整体概率更高的句子;再看「完全按概率随机抽」为什么几乎一定会抽到奇怪的词;然后讲温度、top-k、top-p 三个旋钮各自在修什么问题。前几讲反复预告的「同一个模型为什么能给出不同回答」,答案就在这一步。