困惑度 | Answer

交叉熵损失函数：为什么这个公式统治了深度学习的概率预测

当一个语言模型预测下一个词时，它输出的是整个词表上的概率分布。比如在"今天天气很"这个上下文后，模型可能给出"好"的概率是0.7，“差"的概率是0.2，“热"的概率是0.08，其他词的概率更低。如果真实的下一个词确实是"好”，我们如何量化模型预测的质量？更进一步，如何设计一个可微分的损失函数，让模型能够通过梯度下降不断优化这个预测能力？ ...

困惑度如何成为语言模型评估的黄金标准：从信息论到现代大模型的五十年演进

一个语言模型的好坏，究竟该如何衡量？假设你训练了两个语言模型。模型A对句子"猫坐在垫子上"给出了0.01的概率，模型B给出了0.001的概率。哪个模型更好？直觉告诉我们模型A更好——它对真实存在的句子赋予了更高的概率。但如果模型A对所有句子都赋予高概率呢？包括那些毫无意义的句子组合？ ...