Perplexity

一个语言模型的好坏，究竟该如何衡量？假设你训练了两个语言模型。模型A对句子"猫坐在垫子上"给出了0.01的概率，模型B给出了0.001的概率。哪个模型更好？直觉告诉我们模型A更好——它对真实存在的句子赋予了更高的概率。但如果模型A对所有句子都赋予高概率呢？包括那些毫无意义的句子组合？ ...