Answer

混合精度训练：为什么用一半精度反而能训练更好的模型

训练大模型时，显存总是第一个瓶颈。以一个拥有70亿参数的LLaMA 7B模型为例，仅存储FP32权重就需要约28GB显存。再加上梯度、优化器状态和中间激活值，即使是一张A100 80GB显卡也可能捉襟见肘。 ...

2015年3月，Geoffrey Hinton在arXiv上发表了一篇只有9页的论文，标题是《Distilling the Knowledge in a Neural Network》。这篇论文没有提出什么新的网络架构，也没有刷新任何榜单，却彻底改变了模型部署的游戏规则。 ...

一个看似简单的参数当你第一次在API文档中看到seed参数时，可能会觉得它只是一个普通的整数。但这个看似简单的参数，却隐藏着大语言模型推理过程中最深层的随机性控制机制。 ...

2017年，Vaswani等人在《Attention Is All You Need》中提出了Transformer架构，用纯粹的注意力机制取代了循环神经网络。然而，这个革命性的架构有一个致命缺陷：自注意力机制天生不知道顺序。 ...

从一个预测游戏说起当我们在说话或写作时，大脑在不停地进行一个预测游戏：根据已经说出的内容，预测下一个最可能出现的词。这个看似简单的认知过程，恰恰是现代大语言模型的核心工作原理。 ...

当你在 ChatGPT 中输入一个问题，模型生成一段流畅的回答后优雅地停下——这个看似简单的"停止"动作背后，隐藏着一个被大多数人忽视却至关重要的机制：EOS Token。这个特殊的词汇表条目，像一个隐形的句号，决定了大模型何时该闭嘴。 ...

当GPT-4被问到"法国的首都是哪里"时，它能准确回答"巴黎"。这个看似简单的过程背后，隐藏着一个深刻的问题：大模型是如何"记住"这些事实的？是参数随机分布，还是有组织的存储？ ...