大模型 | Answer

Seed参数：为什么这个整数能决定大模型的输出轨迹

一个看似简单的参数当你第一次在API文档中看到seed参数时，可能会觉得它只是一个普通的整数。但这个看似简单的参数，却隐藏着大语言模型推理过程中最深层的随机性控制机制。 ...

相对位置偏置如何改变Transformer的序列理解能力：从Shaw到ALiBi的七年技术演进

2017年，Vaswani等人在《Attention Is All You Need》中提出了Transformer架构，用纯粹的注意力机制取代了循环神经网络。然而，这个革命性的架构有一个致命缺陷：自注意力机制天生不知道顺序。 ...

EOS Token：为什么这个特殊标记决定了大模型的说话边界

当你在 ChatGPT 中输入一个问题，模型生成一段流畅的回答后优雅地停下——这个看似简单的"停止"动作背后，隐藏着一个被大多数人忽视却至关重要的机制：EOS Token。这个特殊的词汇表条目，像一个隐形的句号，决定了大模型何时该闭嘴。 ...

从输入文本到输出：大模型推理的完整流程解析

当你向一个大语言模型输入"今天天气怎么样"，它在毫秒级别内就能返回一段流畅的回答。这个过程看似简单，背后却隐藏着一套精密的计算流程。输入的文本经历了分词、嵌入、多层Transformer处理、概率计算、采样选择等多个阶段，最终才能生成你所看到的每一个字符。 ...

参数高效微调：为什么0.1%的参数能做到全参数微调99%的效果

2021年，微软的研究团队提出了一个看似不可能的假设：如果预训练模型学到的知识实际上只存在于一个极低维的子空间中，那么微调是否只需要更新这个子空间就足够了？ ...

自注意力与交叉注意力：Transformer如何用两种机制处理「同一序列」与「两个世界」

2017年，Vaswani等人在论文《Attention Is All You Need》中提出了Transformer架构。这篇论文的核心洞察可以用一句话概括：循环神经网络并非处理序列数据的唯一途径，注意力机制本身就足够了。 ...

为什么大模型连两位数加法都算不准：从tokenization到启发式神经元的完整技术解析

2024年7月，一个简单的问题让全球十二个主流大模型中的八个栽了跟头：9.11和9.9哪个大？这不是孤例。同样的问题还有：247 × 389等于多少？8743 + 3927呢？如果你尝试让ChatGPT、Claude或其他大模型直接计算这些数字，得到的答案往往令人哭笑不得——要么差几位数，要么完全离谱。 ...