架构设计 | Answer

Encoder-Only、Decoder-Only和Encoder-Decoder：为什么这三种架构统治了Transformer的七年演变

从一个问题说起如果你问一位NLP研究者：“为什么GPT选择了Decoder-only架构，而BERT选择了Encoder-only？“答案可能涉及双向注意力、因果掩码、预训练目标……但如果你追问：“那为什么现在的千亿参数大模型几乎清一色是Decoder-only？“很多人可能就说不清楚了。 ...

2015年，何凯明团队在ImageNet竞赛中提交了一个152层的神经网络模型。这个深度是当时主流模型的8倍，但训练误差却更低——这在当时简直是不可思议的事情。因为在那之前，人们普遍认为网络越深，训练越困难。实际上，研究者们观察到一个反直觉的现象：增加层数反而会让模型性能下降。 ...

2016年，一个初创团队决定采用事件溯源架构来构建他们的电商系统。两年后，当被问及这个决策时，技术负责人的回答让人深思：“如果你问我是否后悔选择事件溯源，我的回答是：不后悔。但如果让我重新选择，我会先用CRUD。” ...