去皮卡多 发表于 2024-9-14 01:53:57

一文彻底搞懂大模型 - GPT和LlaMA的模型架构

https://img-blog.csdnimg.cn/img_convert/c7aea9cbadb48a7f1dcb2b25a5078354.png
GPT vs LlaMA
GPT与LlaMA,作为大语言模型的两大巨擘,均基于Transformer架构却各有千秋。GPT系列以强大的生成本领著称,通过不绝增大的参数规模引领复杂语言与推理任务的前沿;而Llama则以开源姿态,通过技能创新提升模型性能,预示着多模态扩展的将来,为AI生态的多样性和开放性贡献气力。
GPT vs LlaMA
一、GPT
什么是GPT?GPT模型,全称为Generative Pre-trained Transformer,是由OpenAI团队开发的一种基于深度学习的自然语言处理(NLP)模型。该模型通过无监督学习的方式,对大规模文本举行学习和抽象概括,进而通过微调的方式用于各种特定的自然语言处理任务。
GPT
GPT的版本迭代:OpenAI GPT模型自发布以来,已经历了多个版本的迭代升级,每个版本都在前一版本的底子上举行了改进和优化。
GPT的版本迭代

[*] GPT-1:这是GPT系列的第一个版本,发布于2018年。**GPT-1具有1.17亿个参数,使用Transformer的Decoder结构作为底子,并接纳了预训练的语言模型。**它在多项自然语言处理任务上取得了很好的表现,如文本生成、机器翻译和阅读理解等。
[*] GPT-2:GPT-2是GPT系列的第二个版本,发布于2019年。相比于GPT-1,GPT-2在模型规模和预训练数据上都有了显著的提升。**GPT-2的参数数量增长到了15亿,并使用了更多的预训练数据。**这些改进使得GPT-2在生成任务上表现出了更强的创造力和语言理解本领,能够生成更长、更连贯的文本。
[*] GPT-3:GPT-3是GPT系列的第三个版本,发布于2020年。**GPT-3具有惊人的1750亿个参数。**这一巨大的模型规模使得GPT-3能够处理更加复杂和多样的自然语言处理任务,包括文本生成、翻译、问答和文天职类等。GPT-3在预训练过程中使用了大量的互联网文本数据,进一步提升了其性能和泛化本领。
[*] GPT-4:GPT-4是GPT系列的第四个版本,发布于2023年3月。**GPT-4是一款具有广泛应用的大型、多模态模型。**与之前的版本不同,GPT-4是第一个能够同时接收文本和图像的多模态模型。它不但可以接收文本输入,还能接收图像输入,并生成相应的文本输出。GPT-4在各种专业和学术基准测试中表现出色,表现出其强大的自然语言处理本领和多模态理解本领。
https://img-blog.csdnimg.cn/img_convert/dcf7cac640de3b5b1976bbe4cc1ad9ab.jpeg
GPT的版本迭代
GPT2的架构:GPT-3及以后的版本接纳了闭源的计谋,模型的详细实现细节、训练数据、超参数配置等关键信息并未对外公开。
GPT-2的架构主要基于Transformer的解码器(Decoder)部分,并通过堆叠多个Decoder层、引入自注意力机制和位置编码、使用残差毗连和层归一化等技能手段来构建模型。
GPT-2的架构
1. 堆叠Transformer的Decoder



[*] GPT-2沿用了Transformer的解码器部分,通过堆叠多个Decoder层来构建模型。每个Decoder层都包罗了自注意力(Self-Attention)机制和位置编码(Position Encoding)等关键组件。
[*] GPT-2的堆叠层数可以根据详细需求举行调整,但通常包括多个(如12层)Decoder层,以提供足够的深度来捕捉文本中的复杂依赖关系。
2. 自注意力机制(Self-Attention)



[*] 自注意力机制是Transformer和GPT-2中的焦点组件,它答应模型在处理文本时同时关注到文本中的其他部分。
[*] 在GPT-2中,自注意力机制通过盘算输入序列中每个单词与其他单词之间的相关性来实现,从而帮助模型理解文本的全局上下文信息。
3. 位置编码(Position Encoding)



[*] 由于Transformer模型本身并不包罗任何关于单词位置的信息,GPT-2引入了位置编码来弥补这一缺陷。
[*] 位置编码是一种将单词在序列中的位置信息嵌入到模型中的方法,它使得模型能够区分不同位置的单词并理解它们的顺序关系。
4. 残差毗连(Residual Connections)和层归一化(Layer Normalization)



[*] GPT-2在Decoder层之间使用了残差毗连和层归一化技能,以进步模型的训练稳定性和收敛速率。
[*] 残差毗连答应模型在传递信息时保留前一层的部分输出,从而制止了深层网络中的梯度消散或梯度爆炸题目。
[*] 层归一化则通过对每一层的输入举行归一化处理,使得模型的每一层都能够在相似的尺度上工作,进一步进步了模型的稳定性和性能。
5. 输出层



[*] GPT-2的输出层通常包括一个线性层(Linear Layer)和一个Softmax层,用于将Decoder层的输出映射到词汇表上的概率分布。
[*] 通过这种方式,GPT-2可以根据输入的上文生成对应的下文单词,从而实现文本生成任务。
https://img-blog.csdnimg.cn/img_convert/dd367a7855db430bf62897817a7c614a.png
GPT-2的架构
二、LlaMA
什么是LlaMA? LLaMA的全称是Large Language Model Meta AI,直译为“大语言模型元AI”。由于“Llama”在西班牙语中意为“羊驼”,因此社区也将其昵称为羊驼系模型。
LLaMA于2023年2月由Meta AI发布,是该系列的初代模型。随后,Meta AI又相继推出了LLaMA2和LLaMA3等升级版本。

[*] 训练数据:LLaMA的训练数据来源于公开数据集,无任何定制数据集,确保了其工作的开源兼容性和可复现性。整个训练数据集在token化之后大约包罗1.4T的token。随着版本的迭代,训练数据的规模不绝增长,LLaMA3甚至基于超过15万亿个token的数据举行预训练。
[*] 模型规模:LLaMA提供了多种规模的版本,包括7B、13B、70B和405B(4050亿)等不同参数量的模型。这些模型可以根据详细的应用场景和盘算资源举行选择。
[*] 性能优异:LLaMA在多个基准测试上表现出色,甚至能够媲美或超越一些参数量更大的模型。比方,具有130亿参数的LLaMA模型在大多数基准上可以胜过GPT-3(参数量达1750亿)。
LlaMA
LlaMA的架构:LLaMA模型的整体架构与GPT-2等Transformer模型类似,但针对稳定性和性能举行了多项改进。它接纳了前置层归一化(Pre-normalization)、RMSNorm归一化函数、SwiGLU激活函数以及旋转位置嵌入(RoPE)等关键技能。
https://img-blog.csdnimg.cn/img_convert/a37d69c4b4c44fd7bb4bc1dc5a665821.png
LlaMA的架构

[*]前置层归一化(Pre-normalization)


[*]为了提升训练时的稳定性,LLaMA将归一化利用从Transformer子层的输出移到了输入。详细地,第一层归一化被设置在多头注意力层之前,第二层归一化被移动到全毗连层之前。同时,残差毗连的位置也调整到了多头注意力层与全毗连层之后。这种筹划有助于减少梯度消散或爆炸的题目,从而进步训练稳定性。

[*]RMSNorm归一化函数


[*]LLaMA在归一化过程中使用了RMSNorm(Root Mean Square Layer Normalization),这是一种基于均方根(RMS)的归一化方法。RMSNorm不依赖于均值,而是通过盘算特征向量的RMS值来举行归一化。这种方法在盘算上更为简洁,且在某些情况下可以提供类似甚至更好的性能。在LLaMA中,RMSNorm还加入了可学习的缩放因子和偏移参数,以进一步进步模型的灵活性。

[*]SwiGLU激活函数


[*]LLaMA使用了SwiGLU(Swish-Gated Linear Unit)激活函数,这是Shazeer在文献中提出的一种激活函数,并在PaLM等模型中得到了广泛应用。相较于传统的ReLU函数,SwiGLU在许多评测数据集上表现出了更好的性能。在LLaMA中,全毗连层使用了带有SwiGLU激活函数的盘算方式,这有助于提升模型的非线性处理本领。

[*]旋转位置嵌入(RoPE)


[*]LLaMA没有使用传统的绝对位置编码(如BERT中的sin/cos位置编码),而是接纳了旋转位置嵌入(RoPE)。RoPE借助了复数的思想,通过绝对位置编码的方式实现了相对位置编码的效果。这种方法能够更有效地捕捉序列中的位置信息,从而提升模型在处理序列数据时的性能。
怎样学习大模型 AI ?

由于新岗位的生产效率,要优于被代替岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是详细到个人,只能说是:
“最先把握AI的人,将会比力晚把握AI的人有竞争上风”。

这句话,放在盘算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线互联网企业工作十余年里,引导过不少偕行后辈。帮助许多人得到了学习和成长。
我意识到有许多履历和知识值得分享给大家,也可以通过我们的本领和履历解答大家在人工智能学习中的许多困惑,所以在工作繁忙的情况下还是对峙各种整理和分享。但苦于知识传播途径有限,许多互联网行业朋友无法得到精确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。
页: [1]
查看完整版本: 一文彻底搞懂大模型 - GPT和LlaMA的模型架构