mirror of
https://github.com/skindhu/Build-A-Large-Language-Model-CN.git
synced 2026-07-29 15:20:24 +08:00
feature: update img format
This commit is contained in:
@@ -25,13 +25,13 @@
|
||||
|
||||
|
||||
|
||||
在上一章中,我们介绍了大语言模型(LLM)的基本结构,并了解到它们会基于海量的文本数据集进行预训练。我们特别关注的是仅使用通用 Transformer 架构中解码器部分的 LLM,这也是 ChatGPT 和其他流行的类似 GPT 的 LLM 所依赖的模型。
|
||||
在上一章中,我们介绍了大语言模型(LLM)的基本结构,并了解到 LLM 用海量文本数据集进行`预训练`。我们特别关注仅用**解码器**(Transformer 架构下)的 LLM,这也是 ChatGPT 和其他流行 GPT 的 LLM 所依赖的模型。
|
||||
|
||||
在预训练阶段,LLM 逐字处理文本。通过使用下一个单词预测任务训练拥有数百万到数十亿参数的 LLM,最终能够生成具有出色能力的模型。这些模型随后可以进一步微调,以遵循指令或执行特定目标任务。然而,在我们接下来几章中实现和训练 LLM 之前,我们需要准备训练数据集,这也是本章的重点,如图 2.1 所示。
|
||||
在**预训练**阶段,LLM 逐字处理文本。通过**预测下一个单词任务**,来训练出拥有数百万到数十亿参数的 LLM,最终生成的模型具有出色的能力。随后可以进一步微调模型,以遵循指令或执行特定目标任务。然而,在我们接下来几章中实现和训练 LLM 之前,我们需要准备训练数据集,这也是本章的重点,如图 2.1 所示。
|
||||
|
||||
<img src="../Image/chapter2/figure2.1.png" width="75%" />
|
||||
|
||||
在本章中,您将学习如何为训练 LLM 准备输入文本。这包括将文本拆分为单个单词和子词token,并将这些token编码为 LLM 的向量表示。您还将了解一些先进的token分割方案,比如字节对编码,这种方法在像 GPT 这样的流行 LLM 中得到应用。最后,我们将实现一个采样和数据加载策略,以生成后续章节中训练 LLM 所需的输入输出数据对。
|
||||
在本章中,您将学习如何为训练 LLM 准备输入文本。这包括将文本拆分为单个单词和子词token,并将这些token编码为 LLM 的向量表示。您还将了解一些先进的token分割方案,比如字节对编码,流行 LLM 中常用此类优化后的方案。最后,我们将实现一个采样和数据加载策略,以生成后续章节中训练 LLM 所需的输入输出数据对。
|
||||
|
||||
|
||||
|
||||
|
||||
Reference in New Issue
Block a user