feature: update img format

This commit is contained in:
Ning Guo
2025-07-27 20:49:30 +08:00
parent 2da27b87e0
commit dea4d004d8
2 changed files with 41 additions and 13 deletions

View File

@@ -25,13 +25,13 @@
在上一章中我们介绍了大语言模型LLM的基本结构并了解到它们会基于海量文本数据集进行预训练。我们特别关注的是仅使用通用 Transformer 架构中解码器部分的 LLM这也是 ChatGPT 和其他流行的类似 GPT 的 LLM 所依赖的模型。
在上一章中我们介绍了大语言模型LLM的基本结构并了解到 LLM 用海量文本数据集进行`预训练`。我们特别关注仅用**解码器**Transformer 架构下)的 LLM这也是 ChatGPT 和其他流行 GPT 的 LLM 所依赖的模型。
在预训练阶段LLM 逐字处理文本。通过使用下一个单词预测任务训练拥有数百万到数十亿参数的 LLM最终能够生成具有出色能力的模型。这些模型随后可以进一步微调,以遵循指令或执行特定目标任务。然而,在我们接下来几章中实现和训练 LLM 之前,我们需要准备训练数据集,这也是本章的重点,如图 2.1 所示。
**预训练**阶段LLM 逐字处理文本。通过**预测下一个单词任务**,来训练拥有数百万到数十亿参数的 LLM最终生成的模型具有出色能力随后可以进一步微调模型,以遵循指令或执行特定目标任务。然而,在我们接下来几章中实现和训练 LLM 之前,我们需要准备训练数据集,这也是本章的重点,如图 2.1 所示。
<img src="../Image/chapter2/figure2.1.png" width="75%" />
在本章中,您将学习如何为训练 LLM 准备输入文本。这包括将文本拆分为单个单词和子词token并将这些token编码为 LLM 的向量表示。您还将了解一些先进的token分割方案比如字节对编码这种方法在像 GPT 这样的流行 LLM 中得到应用。最后,我们将实现一个采样和数据加载策略,以生成后续章节中训练 LLM 所需的输入输出数据对。
在本章中,您将学习如何为训练 LLM 准备输入文本。这包括将文本拆分为单个单词和子词token并将这些token编码为 LLM 的向量表示。您还将了解一些先进的token分割方案比如字节对编码流行 LLM 中常用此类优化后的方案。最后,我们将实现一个采样和数据加载策略,以生成后续章节中训练 LLM 所需的输入输出数据对。