7 Commits

Author SHA1 Message Date
long_long_ago
7074262f7d Merge pull request #30 from FMLS/patch-1
Revise token ID list and corresponding explanations
2026-08-10 10:54:48 +08:00
FMLS
b58c369e29 Revise token ID list and corresponding explanations
Updated token ID examples and explanations in the document.
2026-07-04 22:53:33 +08:00
long_long_ago
592cc35a7a Update 5.在无标记数据集上进行预训练.md
修复代码错误
2025-09-07 09:02:42 +08:00
long_long_ago
8f18f81dec Update README.md 2025-08-31 15:01:25 +08:00
skindhu
49387bb4e1 opt readme 2025-08-24 23:56:29 +08:00
long_long_ago
84b09d1aa7 Update README.md 2025-08-20 10:16:12 +08:00
long_long_ago
5de19f2835 Update README.md 2025-08-11 11:00:25 +08:00
3 changed files with 14 additions and 4 deletions

View File

@@ -50,6 +50,12 @@
+ [附录D给训练循环添加高级技巧](https://skindhu.github.io/Build-A-Large-Language-Model-CN/#/./cn-Book/附录D.给训练循环添加高级技巧.md)
+ [附录E使用 LoRA 的参数高效微调](https://skindhu.github.io/Build-A-Large-Language-Model-CN/#/./cn-Book/附录E.使用LoRA的参数高效微调.md)
### 新书推荐
+ [《Google DeepMind - How to Scale Your Model》电子书中文翻译项目](https://github.com/skindhu/How-To-Scale-Your-Model-CN)
## 个人思考
巴克莱在最近发布的研报中提出了一份“AI路线图”描绘了未来AI技术应用的演进路径我个人比较认同。报告指出AI的应用将经历三个重要阶段首先是当下的**第一阶段**聊天机器人和早期的AI助理Copilot因为目前主要是侧重于基础设置的建设和模型能力的竞赛。接下来在2025-2026年将迎来“真AI代理时代”的人**第二阶段**这一阶段的核心在于能够自主完成任务的AI代理的广泛应用。与聊天机器人和Copilot不同AI代理能完成相对复杂的任务尽量减少人类的直接干预。而在2027年以后AI技术将进一步进入“数字员工与机器人时代”**第三阶段**”应该是所谓的具身智能在企业应用中AI代理可能演变成独立完成任务的“数字员工”在消费者市场智能机器人将开始逐步融入家庭生活承担简单和重复性的日常任务。
@@ -79,6 +85,10 @@
<img src="https://wechat-account-1251781786.cos.ap-guangzhou.myqcloud.com/wechat_account.jpeg" width="30%">
## 最新文章
[最近爆火的Nano-Banana模型你会玩了么](https://mp.weixin.qq.com/s/qTnDKI-F5Teu0pQJoBJLeA)<br />
[我是如何快速翻译Google DeepMind出品的《How to Scale Your Model》电子书](https://mp.weixin.qq.com/s/-mURsM3VXmOUXmbxEkCfxA) <br />
[从源码看Google LangExtract如何应对长文本数据挖掘的挑战](https://mp.weixin.qq.com/s/2GfgVfi_y47ioBsKLbMPrA)<br />
[GPT 5祛魅时刻当OpenAI陷入内卷谷歌已在布局下一个十年](https://mp.weixin.qq.com/s/7WNZmwdzHCiMhWPUGSv4pA)<br />
[大模型上下文工程之Prefill Response预填响应技巧](https://mp.weixin.qq.com/s/fMeg0wcCd4XZPSN5EouLcg)<br />
[大模型上下文工程之Prefix Caching技术详解](https://mp.weixin.qq.com/s/TA7DY1cynVNPYW-sVI2zHw)<br />
[产品级AI应用的核心上下文工程](https://mp.weixin.qq.com/s/93rEhMY7rIUlHIiPPDvEag) <br />

View File

@@ -448,13 +448,13 @@ tokenizer = SimpleTokenizerV2(vocab)
print(tokenizer.encode(text))
```
这将输出以下token ID列表
这将打印以下词元ID
```
[1160, 5, 362, 1155, 642, 1000, 10, 1159, 57, 1013, 981, 1009, 738, 1013, 1160, 7]
[1131, 5, 355, 1126, 628, 975, 10, 1130, 55, 988, 956, 984, 722, 988, 1131, 7]
```
从上面的内容可以看出token ID 列表中包含了 1159 ,它对应于 <|endoftext|> 分隔token以及两个 1160 ,用于表示未知单词。
从上面的内容可以看出token ID 列表中包含了 1130 ,它对应于 <|endoftext|> 分隔token以及两个 1131 ,用于表示未知单词。
```python
print(tokenizer.decode(tokenizer.encode(text)))

View File

@@ -158,7 +158,7 @@ inputs = torch.tensor([[16833, 3626, 6100], # ["every effort moves",
[40, 1107, 588]]) # "I really like"]
# Matching these inputs, the `targets` contain the token IDs we aim for the model to produce:
targets = torch.tensor([[3626, 6100, 345 ], # [" effort moves you",
[107, 588, 11311]]) # " really like chocolate"]
[1107, 588, 11311]]) # " really like chocolate"]
```
需要注意的是,目标值中展示的是输入数据向前偏移了一个位置。我们在第 2 章实现数据加载器时已介绍过这一概念。这种偏移策略对于教会模型预测序列中的下一个 token 至关重要。