mirror of
https://github.com/skindhu/Build-A-Large-Language-Model-CN.git
synced 2026-08-29 21:30:25 +08:00
Compare commits
7 Commits
revert-19-
...
7074262f7d
| Author | SHA1 | Date | |
|---|---|---|---|
|
|
7074262f7d | ||
|
|
b58c369e29 | ||
|
|
592cc35a7a | ||
|
|
8f18f81dec | ||
|
|
49387bb4e1 | ||
|
|
84b09d1aa7 | ||
|
|
5de19f2835 |
10
README.md
10
README.md
@@ -50,6 +50,12 @@
|
||||
+ [附录D:给训练循环添加高级技巧](https://skindhu.github.io/Build-A-Large-Language-Model-CN/#/./cn-Book/附录D.给训练循环添加高级技巧.md)
|
||||
+ [附录E:使用 LoRA 的参数高效微调](https://skindhu.github.io/Build-A-Large-Language-Model-CN/#/./cn-Book/附录E.使用LoRA的参数高效微调.md)
|
||||
|
||||
|
||||
### 新书推荐
|
||||
|
||||
+ [《Google DeepMind - How to Scale Your Model》电子书中文翻译项目](https://github.com/skindhu/How-To-Scale-Your-Model-CN)
|
||||
|
||||
|
||||
## 个人思考
|
||||
|
||||
巴克莱在最近发布的研报中提出了一份“AI路线图”,描绘了未来AI技术应用的演进路径,我个人比较认同。报告指出,AI的应用将经历三个重要阶段,首先是当下的**第一阶段**:聊天机器人和早期的AI助理(Copilot),因为目前主要是侧重于基础设置的建设和模型能力的竞赛。接下来在2025-2026年将迎来“真AI代理时代”的人**第二阶段**,这一阶段的核心在于能够自主完成任务的AI代理的广泛应用。与聊天机器人和Copilot不同,AI代理能完成相对复杂的任务,尽量减少人类的直接干预。而在2027年以后,AI技术将进一步进入“数字员工与机器人时代”**第三阶段**”(应该是所谓的具身智能),在企业应用中,AI代理可能演变成独立完成任务的“数字员工”,在消费者市场,智能机器人将开始逐步融入家庭生活,承担简单和重复性的日常任务。
|
||||
@@ -79,6 +85,10 @@
|
||||
<img src="https://wechat-account-1251781786.cos.ap-guangzhou.myqcloud.com/wechat_account.jpeg" width="30%">
|
||||
|
||||
## 最新文章
|
||||
[最近爆火的Nano-Banana模型,你会玩了么?](https://mp.weixin.qq.com/s/qTnDKI-F5Teu0pQJoBJLeA)<br />
|
||||
[我是如何快速翻译Google DeepMind出品的《How to Scale Your Model》电子书](https://mp.weixin.qq.com/s/-mURsM3VXmOUXmbxEkCfxA) <br />
|
||||
[从源码看Google LangExtract如何应对长文本数据挖掘的挑战](https://mp.weixin.qq.com/s/2GfgVfi_y47ioBsKLbMPrA)<br />
|
||||
[GPT 5祛魅时刻:当OpenAI陷入内卷,谷歌已在布局下一个十年](https://mp.weixin.qq.com/s/7WNZmwdzHCiMhWPUGSv4pA)<br />
|
||||
[大模型上下文工程之Prefill Response(预填响应)技巧](https://mp.weixin.qq.com/s/fMeg0wcCd4XZPSN5EouLcg)<br />
|
||||
[大模型上下文工程之Prefix Caching技术详解](https://mp.weixin.qq.com/s/TA7DY1cynVNPYW-sVI2zHw)<br />
|
||||
[产品级AI应用的核心:上下文工程](https://mp.weixin.qq.com/s/93rEhMY7rIUlHIiPPDvEag) <br />
|
||||
|
||||
@@ -448,13 +448,13 @@ tokenizer = SimpleTokenizerV2(vocab)
|
||||
print(tokenizer.encode(text))
|
||||
```
|
||||
|
||||
这将输出以下token ID列表:
|
||||
这将打印以下词元ID:
|
||||
|
||||
```
|
||||
[1160, 5, 362, 1155, 642, 1000, 10, 1159, 57, 1013, 981, 1009, 738, 1013, 1160, 7]
|
||||
[1131, 5, 355, 1126, 628, 975, 10, 1130, 55, 988, 956, 984, 722, 988, 1131, 7]
|
||||
```
|
||||
|
||||
从上面的内容可以看出,token ID 列表中包含了 1159 ,它对应于 <|endoftext|> 分隔token,以及两个 1160 ,用于表示未知单词。
|
||||
从上面的内容可以看出,token ID 列表中包含了 1130 ,它对应于 <|endoftext|> 分隔token,以及两个 1131 ,用于表示未知单词。
|
||||
|
||||
```python
|
||||
print(tokenizer.decode(tokenizer.encode(text)))
|
||||
|
||||
@@ -158,7 +158,7 @@ inputs = torch.tensor([[16833, 3626, 6100], # ["every effort moves",
|
||||
[40, 1107, 588]]) # "I really like"]
|
||||
# Matching these inputs, the `targets` contain the token IDs we aim for the model to produce:
|
||||
targets = torch.tensor([[3626, 6100, 345 ], # [" effort moves you",
|
||||
[107, 588, 11311]]) # " really like chocolate"]
|
||||
[1107, 588, 11311]]) # " really like chocolate"]
|
||||
```
|
||||
|
||||
需要注意的是,目标值中展示的是输入数据向前偏移了一个位置。我们在第 2 章实现数据加载器时已介绍过这一概念。这种偏移策略对于教会模型预测序列中的下一个 token 至关重要。
|
||||
|
||||
Reference in New Issue
Block a user