惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

IT之家
IT之家
A
About on SuperTechFans
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
N
Netflix TechBlog - Medium
Microsoft Security Blog
Microsoft Security Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 三生石上(FineUI控件)
博客园 - 聂微东
博客园 - Franky
D
Docker
Martin Fowler
Martin Fowler
Engineering at Meta
Engineering at Meta
The Cloudflare Blog
人人都是产品经理
人人都是产品经理
Last Week in AI
Last Week in AI
U
Unit 42
F
Fortinet All Blogs
H
Help Net Security
Blog — PlanetScale
Blog — PlanetScale
Microsoft Azure Blog
Microsoft Azure Blog
罗磊的独立博客
P
Proofpoint News Feed
月光博客
月光博客
G
Google Developers Blog

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19)
什么是 Token
微信公众号 · 2024-09-10 · via 陈少文的网站

Please enable Javascript to view the contents

Token 是一个与数据紧密相关的单位,可以用来度量训练模型所需的语料量,还可以用来度量推理时的输入和输出长度。

1. token 是什么

Token 可以是一个完整的单词、子词,甚至是一个字符。在语言模型中,文本被拆分为若干个 token,模型逐一处理这些 token 来生成预测或生成新文本。

下面是一些经验,可以帮助理解 token 的长度:

1 token ~= 5-6 chars in English
100 tokens ~= 90 words in English 或 10 sentences in English

可以通过 https://platform.openai.com/tokenizer 来查看 OpenAI 的 Tokenizer 表现,下面这个例子中,可以看到 token 与人理解的词并没有一一对应的关系。

2. token 的 embedding

在上面的例子中,切换底部的 [Token IDs],可以看到文本对应的 token 的 embedding ids.

文本是给人看的,Token IDs 是给模型处理使用的。文本经过 Tokenizer 后,会变成一个或者多个 token,然后经过 embedding,转换为 Token IDs。而词表就存储着,每个 token 对应的 embedding id。

3. 词表是怎么生成的

词表通常在模型训练之前生成,在整个训练过程中,词表不会发生变化。

SentencePiece 是一个用于分词和词表生成的工具,支持多种分词算法,如 BPE、WordPiece 和 unigram。它被广泛应用于大模型的词表和分词器的构建中,例如 LLaMa、BLOOM、ChatGLM 和 Baichuan 等。

使用 SentencePiece 可以从语料中生成一个完整的词表,也可以用来扩充现有的词表。

比如,训练 LLaMa 时,使用的中文资料很少。在对模型针对中文语料进行微调之前,就需要先进行词表扩充,能够有效地提高模型的表现。

4. token 与数据大小的关系

下面是一个典型模型与预训练数据规模的对照表:

模型参数规模 (B)预训练数据规模(tokens)
CodeGen16577 B
LLaMA651.4 T
GPT-3175300 B

其中 ,B 表示 Billion 十亿,T 表示 Trillion 表示万亿。

直接使用 tokens 作为数据规模有时不够直观,下面是 tokens 与文件大小的对照表:

文本类型平均每 Token 字节数1GB 文本数据的 Token 数量
英文6 字节( \frac{1 \times 2^{30}}{6} ≈ 0.167 B )
中文3 字节( \frac{1 \times 2^{30}}{3} ≈ 0.556 B )
文本类型平均每 Token 字节数1B Token 的文件大小
英文6 字节( 1B \times 6 ) 字节 ≈ 5.6 GB
中文3 字节( 1B \times 3 ) 字节 ≈ 2.8 GB

微信公众号