惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
Apple Machine Learning Research
Apple Machine Learning Research
宝玉的分享
宝玉的分享
博客园 - 叶小钗
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 司徒正美
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - Franky
爱范儿
爱范儿
罗磊的独立博客
IT之家
IT之家
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
N
Netflix TechBlog - Medium
云风的 BLOG
云风的 BLOG
P
Proofpoint News Feed
U
Unit 42
Engineering at Meta
Engineering at Meta
WordPress大学
WordPress大学
博客园 - 三生石上(FineUI控件)
T
Tailwind CSS Blog
H
Help Net Security
博客园_首页
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
人人都是产品经理
人人都是产品经理

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
token为什么今天才叫词元? - 少数派
2026-03-18 · via 少数派

龙虾火了之后,一个词的翻译终于被官方定下来了:token,中文叫词元

这个翻译其实并不新。早在 2021 年,国内 AI 圈就试图统一术语,将 token 译为「词元」[1],但没被广泛接受。

直到最近,「词元」开始出现在《人民日报》的经济版面,还有记者专门解释「什么是词元」。

图片

当一个技术词进入官方口径,它就不只是翻译问题了。

大模型处理文字之前,要先把文本拆成小块,每一块就是一个 token。

英文有空格做天然分隔符,但切法不只是按空格劈开:词根、前缀、后缀都可能独立成块。「unbelievable」可能被拆成:un / believe / able

中文没有空格和形态变化,由训练方自己决定怎么切。同一句话进不同模型,token 数可能差出好几倍。

下图来自我们之前做的一个实验:让模型逐步生成一段中文回答,同时记录每一个 token 的概率分布。

图片

所以,中文切分的复杂性,是 token 长期没有统一翻译的原因之一。更棘手的是:token 这个词不专属于大模型,它在不同领域有不同含义。

图片

你用什么词称呼一件事,就是在声明它属于哪个世界,所以,token 必须要有合适、统一的中文翻译。

为什么是词元[2]?

token 切分出的单位有时是字,有时是词,而更能覆盖这种范围。

那为什么是。为什么不是符、标或其他?

在中文术语里有固定语感:最小的、不可再分的基础单位。词元的意思是:这就是语言处理中最底层的东西,没必要往下切了。

以上只是语言学上的理由,但仍然没有回答一个问题:为什么最近才定下来?

图片

token的政治语言

一个词要被记住,往往要等它先变得重要。

大模型最初是英文叙事。token、benchmark、context window……整套话语体系都来自英文世界。在那个阶段,我们能说的无非是「也追上来了」。

龙虾(AI Agent)爆发之后,变化不在技术,而在经济结构。

龙虾每一步都要重新喂上下文,极其烧 token,价格迅速变得敏感。与此同时,人们发现很多落地业务只是发邮件、整理文件、调用工具。这太讽刺了:越接近现实场景,模型越不需要聪明,便宜就行。

产业重心因此移动:从训练转向推理,从谁的模型更聪明转向谁能处理更多请求,还便宜

当 token 变成可以大规模供应的资源,它就不再只是技术指标,而开始像一种工业品,一种可以出口的东西。

图片

于是它以这种句式,进入新闻:

国家数据局披露,中国日均词元调用量从 2024 年初的 1000 亿增长到 2025 年 9 月的 40 万亿。《人民日报》报道,当周中国大模型调用量以 4.12 万亿词元首次超过美国的 2.94 万亿。

这些 token 数字在句子里的位置,很像出口了多少吨钢材这种表达。

图片

这和以 OpenAI、Google、Anthropic 当主语的句式不同。那里用的是 benchmark(评判基准线);而词元消耗量听起来更像产能和出货。 于是出现了两层语言变化:

第一层是命名权。谁的语言定义单位,谁就在这个领域拥有话语权。

第二层是类别归属。「词元」悄悄把大模型从「科技产品」归入了「工业产能」。

慢慢地,AI 不再只是我们也能做,而变成了我们有多少产能。一旦它被纳入制造业叙事,衡量它的语言也会随之改变。

所以真正有意思的不是这个翻译。

而是当大模型发展到今天,谁有资格用自己的语言来报这个数。

参考资料

[1] 技术术语是否翻译有一条隐性规律:专有名称保留英文(Transformer、BERT),Token 通用是计量单位,需要有中文名。

[2] 语言学中有一个更精确的词:语素,汉语里最小的音义结合体,是构成词的直接基础。「词元」的「元」,语感与此接近。但语素与 token 并不完全对应:语素强调意义的最小单位,token 是模型切分的最小处理单位,两者有交叉,不能画等号,而且外界对它不熟悉。