惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Last Week in AI
Last Week in AI
阮一峰的网络日志
阮一峰的网络日志
P
Proofpoint News Feed
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
MongoDB | Blog
MongoDB | Blog
云风的 BLOG
云风的 BLOG
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
J
Java Code Geeks
WordPress大学
WordPress大学
T
The Blog of Author Tim Ferriss
V
Visual Studio Blog
小众软件
小众软件
Microsoft Azure Blog
Microsoft Azure Blog
博客园_首页
IT之家
IT之家
Vercel News
Vercel News
C
Check Point Blog
Google DeepMind News
Google DeepMind News
月光博客
月光博客
D
DataBreaches.Net
酷 壳 – CoolShell
酷 壳 – CoolShell
美团技术团队
Y
Y Combinator Blog
Hugging Face - Blog
Hugging Face - Blog

StudyingLover's Blog

Diffusion Policy笔记 rwkv笔记 act笔记 nanovllm-block_manager opencode多智能体 nanobot-pre-train nanobot-rl nanobot-sft nanobot-checkpoint_manager nanobot-gpt nanobot-mid-train Vision Mamba (Vim)笔记 最后一遍学习Transformer YOLOv5 目标检测笔记 下载根服务器解析记录 Dynaseal A Backend-Controlled LLM API Key Distribution Scheme with Constrained Invocation Parameters 判断链表有环 王道25数据结构勘误 关于perplexity的open-sourcing-r1-1776 AI为什么不像人类一样进行多轮对话 新博客改造日记和功能测试 linuxqq只显示登陆背景图 数字设计和计算机体系结构(机械工业出版社)勘误(自制) Dynaseal:面向未来端侧llm agent的llm api key分发机制 A Definitive Guide to Markdown Style This post is using MDX, Where you can embed JSX and Astro components RT-Patch学习 pydantic实现的LLM ReAct fastapi 和 uvicorn 设置监听 ipv6 pydantic+openai+json 控制大模型输出的最佳范式
BPE演示
About the Author StudyingLover · 2026-01-02 · via StudyingLover's Blog

BPE 算法演示

📊 初始语料: hug(10), pug(5), pun(12), bun(4)

Step 0: 初始化阶段 (Initialization)

当前词表: 7个基础字符

语料库物理状态

10: h u g </w>
05: p u g </w>
12: p u n </w>
04: b u n </w>

相邻词对频次 (排名)

PairCount来源构成
p u17pug(5)+pun(12)
u n16pun(12)+bun(4)
n </w>16pun(12)+bun(4)
u g15hug(10)+pug(5)
g </w>15hug(10)+pug(5)
h u10hug(10)
b u4bun(4)

🚀 执行动作: 合并 (p, u) -> 生成新 Token pu

Step 1: 第一次合并后

新增 Token: [pu]

语料库更新情况

10: h u g </w> (u未变)
05: pu g </w>
12: pu n </w>
04: b u n </w> (u未变)

重新计算频次表

PairCount变化说明
n </w>16-
g </w>15-
pu n12新出现!
h u10-
u g10 (📉原为15)pug贡献消失
pu g5新出现!
u n4 (📉原为16)pun贡献消失

🚀 执行动作: 合并 (n, </w>) -> 生成新 Token n</w>

Step 2: 第二次合并后

新增 Token: [n</w>]

语料库更新情况

10: h u g </w>
05: pu g </w>
12: pu n</w>
04: b u n</w>

重新计算频次表

PairCount备注
g </w>15hug(10)+pug(5)
pu n</w>12新出现!
h u10-
u g10-
pu g5-
u n</w>4新出现!

🚀 执行动作: 合并 (g, </w>) -> 生成新 Token g</w>

最终词表快照 (Vocab Snapshot)

pun</w>g</w>…剩余基础字符…