惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
V2EX
C
Check Point Blog
博客园_首页
B
Blog
D
Docker
U
Unit 42
量子位
I
InfoQ
有赞技术团队
有赞技术团队
Martin Fowler
Martin Fowler
GbyAI
GbyAI
L
LangChain Blog
云风的 BLOG
云风的 BLOG
博客园 - Franky
美团技术团队
T
The Blog of Author Tim Ferriss
阮一峰的网络日志
阮一峰的网络日志
月光博客
月光博客
Vercel News
Vercel News
Recent Announcements
Recent Announcements
雷峰网
雷峰网
大猫的无限游戏
大猫的无限游戏
小众软件
小众软件
Google DeepMind News
Google DeepMind News

自然语言处理

大语言模型 LLM 中/美两个主要玩家,对应两个语系? Humanize-Text 4 步把 AI 文本变成人类写作: DeepSeek×2 + Google + Niutrans cpu/gpu 高性能中英粤文本转语音 TTS 有人能编译跑通 seamlessM4t 吗? 上海某私募 招聘量化研究员(算法模型,深度学习算法,语音算法, nlp, cv,强化学习等方向) 如何快速接入一个有 MCP 能力的 LLM? 有朋友正在学习 nlp 吗? 国内的翻译平台似乎有一个普遍的 bug [请教] [可有偿] 请问有没有懂自然语言处理的大佬,想请教几个问题 高质量数据集对模型开发和 fine-tune 的重要性 请教下本地部署的语音转文字应用 有没有什么语法检查的模型啊? 我是国内的 NLP 从业者,大模型这一波风吹过来了,在公司做大模型感觉前途未卜的样子 [求助]kaggle 中训练模型遇到的一些问题 请问有哪些文章改写润色的开源实现啊 有没有文本内容标注的成熟项目。 NLP 有没有这样的模型,比如搜索 fetch 请求,自动帮你把 fetch/xhr/request 的数据相关性较高的内容展示出来的 GPT 用于知识图谱构建的 NER 和 RE 深度学习如何运用到区块链中? Vecuna 7b 部署与实践 请教一下此类场景在 NLP 中属于哪个功能分支,可否通过 NLP 相关模型实现 如何根据浏览记录关键词对用户做聚类分析? 诚招语言模型训练实习生 有什么办法能获取一个城市下的地名? 博客根据文章内容跑自然语言分析自动识别关键字,有什么廉价的实现方法吗? 请教一个 NLP 的问题 使用 NLP 从书中提取各个角色的台词 Feishu(飞书) 聊天机器人应用 - 定制对话,实现知识库、信息查询、意图识别、多轮对话 Snowboy 离线唤醒 2021 年开始就停止维护,有没有其他大厂的产品可以替代使用? 2070s 跑不了 gpt2
MicroTokenizer: 一个面向教学的微型中文分词引擎
howlanderson · 2018-06-15 · via 自然语言处理

微型中文分词器

一个微型的中文分词器,能够按照词语的频率(概率)来利用构建 DAG (有向无环图)来分词。

特点 / 特色

  • 微型:主要代码只有一个文件,不足 200 行
  • 面向教育:可以导出 graphml 格式的图结构文件,辅助学习者理解算法过程
  • 良好的分词性能:由于使用类似 结巴分词 的算法,具有良好的分词性能
  • 具有良好的扩展性:使用和 结巴分词 一样的字典文件,可以轻松添加自定义字典

演示

在线演示

在线的 Jupyter Notebook 在 Binder

离线演示

分词

代码:

import MicroTokenizer

tokens = MicroTokenizer.cut("知识就是力量")
print(tokens)

输出:

['知识', '就是', '力量']

有向无环图效果演示

DAG of 'knowledge is power'

备注

  • <s></s> 是图的起始和结束节点,不是实际要分词的文本
  • 图中 Edge 上标注的是 log(下一个节点的概率的倒数)
  • 最短路径已经用 深绿色 作了标记

更多演示

"王小明在北京的清华大学读书"

DAG of xiaomin

项目地址

https://github.com/howl-anderson/MicroTokenizer

开发者

Xiaoquan Kong @ https://github.com/howl-anderson

依赖

只在 python 3.5+ 环境测试过,其他环境不做兼容性保障。

安装

pip install git+https://github.com/howl-anderson/MicroTokenizer.git

如何使用

分词

见上文

导出 GraphML 文件

from MicroTokenizer.MicroTokenizer import MicroTokenizer

micro_tokenizer = MicroTokenizer()
micro_tokenizer.build_graph("知识就是力量")
micro_tokenizer.write_graphml("output.graphml")