惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
SegmentFault 最新的问题
爱范儿
爱范儿
博客园 - 三生石上(FineUI控件)
Microsoft Security Blog
Microsoft Security Blog
Google DeepMind News
Google DeepMind News
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
GbyAI
GbyAI
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
V
V2EX
酷 壳 – CoolShell
酷 壳 – CoolShell
量子位
博客园_首页
T
Tailwind CSS Blog
aimingoo的专栏
aimingoo的专栏
A
About on SuperTechFans
T
The Blog of Author Tim Ferriss
Stack Overflow Blog
Stack Overflow Blog
Recent Announcements
Recent Announcements
P
Proofpoint News Feed
博客园 - 司徒正美
有赞技术团队
有赞技术团队
Engineering at Meta
Engineering at Meta
Last Week in AI
Last Week in AI
MongoDB | Blog
MongoDB | Blog

夜行人

回家路上 第一期的直播演示项目 震动检测器 正能量 在线参观CodeLab Neverland 发布 CodeLab Adapter 3.3.1 DynamicTable 之 纸糊方向盘 CodeLab DynamicTable: 一个可实施的技术方案 CodeLab Insight 发布 Alpha 版 情人节 Home Assistant 周报 && IoT 周报 (02) Joplin: 关注隐私的 Evernote 开源替代软件 浏览器的未来与 Web 传感器 Home Assistant 周报 && IoT 周报 (01) 百宝箱(01) 论自由 介绍 WebThings Home Assistant 周报 && iot 周报 (00) 百宝箱(00) 毛姆读书心得 传世之作 周末徒步 CodeLab Adapter ❤️ Jupyter/Python 航班 躲雨 夏令营途中 [译]思想--作为一种技术 The future of coding 美国之行 三门问题的程序模拟
自然语言处理之语料库资源
2016-08-13 · via 夜行人

文章目录

巧妇难为无米之炊

语料库

语料库(corpus)一词在语言学上意指大量的文本,是在语言的实际使用中真实出现过的语言材料,通常经过整理,具有既定格式与标记

事实上,语料库英文 “text corpus” 的涵意即为 “body of text”。

语料库是语料库语言学研究的基础资源,也是经验主义语言研究方法的主要资源。

本文主要关注中文语料库(顺便一提英文语料库)

英文语料库

NLTK的nltk_data囊括数个在 NLP 研究圈里广泛使用的实用语料库,针对英文的自然语言处理,已经成果显著,资源也易于获取,这里列出一些不错的语料库,我们更多的精力放在中文语料库上

先列出NLTK里的语料库:

  • 布朗语料库(Brown Corpus):第一个可以在计算语言学处理中使用的通用英语语料库。它包含了一百万字 1961 年出版的美语文本。它代表了通用英语的样本,采样自小说,新闻和宗教文本。随后,在大量的人工标注后,诞生了词性标注过的版本。
  • 古登堡语料库(Gutenberg Corpus):古登堡计划(Gutenberg Project)致力于将文化作品的数字化和归档,并鼓励创作和发行电子书。古登堡语料库选择了 14 个文本,整个语料库包含了一百七十万字v
  • Stopwords Corpus:NLTK 所收集的停用词语料库(Stopwords Corpus)包含了 来自 11 种不同语言(包括英语)的 2400 个停用词

其他的著名语料库

中文语料库

github的一些资源

搜狗实验室

其他

  • google-10000-english:list of the 10,000 most common English words in order of frequency, as determined by n-gram frequency analysis of the Google’s Trillion Word Corpus
  • corpora:A collection of small corpuses of interesting data for the creation of bots and similar stuff.
  • pattern 从互联网获取语料

参考

文章作者 种瓜

上次更新 2016-08-13