惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 叶小钗
MyScale Blog
MyScale Blog
博客园 - 【当耐特】
I
InfoQ
腾讯CDC
aimingoo的专栏
aimingoo的专栏
L
LangChain Blog
人人都是产品经理
人人都是产品经理
D
DataBreaches.Net
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Engineering at Meta
Engineering at Meta
A
About on SuperTechFans
Google DeepMind News
Google DeepMind News
Vercel News
Vercel News
C
Check Point Blog
B
Blog RSS Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
美团技术团队
Stack Overflow Blog
Stack Overflow Blog
Y
Y Combinator Blog
D
Docker
MongoDB | Blog
MongoDB | Blog
量子位
博客园_首页

博客园 - 寒 刚入门

如何在IIS7或IIS7.5中导入导出站点及应用程序池. 编程点滴.验证信息本地化遇到的问题 编程点滴.技巧小记.处理"可疑"数据库 编程点滴.技巧小记.数据库链接 Razor 语法快速参考 [转]SQL,LINQ,Lambda语法对照图 编程点滴.LUCENE保存检索表达式遇到的问题 - 寒 刚入门 - 博客园 编程点滴.如何在VS2010中使用Regex Editor - 寒 刚入门 小玩意.包含全国省市区街道邮编的数据库 编程点滴.LUCENE高亮代码 编程点滴.LUCENE.Luke查询工具 - 寒 刚入门 - 博客园 编程点滴.LUCENE的检索方式 编程点滴.LUCENE执行检索和分页 编程点滴.LUCENE.对数字、日期、时间等进行索引 - 寒 刚入门 - 博客园 编程点滴.LUCENE的FILED选项 jQuery1.3.2的选择器在IE8小[checked]失效的简单解决方法 我写的找重复数和过桥问题. CuteEditor6完整汉化包(更新到6.1) ASP.NET中设置CheckBox和RadioButton的默认值不可改变,并不丢失样式!
编程点滴.LUCENE.常用分词器
寒 刚入门 · 2010-09-07 · via 博客园 - 寒 刚入门

在LUCENE中分词器可是非常重要的一环.它把一个整句经过提取,去标点,转换成小写,还原,去除停止词等操作后,形成若干个有意义的Term.

常用内置分词器

WhitespaceAnalyzer,空白分词器.顾名思义,通过空格来进行分析.

SimpleAnalyzer,简单分词器.转换小写,去除非字母(注意,数字也会移除).

StopAnalyzer,停止词分析器.在SimpleAnalyzer的基础上移除停止词(the,a,of...etc)默认是英文,可以自行设置停止词库.

StandardAnalyzer,标准分词器.这个很重要,是Lucene中最复杂的一个核心分词器.是先用WhitespaceAnalyzer后,去停止词,小写化后再还原拼写.

实例一:

原文:"The quick brown fox jumped over the lazy dogs"
WhitespaceAnalyzer :
[The] [quick] [brown] [fox] [jumped] [over] [the] [lazy] [dogs]
SimpleAnalyzer :
[the] [quick] [brown] [fox] [jumped] [over] [the] [lazy] [dogs]
StopAnalyzer :
[quick] [brown] [fox] [jumped] [over] [lazy] [dogs]
StandardAnalyzer:
[quick] [brown] [fox] [jumped] [over] [lazy] [dogs]

实例二:

原文: "XY&Z Corporation - xyz@example.com"
WhitespaceAnalyzer:
[XY&Z] [Corporation] [-] [xyz@example.com]
SimpleAnalyzer:
[xy] [z] [corporation] [xyz] [example] [com]
StopAnalyzer:
[xy] [z] [corporation] [xyz] [example] [com]
StandardAnalyzer:
[xy&z] [corporation] [xyz@example.com]

中文分词

由于汉字的词可以是一个或多个汉字组成的,既有简繁之分,又有不同语意的用法.所以中文分词是个很复杂的工作,还得有一个非常庞大,而完备的字典作为辅助.

这方面做的好的有ICTCLAS(支持C/C++、C#、Delphi、Java等主流的开发语言),Paoding(支持Java),盘古(支持.Net)等.

LUCENE.NET QQ交流群(81361051)