惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
月光博客
月光博客
aimingoo的专栏
aimingoo的专栏
Google DeepMind News
Google DeepMind News
Recent Announcements
Recent Announcements
MyScale Blog
MyScale Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
S
SegmentFault 最新的问题
Hugging Face - Blog
Hugging Face - Blog
Martin Fowler
Martin Fowler
WordPress大学
WordPress大学
F
Fortinet All Blogs
小众软件
小众软件
D
Docker
U
Unit 42
博客园 - 聂微东
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
爱范儿
爱范儿
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
IT之家
IT之家
云风的 BLOG
云风的 BLOG
博客园 - 司徒正美
有赞技术团队
有赞技术团队
腾讯CDC

博客园 - T.t.T!Ck.¢#

博文阅读密码验证 - 博客园 博文阅读密码验证 - 博客园 人工神经网络(Artificial Neural Netwroks)笔记-模拟退火算法(Simulated Annealing) 人工神经网络(Artificial Neural Netwroks)笔记-径向基函数(Radial Basis Function- RBF) 人工神经网络(Artificial Neural Netwroks)笔记-粒子群优化(Partical Swarm Optimization - PSO) 识别地图上的地名-- 笔记一 人工神经网络(Artificial Neural Netwroks)笔记-基本的非确定性统计训练算法 - T.t.T!Ck.¢# 人工神经网络(Artificial Neural Netwroks)笔记 人工神经网络(Artificial Neural Netwroks)笔记-消除样本顺序的BP算法 博文阅读密码验证 - 博客园 人工神经网络(Artificial Neural Netwroks)笔记-连续多输出感知器算法 人工神经网络(Artificial Neural Netwroks)笔记--离散多输出感知器训练算法 博文阅读密码验证 - 博客园 人工神经网络(Artificial Neural Netwroks)笔记-离散单输出感知器算法 Mutual Information 互信息的应用 BeIT Memcached web页面列表的内容抽取 文本相似度计算--余弦定理和广义Jaccard系数 坏事做尽--通过修改IL获取某资源文件 - T.t.T!Ck.¢# - 博客园
倒排序索引实验
T.t.T!Ck.¢# · 2007-08-04 · via 博客园 - T.t.T!Ck.¢#

倒排序索引实验,无意义,无价值,纯粹为了理清思路

ReverseOrderIndex.rar 测试代码下载

class Word 为主要被索引的词,
其中
        public IList<string> FileList;  该词所在的文件列表
        public IList<TF> Degree; 该词在对应的文件中出现的次数以及位置索引
        public IList<int> Position;该词在文件中出现的位置
        public IList<int> Number; 该词在对应的文件中出现的次数

整个流程思路:

1.对测试用的文本文件进行分词,(分词可使用网上免费的分词组件,修改class Segment即可)
2.统计词频,
3.将词相关信息加入到索引中(通过文件保存Dictionary中的数据)。

为简单起见全部使用Dictionary 实现,鄙视自己一下 -_-!!

4.通过文件保存Dictionary中的数据。作为持久化索引
5.读出被保存的索引,放到Dictionary中
6.之后变得简单了。。。

引用一下:

Lucene 2.1研究:倒排序基本常识
下面是信息检索研究中常用的几个相关量:

N:文档集合的大小

M:词项集合的大小

Sj=|PLtj|:词项tj所涉及文档的个数

DFtj=sj/N:词项tj的文档频率

IDFtj=-logDFtj):倒置文档频率;其值越小表示出现的频率越高

fi,j:第j个词项tj在第i个文档di中出现的次数

TN= fi,j:系统所有文档分解后包含词项的总量(包括重复,即一个多重集(multi-set))

TFtj= fij/TN:词项tj在文档中出现的频度(词频)

ITFtj=logTFtj):倒置词频;越小表示出现的频率越高

继续把这些东西都计算出来.
数学其实没有想象中难,也没有想象中的简单 -_-!!