惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
SegmentFault 最新的问题
G
Google Developers Blog
Stack Overflow Blog
Stack Overflow Blog
WordPress大学
WordPress大学
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
罗磊的独立博客
月光博客
月光博客
IT之家
IT之家
爱范儿
爱范儿
Google DeepMind News
Google DeepMind News
小众软件
小众软件
C
Check Point Blog
B
Blog RSS Feed
H
Help Net Security
博客园 - 司徒正美
L
LangChain Blog
MongoDB | Blog
MongoDB | Blog
B
Blog
The Cloudflare Blog
Apple Machine Learning Research
Apple Machine Learning Research
Microsoft Security Blog
Microsoft Security Blog
M
MIT News - Artificial intelligence
N
Netflix TechBlog - Medium
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知

博客园 - lanjue

印度同行成功者给我的忠告 创业型企业如何招聘销售总监 支付宝常见问题说明 读《度过有意义的生命》有感 克菲勒留给儿子的38封信 戴尔借Twitter交流平台获100万美元销售收入 右键新建菜单中增加新类型文件 前台和后台线程 三个在线生成".ico"图片的网站 - lanjue - 博客园 小结提升网站访问量 网页设计工具补丁 各种免费在线工具收集 ip计算实例 Path.Combine (合并两个路径字符串)方法的一些使用细节 改善用户体验的alert提示效果 教你一招又叠衣服 转《浅谈数据库设计技巧》 转《“数据建模”读书笔记 》 转<数据库设计经验>
如何衡量两个词的相关度
lanjue · 2008-07-07 · via 博客园 - lanjue

在信息论中常用互信息(MI,Mutual Information)来衡量两个词的相关度MI(X,Y)=log2p(x,y)/p(x)p(y)
MI越大,表示两个词之间的结合越紧密。
当X,Y关联大时,MI(X,Y)大于0;当X与Y关系弱时,MI(X,Y)等于0;当MI(X,Y)小于0时,X与Y称为“互补关系”

这个算式看起来很直观,但计算还是有些麻烦,因为计算概率值p(x),p(y)都需要在语料中进行分词,
这就涉及到词典的构成以及分词的算法。
下面介绍一个简便而直观的算法:
假设一个文章集合 {C},总文章数目为N,其中含有单词X的文章总数为Nx,含有单词Y的文章总数是Ny,含有{X+Y}的文章总数是 Nxy,那么相关性这么计算
Corr(X,Y)= Nxy/(Nx+Ny-Nxy)-(Nx*Ny)/(N*N)

Technorati 标记: 中文分词