惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Vercel News
Vercel News
博客园 - 司徒正美
C
Check Point Blog
G
Google Developers Blog
The GitHub Blog
The GitHub Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
有赞技术团队
有赞技术团队
P
Proofpoint News Feed
IT之家
IT之家
B
Blog
博客园_首页
量子位
MongoDB | Blog
MongoDB | Blog
博客园 - Franky
J
Java Code Geeks
H
Help Net Security
A
About on SuperTechFans
Apple Machine Learning Research
Apple Machine Learning Research
Jina AI
Jina AI
D
DataBreaches.Net
Y
Y Combinator Blog
大猫的无限游戏
大猫的无限游戏
云风的 BLOG
云风的 BLOG
Google DeepMind News
Google DeepMind News

博客园 - ideas

从 datetime2 数据类型到 datetime 数据类型的转换产生一个超出范围的值。 移除google搜索结果中烦人的URL跟踪跳转 关于分页存储过程的优化【让数据库按我们的意思执行查询计划】 DiscuzNT首页版块提取优化 中国娱乐网招聘asp.net软件工程师 几个有用的DMV查询 【转】Iframe高度自适应(兼容IE/Firefox、同域/跨域) 【转】MAQETTA: 基于HTML5的开源可视化界面设计工具 高效能人士的七个习惯 MongoDB 学习笔记—MapReduce MongoDB系列文章推荐 【转】linux screen 命令详解 - [linux] 关于添加索引视图后的数据存储区别 索引视图 添加计算列,并创建索引 浏览器的加载与页面性能优化【转】 IO瓶颈 内存瓶颈 Windows Live Writer 插件 Source Code Plug-in
有《基于行块分布函数的通用网页正文抽取》想到的
ideas · 2011-03-28 · via 博客园 - ideas

说明:《基于行块分布函数的通用网页正文抽取》是哈尔滨工业大学信息检索研究中心陈 鑫 (Xin Chen) 的研究成果,详细看这里:http://code.google.com/p/cx-extractor/ ,完整算法及C#实现从这里下载:https://files.cnblogs.com/ideas/TextExtractor.rar

  看了这个算法之后,对网页内容的抓取,很有启发。如果要实现抓规则的通用性,就得找出网页大众化的设计规律。比如新闻,首先仿照该算法去除所有html标签,然后提取body内的文本。一般情况下,标题都会占用单独的一行,所以就可以使用“行文本”与title对比,如果该行内容与title开头一样,则可以认为是网页标题开发。而新闻的发布时间的位置大部分是放在标题与正文之间,所以这样就可以从标题往后解析,如果“行文本”包含有时间格式的文本,即可认定是发布时间。新闻其它字段提取方法类似。

如何判断一个URL是否是新闻最终页?可以使用机器学习的方法,使用上面方法提取新闻正文,如果成功,则解析该URL转换为正则,然后拿该正则去匹配其它的URL,如果成功数超过一定的阀值,则认为是新闻最终页。

如何判断一个URL是否是新闻列表页?根据新闻最终页引用地址判断,如果最终页来源于某个网页的数量超过一个阀值,则认为该页是新闻列表页。

另外今天发现.net使用正则\w匹配的结果竟然把中文字符也给算进去了。不知何解。