惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

aimingoo的专栏
aimingoo的专栏
WordPress大学
WordPress大学
阮一峰的网络日志
阮一峰的网络日志
博客园 - 司徒正美
月光博客
月光博客
宝玉的分享
宝玉的分享
Recent Announcements
Recent Announcements
小众软件
小众软件
H
Hackread – Cybersecurity News, Data Breaches, AI and More
美团技术团队
博客园 - 三生石上(FineUI控件)
A
About on SuperTechFans
J
Java Code Geeks
云风的 BLOG
云风的 BLOG
罗磊的独立博客
大猫的无限游戏
大猫的无限游戏
IT之家
IT之家
Vercel News
Vercel News
量子位
Martin Fowler
Martin Fowler
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
V
Visual Studio Blog
腾讯CDC
有赞技术团队
有赞技术团队

博客园 - Lee-hp

SQL:去掉重复行,只保留第一行 游标(转3) 游标(转2) 游标(转) Sql:取每个分类的前10条数据 sql:去掉重复行 水晶报表参考资料 xml操作 页面信息抓取(二) 在GridView中绑定Radio 引用js脚本的奇怪问题 读博 好好工作,好好学习 游标使用——获取每个分类的前10条数据 Url传递中文 SQL触发器--插入时判断数据是否已存在 程序开发和参考资料 SQLServer - 标识列自增 锻炼你的专注力
页面信息抓取
Lee-hp · 2007-04-02 · via 博客园 - Lee-hp

这两天在整这个,提取某一个网站的信息,不断学习中.......
using System.IO;
using System.Net;
using System.Text;
using System.Text.RegularExpressions;
//根据 url 读取 源文件
         public string GetSourceHtml(string urlstr)
        {
            WebRequest wreq = WebRequest.Create(urlstr);
            WebResponse wres = wreq.GetResponse();
            Stream rece = wres.GetResponseStream();

            Byte[] read = new Byte[512];
            int bytes = rece.Read(read, 0, 512);

            string reshtml = "";
            while (bytes > 0)
            {
                Encoding encode = Encoding.GetEncoding("gb2312");
                reshtml += encode.GetString(read, 0, bytes);
                bytes = rece.Read(read, 0, 512);
            }
            return reshtml;
        }
//提取源文件中 相关的 url
.......
//提取源文件中的文章内容,去掉页面的头尾。
.......
定位页面中内容的一点想法:
现在要提取的内容就是提取只包含内容的表格,而去掉其它的,可以根据不需要的内容的一些关键字,去掉那些表格并根据标题,位置和内容中的一些固定元素判断内容所在的具体位置,从而实现提取。