惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

腾讯CDC
博客园 - Franky
MyScale Blog
MyScale Blog
L
LangChain Blog
Martin Fowler
Martin Fowler
Recent Announcements
Recent Announcements
Stack Overflow Blog
Stack Overflow Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 司徒正美
量子位
A
About on SuperTechFans
C
Check Point Blog
大猫的无限游戏
大猫的无限游戏
Last Week in AI
Last Week in AI
小众软件
小众软件
Apple Machine Learning Research
Apple Machine Learning Research
I
InfoQ
V
Visual Studio Blog
Vercel News
Vercel News
B
Blog
爱范儿
爱范儿
aimingoo的专栏
aimingoo的专栏
U
Unit 42

博客园 - Lee-hp

SQL:去掉重复行,只保留第一行 游标(转3) 游标(转2) 游标(转) Sql:取每个分类的前10条数据 sql:去掉重复行 水晶报表参考资料 xml操作 页面信息抓取(二) 在GridView中绑定Radio 引用js脚本的奇怪问题 读博 好好工作,好好学习 游标使用——获取每个分类的前10条数据 Url传递中文 SQL触发器--插入时判断数据是否已存在 程序开发和参考资料 SQLServer - 标识列自增 锻炼你的专注力
页面信息抓取
Lee-hp · 2007-04-02 · via 博客园 - Lee-hp

这两天在整这个,提取某一个网站的信息,不断学习中.......
using System.IO;
using System.Net;
using System.Text;
using System.Text.RegularExpressions;
//根据 url 读取 源文件
         public string GetSourceHtml(string urlstr)
        {
            WebRequest wreq = WebRequest.Create(urlstr);
            WebResponse wres = wreq.GetResponse();
            Stream rece = wres.GetResponseStream();

            Byte[] read = new Byte[512];
            int bytes = rece.Read(read, 0, 512);

            string reshtml = "";
            while (bytes > 0)
            {
                Encoding encode = Encoding.GetEncoding("gb2312");
                reshtml += encode.GetString(read, 0, bytes);
                bytes = rece.Read(read, 0, 512);
            }
            return reshtml;
        }
//提取源文件中 相关的 url
.......
//提取源文件中的文章内容,去掉页面的头尾。
.......
定位页面中内容的一点想法:
现在要提取的内容就是提取只包含内容的表格,而去掉其它的,可以根据不需要的内容的一些关键字,去掉那些表格并根据标题,位置和内容中的一些固定元素判断内容所在的具体位置,从而实现提取。