惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
大猫的无限游戏
大猫的无限游戏
Jina AI
Jina AI
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 司徒正美
美团技术团队
雷峰网
雷峰网
阮一峰的网络日志
阮一峰的网络日志
WordPress大学
WordPress大学
T
Tailwind CSS Blog
U
Unit 42
C
Check Point Blog
S
SegmentFault 最新的问题
Martin Fowler
Martin Fowler
Stack Overflow Blog
Stack Overflow Blog
云风的 BLOG
云风的 BLOG
L
LangChain Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
腾讯CDC
罗磊的独立博客
小众软件
小众软件
Recent Announcements
Recent Announcements
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
D
DataBreaches.Net

月光博客

AI编程从零开始:环境配置到开发调试-月光博客 母亲被保健品诈骗-月光博客 向身体低头,向岁月妥协:我的高血压“还债日记” -月光博客 月光博客电子书:《信息安全指南》 谷歌发布2025年度搜索排行榜 中国2025社会热点大事记 2025年十大流行语发布 7天3次,骗子骗走我母亲95万元 “技术男”设三重安全墙,母亲95万存款还是被骗走了 电信诈骗后的复盘:母亲的95万元,是怎么从手机银行里消失的 母亲被电信诈骗95万元的全过程 阿根廷警察被谷歌街景相机拍到裸照 网信办开展“清朗·整治恶意挑动负面情绪问题”专项行动 翟欣欣敲诈勒索案一审获刑12年 《绝命毒师》影评:力工觉醒后的梭哈至死 《人工智能生成合成内容标识办法》正式施行 用AI分析你的财务信息 腾讯子公司实习HR怒怼求职者后被开除 OpenAI发布最强模型GPT-5,免费向所有用户开放 用AI解构你的日记 用AI分析你的游戏偏好 用AI分析你的观影偏好 用AI分析你的听歌偏好 《白鹿原》人物分析:乱世浮沉中的人性剖析 乌托邦的捷径:让AI治理“失败国家” 苹果AI的“路径错误”:为什么它在大模型时代掉队了? 《暗黑破坏神3》第35赛季开荒指南 我对特朗普的看法 欧·亨利十大经典小说鉴赏 HBO电视剧《最后生还者》第二季影评
通过HTTP状态代码看搜索引擎怎么Crawl你的站
投稿 · 2005-06-01 · via 月光博客

2005-6-1 4:0:2 | 作者: 投稿 | 分类: 网站建设 | 评论: 3 | 浏览:

通过HTTP状态代码通通透透看搜索引擎怎么Crawl你的站。

下面的表格是所有 HTTP 状态代码及其定义。
 

代码指示
2xx成功
200正常;请求已完成。
201正常;紧接 POST 命令。
202正常;已接受用于处理,但处理尚未完成。
203正常;部分信息 — 返回的信息只是一部分。
204正常;无响应 — 已接收请求,但不存在要回送的信息。
3xx重定向
301已移动 — 请求的数据具有新的位置且更改是永久的。
302已找到 — 请求的数据临时具有不同 URI。
303请参阅其它 — 可在另一 URI 下找到对请求的响应,且应使用 GET 方法检索此响应。
304未修改 — 未按预期修改文档。
305使用代理 — 必须通过位置字段中提供的代理来访问请求的资源。
306未使用 — 不再使用;保留此代码以便将来使用。
4xx客户机中出现的错误
400错误请求 — 请求中有语法问题,或不能满足请求。
401未授权 — 未授权客户机访问数据。
402需要付款 — 表示计费系统已有效。
403禁止 — 即使有授权也不需要访问。
404找不到 — 服务器找不到给定的资源;文档不存在。
407代理认证请求 — 客户机首先必须使用代理认证自身。
415介质类型不受支持 — 服务器拒绝服务请求,因为不支持请求实体的格式。
5xx服务器中出现的错误
500内部错误 — 因为意外情况,服务器不能完成请求。
501未执行 — 服务器不支持请求的工具。
502错误网关 — 服务器接收到来自上游服务器的无效响应。
503无法获得服务 — 由于临时过载或维护,服务器无法处理请求。

比如说:
2004-12-03 07:33:25 61.135.145.208 - *.*.*.* 80 GET /index/119.htm - 304 Baiduspider+(+http://www.baidu.com/search/spider.htm)
这就意味着百度蜘蛛在2004-12-03 07:33:25爬过/index/119.htm这一页,它发现这页是没有更新过的。

再比如说:2004-12-03 07:33:25 61.135.145.208 - *.*.*.* 80 GET /index/120.htm - Googlebot/2.1
(http://www.google.com/bot.html)
这就意味着Google蜘蛛在2004-12-03 07:33:25爬过/index/119.htm这一页,它发现这页是新的,并全部爬完。

作者:佚名 来源:网络

通过HTTP状态代码看搜索引擎怎么Crawl你的站