惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
Visual Studio Blog
博客园 - 司徒正美
Hugging Face - Blog
Hugging Face - Blog
博客园 - 叶小钗
The Cloudflare Blog
D
DataBreaches.Net
J
Java Code Geeks
G
Google Developers Blog
L
LangChain Blog
N
Netflix TechBlog - Medium
Stack Overflow Blog
Stack Overflow Blog
月光博客
月光博客
酷 壳 – CoolShell
酷 壳 – CoolShell
WordPress大学
WordPress大学
小众软件
小众软件
量子位
Apple Machine Learning Research
Apple Machine Learning Research
P
Proofpoint News Feed
博客园_首页
罗磊的独立博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
B
Blog
腾讯CDC

执迷者X

联系页存档:2026 年初 Vibe Coding 版 2026江西·葛仙山:春到门庭渐吉昌 - 执迷者X 2026秋 · 三清山:以道养身 ,全生保真 - 执迷者X 黄山:改名的遗憾和时代的空心化 - 执迷者X GPT给CBT和家庭命运的“破局观” - 执迷者X 也无风雨也无晴:情绪也是精力的开关 - 执迷者X 2026金秋,治愈和自愈 - 执迷者X 传统分析 vs AI 时代,变革能力要求变在哪 - 执迷者X [网站修复]:Puock 主题 缩略图修改原图方案 - 执迷者X 备份:适配我博客的润色[提示词] - 执迷者X 零基础爬虫:看懂一个API,让AI帮你写逻辑 - 执迷者X 2026年秋:岳阳圣安寺,“智慧”和“慈悲” - 执迷者X 2026年秋回家:质朴亲缘和个体成长 - 执迷者X Codex 与 WorkBuddy,一般职场人怎么选? - 执迷者X 业务数据分析师到底做什么,2026 年要会哪些工具 - 执迷者X 2026年秋:岳阳圣安寺,“智慧”和“慈悲” - 执迷者X Codex默认输出 Markdown,Word/PDF 却要程序翻译 - 执迷者X 此项为测试日志 - 执迷者X 年夏生病日记(第四篇) - 执迷者X 手相入门:生命线、智慧线、感情线怎么看 - 执迷者X ?????:??REST API??????WordPress??????? - 执迷者X 年夏生病日记(第三篇)-身弱不担世事变 - 执迷者X Codex接管浏览器实现抖音评论区截流自动化 - 执迷者X 年夏生病日记(第二篇)-心神俱耗 - 执迷者X 用AI养号?别想太多,先让你的浏览器寄生一下:Playwright+CDP实现抖音半自动化操作指南 - 执迷者X Codex合并进 GPT 之后的这几天 - 执迷者X 三段日常观察:实体的一些运作逻辑 - 执迷者X 搭建博客两年后,AI给出的诊断 - 执迷者X 「常见感冒药」功能分类备忘 - 执迷者X [笔记]:生根与拔根:一个鄂西家庭的精神脉络(12) - 执迷者X
爬虫的钥匙:Codex 处理常规网站,掌握 F12 请求头到底够不够...
Myclaw · 2026-08-13 · via 执迷者X

很多人把爬虫想得很玄。其实大多数常规网站,一条 F12 + 复制请求头,就够 Codex 帮你写出能跑的爬虫。但它只是一把”钥匙”,不是”万能钥匙”。这篇讲清基础套路和边界:什么时候 F12 请求头够用,什么时候必须上浏览器自动化。

「一、先搞清楚:爬虫到底在爬什么」

【爬虫的本质:替浏览器发请求】

爬虫干的事,说穿了就一句:替浏览器把”请求”发出去,再把”响应”接住。人话解释:请求就是浏览器向服务器要数据时说的话,响应就是服务器回的话。

大多数常规网站,数据并不是直接写在网页里的,而是由网页里的 JS 向接口要 JSON。人话解释:接口是服务器开的”数据窗口”,JSON 是网站传数据的”标准信封”,按固定格式装字段。

所以爬虫要做的,就是找到那个接口,模拟浏览器发请求,再把 JSON 拆开取字段。

【F12 在看什么:Network 与请求头】

F12 开发者工具的 Network(网络)面板,让你看到浏览器到底发了哪些请求、带了哪些头。

请求头(headers)是请求的”自我介绍”:我是谁(User-Agent)、我从哪来(Referer)、我接受什么格式(Accept)。服务器就靠它判断你是不是正常浏览器。

理解这一点,就理解了”F12 刷新请求头”为什么能当基础门槛——你只是把浏览器的”自我介绍”原样抄了一遍。

「二、Codex 写爬虫的标准套路」

【四步走】

第一步:F12 打开 Network,刷新页面,找到返回目标数据的接口(看 Preview 或响应体里有没有你要的字段)。

第二步:右键这个请求,复制为 cURL。人话解释:cURL 是浏览器能一键导出的”标准请求写法”,包含网址、请求头、Cookie 全套信息。

第三步:把 cURL 贴给 Codex,说清楚”把这段转成 Python requests 爬虫,解析出 X 字段”。

第四步:本地跑起来,把结果存成 CSV 或 JSON。整个链路,Codex 十分钟内能给你第一版。

这段在做什么:用 F12 复制来的请求头发一个 GET,把返回的 JSON 解析成列表:

import requests
url = "https://example.com/api/list"
headers = {
    "User-Agent": "Mozilla/5.0 ...",    # 你是谁
    "Referer": "https://example.com/",  # 你从哪来
}
data = requests.get(url, headers=headers).json()
print([item["title"] for item in data["list"]])

【为什么”F12 刷新请求头”就是基础门槛】

大多数常规网站(新闻、博客、公开数据页)没有强反爬,只要请求头像正常浏览器,服务器就放行。

这也是”掌握 F12 刷新请求头即可”这句话真正成立的场景:常规网站 = 不需要登录 + 返回纯 JSON + 没有签名参数。

「三、钥匙打不开的门」

【登录态:Cookie 会过期】

很多数据要登录才看得到。请求头里的 Cookie,人话解释:服务器发给你的”临时通行证”,登录后才发。

F12 能复制到 Cookie,但它有有效期;登录态一变,爬虫立刻失效,得重登再换。

【JS 渲染:响应里根本没有数据】

有些网站服务器只返回空壳 HTML,数据由浏览器里的 JS 现算现填。你翻遍 Network 也找不到目标接口。

这种场景请求头救不了你,只能让真实浏览器跑起来——Playwright/CDP 就是干这个的。人话解释:CDP 是 Chrome 给外部程序开的”遥控器”,能像真人一样点页面、等渲染、拿数据。

【签名参数:请求头凑不齐】

部分接口要求带上签名(sign)、时间戳、加密参数,服务器会校验”这个请求是不是正规客户端发的”。

少了签名,请求头再全也被拒。而破解签名通常要逆向 JS,成本直接上一个台阶。

【频率风控:不封你封谁】

就算请求头齐全,短时间高频请求也会触发风控:封 IP、弹验证码、限速。

这是”会不会写”之外的另一道门槛——技术上能爬到,业务上未必让你爬。

▸ 小贴士:小贴士:判断一个接口是否常规,最快看三点:要不要登录、要不要签名参数、返回是不是纯 JSON。三个都不占,F12 + 请求头基本够用。

所以答案是什么?

对”大多数常规网站”,答案是肯定的:掌握 F12 + 请求头,就是 Codex 写爬虫的基础办法,够用。

但这里有一个前提:一旦碰上登录态、JS 渲染、签名参数、频率风控这四样里的任何一样,光靠请求头就不够了,得升级到 Playwright/CDP 浏览器自动化,甚至分布式方案。

一句话总结:F12 + 请求头是 Codex 爬虫的”入门钥匙”,能打开大多数常规网站的门;打不开的门,说明它本来就不是常规网站。

写在最后

如果你接下来要用 Codex 写第一个爬虫,下一步建议:打开 F12 的 Network,挑一个返回 JSON 的接口,右键复制为 cURL,贴给 Codex 让它生成 requests 代码——先跑通最简单的,再谈复杂场景。

你踩过最坑的反爬是哪一种?评论区聊聊。