
























来源:百度搜索
提取网页源码中的头信息(通常指 <head> 标签及其内部内容)时,可以使用正则表达式匹配从 <head> 开始到 </head> 结束之间的所有内容。以下是基于公开资料整理的常用方法和正则表达式:
匹配整个 <head> 区块(包含标签本身):
[\s\S]:匹配任意字符(包括换行符和空格),等价于 . 但不受 re.DOTALL 限制。*?:非贪婪匹配,确保在第一个 </head> 就停止,避免跨多个 <head> 标签误匹配。仅提取 <head> 内部的内容(不含 <head> 和 </head> 标签):
() 提取中间内容,可通过 .group(1) 获取。import re import requests # 获取网页源码 url = "https://example.com" response = requests.get(url) html = response.text
⚠️ 注意:若网页内容包含多个
<head>标签(虽不符合 HTML 标准),非贪婪匹配仍可能出错。此时建议使用 BeautifulSoup 等 HTML 解析器更可靠 5。
<title> 等具体头信息,可单独使用:
<title>(.*?)</title> # 提取网页标题
re.IGNORECASE 可忽略大小写(如 <HEAD> 与 <head>)12。此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。