惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 【当耐特】
Stack Overflow Blog
Stack Overflow Blog
V
Visual Studio Blog
小众软件
小众软件
The Cloudflare Blog
T
Tailwind CSS Blog
Apple Machine Learning Research
Apple Machine Learning Research
爱范儿
爱范儿
美团技术团队
WordPress大学
WordPress大学
罗磊的独立博客
Microsoft Azure Blog
Microsoft Azure Blog
A
About on SuperTechFans
Last Week in AI
Last Week in AI
月光博客
月光博客
博客园 - Franky
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
G
Google Developers Blog
GbyAI
GbyAI
B
Blog
大猫的无限游戏
大猫的无限游戏
博客园 - 聂微东
Hugging Face - Blog
Hugging Face - Blog
博客园 - 叶小钗

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
待在家里出不去?用Python选本书看吧 - 少数派
2020-01-28 · via 少数派

本文知识点: requests, cookie, BeautifulSoap, redis

今天天气不错,应该出去走走,我决定去客厅散散心。打开某信出的阅读软件,以前添加的几百本列在那里,感觉都挺好看,可怎么选出最值得看的呢?软件没有书单和排行榜功能,但每本书都有分数和评论人数。一个个点开统计太累人了。这种重复性的工作当然要用编程来解决啊。

软件提供了Web端,我们只需要拿出requests这个大杀器就可以用普通的get方法就可以了。然而拿到的html提示没登录。为什么呢?因为服务器端认为requests是一个没有登录过的浏览器,所以提示登录。但真要登录的话又需要扫二维码。这就不方便了。

登录往往是爬虫程序的大敌,一般解决思路是selenium打开浏览器,输入用户名和密码登录后获取cookie. 但往往会遇上验证码,这还要用AI来识别。但我们的情况不需要登录多次,所以只要拿到登录过的cookie就好了。

用Chrome的同学只要打开开发者工具,选Network,按上头所示就可以拿到cookie, 拷贝后就可以放在程序里了。可是Cookie会过期的,那我们又需要拷贝一次。任何一个有追求的程序员是不会忍受手工操作的。既然Cookie是个文件,那肯定在硬盘上。那我们用Python读取就好了。

def get_cookie_from_chrome(host):
   cookie_path = os.environ['LOCALAPPDATA'] + r"\Google\Chrome\User Data\Default\Cookies"
   sql = "select host_key,name,encrypted_value from cookies where host_key='%s'" % host
   with sqlite3.connect(cookie_path) as conn:
       cu = conn.cursor()
       cookies = {name: CryptUnprotectData(encrypted_value)[1].decode() for host_key, name, encrypted_value in
                  cu.execute(sql).fetchall()}
       # for host_key, name, encrypted_value in cu.execute(sql).fetchall():
       #     print(f"{host_key}:{name}")
       return cookies

最新版的Chrome是用sqlite管理Cookie的,我们找到Chrome的存放路径后,跑个SQL就可以了。

有了Cookie,我们就可以去拿任意网页资源了。因为Requests默认的User-Agent可以会被反爬虫程序检测到,所以需要替换为当前浏览器的。同时要注意返回数据可能会出现乱码,需要指定为UTF-8或者GBK等

def get_page(url):
   global cookie
   headers = {
       'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.117 Safari/537.36'}
   result = requests.get(url, cookies=cookie, headers=headers)
   result.encoding = 'utf-8'
   return result.text

拿到整个网页后,就需要解析Html来获取我们感兴趣的资源。懂正则的高手这时就可以离开了。但普通程序员还是需要一个html的解析器,比如BeautifulSoup.

   shelfBooks = shelf.find_all(attrs={'class': 'shelfBook'})
      books = []
      for b in shelfBooks:
          try:
              books.append(Book(root + b.get('href'), b.select('div.title')[0].text))
          except Exception as e:
              print(f"{b} got {e}")

用find_all通过css class名就可以拿到书架上所有的书,获取它们的详细链接页,然后再用reqeusts获取详细页拿数据。这样的批量操作自然会引起注意。所以每个请求都要sleep下随机时间。

网络有时不是很稳定,如果没有用多线程的话,一次失败就导致前面的结果丢失了。一方面我们要多用try..except。另一方面我们要随时保存数据。数据库就没什么意思了,来个最近流行的redis吧。 果然非常好用,get和set方法就可以搞定了

r = redis.Redis(host='192.168.1.250', port=6379, decode_responses=True)
r.set(book.title, json.dumps(book, cls=UserEncoder))

...
saved_book = r.get(book.title)

你可以用简单的字符器,也可以用json。

拿到所有数据后,自然可以按你的需要排序,筛选需要的书了。不知不觉,天怎么黑了