惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Last Week in AI
Last Week in AI
阮一峰的网络日志
阮一峰的网络日志
P
Proofpoint News Feed
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
MongoDB | Blog
MongoDB | Blog
云风的 BLOG
云风的 BLOG
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
J
Java Code Geeks
WordPress大学
WordPress大学
T
The Blog of Author Tim Ferriss
V
Visual Studio Blog
小众软件
小众软件
Microsoft Azure Blog
Microsoft Azure Blog
博客园_首页
IT之家
IT之家
Vercel News
Vercel News
C
Check Point Blog
Google DeepMind News
Google DeepMind News
月光博客
月光博客
D
DataBreaches.Net
酷 壳 – CoolShell
酷 壳 – CoolShell
美团技术团队
Y
Y Combinator Blog
Hugging Face - Blog
Hugging Face - Blog

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
「零代码」写爬虫下载自己全部的豆瓣影评 - 少数派
2021-02-06 · via 少数派

一、背景概述

1、豆瓣一次性发5篇影评就要想办法阻止你了,输对了验证码也告诉你是错的。还经常因为语言过激就把影评给和谐了。

2、想把影评、体验这一类的数据都转存的到维格表格里面统一管理,再通过api标准接口做可视化。

3、然后摸索了一下用浏览器的爬虫插件快速把自己这些年在豆瓣上对各种电影,电视剧,综艺的评价快速爬取下来。具体过程如下。

二、准备内容

  1. web scraper 浏览器插件
  2. 豆瓣账户地址

三、过程记录

0)安装webscraper 浏览器插件

这个不多赘述,自行狗度。插件商店也能直接搜索安装下载。

1)配置爬虫

0、复制广播页面的url地址备用

1、F12打开控制栏,打开webscraper控制台新增一个爬虫,设置复制的广播地址作为sitemap的开始url。注意后面[1-6],代表的是爬取我1到6页的内容,自己可以按需配置。

2、配置第一个容器:add newselector;然后点击select按钮在页面中选中那个评论的div,然后再选第二个,就会默认把整页的这个div都选中了,然后勾选下面的multiple。表示这是爬虫在页面里要爬取的主要对象。

3、配置容器里面的元素:咱们这个列表页的容器里面除了一个访问二级详情页的跳转url,没有任何有价值的元素。所以就添加一个跳转元素即可。先选择type类型为link,然后在上一步容器内找到点击后会跳转详情页的区域。选择父级选择器为上一步的容器即可。

4、配置二级页面的需要元素:方法同理上面2步,类型选择text就行,然后可以按需在右侧电影信息栏抓取影片信息里面的项目。我主要抓了自己的评论,导演,地区。

上映日期不是一个纯粹的日期(会后面加地区),并且经常包含多个日期,需要做正则或者在表格里另做函数处理才能数据结构化。于是我就放弃了这个。

5、查看自己配置的选择器的内容与层级:我从root》容器》二级》各种内容

3)运行爬虫

1、点击sitemap下面的scrape,设置延时用默认的就行,这个不是视频站,加载还是比较快的。然后就静静等待插件运行抓取数据。注意运行爬虫前把多余的窗口都关闭了。这个占电脑资源还是比较大的。

整个爬取过程就是会有一个插件的浏览器弹窗会按配置的规则一条一条的打开你的评论详情页,把指定的内容数据自动存下来。

2、查看抓取进度:点击browse,可以实时刷新看爬虫抓到的数据内容表格。因为我状态页面里除了影评还会有软件和其他东西的评价,规则不适用所以抓上来是null,这个可以回头下载本地直接筛选清除。

3)下载爬取结果

点击export as csv就能直接下载本地了。

4)确认爬取数据完整性

爬取完成不会有具体的提示,直接插件的爬取窗口会关闭,也有可能是占用资源太多插件崩溃了,所以需要在下载的文件里看一下爬取内容的数据是否和预期数量一致,我设定了6页,每页二十条,差不多120条用了10分钟完成爬取。所以数据是完整的。

四、心得体会

1、这个应该是对于无IT基础最快捷的抓取和移动数据的方法了。场景还可以适用于行业网站的联系方式啥的获取,或者各种工具平台之间的数据迁移。

2、这个爬虫是可以直接快速导入复用的,如果有相同需求的同学可以关注并私信我“爬虫”关键字,就可以获得我上面写好的现成脚本,直接导入插件,编辑账号地址进行修改就能快速抓取目标数据。这个也适用于爬取其他用户的影评记录。