惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
Visual Studio Blog
爱范儿
爱范儿
GbyAI
GbyAI
博客园 - 叶小钗
Last Week in AI
Last Week in AI
Jina AI
Jina AI
Microsoft Security Blog
Microsoft Security Blog
云风的 BLOG
云风的 BLOG
C
Check Point Blog
H
Help Net Security
P
Proofpoint News Feed
酷 壳 – CoolShell
酷 壳 – CoolShell
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
大猫的无限游戏
大猫的无限游戏
H
Hackread – Cybersecurity News, Data Breaches, AI and More
B
Blog RSS Feed
Y
Y Combinator Blog
U
Unit 42
T
Tailwind CSS Blog
MyScale Blog
MyScale Blog
N
Netflix TechBlog - Medium
S
SegmentFault 最新的问题
J
Java Code Geeks
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
Week 12:API 捷径基础实例(必读) - 少数派
2019-01-11 · via 少数派

在《Week 11:学会扒网页》我们已经介绍过,通过捷径获取网页的方式有两种,一种是通过扒网页,一种是通过 API。

上一周的内容主要介绍了「扒网页」这种方法。它的主要思路就是把一个网页还原为 HTML,随后从纯文本中匹配出我们需要的部分(比如图片链接),再把这部分内容提取出来(比如下载链接里的图片)。

扒网页的方法适应的范围很广,所以我们说它「可耻但有效」,但它也有三个明显的局限性:

  1. 必须设计复杂的匹配:我们要精确地获取网页中的信息,就要精确匹配到想要的内容,这需要对正则表达式有一定的要求不说,还需要设计大量的步骤以及试错。
  2. 必须下载整个网页:因为必须精确匹配网页内的内容,所以我们必须无差别地下载整个网页的内容。哪怕我们只想要网页里的一句话,我们也不得不把网页里的所有图片都下载下来。
  3. 无法灵活应对变化:这也是扒网页这个方法最不稳定的原因。不同的公司会根据自身的发展需求,对网页的界面的组织方式和显示方式进行调整、改版、升级等等,而我们针对某一个时间点设计的扒网页流程很容易因为这些变动而失效。

出于对这三个局限性的厌恶,我们会希望有一种更稳定、更有针对性的方法,它能够让我们:

  1. 不必设计复杂的匹配,而是像查字典一样就能获取需要的内容。
  2. 不必下载整个网页,而是仅下载自己要用的那部分内容。
  3. 不必面对变化,不管网页设计怎么变,都不影响我们获取内容的那个方式。

有这么好的方法吗?有,这种方法就是借由 API 来获取网页里的内容。