





















这是一个创建于 238 天前的主题,其中的信息可能已经有所发展或是发生改变。
1 BingoW 2025 年 10 月 20 日scrapy:我算什么 |
2 happytaoer 2025 年 10 月 20 日@BingoW 比 scrapy 还轻量。大部分爬虫只需要实现 parse 方法即可得到支持 API 的爬虫系统。并且对 AI 编写爬虫特别友好。未来的开发思路是精简为主,完成核心功能,提供 AI 快速集成。 from typing import Dict, Any class DefaultSpider(BaseSpider): |
3 rev1si0n 2025 年 10 月 20 日看着很理想,现实很残酷,只有基础到爆的程度的抓取才会只有一条 url ,实际业务上请求参数,请求头都需要特定计算,甚至依赖计算,完全无法处理。你这也没简单到哪里,甚至我为了调用你还得单独写个请求你这接口的,那我何必不直接请求目的接口直接 parse 呢。 |
4 rev1si0n 2025 年 10 月 20 日和我前某东家的自研框架想法类似,但是你至少得有 request + parse 两个阶段吧。 |
6 fkdtz 2025 年 10 月 20 日无非是一个生产消费模型,解耦了任务和解析这两侧,说实话没啥必要,爬虫面对的核心问题并不在这里。 |
7 happytaoer 2025 年 10 月 20 日@rev1si0n 对,目前有这个接口的实现。可以自定义 header request ,自定义 parse ,甚至于入库自定义。这个项目主要的意义其实不是用来写单个爬虫,而是成百上千个爬虫,提供对外的聚合查询服务。 |
9 happytaoer 2025 年 10 月 20 日@fkdtz 对实际就是抽象了一个架构,对外提供 API ,对于那种成规模爬虫可以使用,如果是单独爬一个用这个没啥意义。后面的方向就是通过提供清晰的接口来提供 AI 爬虫代码的生成。 |
10 luzihang 2025 年 10 月 21 日n 年前,用过类似的内部框架。对接数字货币交易所行情,parse 各个交易所的数据结构,转成我们内部的结构。但是这种应用不能严格称为爬虫。 |
11 czl777 2025 年 10 月 21 日这么说 你这个项目废了,爬从是目前市场上唯一一个不能做成标准化的东西 |
13 konakona 3 月 18 日github 网址打不开,404 了 |
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。