惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 三生石上(FineUI控件)
MyScale Blog
MyScale Blog
爱范儿
爱范儿
Y
Y Combinator Blog
Last Week in AI
Last Week in AI
博客园 - Franky
MongoDB | Blog
MongoDB | Blog
aimingoo的专栏
aimingoo的专栏
T
Tailwind CSS Blog
Microsoft Azure Blog
Microsoft Azure Blog
Hugging Face - Blog
Hugging Face - Blog
博客园_首页
阮一峰的网络日志
阮一峰的网络日志
WordPress大学
WordPress大学
月光博客
月光博客
Martin Fowler
Martin Fowler
A
About on SuperTechFans
有赞技术团队
有赞技术团队
酷 壳 – CoolShell
酷 壳 – CoolShell
I
InfoQ
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
J
Java Code Geeks
博客园 - 聂微东
宝玉的分享
宝玉的分享

Python

[开源] CNEquity:自托管 A 股 Parquet 数据湖(日更 / PIT / 防幸存者偏差 / MCP) - V2EX 没人觉得 cursor 的模型思考很慢嘛,经常思考卡死要手动停止再继续 - V2EX [原创工具] hot-list 多平台热榜聚合+AI 分析系统,一键部署,开源免费 - V2EX 开发了一个查看 conda 镜像工作情况的项目,已经开源 - V2EX JD 评论风控问题 - V2EX [开源分享] QQ 空间 Flash 老游戏-红警大战坦克风暴-保活与每日脚本 - V2EX TG api 我用 google Voice 老申请失败 哪位朋友帮忙用 mac 测试下我的 Python 脚本 用 GPT5.6 填了之前的坑:在线的 Python 编辑器和运行终端 为什么这段 cuda 的并行前缀算法不会数据竞争 怎么搞定纯 Python 代码解码 jpg 图片,要求无外部依赖 使用 kkRepo 搭建 Python PyPI 私服 Python WebSocket 长连接到底怎么写才稳? 小白求推荐人工智能学习的网课 humanize-text 一个开源的 AI 文本拟人化工具集 9.9 元起!跨境卖家疯抢的纯净住宅 IP 辣椒 HTTP,到底有多香? 从会议录音到知识库全自动:我把数百段录音做成了可 RAG 问答的 Wiki(附开源代码) CodexSaver:在不让 Codex 变笨的前提下,让它更便宜。 [开源] 我正在用 Python 复刻经典游戏红色警戒 2 有准确绘制缠论中枢的 Python 代码借鉴么 做了一个面向张量计算的语言,可从 Python 调用,支持显式索引和自动求导 把电脑伪装成电视,用 DLNA 投屏拿到视频号直播流地址 爬虫开发工作中,你们是如何基于 AI 进行提效的? 发现 Python 一个有意思的小特性,发现很合适搞成面试题。问了 AI 都不行:),欢迎来挑战~ 大型 Python 开源项目都不会对变量进行类型注解? 使用 pycharm 开发 Python ,自定义代码风格,并实时提示 创造了 uv 的 Astral 公司被 OpenAI 收购 慎用 PyCharm Remote Development 功能 Python 3.15 JIT 的最新进展,已经有大概 5%的性能提升了 [开源] 做了个 feishu-docx,把飞书知识库变成 AI 更容易读写和管理的内容源,方便给 Agent 用
Python 爬虫微框架 web-craft
happytaoer · 2025-10-20 · via Python

背景

这两天构思了一个爬虫框架,对外提供 API 创建爬虫任务,然后内部的队列会进行爬虫的消费。只需要实现数据的解析接口就能快速编写爬虫。非常适合需要利用 AI 快速生成爬虫代码的团队。 screenshot.png

这个框架对外提供了 API 接口来创建,非常便利。目前的设计思路就是只需要实现一个 parse 接口,就行了,方便后续 AI 的介入。

后续开发计划

  1. 开放 AI 接口,通过 AI 自动生成爬虫代码
  2. 集成基于 redis 的任务队列
  3. 实现对外输出的接口层,例如爬虫结果转储到 mysql 等。

目前这是一个非常简单清晰的项目,希望和感兴趣的朋友共建这个项目,提升大家的技术影响力,或许对找远程工作也是有帮助的。

项目地址: happytaoer/web-craft: A Python-based modular web scraping framework focused on efficient single URL crawling, supporting asynchronous processing, API services, and highly customizable spider modules.