惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
T
Tailwind CSS Blog
J
Java Code Geeks
Microsoft Azure Blog
Microsoft Azure Blog
GbyAI
GbyAI
爱范儿
爱范儿
量子位
Martin Fowler
Martin Fowler
V
V2EX
博客园 - 三生石上(FineUI控件)
I
InfoQ
MongoDB | Blog
MongoDB | Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
N
Netflix TechBlog - Medium
D
DataBreaches.Net
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Last Week in AI
Last Week in AI
U
Unit 42
Apple Machine Learning Research
Apple Machine Learning Research
H
Help Net Security
T
The Blog of Author Tim Ferriss
Hugging Face - Blog
Hugging Face - Blog
美团技术团队
Engineering at Meta
Engineering at Meta

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
用Python看新闻,掌握最新疫情 - 少数派
2020-02-01 · via 少数派

本文知识点:Python, RSS, gevent,PyQt5

记着十几年前,看新闻还是一件很轻松的事。打开Google Reader,天下新闻尽在我手。各大知名博主每天都在更新高质量的文章。而到了今天,新闻app有十几个,一天能推送几十篇各大小明星的烂事,说好的人工智能呢?

那只能自力更生,自己打造一个了。RSS源虽然不多了,但剩下的都是精品。而且还有爱好者打造的rsshub这样的开源项目, 收集了各大网站的自制RSS源。我们就差一个好的客户端了。

拿出祖传的从feedly导出的opml文件,其它rss服务器应该也有导出功能,它包含了你订阅的所有源。而opml文件只是一个简单的xml文件,用lxml很容易就可以拿到需要的rss网址

    with open('feedly.opml', encoding='utf-8') as opml:

        feeds = etree.parse(opml)

        feeds = feeds.xpath('/opml/body/outline')

        return feeds

Python对RSS格式最好的还是feedparser, 依然还在持续更新。

show_rss方法里会调用feedparser解析rss网址

def show_rss(rss):

    try:

        titles = []

        print(f"loading {rss}")

        result = feedparser.parse(rss)

        print(f"loaded {rss}:{result}")

        for e in result.entries:

            print(e.title)

            titles.append(e.title)

        return {rss: titles}

    except Exception as e:

        pp.pprint(e)

        return {rss: titles}

这个opml有上百个RSS源,如果按顺序读取的话,速度就太慢了。就想想用多线程。打开feedparser的源码一看,用的是urllib。那我们就可以上gevent调用纤程加载所有的RSS源,它的monkey补丁可以直接修改urllib成协作式的调度方式。

import gevent

from gevent import monkey

gevent.monkey.patch_all()

        for feed in feeds:

            for rss in feed.iterchildren():

                rsslist.append(rss.get('xmlUrl'))

        jobs = [gevent.spawn(show_rss, rss) for rss in rsslist]

        gevent.joinall(jobs, timeout=20)

        result = [job.value for job in jobs]

运行后速度飞快,两秒不到全部读完。但基于网速的问题,可能有些站点没有及时响应。可以根据需要修改上面的timeout值。 下来就上个图形界面。PyQt5 用一个QTreeWidget显示RSS源标题列表, 点击事件关联到上面的读取方法后存在QTableWidget里显示所有新闻标题。

虽然我们可以很短时间内读取所有信息,但也没必要每次点击都读取一次,用一个dict缓存一下就好了。

     titles = []

        if len(self.feeds) == 0:

            self.feeds = feed_loader.load()

        if feed in self.feeds.keys():

            titles = self.feeds[feed]

最后的界面如下,非常简洁吧!(其实是不会设计)