惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

量子位
WordPress大学
WordPress大学
小众软件
小众软件
云风的 BLOG
云风的 BLOG
IT之家
IT之家
人人都是产品经理
人人都是产品经理
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Last Week in AI
Last Week in AI
博客园 - 【当耐特】
T
Tailwind CSS Blog
阮一峰的网络日志
阮一峰的网络日志
V
V2EX
宝玉的分享
宝玉的分享
博客园 - Franky
F
Fortinet All Blogs
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
GbyAI
GbyAI
Hugging Face - Blog
Hugging Face - Blog
Jina AI
Jina AI
D
Docker
博客园 - 聂微东
C
Check Point Blog
H
Help Net Security

碎言

不懂就别瞎掰掰:【程序员的常识】写的什么玩意? PrimaryOralMathPack 小学生口算题生成器 AI 辅助编程下的程序设计与代码编写 使用 Next.js 和 Tailwind CSS 构建可编辑和删除的 ToDo 待办事项应用 探索编程新境界:MarsCode 助你一臂之力 使用 Next.js 和 Tailwind CSS 搭建静态图片展示站点并部署到 Vercel AI 辅助编程:免费工具的优缺点及官网一览 GitHub push更新总是失败,写个python脚本解决 把博客从GitHub迁移到到了vercel ComfyUI 和 Flux.1 安装与使用教程 Flux.1 入门必知:硬件、环境、模型 Git项目的子文件夹中的内容无法同步到远程仓库的解决方法 blender流体Fluid使用中没有流体、流体穿模等一些问题的解决方法 博客聚合网站:积薪,竟然关闭了! blender日常使用中的一些技巧 虽然只有我自己在用,但还是更新了碎言博客的源代码, 与其在迷茫中困惑,不如在努力中前进 差点忘了我还有一个博客... 秧歌、博客和AI 终于熬到了新手上路 好久没有更新博客了。。。 老妈大腿骨骨折,最近一直在医院护理 Hello, September! Ubuntu开机自动启动Docker容器运行WordPress Docker 简单快速安装部署WordPress Docker下安装MySQL 加碘盐能防核辐射的话,还怕什么核战争? shields.io 一个简洁、一致、清晰的徽章 Ubuntu下使用root登录ssh的设置 GitHub Actions 构建、部署 Next.js项目
博客大数据分析:38880条博文揭示博主最爱写什么?
J.sky · 2023-07-28 · via 碎言

十年之约有个rss订阅的专题页面,这里通过十年的博主RSS采集了很多的博文,那么多博文,真是好奇大家都在写什么?那么,我们来一次博客大数据分析,看看这些年博主们都写了些什么?

数据采集

首先使用python进行一些数据采集,十年大约通过rss抓去了2500多页的博文数据,包括标题、链接、时间和博主的昵称,但是由于时间只显示了月份和日期,所以时间上无法统计出有意义东西了,看来只能从标题上下手了,先采集所有博文的标题并保存到磁盘上,代码如下:

import requests
import numpy as np
from bs4 import BeautifulSoup
from concurrent.futures import ThreadPoolExecutor

page_url = 'https://foreverblog.cn/feeds.html?page='  # 10年之约rss
number = 2592
titles = []

def collect_title(url):
    # 发送HTTP请求
    response = requests.get(url)

    # 解析HTML文档
    soup = BeautifulSoup(response.content, 'html.parser')
    # 使用正则表达式匹配
    articles = soup.findAll('article', class_='post')
    for article in articles:
        titles.append(article.h1.text.strip('\n\n'))
    print(url+'已经采集完成')

def saveArray(array):
    arr = np.array(array)
    np.savetxt('titles.txt',arr,fmt='%s',encoding='utf-8')
    print('保存所有标题完毕!')

if __name__ == '__main__':
    with ThreadPoolExecutor(max_workers=10) as executor:
        futures = [executor.submit(collect_title,page_url+str(i+1)) for i in range(number)]
        for f in futures:
            f.result()

    print(len(titles))
    saveArray(titles)

网速快的话,几分钟就搞定了,大约采集38880条博文标题!

jieba分词

整理数据,通过jieba中文分词提取有效的词语,然后对词语出现的频率进行排行,根据词语出现的频率前200生成一个词云图。具体代码如下:

import re
import jieba
import matplotlib.pyplot as plt
from wordcloud import WordCloud

titles = []
# 打开文件
with open('titles.txt', 'r', encoding='utf-8') as f:
    for line in f:
        titles.append(line)

words = []
for title in titles:
    text = re.sub('\W*', '', title)
    words.extend(jieba.cut(text,cut_all=True))

word_counts = {}
for word in words:
    if word not in word_counts:
        word_counts[word] = 0
    word_counts[word] += 1

sorted_word_counts = sorted(word_counts.items(), key=lambda x: x[1], reverse=True)

filtered_data = [(word, freq) for word, freq in sorted_word_counts if len(word) > 1]


# 只展示词语出现最多的前200个
top_200_words = filtered_data[:200]
# print(top_200_words)

font_path ='msyh.ttc'
# 创建WordCloud对象,并根据词频数据生成词云图
wordcloud = WordCloud(width=1920, height=1080,font_path=font_path, background_color="white").generate_from_frequencies(dict(top_200_words))

# 绘制词云图
plt.figure(figsize=(10, 5))
plt.imshow(wordcloud, interpolation="bilinear")
plt.axis("off")  # 不显示坐标轴
plt.show()

以下是一些排名靠前的词语:

('使用', 1543), 
('一个', 862), 
('如何', 855), 
('博客', 848), 
('服务', 847),
 ('安装', 714), 
('2022', 677), 
('网站', 657), 
('记录', 651), 
('笔记', 631), 
('解决', 629), 
('什么', 623), 
('系统', 603), 
('教程', 579), 
('数据', 572), 
('问题', 560),
('服务器', 550),
('务器', 550), 
('世界', 517), 
('实现', 513), 
('方法', 474), 
('开源', 467), 
('学习', 450), 
('开发', 418), 
('关于', 413), 
('文件', 412), 
('更新', 406), 
('免费', 386)

总体感觉大部十年的博主都是技术类型的啊,都是大佬了!最后贴上生成的云图,大家雅俗共赏:

博客大数据分析

总结

这个数据比较局限性,因为十年之约的博主并不能代替整个中文博客圈子,而且有很大一部分博主不会弄或是压根没弄RSS订阅,所以这个数据大家看看就好,不必较真。

完整的代码仓库