惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 司徒正美
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Last Week in AI
Last Week in AI
大猫的无限游戏
大猫的无限游戏
博客园 - Franky
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
爱范儿
爱范儿
The Cloudflare Blog
阮一峰的网络日志
阮一峰的网络日志
博客园 - 叶小钗
博客园_首页
有赞技术团队
有赞技术团队
WordPress大学
WordPress大学
宝玉的分享
宝玉的分享
V
V2EX
V
Visual Studio Blog
博客园 - 三生石上(FineUI控件)
S
SegmentFault 最新的问题
量子位
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Apple Machine Learning Research
Apple Machine Learning Research
美团技术团队

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
pdf-helper 02 | 拒绝散装 pdf 之二 - 少数派
2024-01-24 · via 少数派

前言

图片

上次用的方法是把pdf转成图片二维数组来分析重复部分,其实这种思路用起来还是心里打鼓的,不敢确定能不能百分百判断「重复页」和「新起一页」。

图片

这篇文章要讲的方法更有效,我可以绝对放心,但是也有应用场景的限制:

  • 每一页pdf页面上写有作为PPT显示时候的页码。即不是pdf阅读器显示的页码,同一个PPT页码可以对应多页pdf。比如上面那张图。
  • 显示的PPT页码位置固定
  • 页码文本可选
图片

动手

限制说完,代码思路也就出来了。(代码中PyPDF2版本为2.x)

    1. 对每一页进行文本提取,得到对应每一页的字符串。

    2. 对字符串做正则匹配或固定位置切片提取,得到PPT页码文本。

    3. 相同页码文本是同一页,以相同PPT页码文本的最后一页pdf页码为待会要提取的页,存储为一个「待提取的pdf页码」数组。

def getPdfIndex(filename):
    pdf = PdfFileReader(open(filename, "rb"))
    indexs = []
    pages = []
    now = ""
    for i in range(0, pdf.getNumPages()):
        pageObj = pdf.getPage(i)
        content = pageObj.extractText()
        index = content.split("\n")[-2]
        if now != index:
            pages.append(i-1)
            now = index
        indexs.append(index)
    pageCount = pdf.getNumPages()
    pages.remove(-1)
    pages.append(pageCount-1)
    return indexs, pages

    4. 根据「待提取的pdf页码」数组提取页面,导出新pdf。

def splitPdf(filename, pages):
    assert filename[-4:] == '.pdf'
    output = PdfFileWriter()
    pdf_file = PdfFileReader(open(filename, "rb"))
    for i in pages:
        output.addPage(pdf_file.getPage(i))
    filename = filename.replace('\\', '/').split('/')[-1]
    outputStream = open("[Splited] "+filename, "wb")
    output.write(outputStream)

多说几句

最后补一句,就算页码不能直接文本提取也没关系,OCR 就好了。

不过,要是没有PPT页码,那就只能用上回推送说的代码了,上次的代码应该是很通用的了。

怎么用

仓库地址还是这个:https://github.com/Benature/pdf-helper

这次说的代码在 pdf_filter/latex_pdf_filter.py 文件内。

使用方法有两种,比如想处理 chp11.pdf 文件

    a. 可以直接命令行

python3 latex_pdf_filter.py chp11

    b. 也可以在文件里设置好变量

filename = "chp01.pdf"  # 改相应的文件名

        然后直接

python3 latex_pdf_filter.py