惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

G
Google Developers Blog
人人都是产品经理
人人都是产品经理
爱范儿
爱范儿
云风的 BLOG
云风的 BLOG
Last Week in AI
Last Week in AI
H
Hackread – Cybersecurity News, Data Breaches, AI and More
B
Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
H
Help Net Security
B
Blog RSS Feed
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
N
Netflix TechBlog - Medium
S
SegmentFault 最新的问题
The Cloudflare Blog
I
InfoQ
美团技术团队
博客园 - 三生石上(FineUI控件)
MyScale Blog
MyScale Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 司徒正美
L
LangChain Blog
A
About on SuperTechFans
T
The Blog of Author Tim Ferriss
Y
Y Combinator Blog

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
利用 Python 处理 Excel 文件 - 少数派
2020-01-14 · via 少数派

使用场景

日常办公的大多数场景都可能和数据打交道,此时我们第一个想到的便可能是 Excel,方便,简洁,拥有各种集合在一起的功能,相对而言其学习成本低一些。但对于一些专业性较强的行业来说,可能打开一个表格文件的时间已经可以喝一杯咖啡了,此时如果我们会使用脚本语言来处理文件,在时效上要快得多,本文将展示利用 openpyxl 来处理 excel 文件的功能,并且会结合一个小例子给出具体分析。

功能展示

基本准备工作

首先是 openpyxl 的安装,查看 python 的官方网站,我们可以用 pip 安装:

pip install openpyxl

当然如果你用的是 Python 3,也可以这样:

pip3 install openpyxl

安装好 openpyxl 库后,我们可以新建一个 .py 文件,并做好一些初始化的准备:

from openpyxl import load_workbook import datetime

kaggleData = "Your_Excel_file_path" # 此处需要替换为你自己电脑上相应 excel 文件的位置

wb = load_workbook(filename=kaggleData,read_only=True) # 请注意,如果只是读取文件,尽量把 read_only 这个参数设置为 True,这对于较大的 excel 文件来说会有很大的性能提升 sheetNames = wb.sheetnames # 这将返回表格的所有表单名称,以列表形式

写入一个 Excel 文件

读取一个 Excel 文件的工作表,工作薄,每行每列及每个单元格

读取一个 Excel 文件的工作簿

"""读取每个工作表的名字,最大最小的行和列"""

def sheetRange(sheetName):

    minRow = sheetName.min_row

    minCol = sheetName.min_column

    maxRow = sheetName.max_row

    maxCol = sheetName.max_column

    rowRange = 0

    columnRange = 0

    if minRow >= 1:

        rowRange = maxRow - minRow + 1 

    if minCol >= 1:

        columnRange = maxCol - minCol + 1

    print(sheetName.title + “ rowRange: “ + str(rowRange) + “,columnRange: “ + str(columnRange))

读取某个指定的行

对于数据的提取,有时可能需要用到某个指定的行,可以按照下面的方法操作:

def typicalRow(sheetName,RowNumber): # sheetName 是工作簿的名字,RowNumber 是指要读取的指定行

    rowList = []

    minRow = sheetName.min_row

    minCol = sheetName.min_column

    maxRow = sheetName.max_row

    maxCol = sheetName.max_column

"""以下是一些简单的保护代码,在实际操作时可能要考虑到更具体的意外情况"""

    if maxRow < 1:

        errorMessage = sheetName.title + “ 没有内容”

        print(errorMessage)

    elif RowNumber not in range(minRow,maxRow+1):

        errorMessage = “您要查找的第 “ + str(RowNumber) + “ 行超出工作表范围”

        print(errorMessage)

    else:

        for column in range(minCol,maxCol+1):

            cell = sheetName.cell(RowNumber,column)

            rowList.append(cell.value)

    if len(rowList):

        return rowList

读取某个指定的列

就像刚才提到的,有时需要读取某个指定的列,可参考下面的方法:

def typicalColumn(sheetName,ColumnNumber):

    columnList = []

    minRow = sheetName.min_row

    minCol = sheetName.min_column

    maxRow = sheetName.max_row

    maxCol = sheetName.max_column   

    if maxCol < 1:

            errorMessage = sheetName.title + “ 没有内容”

            print(errorMessage)

    elif ColumnNumber not in range(minCol,maxCol+1):

        errorMessage = “您要查找的第 “ + str(ColumnNumber) + “ 列超出工作表范围”

        print(errorMessage)

    else:

        for row in range(minRow,maxRow+1):

            percentProcess = ‘{:.2%}’.format(row/maxRow) # 测试的文件有太多行,加入这一段代码显示进度

            message = "正在获取 " + sheetName.title + " 中的第 " + str(row) + " 行第 " + str(ColumnNumber) + " 列数据,共 " + str(maxRow) + "行,进度为 " + str(percentProcess) 

            print(message,end="\r")

            cell = sheetName.cell(row,ColumnNumber)

            columnList.append(cell.value)

    if len(columnList):

        return columnList

案例分析

自己用 Faker 库创建一些数据写入表格

To be Continued…