惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
U
Unit 42
Google DeepMind News
Google DeepMind News
博客园 - 司徒正美
Y
Y Combinator Blog
F
Fortinet All Blogs
云风的 BLOG
云风的 BLOG
T
Tailwind CSS Blog
G
Google Developers Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
罗磊的独立博客
D
DataBreaches.Net
T
The Blog of Author Tim Ferriss
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
MyScale Blog
MyScale Blog
N
Netflix TechBlog - Medium
Microsoft Security Blog
Microsoft Security Blog
GbyAI
GbyAI
P
Proofpoint News Feed
Jina AI
Jina AI
B
Blog RSS Feed
腾讯CDC
阮一峰的网络日志
阮一峰的网络日志
D
Docker

晚花行乐

马克卡尼在2026年达沃斯论坛上的讲话(阅读材料) | 晚花行乐 鸡娃如何用力才是恰到好处 | 晚花行乐 读万卷书,行万里路的辩证关系 | 晚花行乐 反对培训机构掐尖招生 | 晚花行乐 小泽和建国会谈最后10分钟全文(阅读材料) | 晚花行乐 来看看 DeepSeek 怎么鸡娃 | 晚花行乐 谈谈基本功 | 晚花行乐 惠普 ProDesk SFF PC 各系列参数对比 | 晚花行乐 解决瘦客户机上安装 Debian 12 启动失败问题 | 晚花行乐 意拾喻言:老外写的文言文 | 晚花行乐 笠翁对韵中的典故(十三元) | 晚花行乐 谈谈中考取消四小门 | 晚花行乐 亚马逊云科技产品免费试用攻略(3) - 对象存储服务 | 晚花行乐 在 Windows 10 LTSC 版本上安装 WSL2 | 晚花行乐 Debian 12 的常用配置项 | 晚花行乐 在 Debian 12 上安装 Nvidia 显卡驱动程序 | 晚花行乐 解决 Debian 12 关机失败问题 | 晚花行乐 解决 VS Code 自动更新版本后卡在连接界面 | 晚花行乐 观看巴黎奥运会有感 | 晚花行乐 在 Windows10 上安装惠普旧打印机驱动程序 | 晚花行乐 欢迎关注公众号:晚花行乐 | 晚花行乐 如何编写拼写检查器 | 晚花行乐 亚马逊云科技产品免费试用攻略(2) - 云服务器 | 晚花行乐 Pandas 中 axis 参数的理解(附实例) | 晚花行乐 我打算命个名,叫什么什么 Manager | 晚花行乐 上海武康路历史建筑一览 | 晚花行乐 Python 实现简单的数学表达式解析并处理 | 晚花行乐 观看马拉松的感悟 | 晚花行乐 Python 保存 Cookies 到文件并再次读取 | 晚花行乐 如何为 Hugo 静态网站添加评论功能 | 晚花行乐
解决 CSV 文件的第一列不能解析 | 晚花行乐
2023-10-25 · via 晚花行乐

用 Python 或者 go 语言解析 CSV 文件的时候,有时候会遇到不能解析出第一列的情况,尤其是当这个CSV文件来自 Excel的时候,容易出现这种现象。本文试着解决这个问题。

问题描述

其实在 向 Elastic Search 中批量导入 Excel 这篇文章中已经遇到了这个问题。

看这样一个使用 Excel 软件创建的 csv 文件:

( ☝ Excel 创建的 csv )

用文本编辑器打开 csv 文件,正如文本看到的是用逗号分隔的文本:

( ☝ Excel 创建的 csv )

我们希望用 Python 或者 Go 语言解析这个 csv, 使用的代码如下:

使用 Python 解析

运行下面的代码用来查看每一行的内容:

import csv

with open("some.csv", 'r') as f:
    reader = csv.DictReader(f)
    for row in reader:
        print(row["Id"], row["Name"], row["Age"])

运行这段代码,会报错:找不到 Id 这个字段:

Traceback (most recent call last):
  File "some.py", line 6, in <module>
    print(row["Id"], row["Name"], row["Age"])
KeyError: 'Id'

使用 Go 解析

运行下面的代码用来寻找名字叫 Id 的文本值:

package main

import (
	"encoding/csv"
	"fmt"
	"io"
	"log"
	"os"
)

func main() {
	f, err := os.Open("some.csv")
	if err != nil {
		log.Fatalf("Error: %s", err)
	}
	defer f.Close()

	r := csv.NewReader(f)

	for {
		record, err := r.Read()
		if err == io.EOF {
			break
		}
		if err != nil {
			log.Fatalf("Read csv error: %s", err)
		}
		for _, field := range record {
			if field == "Id" {
				fmt.Println(field)
			}
		}

	}
}

得到结果为空,什么也不打印。

问题原因

用 16进制编辑器查看文件,会发现文件头有三个字节的 BOM 字符:

如果解析 csv 的库不去主动处理这三个字符,就会被当作第一个字段名的一部分。

Python 的解决方法

在打开文件的 open 函数中,指定解码方式为 encoding='utf_8_sig'

import csv

with open("some.csv", 'r', encoding='utf_8_sig') as f:
    reader = csv.DictReader(f)
    for row in reader:
        print(row["Id"], row["Name"], row["Age"])

顺利读出 csv 文件的结构:

1 Alice 12
2 Bob 8
3 Charlie 10

Go 语言的解决方法

使用第三方库 utfbom,可以方便的去掉 BOM 字符:

go get -u github.com/dimchansky/utfbom

原生 csv 库


package main

import (
	"encoding/csv"
	"fmt"
	"io"
	"log"
	"os"

	"github.com/dimchansky/utfbom"
)

func main() {
	f, err := os.Open("some.csv")
	if err != nil {
		log.Fatalf("Error: %s", err)
	}
	defer f.Close()

	r := csv.NewReader(utfbom.SkipOnly(f))

	for {
		record, err := r.Read()
		if err == io.EOF {
			break
		}
		if err != nil {
			log.Fatalf("Read csv error: %s", err)
		}
		for _, field := range record {
			if field == "Id" {
				fmt.Println(field)
			}
		}

	}
}

各位读后有什么想法,请在下方留言吧!如果对本文有疑问或者寻求合作,欢迎 联系邮箱邮箱已到剪贴板

精彩评论