惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

云风的 BLOG
云风的 BLOG
P
Privacy International News Feed
Vercel News
Vercel News
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
博客园 - 叶小钗
F
Fortinet All Blogs
Security Archives - TechRepublic
Security Archives - TechRepublic
L
LINUX DO - 最新话题
AWS News Blog
AWS News Blog
Engineering at Meta
Engineering at Meta
Attack and Defense Labs
Attack and Defense Labs
Recent Announcements
Recent Announcements
Recent Commits to openclaw:main
Recent Commits to openclaw:main
PCI Perspectives
PCI Perspectives
Cloudbric
Cloudbric
AI
AI
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
IT之家
IT之家
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
J
Java Code Geeks
M
MIT News - Artificial intelligence
Cisco Talos Blog
Cisco Talos Blog
V2EX - 技术
V2EX - 技术
Webroot Blog
Webroot Blog
Microsoft Security Blog
Microsoft Security Blog
Cyberwarzone
Cyberwarzone
博客园 - 聂微东
G
Google Developers Blog
W
WeLiveSecurity
罗磊的独立博客
P
Privacy & Cybersecurity Law Blog
阮一峰的网络日志
阮一峰的网络日志
A
About on SuperTechFans
WordPress大学
WordPress大学
The GitHub Blog
The GitHub Blog
T
Tailwind CSS Blog
V
Visual Studio Blog
Application and Cybersecurity Blog
Application and Cybersecurity Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
S
Secure Thoughts
Apple Machine Learning Research
Apple Machine Learning Research
Hugging Face - Blog
Hugging Face - Blog
Google DeepMind News
Google DeepMind News
Google DeepMind News
Google DeepMind News
雷峰网
雷峰网
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
F
Full Disclosure
Blog — PlanetScale
Blog — PlanetScale
The Last Watchdog
The Last Watchdog
P
Proofpoint News Feed

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19) 使用 Velero 备份 Kubernetes 集群 Kubernetes Cheat Sheet 开发 Tips(18) 如何构建一个 Java 工程 开发 Tips(17) KubeSpray 安装 Kubernetes 报错 ip in ansible_all_ipv4_addresses 基于 Kubernetes 和 Jenkins 搭建自动化测试系统 在 Kubernetes 上动态创建 Jenkins Slave 使用 Jenkins 进行服务拨测 开发 Tips(16) Kubernetes 签发 Ingress 证书及日常故障运维 Kubernetes 中 Deployment 的基本操作 Kubernetes 中的证书 如何使用 KubeBuilder 开发一个 Operator Kubernetes 1.6.0 安装问题汇总 镜像管理工具 -- Harbor 开发 Tips(15) Docker 如何拉取镜像 开发 Tips(14) 使用 Helm 安装 harbor 开发 Tips(13) 使用 S2I 构建云原生应用 在 Kubernetes 中使用 emptyDir、hostPath、localVolume 开发 Tips(12) 开发 Tips(11) 代码质量分析工具 SonarQube 使用 Kubeadm 安装 Kubernetes 集群 一起来学 Go --(4)常用函数 Kubernetes 中的 Ceph Kubernetes 之 Volumes Kubernetes 之 Labels、Selectors 开发 Tips(10) 开源正在重构商业模式 Kubernetes 之网络 Kubernetes 之 API 使用 Helm 和 Operator 快速部署 Prometheus Kubernetes 复杂有状态应用管理框架 -- Operator Kubernetes 的包管理器 -- Helm 一起来学 Go --(3)Go Modules 如何一步一步地优化博客方案 kubectl 实用指南 Kubernetes 中的基本概念 搭建远程 Kubernetes 开发环境 大公司和小公司的 ToB 思路 开发 Tips(9) Go 入门指南 一起来学 Go --(2)数据与逻辑结构 如何预防 Web 富文本中的 XSS 攻击 django-xss-cleaner 云工作时代 一起来学 Go --(1)背景与特点 SaaS 开发团队的不同阶段 你不知道的 Git 使用技巧 输出既服务 微服务设计 继续奔跑 开发 Tips(8) 从账户安全到二次验证 Django 性能之数据库查询优化 Django 性能之分库分表 敏捷开发之研发流程 打造一致性的团队 开发 Tips(7) Pytest 进阶学习之 Mock PaaS 部署之 buildpack Go 开发配置 领域输出才是 PaaS 的核心竞争力 Pytest 入门学习 开发 Tips(6) 如何使用 Jenkins、Docker、GitLab 搭建 Django 自动化部署流程
Python的字符编码入门
微信公众号 · 2016-11-09 · via 陈少文的网站

背景: 刚做完一个django的数据查询web项目,数据来源于内部API查询,每次查询都需要调用若干API查询数据渲染在前端页面。由于,相关的数据不会经常变动,为了提高前端响应速度、在API不可用时依然能够查询,设计了缓存。API查询到的数据是json格式返回,缓存的数据是MySQL的Unicode编码,数据由此产生了两个来源:API和MySQL,导致了编码的错误。

1. 编码格式

1.1 ASCII

计算机只能处理0和1两种数字,为了让计算机能够处理文本信息(也就是文字字符串),就需要对这些信息进行编码。最早的计算机编码格式是ASCII码,采用8个bit表示一个字母,定义了128个字符,其中33个字符无法显示。8个bit位最多只能表示255个字符,只够英文国家使用,对全世界显然是不够的。

1.2 GB2312

为了满足计算机处理中文字符的需要,中国发布了GB2312编码规范,采用两个字节,16个bit表示一个图形字。收录6763个汉字,其中一级汉字3755个,二级汉字3008个;同时收录了包括拉丁字母、希腊字母、日文平假名及片假名字母、俄语西里尔字母在内的682个字符。

1.3 GBK

由于GB2312没有覆盖到全部汉字,一些古汉语字形和特殊的字符,GBK采用两个字节,16个bit表示一个图形字,同时完全兼容GB2312。GBK一共收录了21886个汉字和图形符号

1.4 Unicode

各个国家为了计算机能够处理本国语言,各自制定编码规范,不可避免会有各种各样的冲突。为了同一编码,出现了Unicode编码,采用多字节编码。Unicode的标准在不断发展,常见的是采用两个字节,16个bit表示一个字符的,如果是不常见的字符,也可以扩展到多个字节。

1.5 UTF-8

为了能表示更多的字符,Unicode采用长字节编码,这样会造成存储和带宽的浪费。UTF-8应运而生,采用边长的编码方式,实际上UFT-8是Unicode规则字库的一种实现形式。如果一个字节的首位是0,那么就表示一个字符,如果一个字节的首位是1,那么继续扩展一个字节编码判断。这种编码方式使UTF-8得到迅速推广。

1.6 各种编码的使用场景

ASCII:适用于英文的使用环境
GB2312、GBK:适用于中文字符编码
Unicode:通用,常作为中间编码,转换其他编码
UTF-8:节约存储空间和宽带资源,应用非常广

2. Python的编码

Python默认脚本的编码方式是ASCII,如果使用了非ASCII的字符,通常会在第一行或第二行指定编码方式,# -*- coding=utf-8 -*- 或者 #coding=utf-8,当然也可以采用其他字符集,gbk等,但强烈建议保持utf8。

2.1 字典类型

字典是可变容器模型,可存储任意类型对象。键必须是唯一的,但值不必。格式如下:

1
    d = {key1 : value1, key2 : value2 }

在ipython下执行,返回类型:

1
2
3
4
5
    In [1] :dic_a ='name':'tom'    In [2] :type(dic_a)
    Out [2] :dict
    In [3] :dic_a['name']
    Out [3] :'tom'

2.2 列表和元组

列表的数据项不需要具有相同的类型,列表是使用中括号中逗号分割单元定义的,列表的元素允许相同。格式如下:

1
 list= ['value1', 'value2', num1, num1]

在ipython下执行:

1
2
3
4
5
    In [1] :list_a = ['a','b',1,2]
    In [2] :type(list_a)
    Out [2] :list
    In [3] :list_a[0]
    Out [3] :'a'

元组是使用圆括号中逗号分割单元定义,但是元组的内容是不允许改变的。格式如下:

1
 tuple= ('value1', 'value2', num1, num1)

在ipython下执行:

1
2
3
4
5
    In [1] :tuple_a = ('a','b',1,2)
    In [2] :type(tuple_a)
    Out [2] :tuple
    In [3] :tuple_a[0]
    Out [3] :'a'

2.3 Python的字符数据类型

Python中有两种字符串类型,分别是 str 类型(8 bit的序列)和 unicode类型(每个unit是一个unicode对象)。当Python读取一个文本内容时,保持的对象为str类型。而以Unicode编码的字符串需要用u’‘表示。

1
2
3
4
5
6
    In [1] :u'我'
    Out [1] :u'\u6211'
    In [2] :u'我'.encode('gbk')
    Out [2] :'\xce\xd2'
    In [3] :u'我'.encode('utf8')
    Out [3] :'\xe6\x88\x91'

上面编码使用的十六进制显示,使用print可以直接打印出表示的字符。可以看到字符一样,不同的编码存储开销是不一样的。

2.4 JSON数据

json字符串实际上是字符串,只不过它是由单引号包裹的,但是必须符合一定的字符规则。这里有四条:

  • 并列的数据之间用逗号(", “)分隔
  • 映射用冒号(” : “)表示
  • 并列数据的集合(数组)用方括号(”[]")表示
  • 映射的集合(对象)用大括号("{}")表示

json模块提供了两个函数 json.dumps() 和json.loads() 来编码和解码json数据。使用起来非常简单,需要注意的是dumps之后,tuple会变成list,loads之后不会完全恢复。json模块还提供dump和load函数,应用与需要将json存储到文件、套接字,而当做字符串处理时,使用dumps和loads函数。还有一点需要注意,loads会对字符串进行Unicode的编码,如果需要保持原编码,请使用ast.literal_eval。
在python下执行,返回类型:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
    In [1] :import json
    In [2] :obj_a={'name':'tom','age':20,'position':(1,2,3)}
    In [3] :json_a = json.dumps(obj_a)
    In [4] :json_a
    Out [4] :'{"position":[1,2,3],"age":20,"name":"tom"}'
    In [5] :type(json_a)
    Out [5] :str
    In [6] :obj_b=json.loads(json_a)
    In [7] :obj_b
    Out [7] :{u'age': 20, u'name': u'tom', u'position': [1, 2, 3]}
    In [8] :type(obj_b)
    Out [8] :dict
    In [9] :ast.literal_eval(json_a)
    Out [9] : {'age':20,'name':'tom','position':[1,2,3]}
    In [10] :type(ast.literal_eval(json_a))
    Out [10] : dict

同时,Python还提供ord()和chr()两个函数对字母和数字相互转换。

3. MySQL的字符编码

3.1 基本概念

MySQL字符集包括字符集和校对规则两个概念。字符集定义MySQL存储字符串的方式,校对规则定义比较字符串的方式。字符集和校对规则是一对多的关系,MySQL支持30多种字符集的70多种校对规则。

3.2 校对规则选择

使用utf8_general_ci的速度快,而使用utf8_unicode_ci比较准确。 utf8_unicode_ci的准确主要体现德语和法语上,对于一般的国内应用场景,建议使用general规则就足够。另外,由于unicode和general对大小写都不敏感,utf8_bin_ci也有一定的应用场景。

3.3 注意事项

字符集通常直接选择utf8编码就足够。但是在有Emoji表情存储需求时会出现错误。MySQL的utf8编码最多3个字节,而Emoji表情是4个字节。为了能够存储Emoji,应该选用utf8mb4字符集。

4. 参考