一文学习python中编码和解码

学习目录

1 什么是编码和解码

2 编解码基本原理

3 python的默认编码

4 什么是10进制/2进制/8进制/16进制?

5 python的字符串utf-8编解码

  5.1 使用str.encode()编码 ,str.decode()解码

  5.2 解码的乱码问题

  5.3 16进制字符串转为普通字符串

6 python字符串和unicode类型编码转换

什么是编码和解码

大家都知道计算机是二进制的世界,计算机系统只能识别数字0和1组成的一串串的数字。1位数字代表1个比特(bit),每8个比特代表1个字节(byte),那么1个字节如果都为数字1,如11111111,代表的最大数字是255。

如果是2 个字节最大可以表示为 65535,4 个字节最大表示为4294967295。

每一种不同的数字0和1的组合,就可以代表一个字符。基于上述原理出现了各种编码格式:

  • ASCII 编码

最开始是美国人发明的编码 ASCII ,只能表示 256 个字符,仅支持英文字母,数字和少部分符号。

  • GBK 编码

中国文字博大精深,汉字特别多,其他编码格式并不能满足要求,所以才有了适合中文编解码的 GB2312。编码(后来升级到了 GBK 编码),可以容纳将近7000个汉字。

  • Unicode

世界上除了英文/中文等还有各个国家的文字语言,每个国家的编码不统一会带来很多编解码的困难,后来Unicode 字符集就出现了,它将所有的语言都容纳在一起,后续为了在存储和传输数据时节省空间,出现了目前常用的UTF8编码。

编解码基本原理

平常工作中,我们通过键盘输入英文字符或者中文字符或者一些逗号等符号,程序通过编码将字符转为计算机识别的2进制字节流,当计算机处理完成后再通过解码转为我们能识别的字符。

python的默认编码

安装完python3版本的程序后,我们通过sys库,检查下默认的编码。

import sys
print(sys.getdefaultencoding())
结果:
utf-8

因为utf-8本来就支持中文,所以我们可直接在python3版本上定义中文变量并直接使用,而不会出现乱码问题。

什么是10进制/2进制/8进制/16进制?

10进制

通常我们说的数字,比如数字10 100 200等,没有前缀表示

2进制

由数字0和1组成,以0b或者0B前缀开头,比如0b1010,换算为十进制表示数字10

8进制

由数字0到7组成,每3位2进制数字组成一个8进制数,比如3位111表式数字7,所以最大数字为7,而000就表示为0。

以0O或者0o前缀开头,比如0o12,换算为十进制表示数字10

16进制

由数字0到9,字母a,b,c,d,e,f共16位组成,字母a到f代表的是数字10到15;相当于每4位2进制数字组成一个16进制数,比如4位1111表式数字15,用f表示,而0000就表示为0。

以0x或者0X开头,比如0xa,换算为十进制表示数字10

python中可通过bin(),oct(),hex()函数依次将十进制数转换为2进制,8进制,16进制。

#定义数字10
dig1 = 10#转为2进制
bin_dig1 = bin(dig1)
print(f'十进制 数字10 转为2进制为:{bin_dig1}')#转为8进制
oct_dig1 = oct(dig1)
print(f'十进制 数字10 转为8进制为:{oct_dig1}')#转为16进制
hex_dig1 = hex(dig1)
print(f'十进制 数字10 转为16进制为:{hex_dig1}')结果:
十进制 数字10 转为2进制为:0b1010
十进制 数字10 转为8进制为:0o12
十进制 数字10 转为16进制为:0xa

同理2进制,8进制和16进制可通过int()函数转为10进制。

print(f'2进制 数字10 转为10进制为:{int(bin_dig1,base=2)}')
print(f'8进制 数字10 转为10进制为:{int(oct_dig1,base=8)}')
print(f'16进制 数字10 转为10进制为:{int(hex_dig1,base=16)}')
结果:
2进制 数字10 转为10进制为:10
8进制 数字10 转为10进制为:10
16进制 数字10 转为10进制为:10

python的字符串utf-8编解码

  • 使用str.encode()编码 ,str.decode()解码
userinfo = '章三'

以 encoding 指定的编码格式编码 string

userinfo_byte = userinfo.encode(encoding='utf-8')
print(userinfo_byte)
b'\xe7\xab\xa0\xe4\xb8\x89'

编码后字符串类型为bytes,输出的是16进制的字节码,而且1个中文字占了3个字节

print(type(userinfo_byte))
<class 'bytes'>

通过decode函数解码字节码为字符串。

print(userinfo_byte.decode())
章三
  • 解码的乱码问题

如果编码和解码使用的编码不一样,解码后会出现乱码。 比如下面的示例将中文通过utf-8编码,然后通过gbk解码

使用bytes()函数定义编码格式为utf-8的字节码,解码使用gbk编码

zhongwen = bytes('章三',encoding='utf-8')
print(zhongwen.decode(encoding='gbk'))

打印结果时出现乱码:

绔犱笁

所以我们在平时使用时一般都是统一编码格式,目前使用的都是默认编码utf-8。

  • 16进制字符串解码为普通字符串

以上中文“章三”编码输出的16进制为b'\xe7\xab\xa0\xe4\xb8\x89'可通过str.decode().hex()函数转为16进制字符串:“e7aba0e4b889”

然后使用codecs.decode() 或者bytes.fromhex()或者binascii.unhexlify()方法将16进制的字符串解码为普通字符串。

  • codecs.decode()
import codecs
hex_str = "e7aba0e4b889"
str_result = codecs.decode(hex_str, "hex").decode("utf-8")
print(str_result)
  • binascii.unhexlify()
import binascii
byte_str = binascii.unhexlify(hex_str)
str_result = byte_str.decode("utf-8")
print(str_result)
  • bytes.fromhex()
byte_str = bytes.fromhex(hex_str)
str_result = byte_str.decode("utf-8")
print(str_result)

python字符串和unicode类型编码转换

char = "章三"
char.encode(encoding='unicode_escape')

通过unicode_escape编码为unicode类型,结果如下:

b'\\u7ae0\\u4e09'

unicode字节码以\\u的前缀表示,unicode编码中每个中文占2个字节(跟utf8编码不同,utf8编码占用3个字节),7ae0和4e09表示的是16进制,16进制转为10进制数分别是31456,19977

print(f'16进制 7ae0 转为10进制为:{int("7ae0",base=16)}')
print(f'16进制 4e09 转为10进制为:{int("4e09",base=16)}')
结果:
16进制 7ae0 转为10进制为:31456
16进制 4e09 转为10进制为:19977
  • 通过chr函数可以解析出某数字对应的unicode字符
print(f'16进制 7ae0 转为10进制 通过chr函数获取对应数字的字符:{chr(int("7ae0",base=16))}')
print(f'16进制 4e09 转为10进制 通过chr函数获取对应数字的字符:{chr(int("4e09",base=16))}')

结果: 可以反推出我们字符串定义的“章三”两个汉字。

16进制 7ae0 转为10进制 通过chr函数获取对应数字的字符:章
16进制 4e09 转为10进制 通过chr函数获取对应数字的字符:三
  • 通过ord()函数可以直接得出unicode字符对应的编码中的数字

print(f'汉字 章 对应的unicode编码中的数字是 {ord("章")}')
print(f'汉字 三 对应的unicode编码中的数字是 {ord("三")}')
结果:
汉字 章 对应的unicode编码中的数字是 31456
汉字 三 对应的unicode编码中的数字是 19977

共勉: 东汉·班固《汉书·枚乘传》:“泰山之管穿石,单极之绠断干。水非石之钻,索非木之锯,渐靡使之然也。”

-----指水滴不断地滴,可以滴穿石头;

-----比喻坚持不懈,集细微的力量也能成就难能的功劳。

----感谢读者的阅读和学习,谢谢大家。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.hqwc.cn/news/474759.html

如若内容造成侵权/违法违规/事实不符,请联系编程知识网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

为什么录屏没有声音?深入解析,对症下药!

随着科技的发展&#xff0c;录屏成为了一种越来越受欢迎的方式&#xff0c;可以用来录制游戏、课程、演示等内容。然而&#xff0c;很多人在使用录屏软件的时候&#xff0c;都会遇到一个问题&#xff1a;录屏没有声音。那么为什么录屏没有声音呢&#xff1f;接下来&#xff0c;…

NumPy模块完结篇:深入探讨和高效利用【第85篇—NumPy模块】

NumPy模块完结篇&#xff1a;深入探讨和高效利用 NumPy是Python中用于科学计算的核心库之一&#xff0c;提供了高性能的多维数组对象&#xff08;numpy.ndarray&#xff09;以及许多用于操作这些数组的函数。在前面的几篇博客中&#xff0c;我们介绍了NumPy的基础知识、数组操…

第三百五十一回

文章目录 1. 概念介绍2. 获取方法3. 示例代码4. 对比与总结4.1 横向对比4.2 内容总结 我们在上一章回中介绍了"如何获取当前系统语言"相关的内容&#xff0c;本章回中将介绍获取当前时区.闲话休提&#xff0c;让我们一起Talk Flutter吧。 1. 概念介绍 我们使用的北京…

前端面试必备八股文——HTMLCSS

HTML src和href的区别 src和href都是用来加载外部资源&#xff0c;区别如下 src当浏览器解析到该元素时&#xff0c;会暂停其他资源的加载和处理&#xff0c;直到该资源加载完成。 它会将资源内容嵌入到当前标签所在的位置&#xff0c;将其指向的资源下载应用到文档内&#…

WebServer 之 http连接处理(下)

目录 ✊请求报文--解析 流程图 && 状态机 状态机 -- 状态转移图 主状态机 从状态机 http 报文解析 HTTP_CODE 含义 从状态机 逻辑 主状态机 逻辑 &#x1f41e;请求报文--响应 基础API stat mmap iovec writev 流程图 HTTP_CODE 含义(2) 代码分析 …

C语言学习day16:二维数组

二维数组格式&#xff1a; 数据类型 数组名[行][列] { {值1&#xff0c;值2}, {值3&#xff0c;值4} } 代码&#xff1a; int arr[2][3] { {1,2,3},{4,5,6} }; 那么我们怎么找它的下标呢&#xff0c;我先上一副图&#xff1a; 假如我现在要找1&#xff0c;那么它…

JWT和base64

1.1 jwt和token 1.1.1 token介绍 令牌&#xff08;Token&#xff09;&#xff1a;在计算机领域&#xff0c;令牌是一种代表某种访问权限或身份认证信息的令牌。它可以是一串随机生成的字符或数字&#xff0c;用于验证用户的身份或授权用户对特定资源的访问。 简单理解 : 每个…

vue-路由(六)

阅读文章你可以收获什么&#xff1f; 1 明白什么是单页应用 2 知道vue中的路由是什么 3 知道如何使用vueRouter这个路由插件 4 知道如何如何封装路由组件 5 知道vue中的声明式导航router-link的用法 6 知道vue中的编程式导航的使用 7 知道声明式导航和编程式导航式如何传…

Java实现新能源电池回收系统 JAVA+Vue+SpringBoot+MySQL

目录 一、摘要1.1 项目介绍1.2 项目录屏 二、功能模块2.1 用户档案模块2.2 电池品类模块2.3 回收机构模块2.4 电池订单模块2.5 客服咨询模块 三、系统设计3.1 用例设计3.2 业务流程设计3.3 E-R 图设计 四、系统展示五、核心代码5.1 增改电池类型5.2 查询电池品类5.3 查询电池回…

BUGKU-WEB source

题目描述 题目截图如下&#xff1a; 进入场景看看&#xff1a; 解题思路 看源码&#xff0c;看F12网络请求没有东西只能老老实实按照提示用Linux去扫描目录 相关工具 kali虚拟机安装gobuster 或者dirsearch 解题步骤 先查看源码&#xff1a; flag{Zmxhz19ub3RfaGvyzS…

jwt+redis实现登录认证

项目环境&#xff1a;spring boot项目 pom.xml引入jwt和redis <!-- jwt --><dependency><groupId>com.auth0</groupId><artifactId>java-jwt</artifactId><version>4.3.0</version></dependency><!-- redis坐标-->…

机器学习面试:逻辑回归与朴素贝叶斯区别

逻辑回归与朴素贝叶斯区别有以下几个方面: (1)逻辑回归是判别模型&#xff0c;朴素贝叶斯是生成模型&#xff0c;所以生成和判别的所有区别它们都有。 (2)朴素贝叶斯属于贝叶斯&#xff0c;逻辑回归是最大似然&#xff0c;两种概率哲学间的区别。 (3)朴素贝叶斯需要条件独立假设…