编码转换,基础,copy

阅读目录

一,编码转换

  1. ASCII : 最早的编码. ??有英??写字?, ?写字?, 数字, ?些特殊字符.

   没有中?, 8个01代码, 8个bit, 1个byte

  2. GBK: 中?国标码, ??包含了ASCII编码和中?常?编码. 16个bit, 2个byte

  3. UNICODE: 万国码, ??包含了全世界所有国家?字的编码. 32个bit, 4个byte, 包含了 ASCII

  4. UTF-8: 可变?度的万国码. 是unicode的?种实现. 最?字符占8位

    1.英?: 8bit 1byte

    2.欧洲?字:16bit 2byte

    3.中?:24bit 3byte

  综上, 除了ASCII码以外, 其他信息不能直接转换.

  在python3的内存中. 在程序运?阶段. 使?的是unicode编码.

    因为unicode是万国码. 什么内容都可以进?显?. 那么在数据传输和存储的时候由于unicode比较浪费空间和资源.

  需要把 unicode转存成UTF-8或者GBK进?存储. 怎么转换呢.

  在python中可以把?字信息进?编码. 编码之后的内容就可以进?传输了.

  编码之后的数据是bytes类型的数据.其实啊. 还是原来的 数据只是经过编码之后表现形式发?了改变?已.

bytes的表现形式:

  1. 英? b‘alex‘ 英?的表现形式和字符串没什么两样

  2. 中? b‘\xe4\xb8\xad‘ 这是?个汉字的UTF-8的bytes表现形式

s = "alex"
print(s.encode("utf-8")) # 将字符串编码成UTF-8
print(s.encode("GBK")) # 将字符串编码成GBK
结果:
b‘alex‘
b‘alex‘
s = "中"
print(s.encode("UTF-8")) # 中?编码成UTF-8
print(s.encode("GBK")) # 中?编码成GBK
结果:
b‘\xe4\xb8\xad‘
b‘\xd6\xd0‘

记住: 英?编码之后的结果和源字符串?致. 中?编码之后的结果根据编码的不同. 编码结果也不同.

    我们能看到. ?个中?的UTF-8编码是3个字节. ?个GBK的中?编码是2个字节.

    编码之后的类型就是bytes类型. 在?络传输和存储的时候我们python是保存和存储的bytes 类型.

    那么在对?接收的时候. 也是接收的bytes类型的数据. 我们可以使?decode()来进?解 码操作.

   把bytes类型的数据还原回我们熟悉的字符串:

s = "我叫李嘉诚"
print(s.encode("utf-8")) #
b‘\xe6\x88\x91\xe5\x8f\xab\xe6\x9d\x8e\xe5\x98\x89\xe8\xaf\x9a‘
print(b‘\xe6\x88\x91\xe5\x8f\xab\xe6\x9d\x8e\xe5\x98\x89\xe8\xaf\x9a‘.decod
e("utf-8")) # 解码

编码和解码的时候都需要制定编码格式.

s = "我是?字" bs = s.encode("GBK")
# 我们这样可以获取到GBK的?字
# 把GBK转换成UTF-8
# ?先要把GBK转换成unicode. 也就是需要解码
s = bs.decode("GBK") # 解码
# 然后需要进?重新编码成UTF-8
bss = s.encode("UTF-8") # 重新编码
print(bss)

基础的补充

我们补充给几个数据类型的操作

lst = [1,2,3,4,5,6]

for i in lst:
    lst.append(7) # 这样写法就会一直持续添加7
    print(lst)
print(lst)

列表: 循环删除列表中的每?个元素

li = [11, 22, 33, 44]
for e in li:
 li.remove(e)
print(li)
结果:
[22, 44]

分析原因: for的运?过程. 会有?个指针来记录当前循环的元素是哪?个, ?开始这个指针指向第0 个.

然后获取到第0个元素. 紧接着删除第0个. 这个时候. 原来是第?个的元素会?动的变成 第0个.

然后指针向后移动?次, 指向1元素. 这时原来的1已经变成了0, 也就不会被删除了.

?pop删除试试看:

li = [11, 22, 33, 44]
for i in range(0, len(li)):
 del li[i]
print(li)
结果: 报错
# i= 0, 1, 2 删除的时候li[0] 被删除之后. 后??个就变成了第0个.
# 以此类推. 当i = 2的时候. list中只有?个元素. 但是这个时候删除的是第2个 肯定报错啊

经过分析发现. 循环删除都不?. 不论是?del还是?remove. 都不能实现. 那么pop呢?

for el in li:
 li.pop() # pop也不?
print(li)
结果:
[11, 22]

只有这样才是可以的:

for i in range(0, len(li)): # 循环len(li)次, 然后从后往前删除
 li.pop()
print(li)

或者.用另一种类表来记录你要删除的内容.然后循环的删除

li = [11, 22, 33, 44]
del_li = []
for e in li:
 del_li.append(e)
for e in del_li:
 li.remove(e)

print(li)

注意:

  由于删除元素会导致元素的索引改变,所以容易出现问题,尽量不要在循环中直接去删除元素,可以吧要删除的元素添加到另一个集合中然后在批量删除

dict中的fromkey(),可以帮助我们通过list来创建一个dict

dic = dict.fromkeys(["jay", "JJ"], ["周杰伦", "麻花藤"])
print(dic)
结果:
{‘jay‘: [‘周杰伦‘, ‘麻花藤‘], ‘JJ‘: [‘周杰伦‘, ‘麻花藤‘]}

代码中的元素在迭代过程中是不允许进行删除的

dic = {‘k1‘: ‘alex‘, ‘k2‘: ‘wusir‘, ‘s1‘: ‘??板‘}
# 删除key中带有‘k‘的元素
for k in dic:
  if ‘k‘ in k:
 del dic[k] # dictionary changed size during iteration, 在循环迭
代的时候不允许进?删除操作
print(dic)

那怎么办呢? 把要删除的元素暂时先保存在?个list中, 然后循环list, 再删除

dic = {‘k1‘: ‘alex‘, ‘k2‘: ‘wusir‘, ‘s1‘: ‘??板‘}
dic_del_list = []
# 删除key中带有‘k‘的元素
for k in dic:
 if ‘k‘ in k:
 dic_del_list.append(k)
for el in dic_del_list:
 del dic[el]
print(dic)

类型转换:

  元组 => 列表 list(tuple)

  列表 => 元组 tuple(list)

  list=>str str.join(list)

  str=>list str.split()

  转换成False的数据:

   0,‘‘,None,[],(),{},set() ==> False 

深浅拷贝

lst1 = ["??狮王", "紫衫?王", "?眉鹰王", "?翼蝠王"]
lst2 = lst1
print(lst1)
print(lst2)
lst1.append("杨逍")
print(lst1)
print(lst2)
结果:
[‘??狮王‘, ‘紫衫?王‘, ‘?眉鹰王‘, ‘?翼蝠王‘, ‘杨逍‘]
[‘??狮王‘, ‘紫衫?王‘, ‘?眉鹰王‘, ‘?翼蝠王‘, ‘杨逍‘]

dic1 = {"id": 123, "name": "谢逊"}
dic2 = dic1
print(dic1)
print(dic2)
dic1[‘name‘] = "范瑶"
print(dic1)
print(dic2)
结果:
{‘id‘: 123, ‘name‘: ‘谢逊‘}
{‘id‘: 123, ‘name‘: ‘谢逊‘}
{‘id‘: 123, ‘name‘: ‘范瑶‘}
{‘id‘: 123, ‘name‘: ‘范瑶‘}

对于list, set, dict来说, 直接赋值. 其实是把内存地址交给变量. 并不是复制?份内容. 所以. lst1的内存指向和lst2是?样的. lst1改变了, lst2也发?了改变

浅拷贝

lst1 = ["何炅", "杜海涛","周渝?"]
lst2 = lst1.copy()
lst1.append("李嘉诚")
print(lst1)
print(lst2)
print(id(lst1), id(lst2))
结果:
两个lst完全不?样. 内存地址和内容也不?样. 发现实现了内存的拷?
lst1 = ["何炅", "杜海涛","周渝?", ["麻花藤", "?芸", "周笔畅"]]
lst2 = lst1.copy()
lst1[3].append("?敌是多磨寂寞")
print(lst1)
print(lst2)
print(id(lst1[3]), id(lst2[3]))
结果:
[‘何炅‘, ‘杜海涛‘, ‘周渝?‘, [‘麻花藤‘, ‘?芸‘, ‘周笔畅‘, ‘?敌是多磨寂寞‘]]
[‘何炅‘, ‘杜海涛‘, ‘周渝?‘, [‘麻花藤‘, ‘?芸‘, ‘周笔畅‘, ‘?敌是多磨寂寞‘]]
4417248328 4417248328

浅拷?. 只会拷?第?层. 第?层的内容不会拷?. 所以被称为浅拷?

深拷?

import copy
lst1 = ["何炅", "杜海涛","周渝?", ["麻花藤", "?芸", "周笔畅"]]
lst2 = copy.deepcopy(lst1)
lst1[3].append("?敌是多磨寂寞")
print(lst1)
print(lst2)
print(id(lst1[3]), id(lst2[3]))
结果:
[‘何炅‘, ‘杜海涛‘, ‘周渝?‘, [‘麻花藤‘, ‘?芸‘, ‘周笔畅‘, ‘?敌是多磨寂寞‘]]
[‘何炅‘, ‘杜海涛‘, ‘周渝?‘, [‘麻花藤‘, ‘?芸‘, ‘周笔畅‘]]
4447221448 4447233800

都不?样了.

深度拷贝. 把元素内部的元素完全进行拷贝复制. 不会产??个改变另?个跟着 改变的问题 补充?个知识点:

最后我们来看?个?试题:

a = [1, 2]
a[1] = a
print(a[1])

原文地址:https://www.cnblogs.com/LLBFWH/p/9941006.html

时间: 2024-11-09 03:53:34

编码转换,基础,copy的相关文章

python基础 字符编码转换

python2 1 #python2上所有的字符编码都需要先decode到unicode,再从unicode encode到目标编码 2 str_utf8 = "我就是我" 3 print("str_utf-8:我就是我:",str_utf8) 4 #将utf-8转换为unicode 5 str_utf8_to_unicode = str_utf8.decode("utf-8") 6 print(str_utf8_to_unicode) 7 #将

PHP iconv()函数字符编码转换的问题讲解_php技巧 - PHP

文章来源:嗨学网 敏而好学论坛www.piaodoo.com 欢迎大家相互学习 在php中iconv函数库能够完成各种字符集间的转换,是php编程中不可缺少的基础函数库:但有时候iconv对于部分数据转码会无缘无故的少一些.比如在转换字符"—"到gb2312时会出错. 下面一起慢慢看一下这个函数的用法. 最简单的应用,把gb2312置换成utf-8: $text=iconv("GB2312","UTF-8",$text); 在用$text=ico

Source Insight 添加代码排版和编码转换

Source Insight 提供了宏实现和命令实现. 命令实现: 1.代码排版 需要借助indent工具.可以下载GnuWin32,可以安装大多数Linux命令. indent排版很简单. 添加命令:indent.exe  -npro -nip -nlp -npsl -i4 -ts4 -sob -l80 -ss -bl -bli 0 %f %f代表当前文件. Souce Insight可以给命令添加菜单和快捷键. 2.编码转换 需要借助iconv工具.可以下载libiconv工具. iconv

Python3的unicode编码转换成中文问题

Python3的unicode编码转换成中文问题 从别的地方搬过来的,担心以后不容易搜索到,就收集过来. 我当时面临的问题是要从C++发json代码出来,用python写了个server,然后返回给C++程序,结果收到的是:httpSvrDataCbUser: {"tranNO": "0808ad498670dc996", "data": "\u65b0A1EY16", "ver": "1.0&q

关于raw_input输入中文时的编码转换

今日在敲代码时出现了如下问题 中文的编码出现了问题(在键盘输入中文时也会出现同样的问题),中文的编码应该是utf-8编码格式,有以下两种方式来进行编码转换: (1)decode用法:str  -> decode('the_coding_of_str') -> unicode 即写为格式:raw_input('净利润为:'.decode('utf-8').encode('gbk')) (2)encode用法:unicode -> encode('the_coding_you_want')

Linux下查看文件编码,文件编码格式转换和文件名编码转换

linux相关   2008-10-07 10:46   阅读1392   评论0   字号: 大大  中中  小小  如果你需要在Linux中 操作windows下的文件,那么你可能会经常遇到文件编码转换的问题.Windows中默认的文件格式是GBK(gb2312),而Linux一般都是 UTF-8.下面介绍一下,在Linux中如何查看文件的编码及如何进行对文件进行编码转换. 查看文件编码 在Linux中查看文件编码可以通过以下几种方式: 1.在Vim中可以直接查看文件编码 :set file

关于JS的编码转换问题

在进行JS开发过程中,尤其是在开发报表时,报表已集成到Web页面中,通过在页面传递参数至报表中时,会发现有时某些参数值,传递到报表中是显示为问号或乱码等等一系列不能正常显示的情况. 这是由于浏览器和报表服务器的编码不同,字符多次进行编码转换时出现错误导致字符的显示出现乱码,尤其是中日韩文和特殊字符更容易出现乱码问题. 以开发报表软件FineReport为例,在给报表服务器发送请求之前,对URL或者只对URL里面的参数名字和参数值,进行cjkEncode的编码,该方式兼容了各种不同的字符集,如IS

Nim-字符串编码转换

Nim中对字符串进行转码需要用到encodings模块. encodings模块: proc getCurrentEncoding():string {.raises: [],tags: [].} #检索当前系统编码,在UNIX上,总是返回"UTF-8". proc open(destEncoding = "UTF-8"; srcEncoding = "CP1252"): EncodingConverter {. raises: [Overflo

gbk转utf-8 iconv 编码转换

linux下面有时候 字符需要进行编码转换(爬虫将gbk转为utf-8编码...),一般可以选择iconv函数. 终端下面  输入 man 3 iconv 得到  iconv函数的使用方法. 个人看习惯了,msdn文档之后感觉linux下面的文档的看的不是那么爽了. 使用iconv函数进行转码,一般使用三个函数:iconv_open  . iconv  .iconv_close三个函数. iconv_t iconv_open(const char* tocode,const char* from