字符编码的认识

从三个方面理解编码

ascii unicode gbk

ASCII 码使用指定的7 位或8 位二进制数组合来表示128 或256 种可能的字符。标准ASCII 码也叫基础ASCII码，使用7 位二进制数来表示所有的大写和小写字母，数字0 到9、标点符号，以及在美式英语中使用的特殊控制字符。

Unicode与ASCII一样也是一种字符编码方法，它占用两个字节（0000H—FFFFH）,容纳65536 个字符，这完全可以容纳全世界所有语言文字的编码。在Unicode 里，所有的字符都按一个字符来处理，它们都有一个唯一的Unicode 码。使用Unicode 编码可以使您的工程同时支持多种语言，使您的工程国际化。即在不同语言的系统下不至于产生乱码。

GBK: 汉字国标扩展码,基本上采用了原来GB2312-80所有的汉字及码位，并涵盖了原Unicode中所有的汉字20902，总共收录了883个符号， 21003个汉字及提供了1894个造字码位。Microsoft简体版中文Windows 95就是以GBK为内码，又由于GBK同时也涵盖了Unicode所有CJK汉字，所以也可以和Unicode做一一对应。

UTF-8的特点是对不同范围的字符使用不同长度的编码。对于0x00-0x7F之间的字符，UTF-8编码与ASCII编码完全相同。UTF-8，它将每个码位表示为一个由 1 至 4 个字节组成的序列。UTF-16，它将每个码位表示为一个由 1 至 2 个 16 位整数组成的序列。UTF-32，它将每个码位表示为一个32 位整数。在GB2312编码中一个汉字占2个字节，而在UTF-8中，一个汉字要占3个字节”。“

unicode与UTF-8、UTF-16、UTF-32关系

unicode是国际组织制定的可以容纳世界上所有文字和符号的字符编码方案。Unicode用数字0-0x10FFFF来映射这些字符，最多可以容纳1114112个字符，或者说有1114112个码位。码位就是可以分配给字符的数字。UTF-8、UTF-16、UTF-32都是将数字转换到程序数据的编码方案。（相当于二次编码）

参考：http://zhidao.baidu.com/question/89668249.html

字符编码的认识

时间： 2024-10-17 07:30:15

字符编码的认识

字符编码的认识的相关文章

python字符编码

刨根究底字符编码之十二——UTF-8究竟是怎么编码的

Windows程序员必须知道的字符编码和字符集

Python学习Day2笔记(字符编码)

字符编码集

XSS与字符编码的那些事儿

字符编码笔记：ASCII，Unicode和UTF-8【转载】

python中的字符编码和转换

字符编码

python之----------字符编码具体原理