各种编码格式

ID:74985 · 发表于 2015-3-21 03:07

从ASCII、GB2312、GBK到GB18030，这些编码方法是向下兼容的，即同一个字符在这些方案中总是有相同的编码，后面的标准支持更多的字符。而Unicode只与ASCII兼容（更准确地说，是与ISO-8859-1兼容），与GB码不兼容。例如“汉”字的Unicode编码是6C49，而GB码是BABA。
因此如果一个系统支持GB码，而另一个系统支持UNICODE码，这两个系统如果想进行“说话”的话。二者必须进行转码。

但是不同的编码对应的机内码也是不一样的，比如汉字“啊”，采用GB2312的方式存到内存的数可能是BABA,但是UNICODE码存到内存中的数为1234。

在计算机中字符通常并不是保存为图像，每个字符都是使用一个编码来表示的，而每个字符究竟使用哪个编码代表，要取决于使用哪个字符集(charset)。
“中国北京香蕉是个大笨蛋”这是我定义的aka字符集；各字符对应代码点为：

北 00000001
京 00000010
香 10000001
蕉 10000010
是 10000100
个 10001000
大 10010000
笨 10100000
蛋 11000000
中 00000100
国 00001000
下面是我定义的 zixia 编码方案（8位），可以看到它的编码中表示了aka字符集的所有字符对应的代码单元；
北 10000001
京 10000010
香 00000001
蕉 00000010
是 00000100
个 00001000
大 00010000
笨 00100000
蛋 01000000
中 10000100
国 10001000
所谓文本文件就是我们按一定编码方式将二进制数据表示为对应的文本如00000001000000100000010000001000000100000010000001000000这样的文件。我用一个支持zixia编码和aka字符集的记事本打开，它就按照编码方案显示为 “香蕉是个大笨蛋 ”
如果我把这些字符按照GBK另存一个文件，那么则肯定不是这个，而是
1100111111100011 1011110110110110 1100101011000111 1011100011110110 1011010011110011 1011000110111111 1011010110110000 110100001010

帐号		自动登录	找回密码
密码			立即注册