所在的位置： python >> python市场 >> Python这个入门级编程,为何让人既爱

Python这个入门级编程,为何让人既爱

在Python尤其是Python2中，编码问题是困扰开发者尤其初学者的一大问题。什么Unicode/UTF-8/str，又是decode/encode的，搞得人头都大了。其实不然，看似庞大难懂，但是可以非常精细地定制需求。

0.Python中的编码

Python中有两个常用的由basestring派生出来的表示字符串的类型：str,unicode。其中，str类似于C中的字符数组或者Java中的byte数组，事实上你可以将它理解为一个存储二进制内容的容器，str不存储编码信息，果对str类型的字符串迭代的话，则会按照其在内存中的字节序依次迭代，意味着如果这个字符串存储的是多字节字符（Unicode/GBK等），则会截断这个字符，演示如下：

而对于unicode类型，Python在内存中存储和使用的时候是按照UTF-8格式，在代码中的表示为字符串前加u，如：

而unicode与str之间的转换，则用到了encode和deocde方法。decode表示将一个(str)字符串按照给定的编码解析为unicode类型，encode则表示将一个unicode字符串按照指定编码解析为字节数组(str)：

1.文件读写

内置的open函数打开文件时，read方法读取的是一个str(私以为叫做字节数组更合适)，如果读取的是其它编码的文字，则需要decode之后再做使用。

对于使用open函数打开文件之后的写操作，则需要将需要写入的字符串按照其编码encode为一个str，如果直接写入，则会引发如下错误：

除此以外，codecs模块也提供了一个open函数，可以直接指定好编码打开一个文本文件，那么读取到的文件内容则直接是一个unicode字符串。对应的指定编码后的写入文件，则可以直接将unicode写到文件中。通过codecs.open可以避免很多编码问题：

建议

对于Python代码中避免遇到编码问题，有一些小建议：

字符编码声明：在代码开头声明编码格式

使用codecs的open函数处理文本文件

尽可能使用unicode而不是str

转载请注明：http://www.aierlanlan.com/rzdk/1807.html

上一篇文章： python解释器

下一篇文章：没有了