Python编码问题

Zss 发表于:
为什么需要使用reload sys

​python在安装时,默认的编码是ascii,当程序中出现非ascii编码时,python的处理常常会报这样的错UnicodeDecodeError: ‘ascii’ codec can’t decode byte 0x?? in position 1: ordinal not in range(128),python没办法处理非ascii编码的,此时需要自己设置python的默认编码,一般设置为utf8的编码格式。
查询系统默认编码可以在解释器中输入以下命令:
Python代码

sys.getdefaultencoding()

设置默认编码时使用:

sys.setdefaultencoding(‘utf8’)

可能会报AttributeError: ‘module’ object has no attribute ‘setdefaultencoding’的错误,执行reload(sys),再执行以上命令就可以顺利通过。
此时再执行sys.getdefaultencoding()就会发现编码已经被设置为utf8的了,但是在解释器里修改的编码只能保证当次有效,在重启解释器后,会发现,编码又被重置为默认的ascii了,那么有没有办法一次性修改程序或系统的默认编码呢。

如果需要在运行时(就是整个解释器启动完之后)进行setdefaultencoding,就只能重新加载sys这个模块。

一个解决的方案在程序中加入以下代码:

import sys reload(sys) sys.setdefaultencoding(‘utf8’)

1、程序文件当中的静态中文字符

这个情况下由于python默认是由ascii编码的,无法表示中文。如果我们运行这样的程序,系统提示:SyntaxError: Non-ASCII character ‘\xe8’ in file

所以我们需要做的是告诉系统,程序的编码格式。

关于头部的# coding:utf-8,有以下几个作用
1、如果代码中有中文注释,就需要此声明
2、比较高级的编辑器,会根据头部声明,将此作为代码文件的格式。
3、程序会通过头部声明,解码初始化 u”人生苦短”,这样的unicode对象,(所以头部声明和代码的存储格式要一致)

2、程序运行过程中从文件读取的中文字符:

如果你在python中进行编码和解码的时候,不指定编码方式,那么python就会使用defaultencoding默认编码方式。
而python2.x的的defaultencoding是ascii,这也就是大多数python编码报错:“UnicodeDecodeError: ‘ascii’ codec can’t decode byte ……”的原因

查询系统默认编码可以在解释器中输入以下命令:

import sys
sys.getdefaultencoding()

python没办法处理非ascii编码的,此时需要自己设置将python的默认编码,一般设置为utf8的编码格式

也就是sys.setdefaultencoding(‘utf8’)