国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁 > 編程 > Python > 正文

Python字符串的encode與decode

2019-11-08 00:50:52
字體:
供稿:網(wǎng)友
首先要搞清楚,字符串在Python內(nèi)部的表示是unicode編碼. 因此,在做編碼轉(zhuǎn)換時,通常需要以unicode作為中間編碼,即先將其他編碼的字符串解碼(decode)成unicode,再從unicode編碼(encode)成另一種編碼。 decode的作用是將其他編碼的字符串轉(zhuǎn)換成unicode編碼, 如str1.decode('gb2312'),表示將gb2312編碼的字符串轉(zhuǎn)換成unicode編碼。 encode的作用是將unicode編碼轉(zhuǎn)換成其他編碼的字符串, 如str2.encode('gb2312'),表示將unicode編碼的字符串轉(zhuǎn)換成gb2312編碼。 在某些IDE中,字符串的輸出總是出現(xiàn)亂碼,甚至錯誤,其實是由于IDE的結(jié)果輸出控制臺自身不能顯示字符串的編碼,而不是程序本身的問題。 如在Ulipad中運行如下代碼: s=u"中文" PRint s 會提示: UnicodeEncodeError: 'ascii' codec can't encode characters in position 0-1: ordinal not in range(128)。 這是因為UliPad在英文WindowsXP上的控制臺信息輸出窗口是按照ascii編碼輸出的(英文系統(tǒng)的默認(rèn)編碼是ascii),而上面代碼中的字符串是Unicode編碼的,所以輸出時產(chǎn)生了錯誤。 將最后一句改為:print s.encode('gb2312') 則能正確輸出“中文”兩個字。 若最后一句改為:print s.encode('utf8') 則輸出:/xe4/xb8/xad/xe6/x96/x87, 這是控制臺信息輸出窗口按照ascii編碼輸出utf8編碼的字符串的結(jié)果。 另外,代碼中字符串的默認(rèn)編碼與代碼文件本身的編碼一致, 如: s='中文' 如果是在utf8的文件中,該字符串就是utf8編碼,如果是在gb2312的文件中,則其編碼為gb2312。這種情況下,要進行編碼轉(zhuǎn)換,都需要先用decode方法將其轉(zhuǎn)換成unicode編碼,再使用encode方法將其轉(zhuǎn)換成其他編碼。 通常,在沒有指定特定的編碼方式時,都是使用的系統(tǒng)默認(rèn)編碼創(chuàng)建的代碼文件,在這篇文章中可以看到如何獲得系統(tǒng)的默認(rèn)編碼。 如果字符串是這樣定義: s=u'中文' 則該字符串的編碼就被指定為unicode了,即python的內(nèi)部編碼,而與代碼文件本身的編碼無關(guān)。 因此,對于這種情況做編碼轉(zhuǎn)換,只需要直接使用encode方法將其轉(zhuǎn)換成指定編碼即可。 如果一個字符串已經(jīng)是unicode了,再進行解碼則將出錯, 因此通常要對其編碼方式是否為unicode進行判斷: isinstance(s, unicode) #用來判斷是否為unicode 
發(fā)表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發(fā)表
主站蜘蛛池模板: 曲阜市| 翁源县| 望奎县| 松江区| 永康市| 革吉县| 六安市| 巴青县| 德惠市| 马鞍山市| 富民县| 肃南| 宁明县| 双柏县| 平塘县| 西峡县| 黄山市| 舟曲县| 林甸县| 大竹县| 海兴县| 彭州市| 河曲县| 鱼台县| 留坝县| 玛纳斯县| 瓦房店市| 长海县| 新竹县| 博野县| 香港| 鹤山市| 舟曲县| 新蔡县| 蓝山县| 苏尼特右旗| 高密市| 苗栗市| 临洮县| 禄劝| 油尖旺区|