国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁 > 開發 > PHP > 正文

php使用iconv中文截斷問題的解決方法

2024-05-04 23:31:12
字體:
來源:轉載
供稿:網友

這篇文章主要介紹了php使用iconv中文截斷問題的解決方法,以實例形式較為詳細的分析了出現中文截斷問題的原因與具體解決方法,具有一定參考借鑒價值,需要的朋友可以參考下

本文實例講述了php使用iconv中文截斷問題的解決方法。分享給大家供大家參考。具體分析如下:

今天做了一個采集程序,原理很簡單,使用curl方法把對方頁面的html獲取分析,然后正則提取需要的數據并保存在數據庫。

由于對方頁面是GB2312編碼,而本地使用的是UTF-8編碼。因此在采集后需要進行編碼轉換。

使用了iconv方法進行編碼轉換

iconv — 字符串按要求的字符編碼來轉換

string iconv ( string $in_charset , string $out_charset , string $str )

將字符串 str 從 in_charset 轉換編碼到 out_charset 。

轉換的方法很簡單,直接使用iconv方法就可以了

 

 
  1. <?php  
  2. $content = iconv('GB2312''UTF-8'$content); //$content為采集到的內容  
  3. ?>  

試驗了幾個頁面,都能正常采集。但在之后的采集中,有幾個頁面采集不完整。

一開始考慮是否正則有錯,檢查后排除此問題。經過排查,發現經過iconv轉碼后的內容比采集的內容少了一大段。

查看apache log,看到提示:Notice: iconv(): Detected an illegal character in input string。

翻查手冊,看到以下說明

如果你在 out_charset 后添加了字符串 //TRANSLIT,將啟用轉寫(transliteration)功能。這個意思是,當一個字符不能被目標字符集所表示時,它可以通過一個或多個形似的字符來近似表達。

如果你添加了字符串 //IGNORE,不能以目標字符集表達的字符將被默默丟棄。 否則, str 從第一個無效字符開始截斷并導致一個 E_NOTICE 。

原來iconv遇到不能識別的內容,會從第一個不能識別的字符開始截斷,并生成一個E_NOTICE。因此后邊的內容被丟棄了。

而在輸出字符集后加上//IGNORE則只丟棄不能識別的內容,而不會截斷和丟棄后面的內容。

修改程序后一切正常

 

 
  1. <?php  
  2. $content = iconv('GB2312','UTF-8//IGNORE',$content);//$content為采集到的內容 
  3. ?>  

Tips:使用iconv時,如果要使用UTF-8編碼的,請使用UTF-8而不要使用UTF8,因為UTF8有些服務器會有問題。

希望本文所述對大家的php程序設計有所幫助。

發表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發表
主站蜘蛛池模板: 铜鼓县| 昌邑市| 靖远县| 潼南县| 宿迁市| 双江| 襄城县| 七台河市| 邵阳县| 同心县| 博白县| 烟台市| 翁牛特旗| 屏东市| 苍溪县| 洪湖市| 商河县| 高密市| 武宣县| 舞钢市| 尚志市| 新兴县| 霍山县| 迁西县| 板桥市| 土默特右旗| 盱眙县| 和田县| 漠河县| 淮阳县| 思南县| 随州市| 屯留县| 鄢陵县| 鸡泽县| 深泽县| 当雄县| 井冈山市| 柘荣县| 宁河县| 太仓市|