国产探花免费观看_亚洲丰满少妇自慰呻吟_97日韩有码在线_资源在线日韩欧美_一区二区精品毛片,辰东完美世界有声小说,欢乐颂第一季,yy玄幻小说排行榜完本

首頁 > 編程 > Python > 正文

零基礎寫python爬蟲之HTTP異常處理

2020-02-23 06:08:44
字體:
來源:轉載
供稿:網友

先來說一說HTTP的異常處理問題。
當urlopen不能夠處理一個response時,產生urlError。
不過通常的Python APIs異常如ValueError,TypeError等也會同時產生。
HTTPError是urlError的子類,通常在特定HTTP URLs中產生。

1.URLError
通常,URLError在沒有網絡連接(沒有路由到特定服務器),或者服務器不存在的情況下產生。
這種情況下,異常同樣會帶有"reason"屬性,它是一個tuple(可以理解為不可變的數組),
包含了一個錯誤號和一個錯誤信息。
我們建一個urllib2_test06.py來感受一下異常的處理:

代碼如下:
import urllib2 
req = urllib2.Request('http://www.baibai.com') 
try: urllib2.urlopen(req) 
except urllib2.URLError, e:   
    print e.reason 

按下F5,可以看到打印出來的內容是:
[Errno 11001] getaddrinfo failed
也就是說,錯誤號是11001,內容是getaddrinfo failed

2.HTTPError

服務器上每一個HTTP 應答對象response包含一個數字"狀態碼"。
有時狀態碼指出服務器無法完成請求。默認的處理器會為你處理一部分這種應答。
例如:假如response是一個"重定向",需要客戶端從別的地址獲取文檔,urllib2將為你處理。
其他不能處理的,urlopen會產生一個HTTPError。
典型的錯誤包含"404"(頁面無法找到),"403"(請求禁止),和"401"(帶驗證請求)。
HTTP狀態碼表示HTTP協議所返回的響應的狀態。
比如客戶端向服務器發送請求,如果成功地獲得請求的資源,則返回的狀態碼為200,表示響應成功。
如果請求的資源不存在, 則通常返回404錯誤。

HTTP狀態碼通常分為5種類型,分別以1~5五個數字開頭,由3位整數組成:
------------------------------------------------------------------------------------------------
200:請求成功      處理方式:獲得響應的內容,進行處理
201:請求完成,結果是創建了新資源。新創建資源的URI可在響應的實體中得到    處理方式:爬蟲中不會遇到
202:請求被接受,但處理尚未完成    處理方式:阻塞等待
204:服務器端已經實現了請求,但是沒有返回新的信 息。如果客戶是用戶代理,則無須為此更新自身的文檔視圖。    處理方式:丟棄
300:該狀態碼不被HTTP/1.0的應用程序直接使用, 只是作為3XX類型回應的默認解釋。存在多個可用的被請求資源。    處理方式:若程序中能夠處理,則進行進一步處理,如果程序中不能處理,則丟棄
301:請求到的資源都會分配一個永久的URL,這樣就可以在將來通過該URL來訪問此資源    處理方式:重定向到分配的URL

發表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發表
主站蜘蛛池模板: 嵊泗县| 台北市| 湘西| 兖州市| 松滋市| SHOW| 长白| 梁河县| 滁州市| 囊谦县| 瑞金市| 万州区| 礼泉县| 延川县| 阳泉市| 温宿县| 乌拉特前旗| 宕昌县| 眉山市| 凤冈县| 桦川县| 西宁市| 射阳县| 吐鲁番市| 沂源县| 墨竹工卡县| 宝山区| 乌苏市| 霍林郭勒市| 香港| 迁安市| 德安县| 绥江县| 淄博市| 黑山县| 墨江| 宁国市| 南江县| 屏山县| 南江县| 独山县|