亚洲免费在线-亚洲免费在线播放-亚洲免费在线观看-亚洲免费在线观看视频-亚洲免费在线看-亚洲免费在线视频

零基礎(chǔ)寫(xiě)python爬蟲(chóng)之HTTP異常處理

系統(tǒng) 1759 0

先來(lái)說(shuō)一說(shuō)HTTP的異常處理問(wèn)題。
當(dāng)urlopen不能夠處理一個(gè)response時(shí),產(chǎn)生urlError。
不過(guò)通常的Python APIs異常如ValueError,TypeError等也會(huì)同時(shí)產(chǎn)生。
HTTPError是urlError的子類(lèi),通常在特定HTTP URLs中產(chǎn)生。

1.URLError
通常,URLError在沒(méi)有網(wǎng)絡(luò)連接(沒(méi)有路由到特定服務(wù)器),或者服務(wù)器不存在的情況下產(chǎn)生。
這種情況下,異常同樣會(huì)帶有"reason"屬性,它是一個(gè)tuple(可以理解為不可變的數(shù)組),
包含了一個(gè)錯(cuò)誤號(hào)和一個(gè)錯(cuò)誤信息。
我們建一個(gè)urllib2_test06.py來(lái)感受一下異常的處理:

復(fù)制代碼 代碼如下:

import urllib2?
req = urllib2.Request('http://www.baibai.com')?
try: urllib2.urlopen(req)?
except urllib2.URLError, e:???
??? print e.reason?

按下F5,可以看到打印出來(lái)的內(nèi)容是:
[Errno 11001] getaddrinfo failed
也就是說(shuō),錯(cuò)誤號(hào)是11001,內(nèi)容是getaddrinfo failed

2.HTTPError

服務(wù)器上每一個(gè)HTTP 應(yīng)答對(duì)象response包含一個(gè)數(shù)字"狀態(tài)碼"。
有時(shí)狀態(tài)碼指出服務(wù)器無(wú)法完成請(qǐng)求。默認(rèn)的處理器會(huì)為你處理一部分這種應(yīng)答。
例如:假如response是一個(gè)"重定向",需要客戶(hù)端從別的地址獲取文檔,urllib2將為你處理。
其他不能處理的,urlopen會(huì)產(chǎn)生一個(gè)HTTPError。
典型的錯(cuò)誤包含"404"(頁(yè)面無(wú)法找到),"403"(請(qǐng)求禁止),和"401"(帶驗(yàn)證請(qǐng)求)。
HTTP狀態(tài)碼表示HTTP協(xié)議所返回的響應(yīng)的狀態(tài)。
比如客戶(hù)端向服務(wù)器發(fā)送請(qǐng)求,如果成功地獲得請(qǐng)求的資源,則返回的狀態(tài)碼為200,表示響應(yīng)成功。
如果請(qǐng)求的資源不存在, 則通常返回404錯(cuò)誤。

HTTP狀態(tài)碼 通常分為5種類(lèi)型,分別以1~5五個(gè)數(shù)字開(kāi)頭,由3位整數(shù)組成:
------------------------------------------------------------------------------------------------
200:請(qǐng)求成功????? 處理方式:獲得響應(yīng)的內(nèi)容,進(jìn)行處理
201:請(qǐng)求完成,結(jié)果是創(chuàng)建了新資源。新創(chuàng)建資源的URI可在響應(yīng)的實(shí)體中得到??? 處理方式:爬蟲(chóng)中不會(huì)遇到
202:請(qǐng)求被接受,但處理尚未完成??? 處理方式:阻塞等待
204:服務(wù)器端已經(jīng)實(shí)現(xiàn)了請(qǐng)求,但是沒(méi)有返回新的信 息。如果客戶(hù)是用戶(hù)代理,則無(wú)須為此更新自身的文檔視圖。??? 處理方式:丟棄
300:該狀態(tài)碼不被HTTP/1.0的應(yīng)用程序直接使用, 只是作為3XX類(lèi)型回應(yīng)的默認(rèn)解釋。存在多個(gè)可用的被請(qǐng)求資源。??? 處理方式:若程序中能夠處理,則進(jìn)行進(jìn)一步處理,如果程序中不能處理,則丟棄
301:請(qǐng)求到的資源都會(huì)分配一個(gè)永久的URL,這樣就可以在將來(lái)通過(guò)該URL來(lái)訪問(wèn)此資源??? 處理方式:重定向到分配的URL
302:請(qǐng)求到的資源在一個(gè)不同的URL處臨時(shí)保存???? 處理方式:重定向到臨時(shí)的URL
304 請(qǐng)求的資源未更新???? 處理方式:丟棄
400 非法請(qǐng)求???? 處理方式:丟棄
401 未授權(quán)???? 處理方式:丟棄
403 禁止???? 處理方式:丟棄
404 沒(méi)有找到???? 處理方式:丟棄
5XX 回應(yīng)代碼以“5”開(kāi)頭的狀態(tài)碼表示服務(wù)器端發(fā)現(xiàn)自己出現(xiàn)錯(cuò)誤,不能繼續(xù)執(zhí)行請(qǐng)求??? 處理方式:丟棄
------------------------------------------------------------------------------------------------

HTTPError實(shí)例產(chǎn)生后會(huì)有一個(gè)整型'code'屬性,是服務(wù)器發(fā)送的相關(guān)錯(cuò)誤號(hào)。

Error Codes錯(cuò)誤碼

因?yàn)槟J(rèn)的處理器處理了重定向(300以外號(hào)碼),并且100-299范圍的號(hào)碼指示成功,所以你只能看到400-599的錯(cuò)誤號(hào)碼。
BaseHTTPServer.BaseHTTPRequestHandler.response是一個(gè)很有用的應(yīng)答號(hào)碼字典,顯示了HTTP協(xié)議使用的所有的應(yīng)答號(hào)。
當(dāng)一個(gè)錯(cuò)誤號(hào)產(chǎn)生后,服務(wù)器返回一個(gè)HTTP錯(cuò)誤號(hào),和一個(gè)錯(cuò)誤頁(yè)面。
你可以使用HTTPError實(shí)例作為頁(yè)面返回的應(yīng)答對(duì)象response。
這表示和錯(cuò)誤屬性一樣,它同樣包含了read,geturl,和info方法。
我們建一個(gè)urllib2_test07.py來(lái)感受一下:

復(fù)制代碼 代碼如下:

import urllib2?
req = urllib2.Request('//www.jb51.net/callmewhy')?
try:?
??? urllib2.urlopen(req)?
except urllib2.URLError, e:?
??? print e.code?
??? #print e.read()?

按下F5可以看見(jiàn)輸出了404的錯(cuò)誤碼,也就說(shuō)沒(méi)有找到這個(gè)頁(yè)面。

3.Wrapping

所以如果你想為HTTPError或URLError做準(zhǔn)備,將有兩個(gè)基本的辦法。推薦使用第二種。
我們建一個(gè)urllib2_test08.py來(lái)示范一下第一種異常處理的方案:

復(fù)制代碼 代碼如下:

from urllib2 import Request, urlopen, URLError, HTTPError?
req = Request('//www.jb51.net/callmewhy')?
try:?
??? response = urlopen(req)?
except HTTPError, e:?
??? print 'The server couldn\'t fulfill the request.'?
??? print 'Error code: ', e.code?
except URLError, e:?
??? print 'We failed to reach a server.'?
??? print 'Reason: ', e.reason?
else:?
??? print 'No exception was raised.'?
??? # everything is fine?

和其他語(yǔ)言相似,try之后捕獲異常并且將其內(nèi)容打印出來(lái)。
這里要注意的一點(diǎn),except HTTPError 必須在第一個(gè),否則except URLError將同樣接受到HTTPError 。
因?yàn)镠TTPError是URLError的子類(lèi),如果URLError在前面它會(huì)捕捉到所有的URLError(包括HTTPError )。

我們建一個(gè)urllib2_test09.py來(lái)示范一下第二種異常處理的方案:

復(fù)制代碼 代碼如下:

from urllib2 import Request, urlopen, URLError, HTTPError?
req = Request('//www.jb51.net/callmewhy')?
try:???
??? response = urlopen(req)???
except URLError, e:???
??? if hasattr(e, 'code'):???
??????? print 'The server couldn\'t fulfill the request.'???
??????? print 'Error code: ', e.code???
??? elif hasattr(e, 'reason'):???
??????? print 'We failed to reach a server.'???
??????? print 'Reason: ', e.reason???
else:???
??? print 'No exception was raised.'???
??? # everything is fine???


更多文章、技術(shù)交流、商務(wù)合作、聯(lián)系博主

微信掃碼或搜索:z360901061

微信掃一掃加我為好友

QQ號(hào)聯(lián)系: 360901061

您的支持是博主寫(xiě)作最大的動(dòng)力,如果您喜歡我的文章,感覺(jué)我的文章對(duì)您有幫助,請(qǐng)用微信掃描下面二維碼支持博主2元、5元、10元、20元等您想捐的金額吧,狠狠點(diǎn)擊下面給點(diǎn)支持吧,站長(zhǎng)非常感激您!手機(jī)微信長(zhǎng)按不能支付解決辦法:請(qǐng)將微信支付二維碼保存到相冊(cè),切換到微信,然后點(diǎn)擊微信右上角掃一掃功能,選擇支付二維碼完成支付。

【本文對(duì)您有幫助就好】

您的支持是博主寫(xiě)作最大的動(dòng)力,如果您喜歡我的文章,感覺(jué)我的文章對(duì)您有幫助,請(qǐng)用微信掃描上面二維碼支持博主2元、5元、10元、自定義金額等您想捐的金額吧,站長(zhǎng)會(huì)非常 感謝您的哦!!!

發(fā)表我的評(píng)論
最新評(píng)論 總共0條評(píng)論
主站蜘蛛池模板: 在线视频欧美日韩 | 久久综合久久网 | 亚洲一区二区欧美 | 99精品国产一区二区青青牛奶 | 中文精品久久久久国产网址 | 国产一区二区在线视频观看 | 九九热精品视频 | 91亚洲国产在人线播放午夜 | 久久影院视频 | 日韩中文字幕精品久久 | 精品亚洲无人区一区二区 | 9966久久精品免费看国产 | 亚洲欧洲日产国码二区首页 | 99精品免费视频 | 日韩图区 | free性欧美喷潮hd | 狼人香蕉香蕉在线视频播放 | 色综合久久久久久久久久久 | 欧美区日韩区 | 二级片毛片| 色天天综合久久久久综合片 | aaa级大片 | 福利视频在线 | 亚洲综合中文 | 99国产精品2018视频全部 | 99爱视频99爱在线观看免费 | 国产日韩欧美一区二区 | 中文字幕在线日韩 | 91在线你懂的 | 欧美成人午夜做爰视频在线观看 | 伊人久久国产 | 欧美高清性刺激毛片 | 欧美精品一区二区精品久久 | 欧美日韩中文字幕久久伊人 | 日韩中文字幕免费观看 | 久久久久久综合七次郎 | 欧美国产成人在线 | 国产午夜精品尤物福利视频 | 人人爽天天爽夜夜爽qc | 日韩欧美区 | 手机看片国产免费 |