分類導(dǎo)航

Python爬蟲從入門到放棄（十五）之 Scrapy框架中Spiders用法

發(fā)布時(shí)間：2017年07月19日作者： IT網(wǎng)絡(luò)文摘 (該文來自筆記，點(diǎn)擊查看原文)

Spider類定義了如何爬去某個(gè)網(wǎng)站，包括爬取的動(dòng)作以及如何從網(wǎng)頁內(nèi)容中提取結(jié)構(gòu)化的數(shù)據(jù)，總的來說spider就是定義爬取的動(dòng)作以及分析某個(gè)網(wǎng)頁

工作流程分析

以初始的URL初始化Request，并設(shè)置回調(diào)函數(shù)，當(dāng)該request下載完畢并返回時(shí)，將生成response，并作為參數(shù)傳給回調(diào)函數(shù). spider中初始的requesst是通過start_requests()來獲取的。start_requests()獲取 start_urls中的URL，并以parse以回調(diào)函數(shù)生成Request
在回調(diào)函數(shù)內(nèi)分析返回的網(wǎng)頁內(nèi)容，可以返回Item對象，或者Dict，或者Request，以及是一個(gè)包含三者的可迭代的容器，返回的Request對象之后會(huì)經(jīng)過Scrapy處理，下載相應(yīng)的內(nèi)容，并調(diào)用設(shè)置的callback函數(shù)
在回調(diào)函數(shù)內(nèi)，可以通過lxml，bs4，xpath,css等方法獲取我們想要的內(nèi)容生成item
最后將item傳遞給Pipeline處理

我們以通過簡單的分析源碼來理解
我通常在寫spiders下寫爬蟲的時(shí)候，我們并沒有寫start_requests來處理start_urls中的url，這是因?yàn)槲覀冊诶^承的scrapy.Spider中已經(jīng)寫過了，我們可以點(diǎn)開scrapy.Spider查看分析

大學(xué)生就業(yè)培訓(xùn),高中生培訓(xùn),在職人員轉(zhuǎn)行培訓(xùn),企業(yè)團(tuán)訓(xùn)

通過上述代碼我們可以看到在父類里這里實(shí)現(xiàn)了start_requests方法，通過make_requests_from_url做了Request請求
如下圖所示的一個(gè)例子，parse回調(diào)函數(shù)中的response就是父類列start_requests方法調(diào)用make_requests_from_url返回的結(jié)果，并且在parse回調(diào)函數(shù)中我們可以繼續(xù)返回Request,如下屬代碼中yield Request()并設(shè)置回調(diào)函數(shù)。

大學(xué)生就業(yè)培訓(xùn),高中生培訓(xùn),在職人員轉(zhuǎn)行培訓(xùn),企業(yè)團(tuán)訓(xùn)

spider內(nèi)的一些常用屬性

我們所有自己寫的爬蟲都是繼承與spider.Spider這個(gè)類

name

定義爬蟲名字，我們通過命令啟動(dòng)的時(shí)候用的就是這個(gè)名字，這個(gè)名字必須是唯一的

allowed_domains

包含了spider允許爬取的域名列表。當(dāng)offsiteMiddleware啟用時(shí)，域名不在列表中URL不會(huì)被訪問
所以在爬蟲文件中，每次生成Request請求時(shí)都會(huì)進(jìn)行和這里的域名進(jìn)行判斷

我想了解如何學(xué)習(xí)

分類導(dǎo)航

Python爬蟲從入門到放棄（十五）之 Scrapy框架中Spiders用法

工作流程分析

spider內(nèi)的一些常用屬性

延伸閱讀

我想了解如何學(xué)習(xí)