爬蟲原理

上傳人：奔*** IP屬地：河北更新時(shí)間：2024-03-07 格式：doc 頁數(shù)：3 大?。?7.00KB 人氣指數(shù)：12 舉報(bào) 版權(quán)申訴

已閱讀1頁，還剩2頁未讀，繼續(xù)免費(fèi)閱讀

版權(quán)說明：本文檔由用戶提供并上傳，收益歸屬內(nèi)容提供方，若內(nèi)容存在侵權(quán)，請進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡介

1、搜索引擎蜘蛛爬蟲原理：1聚焦爬蟲工作原理及關(guān)鍵技術(shù)概述網(wǎng)絡(luò)爬蟲是一個(gè)自動提取網(wǎng)頁的程序，它為搜索引擎從Inter網(wǎng)上下載網(wǎng)頁，是搜索引擎的重要組成。傳統(tǒng)爬蟲從一個(gè)或若干初始網(wǎng)頁的URL開始，獲得初始網(wǎng)頁上的URL，在抓取網(wǎng)頁的過程中，不斷從當(dāng)前頁面上抽取新的URL放入隊(duì)列直到滿足系統(tǒng)的一定停止條件。聚焦爬蟲的工作流程較為復(fù)雜，需要根據(jù)一定的網(wǎng)頁分析算法過濾與主題無關(guān)的鏈接，保留有用的鏈接并將其放入等待抓取的URL隊(duì)列。然后，它將根據(jù)一定

2、的搜索策略從隊(duì)列中選擇下一步要抓取的網(wǎng)頁URL，并重復(fù)上述過程，直到達(dá)到系統(tǒng)的某一條件時(shí)停止，另外，所有被爬蟲抓取的網(wǎng)頁將會被系統(tǒng)存貯，進(jìn)行一定的分析、過濾，并建立索引，以便之后的查詢和檢索；對于聚焦爬蟲來說，這一過程所得到的分析結(jié)果還可能對以后的抓取過程給出反饋和指導(dǎo)。相對于通用網(wǎng)絡(luò)爬蟲，聚焦爬蟲還需要解決三個(gè)主要問題：(1)對抓取目標(biāo)的描述或定義；(2)對網(wǎng)頁或數(shù)據(jù)的分析與過濾；(3)對URL的搜索策略。抓取目標(biāo)的描述和定義是決定網(wǎng)

3、頁分析算法與URL搜索策略如何制訂的基礎(chǔ)。而網(wǎng)頁分析算法和候選URL排序算法是決定搜索引擎所提供的服務(wù)形式和爬蟲網(wǎng)頁抓取行為的關(guān)鍵所在。這兩個(gè)部分的算法又是緊密相關(guān)的。2抓取目標(biāo)描述現(xiàn)有聚焦爬蟲對抓取目標(biāo)的描述可分為基于目標(biāo)網(wǎng)頁特征、基于目標(biāo)數(shù)據(jù)模式和基于領(lǐng)域概念3種?；谀繕?biāo)網(wǎng)頁特征的爬蟲所抓取、存儲并索引的對象一般為網(wǎng)站或網(wǎng)頁。根據(jù)種子樣本獲取方式可分為：（1）預(yù)先給定的初始抓取種子樣本；（2）預(yù)先給定的網(wǎng)頁分類目錄和與分類目錄對應(yīng)

4、的種子樣本，如Yahoo!分類結(jié)構(gòu)等；（3）通過用戶行為確定的抓取目標(biāo)樣例，分為：a)用戶瀏覽過程中顯示標(biāo)注的抓取樣本；b)通過用戶日志挖掘得到訪問模式及相關(guān)樣本。其中，網(wǎng)頁特征可以是網(wǎng)頁的內(nèi)容特征，也可以是網(wǎng)頁的鏈接結(jié)構(gòu)特征，等等?，F(xiàn)有的聚焦爬蟲對抓取目標(biāo)的描述或定義可以分為基于目標(biāo)網(wǎng)頁特征，基于目標(biāo)數(shù)據(jù)模式和基于領(lǐng)域概念三種?；谀繕?biāo)網(wǎng)頁特征的爬蟲所抓取、存儲并索引的對象一般為網(wǎng)站或網(wǎng)頁。具體的方法根據(jù)種子樣本的獲取方式可以分為：（

5、1）預(yù)先給定的初始抓取種子樣本；（2）預(yù)先給定的網(wǎng)頁分類目錄和與分類目錄對應(yīng)的種子樣本，如Yahoo!分類結(jié)構(gòu)等；（3）通過用戶行為確定的抓取目標(biāo)樣例。其中，網(wǎng)頁特征可以是網(wǎng)頁的內(nèi)容特征，也可以是網(wǎng)頁的鏈接結(jié)構(gòu)特征，等等。基于目標(biāo)數(shù)據(jù)模式的爬蟲針對的是網(wǎng)頁上的數(shù)據(jù)，所抓取的數(shù)據(jù)一般要符合一定的模式，或者可以轉(zhuǎn)化或映射為目標(biāo)數(shù)據(jù)模式。另一種描述方式是建立目標(biāo)領(lǐng)域的本體或詞典，用于從語義角度分析不同特征在某一主題中的重要程度。PageRan

6、k類似，但是需要對網(wǎng)站之間的鏈接作一定程度抽象，并在一定的模型下計(jì)算鏈接的權(quán)重。網(wǎng)站劃分情況分為按域名劃分和按IP地址劃分兩種。文獻(xiàn)[18]討論了在分布式情況下，通過對同一個(gè)域名下不同主機(jī)、服務(wù)器的IP地址進(jìn)行站點(diǎn)劃分，構(gòu)造站點(diǎn)圖，利用類似PageRank的方法評價(jià)SiteRank。同時(shí)，根據(jù)不同文件在各個(gè)站點(diǎn)上的分布情況，構(gòu)造文檔圖，結(jié)合SiteRank分布式計(jì)算得到DocRank。文獻(xiàn)[18]證明，利用分布式的SiteRank計(jì)算，

7、不僅大大降低了單機(jī)站點(diǎn)的算法代價(jià)，而且克服了單獨(dú)站點(diǎn)對整個(gè)網(wǎng)絡(luò)覆蓋率有限的缺點(diǎn)。附帶的一個(gè)優(yōu)點(diǎn)是，常見PageRank造假難以對SiteRank進(jìn)行欺騙。4.1.3網(wǎng)頁塊粒度的分析算法在一個(gè)頁面中，往往含有多個(gè)指向其他頁面的鏈接，這些鏈接中只有一部分是指向主題相關(guān)網(wǎng)頁的，或根據(jù)網(wǎng)頁的鏈接錨文本表明其具有較高重要性。但是，在PageRank和HITS算法中，沒有對這些鏈接作區(qū)分，因此常常給網(wǎng)頁分析帶來廣告等噪聲鏈接的干擾。在網(wǎng)頁塊級別(B

8、locklevel)進(jìn)行鏈接分析的算法的基本思想是通過VIPS網(wǎng)頁分割算法將網(wǎng)頁分為不同的網(wǎng)頁塊(pageblock)，然后對這些網(wǎng)頁塊建立pagetoblock和blocktopage的鏈接矩陣，分別記為Z和X。于是，在pagetopage圖上的網(wǎng)頁塊級別的PageRank為Wp=XZ；在blocktoblock圖上的BlockRank為Wb=ZX。已經(jīng)有人實(shí)現(xiàn)了塊級別的PageRank和HITS算法，并通過實(shí)驗(yàn)證明，效率和準(zhǔn)確率都比

9、傳統(tǒng)的對應(yīng)算法要好。4.2基于網(wǎng)頁內(nèi)容的網(wǎng)頁分析算法基于網(wǎng)頁內(nèi)容的分析算法指的是利用網(wǎng)頁內(nèi)容（文本、數(shù)據(jù)等資源）特征進(jìn)行的網(wǎng)頁評價(jià)。網(wǎng)頁的內(nèi)容從原來的以超文本為主，發(fā)展到后來動態(tài)頁面（或稱為HiddenWeb）數(shù)據(jù)為主，后者的數(shù)據(jù)量約為直接可見頁面數(shù)據(jù)（PIW，PubliclyIndexableWeb）的400~500倍。另一方面，多媒體數(shù)據(jù)、WebService等各種網(wǎng)絡(luò)資源形式也日益豐富。因此，基于網(wǎng)頁內(nèi)容的分析算法也從原來的較為單

眾賞文庫> 全部分類> 畢業(yè)設(shè)計(jì)

溫馨提示

1. 本站所有資源如無特殊說明，都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
2. 本站的文檔不包含任何第三方提供的附件圖紙等，如果需要附件，請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
3. 本站RAR壓縮包中若帶圖紙，網(wǎng)頁內(nèi)容里面會有圖紙預(yù)覽，若沒有圖紙預(yù)覽就沒有圖紙。
4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
5. 眾賞文庫僅提供信息存儲空間，僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理，對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯，并不能對任何下載內(nèi)容負(fù)責(zé)。
6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容，請與我們聯(lián)系，我們立即糾正。
7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

爬蟲原理

文檔簡介

溫馨提示

最新文檔

評論

爬蟲原理

文檔簡介

溫馨提示

最新文檔

評論

免費(fèi)下載