爬蟲程式:網路爬蟲是一個自動提取網頁的程式，它為搜尋引擎從全球資訊網上下 -百科知識中文網

名詞解釋

大家比較熟悉使用各種搜尋引擎，但是，還有一種更主動和專門的搜尋技術：網路爬蟲。又被稱為網頁蜘蛛，網路機器人，更經常的稱為網頁追逐者，是一種按照一定的規則，自動的抓取全球資訊網信息的程式或者腳本。

簡介

發展套用

隨著網路的迅速發展，全球資訊網成為大量信息的載體，如何有效地提取並利用這些信息成為一個巨大的挑戰。搜尋引擎(Search Engine)，例如傳統的通用搜尋引擎AltaVista，Yahoo!和Google等，作為一個輔助人們檢索信息的工具成為用戶訪問全球資訊網的入口和指南。但是，這些通用性搜尋引擎也存在著一定的局限性。
通用性搜尋引擎的局限性　
(1) 不同領域、不同背景的用戶往往具有不同的檢索目的和需求，通用搜尋引擎所返回的結果包含大量用戶不關心的網頁。　
(2) 通用搜尋引擎的目標是儘可能大的網路覆蓋率，有限的搜尋引擎伺服器資源與無限的網路數據資源之間的矛盾將進一步加深。
(3) 全球資訊網數據形式的豐富和網路技術的不斷發展，圖片、資料庫、音頻/視頻多媒體等不同數據大量出現，通用搜尋引擎往往對這些信息含量密集且具有一定結構的數據無能為力，不能很好地發現和獲取。
(4) 通用搜尋引擎大多提供基於關鍵字的檢索，難以支持根據語義信息提出的查詢。
聚焦爬蟲應運而生

問題解決

為了解決上述問題，定向抓取相關網頁資源的聚焦爬蟲應運而生。聚焦爬蟲是一個自動下載網頁的程式，它根據既定的抓取目標，有選擇的訪問全球資訊網上的網頁與相關的連結，獲取所需要的信息。與通用爬蟲(general?purpose web crawler)不同，聚焦爬蟲並不追求大的覆蓋，而將目標定為抓取與某一特定主題內容相關的網頁，為面向主題的用戶查詢準備數據資源。

工作原理

聚焦爬蟲的工作流程

聚焦爬蟲的工作流程較為複雜，需要根據一定的網頁分析算法過濾與主題無關的連結，保留有用的連結並將其放入等待抓取的URL佇列。然後，它將根據一定的搜尋策略從佇列中選擇下一步要抓取的網頁URL，並重複上述過程，直到達到系統的某一條件時停止。另外，所有被爬蟲抓取的網頁將會被系統存貯，進行一定的分析、過濾，並建立索引，以便之後的查詢和檢索；對於聚焦爬蟲來說，這一過程所得到的分析結果還可能對以後的抓取過程給出反饋和指導。

聚焦爬蟲面臨的問題

相對於通用網路爬蟲，聚焦爬蟲還需要解決三個主要問題：
(1) 對抓取目標的描述或定義；
(2) 對網頁或數據的分析與過濾；
(3) 對URL的搜尋策略。
抓取目標的描述和定義是決定網頁分析算法與URL搜尋策略如何制訂的基礎。而網頁分析算法和候選URL排序算法是決定搜尋引擎所提供的服務形式和爬蟲網頁抓取行為的關鍵所在。這兩個部分的算法又是緊密相關的。
現有聚焦爬蟲對抓取目標的描述可分為基於目標網頁特徵、基於目標數據模式和基於領域概念3種。

特徵

抓取方式

基於目標網頁特徵的爬蟲所抓取、存儲並索引的對象一般為網站或網頁。根據種子樣本獲取方式可分為：
（1）預先給定的初始抓取種子樣本；
（2）預先給定的網頁分類目錄和與分類目錄對應的種子樣本，如Yahoo!分類結構等；
（3）通過用戶行為確定的抓取目標樣例，分為：
a) 用戶瀏覽過程中顯示標註的抓取樣本；
b) 通過用戶日誌挖掘得到訪問模式及相關樣本。
其中，網頁特徵可以是網頁的內容特徵，也可以是網頁的連結結構特徵，等等。
現有的聚焦爬蟲對抓取目標的描述或定義可以分為基於目標網頁特徵，基於目標數據模式和基於領域概念三種。

基於目標數據模式

基於目標數據模式的爬蟲針對的是網頁上的數據，所抓取的數據一般要符合一定的模式，或者可以轉化或映射為目標數據模式。

基於領域

另一種描述方式是建立目標領域的本體或詞典，用於從語義角度分析不同特徵在某一主題中的重要程度。

策略

網頁的抓取策略可以分為深度優先、廣度優先和最佳優先三種。深度優先在很多情況下會導致爬蟲的陷入(trapped)問題，目前常見的是廣度優先和最佳優先方法。

廣度優先搜尋策略

廣度優先搜尋策略是指在抓取過程中，在完成當前層次的搜尋後，才進行下一層次的搜尋。該算法的設計和實現相對簡單。在目前為覆蓋儘可能多的網頁，一般使用廣度優先搜尋方法。也有很多研究將廣度優先搜尋策略套用於聚焦爬蟲中。其基本思想是認為與初始URL在一定連結距離內的網頁具有主題相關性的機率很大。另外一種方法是將廣度優先搜尋與網頁過濾技術結合使用，先用廣度優先策略抓取網頁，再將其中無關的網頁過濾掉。這些方法的缺點在於，隨著抓取網頁的增多，大量的無關網頁將被下載並過濾，算法的效率將變低。

最佳優先搜尋策略

最佳優先搜尋策略按照一定的網頁分析算法，預測候選URL與目標網頁的相似度，或與主題的相關性，並選取評價最好的一個或幾個URL進行抓取。它只訪問經過網頁分析算法預測為“有用”的網頁。存在的一個問題是，在爬蟲抓取路徑上的很多相關網頁可能被忽略，因為最佳優先策略是一種局部最優搜尋算法。因此需要將最佳優先結合具體的套用進行改進，以跳出局部最優點。將在第4節中結合網頁分析算法作具體的討論。研究表明，這樣的閉環調整可以將無關網頁數量降低30%~90%。

算法

網頁分析算法可以歸納為基於網路拓撲、基於網頁內容和基於用戶訪問行為三種類型。

基於網路拓撲的分析算法

基於網頁之間的連結，通過已知的網頁或數據，來對與其有直接或間接連結關係的對象（可以是網頁或網站等）作出評價的算法。又分為網頁粒度、網站粒度和網頁塊粒度這三種。

網頁(Webpage)粒度的分析算法

PageRank和HITS算法是最常見的連結分析算法，兩者都是通過對網頁間連結度的遞歸和規範化計算，得到每個網頁的重要度評價。PageRank算法雖然考慮了用戶訪問行為的隨機性和Sink網頁的存在，但忽略了絕大多數用戶訪問時帶有目的性，即網頁和連結與查詢主題的相關性。針對這個問題，HITS算法提出了兩個關鍵的概念：權威型網頁（authority）和中心型網頁（hub）。
基於連結的抓取的問題是相關頁面主題團之間的隧道現象，即很多在抓取路徑上偏離主題的網頁也指向目標網頁，局部評價策略中斷了在當前路徑上的抓取行為。文獻[21]提出了一種基於反向連結（BackLink）的分層式上下文模型（Context Model），用於描述指向目標網頁一定物理跳數半徑內的網頁拓撲圖的中心Layer0為目標網頁，將網頁依據指向目標網頁的物理跳數進行層次劃分，從外層網頁指向內層網頁的連結稱為反向連結。

網站粒度的分析算法

網站粒度的資源發現和管理策略也比網頁粒度的更簡單有效。網站粒度的爬蟲抓取的關鍵之處在於站點的劃分和站點等級(SiteRank)的計算。SiteRank的計算方法與PageRank類似，但是需要對網站之間的連結作一定程度抽象，並在一定的模型下計算連結的權重。
網站劃分情況分為按域名劃分和按IP位址劃分兩種。文獻[18]討論了在分散式情況下，通過對同一個域名下不同主機、伺服器的IP位址進行站點劃分，構造站點圖，利用類似PageRank的方法評價SiteRank。同時，根據不同檔案在各個站點上的分布情況，構造文檔圖，結合SiteRank分散式計算得到DocRank。文獻[18]證明，利用分散式的SiteRank計算，不僅大大降低了單機站點的算法代價，而且克服了單獨站點對整個網路覆蓋率有限的缺點。附帶的一個優點是，常見PageRank 造假難以對SiteRank進行欺騙。

網頁塊粒度的分析算法

在一個頁面中，往往含有多個指向其他頁面的連結，這些連結中只有一部分是指向主題相關網頁的，或根據網頁的連結錨文本表明其具有較高重要性。但是，在PageRank和HITS算法中，沒有對這些連結作區分，因此常常給網頁分析帶來廣告等噪聲連結的干擾。在網頁塊級別(Block?level)進行連結分析的算法的基本思想是通過VIPS網頁分割算法將網頁分為不同的網頁塊(page block)，然後對這些網頁塊建立page?to?block和block?to?page的連結矩陣，?分別記為Z和X。於是，在pageto?page圖上的網頁塊級別的PageRank為?W?p=X×Z；?在block?to?block圖上的BlockRank為W?b=Z×X。已經有人實現了塊級別的PageRank和HITS算法，並通過實驗證明，效率和準確率都比傳統的對應算法要好。

基於網頁內容的網頁分析算法

基於網頁內容的分析算法指的是利用網頁內容（文本、數據等資源）特徵進行的網頁評價。網頁的內容從原來的以超文本為主，發展到後來動態頁面（或稱為hidden web）數據為主，後者的數據量約為直接可見頁面數據（PIW，Publicly Indexable Web）的400~500倍。另一方面，多媒體數據、Web Service等各種網路資源形式也日益豐富。因此，基於網頁內容的分析算法也從原來的較為單純的文本檢索方法，發展為涵蓋網頁數據抽取、機器學習、數據挖掘、語義理解等多種方法的綜合套用。本節根據網頁數據形式的不同，將基於網頁內容的分析算法，歸納以下三類：第一種針對以文本和超連結為主的無結構或結構很簡單的網頁；第二種針對從結構化的數據源（如RDBMS）動態生成的頁面，其數據不能直接批量訪問；第三種針對的數據界於第一和第二類數據之間，具有較好的結構，顯示遵循一定模式或風格，且可以直接訪問。

基於文本的網頁分析算法

1) 純文本分類與聚類算法
很大程度上借用了文本檢索的技術。文本分析算法可以快速有效的對網頁進行分類和聚類，但是由於忽略了網頁間和網頁內部的結構信息，很少單獨使用。
2) 超文本分類和聚類算法

爬蟲程式