无遮挡色视频真人免费-国产男女性潮高清免费网站-久久国产精品二国产精品-色老二导航

專注抖音視頻、谷歌推廣20年
證券簡稱:思億歐 證券代碼:839255
1對1的貼心服務13603054593

您當前的位置:首頁 >> SEO知識 >> 網(wǎng)站幫助

搜索引擎是如何抓取網(wǎng)站內(nèi)容的

發(fā)布時間:2020-06-22 00:54:20瀏覽次數(shù):

搜索引擎建立網(wǎng)頁索引,處理的對象是文本文件。對于搜索引擎爬蟲來說,抓取下來的網(wǎng)頁包括各種格式,如html、圖片、doc、pdf,多媒體、動態(tài)網(wǎng)頁及其他格式等。這些文件抓取下來后,需要把這些文件中的文本信息提取出來。準確提取這些文檔的信息,一方面對搜索引擎的搜索準確性有重要作用,另一方面對于搜索引擎爬蟲正確跟蹤其他鏈接也有一定的影響。

對于doc、pdf等由專業(yè)廠商提供的軟件生成的文檔,廠商都會提供相應的文本提取接口。搜索引擎爬蟲只需要調(diào)用這些插件的接口,就可以輕松地提取文檔中的文本信息和文件相關(guān)的其他信息。

HTML等文檔不一樣,HTML有一套自己的語法,通過不同的命令標識符來表示不同的字體、顏色、位置等版式,提取文本信息時需要把這些標識符都過濾掉。過濾標識符并非難事,因為這些標識符都有一定的規(guī)則,只要按照不同的標識符取得相應的信息即可。但在識別這些信息的時候,需要同步記錄許多版式信息,例如文字的字體大小、是否是標題、是否是加粗顯示、是否是頁面的關(guān)鍵詞等,這些信息有助于計算單詞在網(wǎng)頁中的重要程度。同時,對于HTML網(wǎng)頁來說,除了標題和正文以外,會有許多廣告鏈接以及公共的頻道鏈接,這些鏈接和文本正文一點關(guān)系也沒有,在提取網(wǎng)頁內(nèi)容的時候,也需要過濾這些無用的鏈接。例如某個網(wǎng)站有“產(chǎn)品介紹”頻道,因為導航條在網(wǎng)站內(nèi)每個網(wǎng)頁都有,若不過濾導航條鏈接,在搜索“產(chǎn)品介紹”的時候,則網(wǎng)站內(nèi)每個網(wǎng)頁都會搜索到,無疑會帶來大量垃圾信息。過濾這些無效鏈接需要統(tǒng)計大量的網(wǎng)頁結(jié)構(gòu)規(guī)律,抽取一些共性,統(tǒng)一過濾;對于一些重要而結(jié)果特殊的網(wǎng)站,還需要個別處理。這就需要搜索引擎爬蟲的設(shè)計有一定的擴展性。

對于多媒體、圖片等文件,一般是通過鏈接的錨文本(即鏈接文本)和相關(guān)的文件注釋來判斷這些文件的內(nèi)容。例如有一個鏈接文字為“故宮的照片”,其鏈接指向一張bmp格式的圖片,那么搜索引擎爬蟲就知道這張圖片的內(nèi)容是“故宮的照片”。這樣,在搜索“故宮”和“照片”的時候都能讓搜索引擎找到這張圖片。另外,許多多媒體文件中都有文件屬性,考慮這些屬性也可以更好地了解文件的內(nèi)容。

動態(tài)網(wǎng)頁一直是網(wǎng)絡(luò)蜘蛛面臨的難題。所謂動態(tài)網(wǎng)頁,是相對于靜態(tài)網(wǎng)頁而言的,是由程序自動生成的頁面,這樣的好處是可以快速統(tǒng)一更改網(wǎng)頁風格,也可以減少網(wǎng)頁所占服務器的空間,但同樣給網(wǎng)絡(luò)蜘蛛的抓取帶來一些麻煩。由于開發(fā)語言不斷增多,動態(tài)網(wǎng)頁的類型也越來越多,如asp、jsp、php等。這些類型的網(wǎng)頁對于搜索引擎爬蟲來說,可能還稍微容易一些。搜索引擎爬蟲比較難于處理的是一些腳本語言(如VBScript和JaVaScript)生成的網(wǎng)頁,如果要完善地處理好這些網(wǎng)頁,網(wǎng)絡(luò)蜘蛛需要有自己的腳本解釋程序。對于許多數(shù)據(jù)是放在數(shù)據(jù)庫的網(wǎng)站,需要通過本網(wǎng)站的數(shù)據(jù)庫搜索才能獲得信息,這樣給網(wǎng)絡(luò)蜘蛛的抓取帶來很大的困難。對于這類網(wǎng)站,如果網(wǎng)站設(shè)計者希望這些數(shù)據(jù)能被搜索引擎搜索,則需要提供一種可以遍歷整個數(shù)據(jù)庫內(nèi)容的方法。

對于網(wǎng)頁內(nèi)容的提取,一直是搜索引擎爬蟲中重要的技術(shù)。整個系統(tǒng)一般采用插件的形式,通過一個插件管理服務程序,遇到不同格式的網(wǎng)頁采用不同的插件處理。這種方式的好處在于擴充性好,以后每發(fā)現(xiàn)一種新的類型,就可以把其處理方式做成一個插件補充到插件管理服務程序中。

由于網(wǎng)站的內(nèi)容經(jīng)常在變化,因此搜索引擎爬蟲也需要不斷地更新其抓取網(wǎng)頁的內(nèi)容,這就需要搜索引擎爬蟲按照一定的周期去掃描網(wǎng)站,查看哪些頁面是需要更新的頁面,哪些頁面是新增頁面,哪些頁面是已經(jīng)過期的死鏈接。

搜索引擎的更新周期對搜索引擎搜索的查全率有很大影響。如果更新周期太長,則總會有一部分新生成的網(wǎng)頁搜索不到;周期過短,技術(shù)實現(xiàn)會有一定難度,而且會對帶寬、服務器的資源都有浪費。搜索引擎爬蟲并不是所有的網(wǎng)站都采用同一個周期進行更新,對于一些重要的更新量大的網(wǎng)站,更新的周期短,如有些新聞網(wǎng)站,幾個小時就更新一次;相反,對于一些不重要的網(wǎng)站,更新的周期就長,可能一兩個月才更新一次。

一般來說,搜索引擎爬蟲在更新網(wǎng)站內(nèi)容的時候,不用把網(wǎng)站網(wǎng)頁重新抓取一遍,對于大部分網(wǎng)頁,只需判斷網(wǎng)頁的屬性(主要是日期),把得到的屬性和上次抓取的屬性相比較,如果一樣則不用更新。

聯(lián)系我們
地址:深圳市龍崗區(qū) 龍城大道85號萬科龍崗云中心16層
13603054593
版權(quán)所有:深圳市西企網(wǎng)科技有限公司|抖音短視頻推廣_抖音短視頻運營_深圳SEO公司,技巧,效果怎么樣 粵ICP備15110110號
X

截屏,微信識別二維碼

微信號:13603054593

(點擊微信號復制,添加好友)

打開微信

主站蜘蛛池模板: 欧美伊人久久大香线蕉综合| 亚洲av成人无码精品电影在线 | 88久久精品无码一区二区毛片 | 国产精欧美一区二区三区| 黑人上司粗大拔不出来电影| 永久免费精品精品永久-夜色| 99国产精品久久99久久久| 婷婷综合久久中文字幕| 婷婷四房色播| 18禁网站在线永久免费观看| 国产精品日韩欧美一区二区三区| 亚洲毛片αv无线播放一区| 美女裸体18禁免费网站| 最近2019年好看中文字幕视频| 亚洲日韩精品无码av海量| 国产精品.xx视频.xxtv| 亚洲人成综合网站7777香蕉 | 色一乱一伦一图一区二区精品| 麻豆精产国品| 欧美牲交a欧美牲交aⅴ免费真| 国产v在线最新观看视频| 中国女人高潮hd| 日本强伦姧人妻一区二区| 影音先锋女人aa鲁色资源| 97久久婷婷五月综合色d啪蜜芽| 久久不见久久见免费视频7| 亚洲中文字幕在线观看| 久久人人爽人人人人爽av| 国产av无码专区亚洲av毛片搜| 欧美日韩国产码高清综合人成 | 亚洲国产精品一区第二页| 亚洲av无码久久久久网站蜜桃| 国产偷v国产偷v亚洲高清| 一边摸一边抽搐一进一出口述| 欧美精品videosbestsex日本| 老熟女重囗味hdxx70星空| 国产乱子伦| 色婷婷综合激情综在线播放| 亚洲av日韩综合一区在线观看| 欧美丰满熟妇乱xxxxx网站| 亚洲av香蕉一区区二区三区|