在线a毛片免费视频观看_每日AV更新在线观看_日本久久国产精品_超97碰免费观看视频

xjskma.com


深圳博盈網(wǎng)絡(luò)是專業(yè)的網(wǎng)絡(luò)公司,為企業(yè)塑造品牌網(wǎng)站建設(shè),為龍華,石巖,布吉,福田,寶安,西鄉(xiāng),坂田,沙井,觀瀾,公明,松崗,龍崗企業(yè)提供網(wǎng)站建設(shè)、品牌網(wǎng)站建設(shè),營銷網(wǎng)站建設(shè),網(wǎng)站重構(gòu)優(yōu)化
博盈網(wǎng)絡(luò)致力于中小企業(yè)的網(wǎng)站建設(shè)、營銷網(wǎng)站建設(shè)、網(wǎng)站重構(gòu)優(yōu)化,為深圳龍華、觀瀾、石巖、坂田、寶安、公明等地提供品牌網(wǎng)站建設(shè),網(wǎng)站改版等網(wǎng)絡(luò)一體化服務(wù)。

新聞動態(tài)

深圳龍華網(wǎng)絡(luò)推廣中搜索引擎如何提取網(wǎng)站內(nèi)容

信息錄入:深圳博盈網(wǎng)絡(luò)技術(shù)        錄入時間:2011-02-05        瀏覽次數(shù):
        搜索引擎建立網(wǎng)頁索引,處理的對象是文本文件。對于網(wǎng)絡(luò)蜘蛛來說,抓取下來網(wǎng)頁包括各種格式,包括html、圖片、doc、pdf、多媒體、動態(tài)網(wǎng)頁及其它格式等。這些文件抓取下來后,需要把這些文件中的文本信息提取出來。網(wǎng)絡(luò)營銷培訓(xùn)指出:要準(zhǔn)確提取這些文檔信息,一方面對搜索引擎的搜索準(zhǔn)確性有重要作用,另一方面對于網(wǎng)絡(luò)蜘蛛正確跟蹤其它鏈接有一定影響。
對于doc、pdf等文檔,這種由專業(yè)廠商提供的軟件生成的文檔,廠商都會提供相應(yīng)的文本提取接口。網(wǎng)絡(luò)蜘蛛只需要調(diào)用這些插件的接口,就可以輕松的提取文檔中的文本信息和文件其它相關(guān)的信息。
HTML等文檔不一樣,HTML有一套自己的語法,通過不同的命令標(biāo)識符來表示不同的字體、顏色、位置等版式,如:、等,提取文本信息時需要把這些標(biāo)識符都過濾掉。過濾標(biāo)識符并非難事,因為這些標(biāo)識符都有一定的規(guī)則,只要按照不同的標(biāo)識符取得相應(yīng)的信息即可。但在識別這些信息的時候,需要同步記錄許多版式信息,例如文字的字體大小、是否是標(biāo)題、是否是加粗顯示、是否是頁面的關(guān)鍵詞等,這些信息有助于計算單詞在網(wǎng)頁中的重要程度。同時,對于HTML網(wǎng)頁來說,除了標(biāo)題和正文以外,會有許多廣告鏈接以及公共的頻道鏈接,這些鏈接和文本正文一點關(guān)系也沒有,在提取網(wǎng)頁內(nèi)容的時候,也需要過濾這些無用的鏈接。例如某個網(wǎng)站有“產(chǎn)品介紹”頻道,因為導(dǎo)航條在網(wǎng)站內(nèi)每個網(wǎng)頁都有,若不過濾導(dǎo)航條鏈接,在搜索“產(chǎn)品介紹”的時候,則網(wǎng)站內(nèi)每個網(wǎng)頁都會搜索到,無疑會帶來大量垃圾信息。過濾這些無效鏈接需要統(tǒng)計大量的網(wǎng)頁結(jié)構(gòu)規(guī)律,抽取一些共性,統(tǒng)一過濾;對于一些重要而結(jié)果特殊的網(wǎng)站,還需要個別處理。這就需要網(wǎng)絡(luò)蜘蛛的設(shè)計有一定的擴展性。
對于多媒體、圖片等文件,一般是通過鏈接的錨文本(即,鏈接文本)和相關(guān)的文件注釋來判斷這些文件的內(nèi)容。例如有一個鏈接文字為“張曼玉照片”,其鏈接指向一張bmp格式的圖片,那么網(wǎng)絡(luò)蜘蛛就知道這張圖片的內(nèi)容是“張曼玉的照片”。這樣,在搜索“張曼玉”和“照片”的時候都能讓搜索引擎找到這張圖片。另外,許多多媒體文件中有文件屬性,考慮這些屬性也可以更好的了解文件的內(nèi)容。
動態(tài)網(wǎng)頁一直是網(wǎng)絡(luò)蜘蛛面臨的難題。所謂動態(tài)網(wǎng)頁,是相對于靜態(tài)網(wǎng)頁而言,是由程序自動生成的頁面,這樣的好處是可以快速統(tǒng)一更改網(wǎng)頁風(fēng)格,也可以減少網(wǎng)頁所占服務(wù)器的空間,但同樣給網(wǎng)絡(luò)蜘蛛的抓取帶來一些麻煩。由于開發(fā)語言不斷的增多,動態(tài)網(wǎng)頁的類型也越來越多,如:asp、jsp、php等。這些類型的網(wǎng)頁對于網(wǎng)絡(luò)蜘蛛來說,可能還稍微容易一些。網(wǎng)絡(luò)蜘蛛比較難于處理的是一些腳本語言(如VBScript和javascript)生成的網(wǎng)頁,如果要完善的處理好這些網(wǎng)頁,網(wǎng)絡(luò)蜘蛛需要有自己的腳本解釋程序。對于許多數(shù)據(jù)是放在數(shù)據(jù)庫的網(wǎng)站,需要通過本網(wǎng)站的數(shù)據(jù)庫搜索才能獲得信息,這些給網(wǎng)絡(luò)蜘蛛的抓取帶來很大的困難。對于這類網(wǎng)站,如果網(wǎng)站設(shè)計者希望這些數(shù)據(jù)能被搜索引擎搜索,則需要提供一種可以遍歷整個數(shù)據(jù)庫內(nèi)容的方法。
對于網(wǎng)頁內(nèi)容的提取,一直是網(wǎng)絡(luò)蜘蛛中重要的技術(shù)。整個系統(tǒng)一般采用插件的形式,通過一個插件管理服務(wù)程序,遇到不同格式的網(wǎng)頁采用不同的插件處理。這種方式的好處在于擴充性好,以后每發(fā)現(xiàn)一種新的類型,就可以把其處理方式做成一個插件補充到插件管理服務(wù)程序之中。
     
最新更新
點擊排行
網(wǎng)站首頁  |   案例鑒賞  |   龍華網(wǎng)站建設(shè)  |   觀瀾網(wǎng)站建設(shè)  |   SEO優(yōu)化  |   軟件開發(fā)  |   新聞動態(tài)  |   龍華畫冊設(shè)計  |   龍華彩頁傳單  |   聯(lián)系我們  |   網(wǎng)站地圖

Copyright © 2007-2015  深圳博盈網(wǎng)絡(luò)技術(shù)  All Rights Reserved .  嚴禁以任何形式進行復(fù)制、抄襲!
公司地址:深圳市龍華新區(qū)龍華街道辦山咀頭綜合辦公大樓9樓915室 (龍華街道辦、|華潤萬家,佳華商場、友誼書城等旁)
聯(lián)系電話:0755-29008907 15989449358    咨詢信箱:boryin@boryin.com  sales@boryin.com

  備案號:粵ICP備20029775號