搜索引擎_第1頁(yè)
已閱讀1頁(yè),還剩3頁(yè)未讀, 繼續(xù)免費(fèi)閱讀

下載本文檔

版權(quán)說(shuō)明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡(jiǎn)介

1、一、什么叫搜索引擎?在Inter上有上百億可用的公共Web頁(yè)面,即使是最狂熱的沖浪者也不會(huì)訪問(wèn)到所有的頁(yè)面,而只能看到其中的一小部分,更不會(huì)在這浩瀚的Web海洋中發(fā)現(xiàn)你那即使精彩卻渺小的一隅。當(dāng)然你可以為你的存在做廣告,可以用大大的字把你的URL刻在你的身體上,然后裸體穿過(guò)白宮草坪,但你得保證媒體正好在那里,并注視到了這一切。與其這樣做,不如好好去理解搜索引擎是如何工作的?又怎樣選擇和使用“keywds“(關(guān)鍵詞)等等。本文的目的就是讓

2、眾多的頁(yè)面設(shè)計(jì)者在了解搜索引擎的基礎(chǔ)上,尋求如何使自己的頁(yè)面在搜索引擎索返回的列表中獲得好的排列層次的方法?!八阉饕妗斑@個(gè)術(shù)語(yǔ)一般統(tǒng)指真正意義上的搜索引擎(也就是全文檢索搜索引擎)和目錄(即目錄式分類搜索引擎),其實(shí)他們是不一樣的,其區(qū)別主要在于返回的搜索結(jié)果列表是如何編排的。1、目錄目錄(比如Yahoo!)返回的列表是由人工來(lái)編排的。這類引擎提供了一份人工按類別編排的網(wǎng)站目錄,各類下邊排列著屬于這一類別的網(wǎng)站的站名和網(wǎng)址鏈接,再記錄

3、一些摘要信息,對(duì)該網(wǎng)站進(jìn)行概述性介紹(摘要可能是你提交過(guò)去的,也可以是引擎站點(diǎn)的編輯為你的站點(diǎn)所做的評(píng)價(jià))。人們搜索時(shí)就按相應(yīng)類別的目錄查詢下去。這類引擎往往還伴有網(wǎng)站查詢功能,也稱之為網(wǎng)站檢索,即提供一個(gè)文字輸入框和一個(gè)按鈕。我們可以在文字框中輸入要查找的字、詞或短語(yǔ),再點(diǎn)擊按鈕,便會(huì)在目錄中查找相關(guān)的站名、網(wǎng)址和內(nèi)容提要,將查到的內(nèi)容列表送過(guò)來(lái)。目前國(guó)內(nèi)Sohoo、常青藤等都是這種搜索方式。2、搜索引擎搜索引擎(如HotBot)是自

4、動(dòng)創(chuàng)建列表的。搜索引擎看起來(lái)與目錄的網(wǎng)站查詢非常相似,也提供一個(gè)文字輸入框和按鈕,使用方法也相同,而且有些也提供分類目錄,但兩者卻有本質(zhì)上的區(qū)別。目錄的資料庫(kù)中,搜集保存的是各網(wǎng)站的站名、網(wǎng)址和內(nèi)容提要;搜索引擎的資料庫(kù)中,搜集保存的則是各網(wǎng)站的每一個(gè)網(wǎng)頁(yè)的全部?jī)?nèi)容,范圍要大得多。搜索引擎是以全文檢索的方式工作的。全文檢索查到的結(jié)果不是站名、網(wǎng)址和內(nèi)容提要,而是與你輸入的關(guān)鍵詞相關(guān)的一個(gè)個(gè)網(wǎng)頁(yè)的地址和一小段文字。在這段文字中,可能沒(méi)有你

5、輸入的那個(gè)關(guān)鍵詞,它只是某一網(wǎng)頁(yè)的第一段話,甚至是一段無(wú)法看懂的標(biāo)記,但在這個(gè)網(wǎng)頁(yè)中,一定有你所輸入的那個(gè)關(guān)鍵詞,或者相關(guān)的詞匯。打個(gè)比方說(shuō),網(wǎng)站查詢可以查到網(wǎng)上有哪些報(bào)紙,如《文匯報(bào)》、《大公報(bào)》,而全文檢索則可以查到網(wǎng)上這些報(bào)紙的每一篇文章中的詞匯。一個(gè)搜索引擎由搜索器、索引器、檢索器和用戶接口等四個(gè)部分組成。1.搜索器搜索器的功能是在互聯(lián)網(wǎng)中漫游,發(fā)現(xiàn)和搜集信息。它常常是一個(gè)計(jì)算機(jī)程序,日夜不停地運(yùn)行。它要盡可能多、盡可能快地搜集

6、各種類型的新信息,同時(shí)因?yàn)榛ヂ?lián)網(wǎng)上的信息更新很快,所以還要定期更新已經(jīng)搜集過(guò)的舊信息,以避免死連接和無(wú)效連接。目前有兩種搜集信息的策略:●從一個(gè)起始URL集合開(kāi)始,順著這些URL中的超鏈(Hyperlink),以寬度優(yōu)先、深度優(yōu)先或啟發(fā)式方式循環(huán)地在互聯(lián)網(wǎng)中發(fā)現(xiàn)信息。這些起始URL可以是任意的URL,但常常是一些非常流行、包含很多鏈接的站點(diǎn)(如Yahoo?。??!駥eb空間按照域名、IP地址或國(guó)家域名劃分,每個(gè)搜索器負(fù)責(zé)一個(gè)子空間的窮盡

7、搜索。搜索器搜集的信息類型多種多樣,包括HTML、XML、Newsgroup文章、FTP文件、字處理文檔、多媒體信息。搜索器的實(shí)現(xiàn)常常用分布式、并行計(jì)算技術(shù),以提高信息發(fā)現(xiàn)和更新的速度。商業(yè)搜索引擎的信息發(fā)現(xiàn)可以達(dá)到每天幾百萬(wàn)網(wǎng)頁(yè)。2.索引器索引器的功能是理解搜索器所搜索的信息,從中抽取出索引項(xiàng),用于表示文檔以及生成文檔庫(kù)的索引表。索引項(xiàng)有客觀索引項(xiàng)和內(nèi)容索引項(xiàng)兩種:客觀項(xiàng)與文檔的語(yǔ)意內(nèi)容無(wú)關(guān),如作者名、URL、更新時(shí)間、編碼、長(zhǎng)度、鏈

8、接流行度(LinkPopularity)等等;內(nèi)容索引項(xiàng)是用來(lái)反映文檔內(nèi)容的,如關(guān)鍵詞及其權(quán)重、短語(yǔ)、單字等等。內(nèi)容索引項(xiàng)可以分為單索引項(xiàng)和多索引項(xiàng)(或稱短語(yǔ)索引項(xiàng))兩種。單索引項(xiàng)對(duì)于英文來(lái)講是英語(yǔ)單詞,比較容易提取,因?yàn)閱卧~之間有天然的分隔符(空格);對(duì)于中文等連續(xù)書(shū)寫(xiě)的語(yǔ)言,必須進(jìn)行詞語(yǔ)的切分。在搜索引擎中,一般要給單索引項(xiàng)賦與一個(gè)權(quán)值,以表示該索引項(xiàng)對(duì)文檔的區(qū)分度,同時(shí)用來(lái)計(jì)算查詢結(jié)果的相關(guān)度。使用的方法一般有統(tǒng)計(jì)法、信息論法和概

溫馨提示

  • 1. 本站所有資源如無(wú)特殊說(shuō)明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁(yè)內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒(méi)有圖紙預(yù)覽就沒(méi)有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 眾賞文庫(kù)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。

評(píng)論

0/150

提交評(píng)論