教研室

标题: 【科普贴】搜索引擎“蜘蛛” [打印本页]

作者: 小C 时间: 2012-9-18 16:52:05 标题: 【科普贴】搜索引擎“蜘蛛”

本帖最后由小C 于 2012-9-18 16:54 编辑

蜘蛛　　指自动抓取网页内容的机器人Robots，搜索引擎蜘蛛的简称

　　搜索引擎蜘蛛工作原理

　　搜索引擎蜘蛛即Search Engine Spider，是一个很形象的名字。把互联网比喻成一张蜘蛛网，那么Spider就是在网上爬来爬去的蜘蛛。搜索引擎蜘蛛是通过网页的链接地址来寻找网页，从网站某一个页面(通常是首页)开始，读取网页的内容，找到在网页中的其它链接地址，然后通过这些链接地址寻找下一个网页，这样一直循环下去，直到把这个网站所有的网页都抓取完为止。如果把整个互联网当成一个网，那么搜索引擎蜘蛛就可以用这个原理把互联网上所有节点的网页都抓取下来。

　　由于互联网上无数的网站页面，搜索引擎蜘蛛无法将所有的页面都下载保存到服务器。因此，许多搜索引擎的网络蜘蛛只是抓取那些重要的网页，而在抓取的时候评价重要性主要的依据是某个网页的链接广泛度(及外部链接的数量与质量)。

　　在抓取网页的时候，搜索引擎蜘蛛一般有两种策略：广度优先和深度优先。广度优先是指搜索引擎蜘蛛会先抓取起始网页中链接的所有网页，然后再选择其中的一个链接网页，继续抓取在此网页中链接的所有网页。这是最常用的方式，因为这个方法可以让搜索引擎蜘蛛并行处理，提高其抓取速度。深度优先是指搜索引擎蜘蛛会从起始页开始，一个链接一个链接跟踪下去，处理完这条线路之后再转入下一个起始页，继续跟踪链接。这个方法有个优点是搜索引擎蜘蛛在设计的时候比较容易。两种策略的区别，下图的说明会更加明确。

　　由于不可能抓取所有的网页，有些搜索引擎蜘蛛对一些不太重要的网站，设置了访问的层数。例如，在上图中，A为起始网页，属于0层，B、C、D、E、F属于第1 层，G、H属于第2层，I属于第3层。如果搜索引擎蜘蛛设置的访问层数为2的话，网页I是不会被访问到的。这也让有些网站上一部分网页能够在搜索引擎上搜索到，另外一部分不能被搜索到。对于网站设计者来说，扁平化的网站结构设计有助于搜索引擎抓取其更多的网页。

　　搜索引擎蜘蛛在访问网站网页的时候，经常会遇到加密数据和网页权限的问题，有些网页是需要会员权限才能访问。当然，网站的所有者可以通过协议让搜索引擎蜘蛛不去抓取，但对于一些出售报告的网站，他们希望搜索引擎能搜索到他们的报告，但又不能完全免费的让搜索者查看，这样就需要给搜索引擎蜘蛛提供相应的用户名和密码。搜索引擎蜘蛛可以通过所给的权限对这些网页进行网页抓取，从而提供搜索。而当搜索者点击查看该网页的时候，同样需要搜索者提供相应的权限验证。

　　这里列出世界各大搜索引擎蜘蛛名字,方便大家查看网站日志时查找:

　　google蜘蛛： googlebot

　　百度蜘蛛：baiduspider

　　yahoo蜘蛛：slurp

　　alexa蜘蛛：ia_archiver

　　bing蜘蛛：bingbot

　　msn蜘蛛：msnbot

　　altavista蜘蛛：scooter

　　lycos蜘蛛： lycos_spider_(t-rex)

　　alltheweb蜘蛛： fast-webcrawler/

　　inktomi蜘蛛： slurp

　　有道蜘蛛：YodaoBot和OutfoxBot

欢迎光临教研室 (http://jiaoyanshi.com/)