正文第四十六章搜索引擎的研发_传奇1997_网游小说

，就需要从头做起，开发一整套完整的技术体系。

    其中包括网络爬虫（Web Crawler）服务、索引服务、缓存服务、日志服务等几大模块，各模块之间互相影响，构成了整个搜索引擎体系。

    从开发量上，技术难度是远远大于目录式检索技术的。

    首先说网络爬虫，也称网络蜘蛛（Web Spider），这项技术是基于Web的自动化浏览程序，通过网页链接（URL），爬虫不断的通过互联网中获得新的网页数据，下载页面数据形成后台数据库。

    可以说，网络爬虫抓取数据是搜索引擎工作流程的第一步。

    爬虫的体系架构直接关系到搜索引擎每天数据的采集量，而抓取策略则关系到搜索结果的数据质量，数据的更新策略则关系到系统资源的利用率。

    这只是第一步，采集了大量数据信息之后，还需要通过自然语言处理（NLP），将文本信息分解为结构化数据和价值性数据。

    这里面就又存在一个问题，目前国外的搜索引擎都是英文分词，而中文比较特殊，最小单位是字，但具有语义的最小单位是词。

    所以，在中文分词这一部分，就需要技术团队单独进行开发。

正文 第四十六章 搜索引擎的研发(4/7)

正文第四十六章搜索引擎的研发(4/7)