设置

关灯

大

中

小

第四十六章 搜索引擎的研发 (4 / 7)

还不赶快来体验!!!

        尽管其中一些搜索引擎已经有了网页关键词检索、用户点击量排序等一些创新,但本质上,还是需要大量的人工编辑的目录式搜索引擎。

        而隋波希望王川团队开发的,则是全新的,通过技术程序,自动在互联网上通过超链接网页进行全文检索的机器人搜索引擎。

        这样的话,就需要从头做起,开发一整套完整的技术体系。

        其中包括网络爬虫服务、索引服务、缓存服务、日志服务等几大模块,各模块之间互相影响,构成了整个搜索引擎体系。

        从开发量上,技术难度是远远大于目录式检索技术的。

        首先说网络爬虫,也称网络蜘蛛,这项技术是基于web的自动化浏览程序,通过网页链接ur,爬虫不断的通过互联网中获得新的网页数据,下载页面数据形成后台数据库。

        可以说,网络爬虫抓取数据是搜索引擎工作流程的第一步。

        爬虫的体系架构直接关系到搜索引擎每天数据的采集量,而抓取策略则关系到搜索结果的数据质量,数据的更新策略则关系到系统资源的利用率。

        这只是第一步,采集了大量数据信息之后,还需要通过自然语言处理n,将文本信息分解为结构化数据和价值性数据。

        这里面就又存在一个问题,目前国外的搜索引擎都是英文分词,而中文比较特殊,最小单位是字,但具有语义的最小单位是词。

        内容未完,下一页继续阅读