设置

关灯

大

中

小

第四十六章 搜索引擎的研发 (5 / 7)

还不赶快来体验!!!

        所以,在中文分词这一部分,就需要技术团队单独进行开发。

        通过建立词库、采用条件随机概率分布模型、词性标注、语义相似度、已存句法分析、情感倾向分析等,通过各种模型判断,让程序理解抓取到的关键词中文的语义,才能提高搜索的准确性和查全率。

        这还只是其中比较小的开发困难。

        比如,搜索引擎的核心就是通过海量数据抓取后的快速检索,而抓取的数据越多,当庞大的数据存储在数据库里,就需要构建快速存取数据的分布式存储架构。

        再比如,为了让用户在最短的时间内获得想要的搜索结果,就需要后台系统不断的执行数据抓取和建立索引等操作。

        这就需要建立分布式实时计算系统,以及对索引结构的构建

        王川估计也是最近开发中有些郁闷了,一说起来就滔滔不绝。

        隋波虽然不太懂他说的一些技术术语,但毕竟前世作为用户也使用了20多年的搜索引擎,接触的多了,也了解一些基本的知识。

        他安静的听着王川不断的讲述团队面临的一个个困难,又是怎么想办法克服的。

        不时提问两句,显得听的很认真。

        内容未完,下一页继续阅读