科技网

当前位置: 首页 >新闻

浅述搜索引擎的两种分词算法7z

新闻
来源: 作者: 2019-06-09 11:52:49

21世纪互联的快速发展让人们生活越来越便利,当日益剧增的海量信息让我们眼花缭乱时,搜索引擎的出现可以让我们快速找到自己想要的答案。因此多了解搜索引擎的分词算法,可以让站在搜索引擎上获得更好的展现机会。在讲解中文分词技术之前,先来了解下全文检索技术。

全文检索技术

全文检索是指索引程序扫描文的结果。基于词的全文索引是把一个词语作为一个单位进行索引记录,并能处理同义词。搜索引擎有自己的词库,当用户搜索时,搜索引擎会从词库中抽取关键词作为索引项,这样可以大大提高检索的准确率。

中文分词技术

一直以来大家都比较熟悉百度,百度有自己的中文分词技术。一般采用的包括正向最大匹配,反向最大匹配,最佳匹配法,专家系统方法等。其中最大正向匹配是最常用的分词解决方案,它采用机械式算法,通过建立词典并进行正向最大匹配对中文进行分词。举个简单的例子比如搜索北京大学在那里,则返回结果很多都是包含北京大学,北大等词语的页,搜索引擎就是采用正向最大匹配去判断,把北京大学当做一个词语来索引记录并返回。当然,正向最大匹配也有不完整性,比如长度过长的词语,搜索引擎有时无法准确的分词,或者对前后都相互关联的词无法准确分词。例如结合成分子时,会被返回结合、成分、子时,而有时我们想要的关键词是分子。

很多时候百度都会根据自己词库中词语户的角度去考虑问题,其实这也是站在搜索引擎的角度考虑问题,不论在确定目标关键词或者是长尾关键词时,都可以根据中文分词的原理来选择,这样可以最大化的减少无用功。

分词原理不断在变化,不断在更新,我们应该继续学习,只有掌握了本质才能抓住实质。

本文出自深圳站建设,原文地址: ,欢迎大家和我交流,以后关于更多分词技术,特别是中文分词技术的更多应用我会陆续和大家分享。

注:相关站建设技巧阅读请移步到建站教程频道。

微店卖家版官方网页版
嗜酸性粒细胞增多性皮炎
中医

相关推荐