您现在的位置:首页 --> 查看专题: 空间相似度
摘要: 本文从切分的需求、作用、难点等方面谈起,介绍分析了目前主流的各种切分方法以及其优缺点,并介绍了一个新型的无监督切分方法,并在此基础上对切分在工程需求上进行了相应的分析和讨论,在最后在此算法基础上给出一个融合各种优点的切分框架。关键词: 中文分词, Query Segmentation,无监督技术领域: 自然语言处理 我们为什么要切分?说到切分(segmentation),大多数人最容易想到的就是中文分词。作为没有天然空格区分的语言,切词可以帮助计算机去索引文章,从而便于信息检索等方面。该部分主要用到了分词的一个方面:降低搜索引擎的性能消耗。我们常用的汉字有5000多个,常用词组是几十万个。在倒排索引中,如果用每个字做索引的话,那么会造成每个字对应的拉链非常长。所以我们一般会用词组来代替单个汉字建立索引。除此,切词更重要的一个功能是帮助计算机理解文字,在这个层次上,切词是不分
[ 共1篇文章 ][ 第1页/共1页 ][ 1 ]
近3天十大热文
- [37] 界面设计速成
- [31] 程序员技术练级攻略
- [31] Oracle MTS模式下 进程地址与会话信
- [31] 视觉调整-设计师 vs. 逻辑
- [30] 如何拿下简短的域名
- [29] android 开发入门
- [28] IOS安全–浅谈关于IOS加固的几种方法
- [27] 读书笔记-壹百度:百度十年千倍的29条法则
- [26] 图书馆的世界纪录
- [25] 【社会化设计】自我(self)部分――欢迎区
赞助商广告