分词分词技术研究报告

分词技术  时间:2021-02-09  阅读:()

分词技术研究报告

目录

二、汉语自动分词系统的研究现状

1、几个早期的自动分词系统

2、清华大学SEG分词系统

3、清华大学SEGTAG系统

4、 国家语委文字所应用句法分析技术的汉语自动分词

5、复旦分词系统

6、哈工大统计分词系统

7、杭州大学改进的MM分词系统

8、 Microsoft Research汉语句法分析器中的自动. . .

9、北大计算语言所分词系统

三、主要的自动分词算法

1、 基于字符串匹配的分词方法

1正向最大匹配

2逆向最大匹配

3最少切分使每一句中切出的词数最小

一种方法是改进扫描方式d匹配方向 +1表示正向 -1表示逆向a每次匹配失败后增加/减少字串长度字符数  +1为增字 -1. . .m最大/最小匹配标志 +1为最大匹配 -1为最小匹配

2、基于理解的分词方法

3、基于统计的分词方法

四、 技术方案

1研究方法

1、 研究词典的存储方式和数据结构

2、 采用正向/反向最大匹配分词法实现自动分词

3、 对2中两种匹配分词算法的结果不一致的词进行提取标记为歧义. . .

4、 对歧义字段进行消歧处理

5、 对未登陆词进行处理

6、 从分词的准确性和分词速度方面对系统进行评价

7、 设计词典管理模块完成对词典的更新和维护

8、 针对具体的中文搜索引擎应用背景对自动分词算法进行改进

2技术路线

3实验平台

4实验方案

五、 已完成的工作

四字及四字以上词

六、下一步工作展望

正文

技术报告报告人杨超一、 研究内容

目前 国内的每个行业、领域都在飞速发展这中间产生了大量的中文信息资源为了能够及时准确的获取最新的信息 中文搜索引擎是必然的产物。中文搜索引擎与西文搜索引擎在实现的机制和原理上大致雷同但由于汉语本身的特点必须引入对于中文语言的处理技术而汉语自动分词技术就是其中很关键的部分。汉语自动分词到底对搜索引擎有多大影响对于搜索引擎来说最重要的并不是找到所有结果最重要的是把最相关的结果排在最前面这也称为相关度排序。 中文分词的准确与否常常直接影响到对搜索结果的相关度排序。分词准确性对搜索引擎来说十分重要但如果分词速度太慢即使准确性再高对于搜索引擎来说也是不可用的 因为搜索引擎需要处理数以亿计的网页如果分词耗用的时间过长会严重影响搜索引擎内容更新的速度。因此对于搜索引擎来说分词的准确性和速度二者都需要达到很高的要求。

研究汉语自动分词算法对中文搜索引擎的发展具有至关重要的意义。快速准确的汉语自动分词是高效中文搜索引擎的必要前提。本课

题研究中文搜索引擎中汉语自动分词系统的设计与实现从目前中文搜索引擎的发展现状出发 引出中文搜索引擎的关键技术------汉语自动分词系统的设计。首先研究和比较了几种典型的汉语自动分词词典机制指出各词典机制的优缺点然后分析和比较了几种主要的汉语自动分词方法 阐述了各种分词方法的技术特点。针对课题的具体应用领域提出改进词典的数据结构根据汉语中二字词较多的特点通过快速判断二字词来优化速度分析中文搜索引擎下歧义处理和未登陆词处理的技术提出了适合本课题的自动分词算法并给出该系统的具体实现。最后对系统从分词速度和分词准确性方面进行了性能评价。本课题的研究将促进中文搜索引擎和汉语自动分词新的发展。

二、汉语自动分词系统的研究现状

1、几个早期的自动分词系统

自80年代初中文信息处理领域提出了自动分词以来一些实用性的分词系统逐步得以开发其中几个比较有代表性的自动分词系统在当时产生了较大的影响。

C DWS分词系统是我国第一个实用的自动分词系统 由北京航空航天大学计算机系于   年设计实现它采用的自动分词方法为最大匹配法辅助以词尾字构词纠错技术。其分词速度为5-10字/秒切分精度约为1/625。

ABWS是山西大学计算机系研制的自动分词系统系统使用 “两次扫描联想-回溯”方法运用了较多的词法、句法等知识。其切分正确率为%(不包括非常用、未登录的专用名词) 运行速度为48词/分钟。

CASS是北京航空航天大学于1   年实现的分词系统。它使用正向增字最大匹配运用知识库来处理歧义字段。其机械分词速度为200字/秒以上知识库分词速度150字/秒没有完全实现

书面汉语自动分词专家系统是由北京师范大学现代教育研究所于1991前后研制实现的它首次将专家系统方法完整地引入到分词技术中。

2、清华大学S EG分词系统

此系统提供了带回溯的正向、反向、双向最大匹配法和全切分-评价切分算法 由用户来选择合适的切分算法。其特点则是带修剪的全切分-评价算法。经过封闭试验在多遍切分之后全切分-评价算法的精度可以达到99%左右。

3、清华大学S EGTAG系统

此系统着眼于将各种各类的信息进行综合 以便最大限度地利用这些信息提高切分精度。系统使用有向图来集成各种各样的信息。通过实验该系统的切分精度基本上可达到99%左右能够处理未登录词比较密集的文本切分速度约为30字/秒。

4、 国家语委文字所应用句法分析技术的汉语自动分词

此分词模型考虑了句法分析在自动分词系统中的作用 以更好地解决切分歧义。切词过程考虑到了所有的切分可能并运用汉语句法等信息从各种切分可能中选择出合理的切分结果。

5、复旦分词系统

此系统由四个模块构成。一、预处理模块利用特殊的标记将输入的文本分割成较短的汉字串这些标记包括标点符号、数字、字母等非汉字符还包括文本中常见的一些字体、字号等排版信息。二、歧义识别模块使用正向最小匹配和逆向最大匹配对文本进行双向扫描如果两种扫描结果相同则认为切分正确否则就判别其为歧义字段需要进行歧义处理三、歧义字段处理模块此模块使用构词规则和词频统计信息来进行排歧。最后此系统还包括一个未登录词识别模块实验过程中对中文姓氏的自动辨别达到了70%的准确率。系统对文本中的地名和领域专有词汇也进行了一定的识别。

6、哈工大统计分词系统

此系统能够利用上下文识别大部分生词解决一部分切分歧义。经测试此系统的分词错误率为%速度为236字/秒。

7、杭州大学改进的MM分词系统

系统的词典采用一级首字索引结构词条中包括了“非连续词”

形如C1„* Cn 。系统精度的实验结果为95%低于理论值%但高于通常的MM、 RMM、 DMM方法。

8、 Microsoft Research汉语句法分析器中的自动分词

微软研究院的自然语言研究所在从90年代初开始开发了一个通用型的多国语言处理平台NLPWi n据报道 NLPW i n的语法分析部分使用的是一种双向的Chart Paing使用了语法规则并以概率模型作导向并且将语法和分析器独立开。 实验结果表明系统可以正确处理85%的歧义切分字段在Pentium 200 PC上的速度约600-900字/秒。

9、北大计算语言所分词系统

本系统由北京大学计算语言学研究所研制开发属于分词和词类标注相结合的分词系统。系统的分词连同标注的速度在Pentium

133Hz/16MB内存机器上的达到了每秒3千词以上而在PentiumI I/64MB内存机器上速度高达每秒5千词。

三、主要的自动分词算法

现有的分词算法主要可分为三大类基于字符串匹配的分词方法、基于理解的分词方法和基于统计的分词方法。

1、 基于字符串匹配的分词方法

这种方法又叫做机械分词方法它是按照一定的策略将待分析的汉字串与一个“充分大的”机器词典中的词条进行配若在词典中找到某个字符串则匹配成功识别出一个词 。按照扫描方向的不同串匹配分词方法可以分为正向匹配和逆向匹配按照不同长度优先匹配的情况可以分为最大最长匹配和最小最短匹配按照是

否与词性标注过程相结合又可以分为单纯分词方法和分词与标注相结合的一体化方法。常用的几种机械分词方法如下

1正向最大匹配

2逆向最大匹配

3最少切分使每一句中切出的词数最小

还可以将上述各种方法相互组合例如可以将正向最大匹配方法和逆向最大匹配方法结合起来构成双向匹配法。 由于汉语单字成词的特点正向最小匹配和逆向最小匹配一般很少使用。一般说来逆向匹配的切分精度略高于正向匹配遇到的歧义现象也较少。统计结果表明单纯使用正向最大匹配的错误率为1/169单纯使用逆向最大匹配的错误率为1/245。但这种精度还远远不能满足实际的需要。 由于分词是一个智能决策过程机械分词方法无法解决分词阶段的两大基本问题歧义切分问题和未登录词识别问题。实际使用的分词系统都是把机械分词作为一种初分手段还需通过利用各种其它的语言信息来进一步提高切分的准确率。

一种方法是改进扫描方式称为特征扫描或标志切分优先在待分析字符串中识别和切分出一些带有明显特征的词 以这些词作为断点可将原字符串分为较小的串再来进机械分词从而减少匹配的错误率。

另一种方法是将分词和词类标注结合起来利用丰富的词类信息对分词决策提供帮助并且在标注过程中又反过来对分词结果进行检验、调整从而极大地提高切分的准确率。

对于机械分词方法可以建立一个一般的模型形式地表示为ASM(d a m) 即Automatic Segmentation Model。其中d匹配方向 +1表示正向 -1表示逆向a每次匹配失败后增加/减少字串长度字符数  +1为增字 -1为减字m最大/最小匹配标志 +1为最大匹配 -1为最小匹配。

例如 ASM(+ - +)就是正向减字最大匹配法即MM方法 ASM(- - +)就是逆向减字最大匹配法(即RMM方法) 等等。对于现代汉语来说只有m=+1是实用的方法。用这种模型可以对各种方法的复杂度进行比较假设在词典的匹配过程都使用顺序查找和相同的计首字索引查找方法则在不记首字索引查找次数最小为log ?12~14和词典读入内存时间的情况下对于典型的词频分布减字匹配ASM(d - m)的复杂度约为次增字匹配ASM(d + m)的复杂度约为。

2、基于理解的分词方法

通常的分析系统都力图在分词阶段消除所有歧义切分现象。而有些系统则在后续过程中来处理歧义切分问题其分词过程只是整个语

安徽BGP云服务器 1核 1G 5M 29元/月 香港云服务器 1核 1G 19元首月 麻花云

麻花云怎么样?麻花云公司成立于2007年,当前主打产品为安徽移动BGP线路,数据中心连入移动骨干网。提供5M,10M大带宽云主机,香港云服务器产品,数据中心为香港将军澳机房,香港宽频机房 cn2-GIA优质线路、采用HYPER-V,KVM虚拟技术架构一、麻花云官网点击直达麻花云官方网站合肥网联网络科技有限公司优惠码: 专属优惠码:F1B07B 享受85折优惠。最新活动 :双11 云上嗨购 香港云主...

RAKsmart:美国圣何塞服务器限量秒杀$30/月起;美国/韩国/日本站群服务器每月189美元起

RAKsmart怎么样?RAKsmart是一家由华人运营的国外主机商,提供的产品包括独立服务器租用和VPS等,可选数据中心包括美国加州圣何塞、洛杉矶、中国香港、韩国、日本、荷兰等国家和地区数据中心(部分自营),支持使用PayPal、支付宝等付款方式,网站可选中文网页,提供中文客服支持。本月商家继续提供每日限量秒杀服务器月付30.62美元起,除了常规服务器外,商家美国/韩国/日本站群服务器、1-10...

Friendhosting四五折促销,VPS半年付7.5欧元起

Friendhosting发布了针对“系统管理日”(每年7月的最后一个星期五)的优惠活动,针对VPS主机提供55%的优惠(相当于四五折),支持1-6个月付款使用,首付折扣非永久,优惠后最低套餐首半年7.18欧元起。这是一家保加利亚主机商,成立于2009年4月,商家提供VDS和独立服务器租用等,数据中心目前可选美国洛杉矶、保加利亚、乌克兰、荷兰、拉脱维亚、捷克和波兰等8个地区机房。下面以最低套餐为例...

分词技术为你推荐
在线代理网站最好的免费在线代理网站有哪些~急!显卡温度多少正常电脑显卡温度多少正常?网店推广网站开网店如何做推广?ios7固件下载ios 7及以上固件请在设备上点“信任”在哪点?畅想中国未来的中国是什么样子的iphone6上市时间苹果6什么时候在中国大陆上市263企业邮箱设置263企业邮箱如何修改密码手工杀毒蠕虫病毒怎么手工杀毒怎样申请支付宝如何申请支付宝2018最火爆的歌曲快手最火的20首歌曲都有哪些?
windows虚机 韩国vps 本网站服务器在美国维护 冰山互联 站群服务器 国外bt 特价空间 godaddy域名优惠码 双12活动 嘟牛 789电视 中国电信测网速 129邮箱 可外链网盘 多线空间 申请免费空间和域名 贵阳电信测速 免费asp空间申请 免费个人主页 cdn网站加速 更多