- 3
- 0
- 约3.53千字
- 约 4页
- 2023-09-08 发布于广东
- 举报
一种中文分词词典存储机制
如果中文文本在书面表达或计算机内显示,则该词与词、词和词之间没有明显的分布标志。对于一句话,人可以通过自己的知识来得到哪些是词,但如何让计算机也能做到这一点,就是中文分词算法的目的。中文分词是中文信息处理的基础,在诸多领域起着至关重要的作用,例如,机器翻译、文本检索、搜索引擎、自动文摘等很多应用都需要以中文分词结果作为基础。一个中文分词算法的好坏,会对其后续的应用产生极大的影响。
现有的分词算法,基本上可以分为三种:机械式分词、理解式分词、统计式分词。在这三种算法中,机械式分词的准确率最高,对于机械式分词,需要一部词典作为后台依据,简单的说是通过将文档中的汉字串与字典中的词相匹配来完成词的切分。这是一种基于字符串匹配的分词方法,它是按照一定的策略将待分析的汉字串与一个(充分大的)机器词典中的词条进行匹配,若在词典中找到某个字符串,则匹配成功(识别出一个词)。按照对文本串的扫描方向的不同,机械分词方法可以分为正向匹配和逆向匹配;按照不同长度优先匹配的情况,可以分为最大(最长)匹配(Maximum Matching Method,简称MM法)和最小(最短)匹配。
正向最大匹配算法的原则是切分出来的词越长越好。因为词越长,包含的信息量就越大。机械式分词算法之所以成为“机械”,是因为这种算法没有考虑任何语法及语义问题,而是单纯的,机械式的将文本与词典中的词相匹配
您可能关注的文档
最近下载
- EBS采购功能点操作手册.doc VIP
- 2017数学建模B“拍照赚钱”的任务定价模型.pdf VIP
- 威科达VB说明书(综合版).pdf
- 组织环境与风险机遇分析表.doc VIP
- 一汽奥迪AudiQ7汽车使用手册用户说明书pdf电子版下载.pdf
- 2026年辅警考试公共基础知识真题库360题(含答案).docx
- IATF16949过程方法内部审核检查表.docx VIP
- GB16423-2020《金属非金属矿山安全规程》关键条款解读.pptx VIP
- 东北财经大学2023-2024学年第2学期《高等数学(下)》期末试卷(B卷)附标准答案.pdf
- YDP-610线路保护测控装置用户手册V5.10.01.pdf VIP
原创力文档

文档评论(0)