- 8
- 0
- 约1.63万字
- 约 6页
- 2017-11-27 发布于福建
- 举报
第27卷 第 11期 重庆 理 工 大 学 学报 (自然科学) 2013年 11月
Vo1.27 No.1l JournalofChongqingUniversityofTechnology(NaturalScience) NOV.2013
doi:10.3969/j.issn.1674-8425(Z).2013.11.011
词类共现频率的MapReduce并行生成方法
程兴国,肖南峰
(华南理工大学计算机科学与工程学院,广州 510640)
摘 要:语料库在 自然语言处理(NLP)领域的应用越来越广泛,词类共现频率的统计是其
研究内容之一。针对词类共现的计算特点,给出了基于MapReduce编程模型实现的并行方法,
即pairs和 stripes方法 。虽然 stripes模式性能明显优于pairs模式,但其在词汇表很大时存在
内存溢出问题。针对此缺陷,给出了划分词汇表的解决方法,对输入词汇表进行拆分,此过程可
利用MapReduce模型进行预处理。实验结果表明:利用MapR
原创力文档

文档评论(0)