词类共现频率的MapReduce并行生成方法.pdfVIP

  • 8
  • 0
  • 约1.63万字
  • 约 6页
  • 2017-11-27 发布于福建
  • 举报

词类共现频率的MapReduce并行生成方法.pdf

第27卷 第 11期 重庆 理 工 大 学 学报 (自然科学) 2013年 11月 Vo1.27 No.1l JournalofChongqingUniversityofTechnology(NaturalScience) NOV.2013 doi:10.3969/j.issn.1674-8425(Z).2013.11.011 词类共现频率的MapReduce并行生成方法 程兴国,肖南峰 (华南理工大学计算机科学与工程学院,广州 510640) 摘 要:语料库在 自然语言处理(NLP)领域的应用越来越广泛,词类共现频率的统计是其 研究内容之一。针对词类共现的计算特点,给出了基于MapReduce编程模型实现的并行方法, 即pairs和 stripes方法 。虽然 stripes模式性能明显优于pairs模式,但其在词汇表很大时存在 内存溢出问题。针对此缺陷,给出了划分词汇表的解决方法,对输入词汇表进行拆分,此过程可 利用MapReduce模型进行预处理。实验结果表明:利用MapR

文档评论(0)

1亿VIP精品文档

相关文档