- 6
- 0
- 约2.48千字
- 约 6页
- 2019-02-17 发布于贵州
- 举报
异构数据文本挖掘技术研究
[摘 要] 本文主要研究基于自然语言处理技术和数据挖掘技术,面向出版行业,对海量、异构的数字出版文本内容进行智能分析与挖掘,研究与实现命名实体识别与语义关系抽取、自动摘要提取、自动关键词提取、自动分类、自动过滤、自动消重、话题检测与追踪、情感分析等关键技术,为资源的编辑、加工、整理提供帮助,为知识标引和素材推荐等提供技术支撑。 [关键词] 出版;文本挖掘;异构数据 doi : 10 . 3969 / j . issn . 1673 - 0194 . XX. 21. 070 [中图分类号] [文献标识码] A [文章编号] 1673 - - 0164- 02 1 背 景 数字出版已经成为出版行业的一种趋势,将逐渐取代传统出版方式。数字出版所产生的大量数字内容需要进行智能管理和自动加工,而其中文本数字内容数量最多,包括报纸、期刊、图书等出版类型,对文本数字内容的智能加工与挖掘技术是数字出版领域的关键基础技术,对数字出版多个子系统起到平台支撑作用。例如,文本分类技术可以将数字内容按照行业分类体系自动归类,文档自动摘要技术可以将数字内容进行提炼和标引。这些技术能帮助出版行业单位对数字资源进行明晰化、系统化、智能化的管理,自动发掘潜在的知识规律,替代人工劳动,提高了生产效率。 目前,文本挖掘技术已经被广泛应用于互联网搜索与服务行业。主
原创力文档

文档评论(0)