基于知网语义特征扩展的题名信息分类.docx

基于知网语义特征扩展的题名信息分类.docx

? ? 基于知网语义特征扩展的题名信息分类 ? ?   0 引言   短文本分类通常指对内容较短的文本(通常少于140个中文字符)进行自动分类。在传统的图书情报领域中,期刊论文的题名信息同样具有内容简短、描述信息能力弱的特点,笔者随机抽出CNKI中500条期刊论文题名统计发现,期刊论文题名的平均文本长度为18个字符,完全符合短文本的条件,且特征更加稀疏。但是与普通的在线资源类短文本不同的是,期刊论文题名的语言更加规范,专业性更强。   虽然之前有很多相关研究提出了成功的文本挖掘技术,但是它们都是针对长文本数据集。由于短文本具有内容简短、描述信息能力弱等特点,传统的文本分类方法应用在短文本分类上并不能取得满意的效果,难以充分挖掘短文本特征词之间的关联性,因此,短文本分类的关键问题在于提高特征词的表达能力,获得包含更准确信息的短文本特征,目前主要使用的方法是对特征词进行扩展。   本文利用文本集内部的语义关联性,通过特征词和隐含主题两个不同粒度,结合外部资源,提出一种基于知网[1]语义特征扩展的题名信息分类方法,其基本思想是:在较细粒度的词特征上,通过特征词词频统计提取训练集的高频词;在较粗粒度的隐含主题特征上,采用概率主题模型挖掘训练集的主题关键词。综合训练集的高频词和主题关键词,获得训练集的语义核心词集,在此基础上,借助知网作为外部资源挖掘测试集与训练集文本之间的语义相关性

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档