- 12
- 0
- 约16.93万字
- 约 113页
- 2015-08-05 发布于河南
- 举报
摘要
摘 要
上有数十亿的网页,成千上万TB的数据。而且,每天有数十万的网页更新,数
百万的新的网页加入,使得Internet上的信息丰富而又复杂。如何有效地组织
和管理这些信息,并快速、准确、全面地从中找到用户所需要的信息是当前信息
科学领域面临的一大挑战。
文本是最基本、最常见的信息载体。本文以文本信息检索模型为基准,对文
本信息处理的几个关键技术包括文本分类、文本聚类和近似查询处理等进行研
究。文本分类和文本聚类是对数据进行组织和管理的核心技术。近似查询处理需
要快速查询到所需信息,这是解决大规模数据集的一个重要技术。
以下是本文的主要研究内容:
(1)文本信息处理的技术基础。包括文档表示模型、切词、特征选择、文
本分类和文本聚类。本文简单介绍了集合模型、代数模型、概率模型和概念模型
等四种文档表示模型;分析了中文切词的主要问题和主要方法;具体介绍了文档
特征及其选择算法;详细介绍了
您可能关注的文档
最近下载
- 小学二年级数学竖式计算题200道(直接打印).pdf VIP
- 始兴事业单位招聘笔试真题.pdf VIP
- GB∕T 37561-2019 难熔金属及其化合物粉末在粒度测定之前的分散处理规则.pdf
- 风电场运营成本控制方案.docx VIP
- 医疗器械风险管理控制程序.pdf VIP
- 京剧常用尖团字上口字对照表.doc VIP
- 专题10立体几何与空间向量(解答题)(解析版)-大数据之十年高考真题(2014-2023)与优质模拟题(天津卷).pdf VIP
- 冠心病心脏康复专家共识精选.ppt VIP
- GB13495.3—2026《消防安全标志 第3部分:设置要求》修订解读.pptx
- GB_T 38977-2020 纳米晶硬质合金棒材.pdf
原创力文档

文档评论(0)