文本信息处理的若干关键技术研究.pdfVIP

  • 12
  • 0
  • 约16.93万字
  • 约 113页
  • 2015-08-05 发布于河南
  • 举报
摘要 摘 要 上有数十亿的网页,成千上万TB的数据。而且,每天有数十万的网页更新,数 百万的新的网页加入,使得Internet上的信息丰富而又复杂。如何有效地组织 和管理这些信息,并快速、准确、全面地从中找到用户所需要的信息是当前信息 科学领域面临的一大挑战。 文本是最基本、最常见的信息载体。本文以文本信息检索模型为基准,对文 本信息处理的几个关键技术包括文本分类、文本聚类和近似查询处理等进行研 究。文本分类和文本聚类是对数据进行组织和管理的核心技术。近似查询处理需 要快速查询到所需信息,这是解决大规模数据集的一个重要技术。 以下是本文的主要研究内容: (1)文本信息处理的技术基础。包括文档表示模型、切词、特征选择、文 本分类和文本聚类。本文简单介绍了集合模型、代数模型、概率模型和概念模型 等四种文档表示模型;分析了中文切词的主要问题和主要方法;具体介绍了文档 特征及其选择算法;详细介绍了

文档评论(0)

1亿VIP精品文档

相关文档