tf-idf向量模型(文本分类算法).docVIP

  • 79
  • 0
  • 约1.03万字
  • 约 8页
  • 2018-11-04 发布于天津
  • 举报
tf-idf向量模型(文本分类算法).doc

现代信息检索 李志峰 DATE \@ M/d/yyyy 9/26/2011 PAGE 1 tf-idf向量模型(文本分类算法) 1.题目:试按tf-idf在剔除一些常用词后给出文本中术语的统计算法和程序,并按降序进行排序。 2.算法思想: 对于中文检索需要有中文词库,程序中用到20万的词库。数据结构用了最简单的数组。读取文献,采用每次读取1KB的内容进行分词。分词采用正向最大匹配算法,查找用二分法(词库中词已排序)。 3.程序代码: #include math.h #include time.h #include iostream using namespace std; #define N 9 //文献数目 int comminute (char *text,long lg,int number); //分词程序 int fileopen(char *f,int n); //独指定文件 char word[200000][22]={0}; //200000条词库 int frequency[200000][N]={0}; //N篇文章 int wordleng=0; //词库中实际词条数目 void main(int n,char *arg[]) { int i=0,j=0; int ni

文档评论(0)

1亿VIP精品文档

相关文档