- 79
- 0
- 约1.03万字
- 约 8页
- 2018-11-04 发布于天津
- 举报
tf-idf向量模型(文本分类算法).doc
现代信息检索
李志峰 DATE \@ M/d/yyyy 9/26/2011 PAGE 1
tf-idf向量模型(文本分类算法)
1.题目:试按tf-idf在剔除一些常用词后给出文本中术语的统计算法和程序,并按降序进行排序。
2.算法思想:
对于中文检索需要有中文词库,程序中用到20万的词库。数据结构用了最简单的数组。读取文献,采用每次读取1KB的内容进行分词。分词采用正向最大匹配算法,查找用二分法(词库中词已排序)。
3.程序代码:
#include math.h
#include time.h
#include iostream
using namespace std;
#define N 9 //文献数目
int comminute (char *text,long lg,int number); //分词程序
int fileopen(char *f,int n); //独指定文件
char word[200000][22]={0}; //200000条词库
int frequency[200000][N]={0}; //N篇文章
int wordleng=0; //词库中实际词条数目
void main(int n,char *arg[])
{
int i=0,j=0;
int ni
原创力文档

文档评论(0)