WSD的项目的报告.docVIP

  • 15
  • 0
  • 约1.06万字
  • 约 18页
  • 2018-06-28 发布于福建
  • 举报
WSD的项目的报告

WSD 项目报告 程智聪 韩冬 张坚 修改历史 日期 版本 修改内容 2009-4-9 0.1 建立大纲 2009-4-10 0.2 初稿 2009-4-11 0.3 添加最大熵部分 2009-4-12 0.4 完善数据分析 目录 1. 项目简介 4 2. 特征的选取 4 3. 数据的预处理 4 4. 分类器的选择 6 MEM 6 NaiveBayes 6 MLP 7 5. 实验结果及分析 7 特征优化 7 标点优化 8 TOKEN的取值优化 8 动词名词的特征选择的区分优化 9 参数优化 9 SVM的C值(惩罚因子)与核函数选择优化 9 MaxEnt的G值优化 9 性能对比 10 6. 总结 12 7. 附录 13 源程序结构及使用说明 13 自写的MLP 13 数据预处理模块 13 分类器模块 16 项目简介 本项目旨在练习所学的分类算法解决自然语言处理的常见问题——中文词义消歧。 项目中总共给出40个需进行词义消歧的词语,包括19个名词和21个动词。 训练数据源:Chinese_train_pos.xml,训练样本总数为2686个。 测试数据源:Chinese_test_pos.xml,测试样本总数为935个。 特征的选取 待消歧词的前后词语的词性(POS)和消歧词的前后词语(TOKEN)。同一位置上的POS和TOKEN不联合在一起作为一个

文档评论(0)

1亿VIP精品文档

相关文档