- 4
- 0
- 约1.13万字
- 约 8页
- 2023-04-22 发布于四川
- 举报
本发明涉及一种基于训练模型的关键短语生成方法,包括:S1、获取待处理的文本数据;S2、对获取的文本数据进行分词和词性标注;S3、建立停用词库,去除存在于停用词库中的词;过滤掉不是动词和名词的词语;S4、进行N‑gram组合,得到候选词组合;S5、基于Bert的预训练模型分别对文本数据和候选词组合进行文本向量转化;S6、对文档级别的向量表示和候选词向量表示进行余弦相似度计算,进行语义相似度排序;S7、根据设定值选取S6中语义相似度排序靠前的词或短语形成关键词。本发明利用开源的预训练模型Bert进行
(19)中华人民共和国国家知识产权局
(12)发明专利申请
(10)申请公布号 CN 113934837 A
(43)申请公布日 2022.01.14
(21)申请号 202111072717.3 G06K 9/62 (2022.01)
(22)申请日 20
原创力文档

文档评论(0)