【自然语言处理实践07】基于PaddleHub的低俗文本审核.pptxVIP

  • 1
  • 0
  • 约1.38千字
  • 约 9页
  • 2026-08-21 发布于山东
  • 举报

【自然语言处理实践07】基于PaddleHub的低俗文本审核.pptx

1基于PaddleHub的低俗文本审核

2任务描述社交媒体色情检测模型可自动判别文本是否涉黄并给出相应的置信度,对文本中的色情描述、低俗交友、污秽文案进行识别。在2017年之前,工业界和学术界对NLP文本处理依赖于序列模型?RecurrentNeuralNetwork(RNN).

3任务描述近年来随着深度学习的发展,模型参数数量飞速增长,为了训练这些参数,需要更大的数据集来避免过拟合。然而,对于大部分NLP任务来说,构建大规模的标注数据集成本过高,非常困难,特别是对于句法和语义相关的任务。相比之下,大规模的未标注语料库的构建则相对容易。最近的研究表明,基于大规模未标注语料库的预训练模型(PretrainedModels,PTM)能够习得通用的语言表示,将预训练模型Fine-tune到下游任务,能够获得出色的表现。另外,预训练模型能够避免从零开始训练模型。

4任务描述

5本项目本项目将采用百度出品的PaddleHub预训练模型微调工具,快速构建方案。模型方面则选择ERNIE模型。

6整体流程

7ERNIEvsBERTERNIE(EnhancedRepresentationthroughKnowledgeIntegration)和BERT是两个在自然语言处理(NLP)领域中广泛应用的预训练模型,它们有以下几个区别:1.预训练数据和任务:BERT使用大

文档评论(0)

1亿VIP精品文档

相关文档