基于神经网络的文本生成评价中基于参考的与无参考的评估指标相关性研究综述.docVIP

  • 0
  • 0
  • 约4.28千字
  • 约 5页
  • 2026-09-25 发布于江苏
  • 举报

基于神经网络的文本生成评价中基于参考的与无参考的评估指标相关性研究综述.doc

基于神经网络的文本生成评价中基于参考的与无参考的评估指标相关性研究综述

一、两类评估指标的核心内涵与技术演化

基于参考的评估指标的核心逻辑是将待评估生成文本与一个或多个人工标注的参考文本进行相似度匹配,通过匹配程度量化生成质量。早期代表性指标BLEU通过计算n-gram重合度实现快速评分,后续METEOR引入词形还原、同义词匹配提升语义相关性捕捉能力,ROUGE则侧重召回率优化,更适合摘要、对话等任务的评价。随着预训练语言模型的发展,基于语义嵌入的参考指标逐渐成为主流,如BERTScore通过计算生成文本与参考文本的token级contextualembedding余弦相似度,大幅降低了词汇多样性带来的误判问题,CHRF则在字符层面实现跨语言场景下的稳定评价。这类指标的优势在于评价锚点明确,与人类偏好的初始相关性较高,但其天然依赖高质量参考文本,在开放域对话、创意写作等参考文本不唯一甚至不存在的场景下适用性严重受限。

无参考评估指标(又称参考-free指标)不依赖外部参考文本,直接通过模型学习人类评价偏好或文本内在属性实现质量判断。其技术路径主要分为三类:第一类是基于内在属性统计的传统指标,通过计算文本的困惑度、重复率、词汇丰富度等浅层特征实现基础质量筛查,这类指标计算效率高但难以捕捉语义连贯性、事实准确性等深层质量问题;第二类是基于预训练模型的质量评估器,如BLEURT、CO

文档评论(0)

1亿VIP精品文档

相关文档