基于分布外检测与不确定性估计的大语言模型幻觉缓解方法研究综述.docVIP

  • 0
  • 0
  • 约3.67千字
  • 约 4页
  • 2026-10-02 发布于江苏
  • 举报

基于分布外检测与不确定性估计的大语言模型幻觉缓解方法研究综述.doc

基于分布外检测与不确定性估计的大语言模型幻觉缓解方法研究综述

分布外检测技术在幻觉识别中的核心应用

分布外(Out-of-Distribution,OOD)检测的核心目标是识别输入数据是否偏离模型训练时的分布边界,而大语言模型的幻觉生成往往与分布外输入触发的不合理知识extrapolation直接相关。现有研究将OOD检测技术分为三类:基于距离的检测方法、基于密度的检测方法和基于能量的检测方法,三类技术分别从特征空间差异、概率分布拟合和模型输出置信度三个维度捕捉幻觉生成的前置信号。

基于距离的OOD检测方法通过计算输入文本在模型隐层空间中的嵌入向量与训练分布质心的距离,判断输入是否属于分布外样本。斯坦福大学2025年提出的Centroid-OOD方法,在LLaMA-2-70B模型的第16层和第28层隐状态中构建训练数据的类簇质心,当输入嵌入与最近质心的余弦距离超过阈值0.37时,即判定为分布外输入。该方法在TruthfulQA数据集上的幻觉识别准确率达到89.2%,相比传统的置信度阈值法提升了21.7个百分点,尤其擅长识别包含虚构实体、矛盾事实的提问。但此类方法的性能高度依赖质心构建的完整性,当训练数据分布存在长尾效应时,对尾部知识类别的OOD检测召回率会下降15%-20%。

基于密度的OOD检测方法通过建模训练数据的隐层特征分布,计算输入样本的对数似然值判断分布外属性。加州

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档