古籍OCR错误页的自动检测——基于语言模型困惑度的后处理纠错方法 .docxVIP

  • 1
  • 0
  • 约1.98万字
  • 约 25页
  • 2026-09-07 发布于北京
  • 举报

古籍OCR错误页的自动检测——基于语言模型困惑度的后处理纠错方法 .docx

PAGE2

古籍OCR错误页的自动检测——基于语言模型困惑度的后处理纠错方法

摘要

古籍数字化是图书馆学与文化遗产保护领域的核心议题,光学字符识别(OCR)技术虽大幅提升了文本转换效率,却不可避免地引入大量错误,严重制约古籍内容挖掘与知识服务的可信度。本文聚焦于古籍OCR错误页的自动检测问题,提出一种基于语言模型困惑度的后处理纠错方法,利用预训练语言模型BERT计算文本序列的合理性,从而识别“大平天国”等语义失当的错误页面。

全文围绕“提出问题→分析问题→解决问题”的递进逻辑展开。第一章阐明研究背景、目的与理论化研究路径;第二章系统梳理国内外古籍OCR后处理与语言模型应用的研究脉络,指出现有方法在页面级检测上的理论空白;第三章界定“OCR错误页”“语言模型困惑度”等核心概念,并阐释BERT的遮蔽语言模型原理及文本合理性评估的理论基础,构建“文本生成—概率评估—异常判定”的三层分析框架;第四章深入剖析古籍OCR错误页问题的生成机制、内在矛盾与本质属性,揭示错误页作为“低概率文本序列”的理论特征;第五章详细阐释困惑度驱动的错误页检测机制,包括困惑度计算的主导逻辑、作用条件与边界,以及在不同古籍类型中的演变规律;第六章在此基础上完成理论建构,提出“基于困惑度阈值的古籍OCR错误页自动检测理论模型”,并论证其相较于传统规则方法的解释力优势。第七章总结主要结论与理论贡献,从图书馆数字资

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档