大语言模型预训练语料的历时分布对语言演变模拟效度的理论分析.docxVIP

  • 0
  • 0
  • 约2.5万字
  • 约 32页
  • 2026-08-25 发布于湖北
  • 举报

大语言模型预训练语料的历时分布对语言演变模拟效度的理论分析.docx

PAGE2

大语言模型预训练语料的历时分布对语言演变模拟效度的理论分析

摘要

本研究聚焦于生成式人工智能与理论语言学交叉领域中的一个核心议题:大语言模型预训练语料的历时分布能否作为语言演变观测的实验替代样本,以及如何基于语料分布构建演变速率测算模型。

论文首先揭示当前语言演变研究面临的核心困境——自然语言历时语料稀缺且分布不均,而大语言模型的海量训练语料为模拟语言历时状态提供了潜在替代方案。

随后,研究系统梳理了国内外在计算语言学、历史语言学与语料库语言学领域的相关成果,指出现有研究尚未建立语料历时分布与演变模拟效度之间的理论关联。

在此基础上,本文提出“语料历时覆盖度”与“演变模拟效度”两个核心概念,构建了基于语料分布密度函数的演变速率测算模型,并通过理论推演论证了该模型在捕捉词汇语义漂移、句法结构更替等演变现象上的解释力。

研究最终建构了一个将语料历时分布特征映射为语言演变参数的理论框架,为利用大语言模型训练语料进行语言演变模拟提供了理论依据与效度评估标准。

全文通过“提出问题—分析问题—解决问题”的递进逻辑,完成了从现实困境到理论建构的完整论证链条。

第一章绪论

1.1研究背景

语言演变研究是理论语言学的核心议题之一。自十九世纪历史比较语言学兴起以来,学者们致力于通过文献考证与比较重构追溯语言的历史变迁轨迹。

然而,这一研究范式始终面临一个根本性困境:自然语言历时语

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档