网络原生语料的噪声清洗规则与历时语料库的均衡抽样方法优化研究.docx

网络原生语料的噪声清洗规则与历时语料库的均衡抽样方法优化研究.docx

PAGE2

网络原生语料的噪声清洗规则与历时语料库的均衡抽样方法优化研究

摘要

本研究聚焦于计算语言学领域中的网络原生语料处理难题,系统探讨了社交平台非规范语料对语言规律挖掘的干扰机制,并提出了兼顾流行度与代表性的均衡抽样模型,旨在提升历时语料库的构建效度。

研究遵循“问题解析—机制阐释—理论建构”的递进逻辑。第一章绪论明确了网络语料噪声问题的现实紧迫性与理论空白。第二章文献综述梳理了国内外在语料清洗与抽样方法上的研究脉络,揭示了现有方法在历时均衡性维度上的系统性缺失。第三章界定了“网络原生语料”“噪声”“均衡抽样”等核心概念,并阐释了语言变异理论、抽样统计理论与语料库语言学理论对本研究

文档评论(0)

1亿VIP精品文档

相关文档