基于 MINKOWSKI 范数的语言检测:通过字符双字元组和频率分析进行识别-计算机科学-自然语言处理-语言检测-统计语言识别.pdf

基于 MINKOWSKI 范数的语言检测:通过字符双字元组和频率分析进行识别-计算机科学-自然语言处理-语言检测-统计语言识别.pdf

  1. 1、本文档共12页,可阅读全部内容。
  2. 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
  3. 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  4. 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多

基于MINKOWSKI范数的语言检测:通过字符双字元组和频率

分析进行识别

Paul-AndreiPogceanSanda-MariaAvram

Babe-BolyaiUniversityBabe-BolyaiUniversity

paul.pogacean@stud.ubbcluj.rosanda.avram@ubbcluj.ro

2025年7月24日

本ABSTRACT

中近年来,关于语言识别的辩论重新引起了人们的关注,尤其是随着基于人工智能的语言模型

的迅速发展。然而,非AI基础的语言识别方法已经被忽视了。本研究探讨了一种通过利用

2

v从已建立的语言学研究中得出的单字母和双字母频率排名来实现语言确定性的算法的数学

4实现。所使用的数据集包含长度、历史时期和体裁各异的文本,包括短篇小说、童话故事和

8诗歌。尽管存在这些差异,该方法在150个字符以下的文本上实现了超过80%的准确率,并

2

6且对于更长的文本达到了100%的准确率。这些结果表明,经典的基于频率的方法仍然是AI

1.驱动模型之外的有效且可扩展的语言检测替代方案。

7

0Keywordsn-gram,单字词组,双字词组,语言检测,统计语言识别

5

2

:

v

i1介绍

x

r

a语言识别是自然语言处理(NLP)[8]中的一个基础任务,在机器学习[6]、信息检索[5]和文本分类[3]等领

域有广泛的应用。针对这一任务的方法通常分为两类:基于AI的方法,如深度学习和神经网络[2],以及非

基于AI的统计方法[9]。虽然基于AI的技术主导了当前的研究,但它们往往需要大量的训练数据集、庞大

的计算资源和复杂的模型管理。

相比之下,利用字符频率、音标和双字母组合的统计方法提供了轻量级且易于访问的替代方案。先前的研究

调查了n-gram分类和字符频率分析[11]。然而,关于音标模式利用的研究很少,并且据我们所知,没有系统

地结合这些特征的工作。本文提出了一种新方法,将这些非AI技术集成起来以提高语言识别的准确性,特

别是在至少包含150个字符的文本中,同时在具有挑战性的场景下保持鲁棒性。

我们使用四个数据集评估我们的方法:ROST(罗马尼亚故事和传说)数据集[1],一个多语言的童话故事集

合[13],OPUS多语言平行语料库[12],以及一个诗歌语料库[14]。这些数据集涵盖了多种文本长度、体裁和

历史时期,为语言识别提供了一个全面且多样的测试平台。

本文的其余部分组织如下:

•节2回顾了语言识别的相关工作。

•节3描述了我们的方法论。

APREPRINT-2025年7月24日

•节4呈现了实验结果。

•结论部分5概述了未来研究方向。

2相关工作

2.1概览

语言检测是计算语言学中的一个长期研究领域[8],早期的研究主要集中在统计和基于规则的方法上[3,9]。

人工智能(AI)的出现随后彻底改变了这一领域,使得更强大和可扩展的解决方案成为可能[6]。如今,语言

识别支撑着从机器翻译到信息检索等一系列应用。

2.2基于人工智能的方法

现代语言识别系统通常依赖深度学习和大型语言模型。谷歌翻译和DeepL使用在大量多语种语料库上训练的

神经架构,即使对于模糊或混合语言输入也能实现高准确性[6,15]。OpenAI的GPT模型因其文本理

您可能关注的文档

文档评论(0)

zikele + 关注
实名认证
内容提供者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档