- 1、本文档共12页,可阅读全部内容。
- 2、有哪些信誉好的足球投注网站(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
通过闵可夫斯基范数进行语言检测:利用字符双字母组合和频
率分析识别语言
Paul-AndreiPogceanSanda-MariaAvram
Babe-BolyaiUniversityBabe-BolyaiUniversity
paul.pogacean@stud.ubbcluj.rosanda.avram@ubbcluj.ro
2025年7月23日
本ABSTRACT
译
中关于语言识别的争论近年来重新引起了关注,特别是随着人工智能驱动的语言模型的迅速发
展。然而,基于非AI的方法在语言识别方面已经被忽视了。本研究探讨了一种通过利用从
1
v现有语言学研究中得出的单字母和双字母频率排名来实现语言确定性的算法的数学实现。所
4使用的数据集包含长度、历史时期和体裁各异的文本,包括短篇小说、童话故事和诗歌。尽
8管存在这些变化,该方法对于少于150个字符的文本准确率超过80%,而对于较长的文本和
2
6较古老的作品则达到了100%的准确率。这些结果表明,基于经典频率的方法仍然是AI驱动
1.模型在语言检测方面的有效且可扩展的替代方案。
7
0Keywordsn-gram,单字词组,双字词组,语言检测,统计语言识别
5
2
:
v
i1介绍
x
r
a语言识别是自然语言处理(NLP)中的基础任务[1],在机器学习[2]、信息检索[3]和文本分类[4]等领域有
广泛的应用。解决这一任务的方法大致可分为两类:基于AI的方法[5],如深度学习和神经网络,以及非基
于AI的统计方法[6]。虽然基于AI的技术主导了当前的研究,但它们通常需要大量的训练数据集、显著的计
算资源和复杂的模型管理。
相比之下,利用字符频率、重音符号和双字母组合的统计方法提供了轻量级且易于使用的替代方案。先前的
研究调查了n-gram分类和字符频率分析[7],但关于重音符号模式利用的研究较少,并且据我们所知,没有
系统地结合这些特征的工作。本文提出了一种新颖的方法,将这些非AI技术集成在一起以提高语言识别的
准确性,特别是对于至少150个字符的文本,同时在具有挑战性的场景中保持鲁棒性。
我们使用四个数据集评估我们的方法:ROST(罗马尼亚故事和传说)数据集[8]、一个多语言的童话集合[9]、
OPUS多语言平行语料库[10],以及一个诗歌语料库[11]。这些数据集涵盖了多种文本长度、体裁和历史时
期,为语言识别提供了一个全面且多样的测试平台。
本文的其余部分组织如下:
•节2回顾了语言识别的相关工作。
•节3描述了我们的方法论。
APREPRINT-2025年7月23日
•节4呈现了实验结果。
•节5结束并概述了未来的研究方向。
2相关工作
2.1概览
语言检测是计算语言学中一个历史悠久的研究领域[1],早期的工作主要集中在统计和基于规则的方法上[4,
6]。人工智能(AI)的出现自此改变了这一领域的面貌,使得更加健壮和可扩展的解决方案成为可能[2]。如
今,语言识别支撑着从机器翻译到信息检索等一系列应用。
2.2基于人工智能的方法
现代语言识别系统通常依赖深度学习和大型语言模型。GoogleTranslate和DeepL使用在大规模多语言语料
库上训练的神经架构,即使面对模糊或混合语言输入也能达到高准确率[2,12]。OpenAI的GPT模型作为其
文本理解能力的
您可能关注的文档
- 具有知识图谱的代理 RAG 用于现实世界应用中的复杂多跳推理-计算机科学-人工智能-检索增强生成-推理.pdf
- ACT:通过合成数据生成及自适应训练弥合代码翻译差距-计算机科学-软件开发-代码翻译-自动训练框架.pdf
- 自适应贝叶斯单次量子传感-计算机科学-机器学习-量子传感-量子信道.pdf
- 通过补丁级图聚类和混合密度专家从整张幻灯片图像进行生存建模-计算机科学-深度学习-注意力机制-组织病理学.pdf
- MMS 播放器:一个用于手语角色参数化数据驱动动画的开源软件-计算机科学-合成手语动画-机器学习-开源软件.pdf
- 一种在大型语言模型(LLM)驱动的应用程序环境中衡量自动语音识别(ASR)模型性能的方法-计算机科学-机器学习-自动语音识别-人机交互.pdf
- 探索大型语言模型在分析和改进科学代码中的方法名称方面的应用-计算机科学- AI自动化-程序理解-大语言模型.pdf
- 具有噪声伪标签学习的鲁棒半监督医学图像分割使用扩散模型-计算机科学-半监督学习-扩散模型-医学图像分割.pdf
- 改进高度不平衡数据上的预测 使用开源合成数据过采样附和-计算机科学-预测建模-人工智能-合成数据.pdf
- GG-BBQ:德国性别偏见问答基准测试-计算机科学-大语言模型-自然语言处理.pdf
- 2025中国冶金地质总局所属在京单位高校毕业生招聘23人笔试参考题库附带答案详解.doc
- 2025年01月中国人民大学文学院公开招聘1人笔试历年典型考题(历年真题考点)解题思路附带答案详解.doc
- 2024黑龙江省农业投资集团有限公司权属企业市场化选聘10人笔试参考题库附带答案详解.pdf
- 2025汇明光电秋招提前批开启笔试参考题库附带答案详解.pdf
- 2024中国能建葛洲坝集团审计部公开招聘1人笔试参考题库附带答案详解.pdf
- 2024吉林省水工局集团竞聘上岗7人笔试参考题库附带答案详解.pdf
- 2024首发(河北)物流有限公司公开招聘工作人员笔试参考题库附带答案详解.pdf
- 2023国家电投海南公司所属单位社会招聘笔试参考题库附带答案详解.pdf
- 2024湖南怀化会同县供水有限责任公司招聘9人笔试参考题库附带答案详解.pdf
- 2025上海烟草机械有限责任公司招聘22人笔试参考题库附带答案详解.pdf
最近下载
- 2024新沂市中小学教师招聘考试题库及答案.docx VIP
- 新人教版三年级数学上册教学课件《因数中间有0的乘法》.pptx VIP
- 田家四季歌教案.doc VIP
- 《GB 27955-2020过氧化氢气体等离子体低温灭菌器卫生要求》(2025版)深度解析.pptx
- 高级碳排放监测员理论考试复习题库资料(含答案).pdf VIP
- 外科学(总论) 清创术 清创术.pptx VIP
- 《文献检索》课程教学大纲.pdf VIP
- 前置胎盘临床诊断与处理指南课件.ppt VIP
- 事业单位考试公共基础知识考试试题精选3000题.pdf VIP
- 人教版四年级上册数学《平行四边形》(说课课件).pptx VIP
文档评论(0)