- 1、本文档共13页,可阅读全部内容。
- 2、有哪些信誉好的足球投注网站(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
改进高度不平衡数据
上的预测使用开源合成数据过采样附和
IvonaKrchovaMichaelPlatzer
MOSTLYAIMOSTLYAI
ivona.krchova@mostly.aimichael.platzer@mostly.ai
本
译PaulTiwald
中MOSTLYAI
1paul.tiwald@mostly.ai
v
9
1
4摘要
6
1不平衡的表格数据集在预测建模和数据分析方面给广泛的应用领域带来
.了重大挑战。在许多现实场景中,如欺诈检测、医疗诊断和罕见事件预测,
7
0少数类别的样本数量极其不足,使得传统的机器学习算法难以达到高精度。
5这些算法倾向于偏向多数类别,导致生成有偏见的模型,难以准确地表示少
2
:数类别。合成数据有望通过提供新的、多样化的且高度逼真的样本解决少数
v
i类别代表性不足的问题。本文介绍了使用AI生成的合成数据对高度不平衡
x表格数据集进行过采样的基准研究。
r
a我们评估了一个开源解决方案的效果,即MOSTLYAI的合成数据SDK,
它为混合类型数据提供了灵活且用户友好的合成上采样方法。我们将使用合
成记录进行上采样的数据集训练的预测模型与使用标准方法(如简单的过采
样和SMOTE-NC)训练的模型进行了比较。我们的结果显示,通过生成填
充特征空间稀疏区域的数据点,合成数据可以提高少数群体的预测准确性。
我们证明了经过上采样的合成训练数据始终能够产生性能最佳的预测模型,
特别是在包含非常少少数样本的混合类型数据集中。
1介绍
人工智能生成的合成数据,我们在下文中将其简称为合成数据,是通过
在原始数据集上训练一个生成模型而创建的。在推理阶段,生成模型从零开
1
始创建具有统计代表性的合成记录。由于其主要用途是增强数据隐私,因此
合成数据在各种注重隐私敏感的行业中日益重要。除了隐私之外,合成数据
还提供了修改和定制数据集以满足特定需求的可能性。在这篇研究论文中,
我们探讨了合成数据通过少数类别的合成过采样来改善具有不平衡类别分
布的数据集上机器学习算法性能的潜力。
类别不均衡是许多现实世界表格数据集中常见的问题,在这种情况下,一个
或多个类别的样本数量显著低于其他类别。这样的失衡可能导致对少数类
别的预测表现不佳,而在诸如欺诈检测或极端保险索赔等应用中,这些类别
往往是最感兴趣的。传统的过采样方法,如简单的过度采样或SMOTE[2],
已经显示出在缓解这一问题方面取得了一定的成功。尽管这些方法被广泛
使用,但它们通常存在局限性,并且可能会引入负面影响模型性能的偏差。
一项研究表明,在与传统机器学习算法[8]结合应用时,经典过采样技术包
括SMOTE是无效的。
简单的过度采样通过简单地复制少数类样本以减轻类
您可能关注的文档
- 术前规划中的语义分割在经导管主动脉瓣置换中的应用-计算机科学-机器学习-语义分割-手术规划.pdf
- 替代损失函数在 Transformer 模型评估中的应用-计算机科学-深度学习-神经网络-算法投资策略.pdf
- 具有知识图谱的代理 RAG 用于现实世界应用中的复杂多跳推理-计算机科学-人工智能-检索增强生成-推理.pdf
- ACT:通过合成数据生成及自适应训练弥合代码翻译差距-计算机科学-软件开发-代码翻译-自动训练框架.pdf
- 自适应贝叶斯单次量子传感-计算机科学-机器学习-量子传感-量子信道.pdf
- 通过补丁级图聚类和混合密度专家从整张幻灯片图像进行生存建模-计算机科学-深度学习-注意力机制-组织病理学.pdf
- MMS 播放器:一个用于手语角色参数化数据驱动动画的开源软件-计算机科学-合成手语动画-机器学习-开源软件.pdf
- 一种在大型语言模型(LLM)驱动的应用程序环境中衡量自动语音识别(ASR)模型性能的方法-计算机科学-机器学习-自动语音识别-人机交互.pdf
- 探索大型语言模型在分析和改进科学代码中的方法名称方面的应用-计算机科学- AI自动化-程序理解-大语言模型.pdf
- 具有噪声伪标签学习的鲁棒半监督医学图像分割使用扩散模型-计算机科学-半监督学习-扩散模型-医学图像分割.pdf
- 2025中国冶金地质总局所属在京单位高校毕业生招聘23人笔试参考题库附带答案详解.doc
- 2025年01月中国人民大学文学院公开招聘1人笔试历年典型考题(历年真题考点)解题思路附带答案详解.doc
- 2024黑龙江省农业投资集团有限公司权属企业市场化选聘10人笔试参考题库附带答案详解.pdf
- 2025汇明光电秋招提前批开启笔试参考题库附带答案详解.pdf
- 2024中国能建葛洲坝集团审计部公开招聘1人笔试参考题库附带答案详解.pdf
- 2024吉林省水工局集团竞聘上岗7人笔试参考题库附带答案详解.pdf
- 2024首发(河北)物流有限公司公开招聘工作人员笔试参考题库附带答案详解.pdf
- 2023国家电投海南公司所属单位社会招聘笔试参考题库附带答案详解.pdf
- 2024湖南怀化会同县供水有限责任公司招聘9人笔试参考题库附带答案详解.pdf
- 2025上海烟草机械有限责任公司招聘22人笔试参考题库附带答案详解.pdf
文档评论(0)