- 1、本文档共11页,可阅读全部内容。
- 2、有哪些信誉好的足球投注网站(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
ACT:通过合成数据生成及自适应训练弥合代码翻译差距
ShreyaSaxena,SivaPrasad,ZishanAhmad,VishalVaddina
PhiLabs,QuantiphiAnalytics
{shreya.saxena,siva.prasad,zishan.ahmad,vishal.vaddina}@
Abstract
代码翻译是软件开发和迁移项目中一个至关重要的过程,它使得不同编程
语言之间能够互操作,并增强了软件的适应性和持久性。传统的自动化翻译
方法高度依赖于手工编写的转换规则,这些规则往往缺乏灵活性和可扩展
性。同时,先进的语言模型提供了有前景的替代方案,但它们常常受限于专
本有的、基于API的实现方式,这引发了数据安全和依赖性的担忧。在本文
中,我们介绍了代码翻译自动训练框架(ACT),这是一个旨在通过使开源
译大型语言模型(LLMs)进行内部微调来提升代码翻译能力的创新性框架。
中ACT的自动化流水线显著提升了这些模型的表现性能,缩短了开源可获取
1性和闭源解决方案高表现之间的差距。核心在于ACT的数据生成模块,该
v模块能够从初始代码样本中构建广泛且高质量的数据集,并引入单元测试
8以确保功能准确性和多样性。ACT的评估框架包含了执行级别的检查,提
7
4供了一个全面的质量评估体系。一个关键特性是其控制器模块,它通过动
6态调整超参数、协调迭代数据生成以及基于实时评估进行微调来管理整个
1
.流水线。这使得ACT能够智能地优化何时继续训练、生成更多针对性的训
7
0练数据或停止过程。我们的结果显示,ACT持续提升了开源模型的有效性,
5为企业和开发者提供了一个安全可靠的替代方案。此外,将我们的数据生
2
:成流水线应用于行业规模迁移项目中已导致开发人员加速显著提升。
v
i
x
r
a1介绍
近年来,软件开发实践的迅速演变需要在不同编程语言之间无缝翻译代码。传统的代码翻
译方法通常依赖于手动创建的规则来转换代码,耗时且经常产生次优的翻译Roziereetal.
(2020);MukherjeeChakrabarti(2011)。用于代码翻译的统计机器翻译技术Karaivanov
etal.(2014),如semSMTNguyenetal.(2014)和其他使用抽象语法树(AST)Phan
Jannesari(2020)的技术提高了翻译质量,但大型语言模型(LLM)的出现显著提升了代码
翻译系统的质量Weiszetal.(2022)。尽管开源语言模型表明它们经常落后于专有解决方案
Roziereetal.(2023);Huietal.(2024)。专有的闭源模型提供了更优的结果,但引发了关于
数据安全、控制以及对第三方服务依赖的担忧。微调开源模型是一种可行的解决方案,但访
问高质量训练数据仍然是一项关键挑战。最近的研究探讨了生成合成数据作为改进各种任
务微调的方法,包括代码翻译Xuetal.(2023);Luetal.(2024)。然而,有效地生成多样化
且功能准确的合成数据仍是一个开放性问题。
在此基础上,我们引入了代码翻译的自动训练框架(ACT
您可能关注的文档
- 量子退火超参数分析在生产环境中用于最优传感器布置-计算机科学-机器学习-量子计算.pdf
- SASH:解码图中的社区结构-计算机科学-机器学习-算法.pdf
- 术前规划中的语义分割在经导管主动脉瓣置换中的应用-计算机科学-机器学习-语义分割-手术规划.pdf
- 替代损失函数在 Transformer 模型评估中的应用-计算机科学-深度学习-神经网络-算法投资策略.pdf
- 具有知识图谱的代理 RAG 用于现实世界应用中的复杂多跳推理-计算机科学-人工智能-检索增强生成-推理.pdf
- 自适应贝叶斯单次量子传感-计算机科学-机器学习-量子传感-量子信道.pdf
- 通过补丁级图聚类和混合密度专家从整张幻灯片图像进行生存建模-计算机科学-深度学习-注意力机制-组织病理学.pdf
- MMS 播放器:一个用于手语角色参数化数据驱动动画的开源软件-计算机科学-合成手语动画-机器学习-开源软件.pdf
- 一种在大型语言模型(LLM)驱动的应用程序环境中衡量自动语音识别(ASR)模型性能的方法-计算机科学-机器学习-自动语音识别-人机交互.pdf
- 探索大型语言模型在分析和改进科学代码中的方法名称方面的应用-计算机科学- AI自动化-程序理解-大语言模型.pdf
- 2025中国冶金地质总局所属在京单位高校毕业生招聘23人笔试参考题库附带答案详解.doc
- 2025年01月中国人民大学文学院公开招聘1人笔试历年典型考题(历年真题考点)解题思路附带答案详解.doc
- 2024黑龙江省农业投资集团有限公司权属企业市场化选聘10人笔试参考题库附带答案详解.pdf
- 2025汇明光电秋招提前批开启笔试参考题库附带答案详解.pdf
- 2024中国能建葛洲坝集团审计部公开招聘1人笔试参考题库附带答案详解.pdf
- 2024吉林省水工局集团竞聘上岗7人笔试参考题库附带答案详解.pdf
- 2024首发(河北)物流有限公司公开招聘工作人员笔试参考题库附带答案详解.pdf
- 2023国家电投海南公司所属单位社会招聘笔试参考题库附带答案详解.pdf
- 2024湖南怀化会同县供水有限责任公司招聘9人笔试参考题库附带答案详解.pdf
- 2025上海烟草机械有限责任公司招聘22人笔试参考题库附带答案详解.pdf
文档评论(0)