ACT：通过合成数据生成及自适应训练弥合代码翻译差距-计算机科学-软件开发-代码翻译-自动训练框架.pdf

下载文档

0
0
约6.38万字
约 11页
2025-07-28 发布于中国
举报
版权申诉
保障服务

ACT：通过合成数据生成及自适应训练弥合代码翻译差距-计算机科学-软件开发-代码翻译-自动训练框架.pdf

1、本文档共11页，可阅读全部内容。
2、原创力文档（book118）网站文档一经付费（服务费），不意味着购买了该文档的版权，仅供个人/单位学习、研究之用，不得用于商业用途，未经授权，严禁复制、发行、汇编、翻译或者网络传播等，侵权必究。
3、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。如您付费，意味着您自己接受本站规则且自行承担风险，本站不退款、不进行额外附加服务；查看《如何避免下载的几个坑》。如果您已付费下载过本站文档，您可以点击这里二次下载。
4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等，请点击“版权申诉”（推荐），也可以打举报电话：400-050-0827(电话支持时间：9:00-18:30)。

ACT：通过合成数据生成及自适应训练弥合代码翻译差距

ShreyaSaxena,SivaPrasad,ZishanAhmad,VishalVaddina

PhiLabs,QuantiphiAnalytics

{shreya.saxena,siva.prasad,zishan.ahmad,vishal.vaddina}@

Abstract

代码翻译是软件开发和迁移项目中一个至关重要的过程，它使得不同编程

语言之间能够互操作，并增强了软件的适应性和持久性。传统的自动化翻译

方法高度依赖于手工编写的转换规则，这些规则往往缺乏灵活性和可扩展

性。同时，先进的语言模型提供了有前景的替代方案，但它们常常受限于专

本有的、基于API的实现方式，这引发了数据安全和依赖性的担忧。在本文

中，我们介绍了代码翻译自动训练框架（ACT），这是一个旨在通过使开源

译大型语言模型（LLMs）进行内部微调来提升代码翻译能力的创新性框架。

中ACT的自动化流水线显著提升了这些模型的表现性能，缩短了开源可获取

1性和闭源解决方案高表现之间的差距。核心在于ACT的数据生成模块，该

v模块能够从初始代码样本中构建广泛且高质量的数据集，并引入单元测试

8以确保功能准确性和多样性。ACT的评估框架包含了执行级别的检查，提

4供了一个全面的质量评估体系。一个关键特性是其控制器模块，它通过动

6态调整超参数、协调迭代数据生成以及基于实时评估进行微调来管理整个

.流水线。这使得ACT能够智能地优化何时继续训练、生成更多针对性的训

0练数据或停止过程。我们的结果显示，ACT持续提升了开源模型的有效性，

5为企业和开发者提供了一个安全可靠的替代方案。此外，将我们的数据生

:成流水线应用于行业规模迁移项目中已导致开发人员加速显著提升。

a1介绍

近年来，软件开发实践的迅速演变需要在不同编程语言之间无缝翻译代码。传统的代码翻

译方法通常依赖于手动创建的规则来转换代码，耗时且经常产生次优的翻译Roziereetal.

(2020);MukherjeeChakrabarti(2011)。用于代码翻译的统计机器翻译技术Karaivanov

etal.(2014)，如semSMTNguyenetal.(2014)和其他使用抽象语法树（AST）Phan

Jannesari(2020)的技术提高了翻译质量，但大型语言模型（LLM）的出现显著提升了代码

翻译系统的质量Weiszetal.(2022)。尽管开源语言模型表明它们经常落后于专有解决方案

Roziereetal.(2023);Huietal.(2024)。专有的闭源模型提供了更优的结果，但引发了关于

数据安全、控制以及对第三方服务依赖的担忧。微调开源模型是一种可行的解决方案，但访

问高质量训练数据仍然是一项关键挑战。最近的研究探讨了生成合成数据作为改进各种任

务微调的方法，包括代码翻译Xuetal.(2023);Luetal.(2024)。然而，有效地生成多样化

且功能准确的合成数据仍是一个开放性问题。

在此基础上，我们引入了代码翻译的自动训练框架（ACT

您可能关注的文档

文档评论（0）

zikele + 关注: 实名认证

内容提供者

该用户很懒，什么也没介绍

咨询Ta 进入空间

1亿VIP精品文档

更多 >

ACT：通过合成数据生成及自适应训练弥合代码翻译差距-计算机科学-软件开发-代码翻译-自动训练框架.pdf