
文章主要内容和创新点主要内容本文聚焦于利用大型语言模型(LLMs)解决开源技术文档的语言障碍问题,核心研究包括三部分:开源社区翻译活动分析:通过对不同规模(小型、中型、大型)开源仓库的拉取请求(PRs)和议题(Issues)分析,发现翻译活动集中在大型仓库,且多为社区驱动、机会性的(如受Hacktoberfest等活动推动),但翻译贡献的可持续性差(翻译版本难以跟上英文原文更新)。LLMs翻译能力评估:选取50个大型仓库的README文件,测试ChatGPT-4和Claude对英文到德文的翻译效果,发现两者能生成较准确的翻译,但在保留代码块、URL和markdown格式等结构元素上存在挑战。翻译保真度评估框架:提出TRIFID框架,用于自动量化翻译中代码、URL和markdown格式的保留程度,为LLM辅助翻译的质量评估提供工具。创新点首次系统分析开源文档翻译活动模式:揭示了不同规模仓库的翻译需求、贡献特点及可持续性问题,为理解全球化开源社区的文档需求提供了实证依据。针对性评估LLMs在混合格式文档翻译中的表现:聚焦技术文档中自然语言、代码、URL和markdown混合的特性,填补了LLMs在该领域应用的研究空白。提出TRIFID框架:首个专门用于评估