BabelDOC一条命令完成 PDF 翻译双语对照排版一步到位【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC拿到一篇 30 页的英文综述逐段复制进翻译软件公式和图片位置全被打乱来回折腾一下午——这是很多人读外文论文的常态。BabelDOC 是专门为 PDF 文档翻译设计的开源工具它解析原文结构后逐段调用大模型翻译再把译文按原排版重建回 PDF输出一份左原文、右译文的双语对照文件公式、表格、页眉位置基本不动。项目价值速览BabelDOC 的定位很明确不是截图 OCR 再重排而是解析 PDF 内部结构 → LLM 逐段翻译 → 按原样式重新排版生成新 PDF翻译质量和版式保真度比纯 OCR 方案更稳。整个流程本地运行、开源免费文档内容不出你的机器翻译服务走任意 OpenAI 兼容接口本地模型也能接。安装与首次运行安装只有一条命令需要 Python 3.12 和 uvuv tool install --python 3.12 BabelDOC验证安装babeldoc --version能打印版本号即可。首次运行会自动下载字体和布局模型也可以提前执行babeldoc --warmup预下载。然后跑第一个翻译任务babeldoc --files survey.pdf --lang-in en --lang-out zh \ --output ./out --openai --openai-model gpt-4o-mini \ --openai-base-url https://api.openai.com/v1 --openai-api-key sk-xxx跑完后在./out下会得到_mono.pdf纯译文版和_dual.pdf双语对照版两个文件打开 dual 版即可看到左右对照效果。核心能力拆解双语对照输出原文一个字符不少BabelDOC 默认同时产出三种视角原文保留的双语对照 PDF、纯译文 PDF、以及不加水印的版本可用--watermark-output-mode控制。对照阅读时随时核对原文比逐句机翻复制方便得多。自动术语抽取专业词汇前后一致翻译前会先从全文抽取高频专业术语glossary翻译时强制按术语表译法输出避免同一个概念前页叫卷积层、后页叫卷积分组。不想自动抽取时加--no-auto-extract-glossary即可更实用的做法是自己准备一份 CSV 术语表source、target 两列示例见 docs/example/demo_glossary.csvbabeldoc --files paper.pdf --glossary-files my_terms.csv ...170 种语言可选英译中体验最完整支持语言清单见 docs/supported_languages.md覆盖中日韩、法德西、俄、越、泰等 170 多种语言代码用--lang-in和--lang-out指定。官方说明当前重点是英译中场景其他语言方向可用但测试较少介乎两者之间建议先用小样验证。实战场景与技巧长文档怕中途失败100 页以上的会议论文集可以交给分段策略加--max-pages-per-part 50BabelDOC 会按 50 页切块翻译全部完成后自动合并回一份完整 PDF某块失败不必从头再来。拿到的是扫描版 PDF加--ocr-workaround它会在译文下方补白色底块盖住原图文字并强制黑字适合白底黑字的扫描件。文档本身混排大量彩色截图或图表时不要用这个选项。某些阅读器打开译文 PDF 显示异常一行--enhance-compatibility能开启全部兼容选项跳过清理、译文页在前、禁用富文本翻译代价是文件体积稍大。这是官方推荐的第一兼容开关比逐个排查参数省事。写在最后BabelDOC 适合两类人需要长期消化外文论文、教材的科研和学习者以及想在自己的工具链里嵌入PDF 翻译能力的开发者可作为库被调用也可接进 Zotero 等场景。它免费、可完全离线部署、支持本地 LLM更多实现细节可以翻 docs/ImplementationDetails/README.md。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考