BabelDOC:开源 PDF 文献翻译工具,论文双语对照一键生成
【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC
BabelDOC 是一款开源的 PDF 文档翻译工具,能把英文论文、技术手册翻译成保留原版排版的中文 PDF,还能输出原文译文并排的双语对照版本,公式和图表原样保留。
读英文论文是不是每次都"半懂不懂"?
你有没有这样的经历:下载了一篇核心论文,用在线翻译网站逐段复制粘贴,结果表格被拆散、公式变成乱码、图片里的标注全丢了,最后只能对着英文硬啃。
翻译工具本身不难,难的是翻译之后排版还像不像样。BabelDOC 的思路是先读懂 PDF 的版面结构,再逐段翻译、重新排版,所以你拿到的不是"翻译后的废稿",而是一份可以直接打印、直接分享的中文 PDF。
最快上手:三步拿到双语 PDF
整个过程不需要你懂任何 PDF 内部结构,跟着做就行:
- 先装好 uv,然后用一条命令安装 BabelDOC:
uv tool install --python 3.12 BabelDOC- 把你的 PDF 丢进去翻译(以 OpenAI 兼容接口为例):
babeldoc --openai --openai-model "gpt-4o-mini" --openai-api-key "你的密钥" --files paper.pdf- 等进度条走完,当前目录就会生成一份双语对照 PDF 和一份纯译文 PDF。原文与译文并排或交替排列,边看原文边看翻译,完全不用来回翻页面。
如果你习惯从源码运行,也可以先 clone 仓库:
git clone https://gitcode.com/GitHub_Trending/ba/BabelDOC这几个功能最实用
- 双语对照排版—— 适合精读论文的人。译文不是粗暴地压在原文上,而是按原文位置重排,并排、交替两种摆法随意切换,精读时中英文对得上号。
- 公式与版面保护—— 适合科研人员。行内公式、编号公式会被识别并原样保留,不会翻成一堆括号乱码;字体、段落、栏位都尽量贴近原稿。
- 术语表支持—— 适合翻译专业文档的团队。可以挂一份 CSV 术语表,让"机器学习"全文统一译成同一个词;项目还会自动从原文里抽取高频术语,减少"同名异译"。示例格式见 docs/example/demo_glossary.csv。
- 接任意 OpenAI 兼容模型—— 适合不想把论文传到云端的用户。Ollama 等本地大模型直接填个地址就能用,API 密钥随便写,数据不出你的机器。
- 大文档自动拆分—— 适合几百页的长报告。指定每部分页数上限后,BabelDOC 会把文档拆段翻译再自动拼回,中途出错不用从头再来。
排版细节可以翻一下实现文档 docs/ImplementationDetails/Typesetting.md,想了解它怎么解析 PDF 可以看 docs/ImplementationDetails/PDFParsing.md。
不同人群怎么选配置
科研党 / 研究生
- 目标语言设中文(默认就是),源语言英文
- 保留双语对照输出,精读时并排看
- 遇到公式多的期刊版式,开
--formular-font-pattern辅助识别公式
企业文档团队
- 把常用术语整理成 CSV 术语表挂上去
- 用 TOML 配置文件固化参数,团队里每人跑出来的译文风格一致
- 大文档用拆页翻译,避免单份文件卡死
隐私敏感 / 本地部署党
- 用 Ollama 之类的本地模型,全文不出内网
- 用离线资源包把字体和模型一次打包,断网环境也能跑
- 关掉缓存失效选项前确认密钥无误,重翻才会重新计费
常见问题
原 PDF 会被改坏吗?
不会。BabelDOC 只读取原文件,翻译结果写入新文件,原件一个字节都不会动。
只能接 OpenAI 吗?
不是。任何 OpenAI 兼容接口都行,--openai-base-url填一下就能换模型,本地模型、中转站都支持。
扫描件和图片型 PDF 能翻吗?
工具内置扫描件检测,还能通过 OCR 兜底选项处理纯黑字白底的扫描件,但效果取决于扫描质量,建议先试小样张。
翻得不满意能重来吗?
可以。默认有翻译缓存(省钱省时),加--ignore-cache就能无视缓存强制重翻某次任务。
进阶玩法,也靠得住
- 配置文件化:所有参数都能写进一份 TOML 配置,
--config一键套用,告别每次敲一长串参数。 - 离线资源包:
--generate-offline-assets把字体和模型打成 zip,拷到断网机器上--restore-offline-assets还原,内网部署不用折腾网络。 - 缓存机制:相同文本不会重复请求翻译接口,批量跑几十篇论文时能明显省开销。
- 开源透明:代码完全开放,核心流水线是插件式结构,中间表示层源码在 babeldoc/format/pdf/document_il/,看不懂的地方也可以直接翻源码。
给你的论文也来一次"汉化"
装好 BabelDOC,挑一篇压箱底的英文论文跑一遍,看看双语对照的效果再决定要不要批量处理。更多参数细节和语言支持列表,去官方仓库的文档目录里找,总有一款配置适合你。
【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考