news 2026/9/18 3:01:56

BabelDOC:开源 PDF 文献翻译工具,论文双语对照一键生成

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
BabelDOC:开源 PDF 文献翻译工具,论文双语对照一键生成

BabelDOC:开源 PDF 文献翻译工具,论文双语对照一键生成

【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC

BabelDOC 是一款开源的 PDF 文档翻译工具,能把英文论文、技术手册翻译成保留原版排版的中文 PDF,还能输出原文译文并排的双语对照版本,公式和图表原样保留。

读英文论文是不是每次都"半懂不懂"?

你有没有这样的经历:下载了一篇核心论文,用在线翻译网站逐段复制粘贴,结果表格被拆散、公式变成乱码、图片里的标注全丢了,最后只能对着英文硬啃。

翻译工具本身不难,难的是翻译之后排版还像不像样。BabelDOC 的思路是先读懂 PDF 的版面结构,再逐段翻译、重新排版,所以你拿到的不是"翻译后的废稿",而是一份可以直接打印、直接分享的中文 PDF。

最快上手:三步拿到双语 PDF

整个过程不需要你懂任何 PDF 内部结构,跟着做就行:

  1. 先装好 uv,然后用一条命令安装 BabelDOC:
uv tool install --python 3.12 BabelDOC
  1. 把你的 PDF 丢进去翻译(以 OpenAI 兼容接口为例):
babeldoc --openai --openai-model "gpt-4o-mini" --openai-api-key "你的密钥" --files paper.pdf
  1. 等进度条走完,当前目录就会生成一份双语对照 PDF 和一份纯译文 PDF。原文与译文并排或交替排列,边看原文边看翻译,完全不用来回翻页面。

如果你习惯从源码运行,也可以先 clone 仓库:

git clone https://gitcode.com/GitHub_Trending/ba/BabelDOC

这几个功能最实用

  • 双语对照排版—— 适合精读论文的人。译文不是粗暴地压在原文上,而是按原文位置重排,并排、交替两种摆法随意切换,精读时中英文对得上号。
  • 公式与版面保护—— 适合科研人员。行内公式、编号公式会被识别并原样保留,不会翻成一堆括号乱码;字体、段落、栏位都尽量贴近原稿。
  • 术语表支持—— 适合翻译专业文档的团队。可以挂一份 CSV 术语表,让"机器学习"全文统一译成同一个词;项目还会自动从原文里抽取高频术语,减少"同名异译"。示例格式见 docs/example/demo_glossary.csv。
  • 接任意 OpenAI 兼容模型—— 适合不想把论文传到云端的用户。Ollama 等本地大模型直接填个地址就能用,API 密钥随便写,数据不出你的机器。
  • 大文档自动拆分—— 适合几百页的长报告。指定每部分页数上限后,BabelDOC 会把文档拆段翻译再自动拼回,中途出错不用从头再来。

排版细节可以翻一下实现文档 docs/ImplementationDetails/Typesetting.md,想了解它怎么解析 PDF 可以看 docs/ImplementationDetails/PDFParsing.md。

不同人群怎么选配置

科研党 / 研究生

  1. 目标语言设中文(默认就是),源语言英文
  2. 保留双语对照输出,精读时并排看
  3. 遇到公式多的期刊版式,开--formular-font-pattern辅助识别公式

企业文档团队

  1. 把常用术语整理成 CSV 术语表挂上去
  2. 用 TOML 配置文件固化参数,团队里每人跑出来的译文风格一致
  3. 大文档用拆页翻译,避免单份文件卡死

隐私敏感 / 本地部署党

  1. 用 Ollama 之类的本地模型,全文不出内网
  2. 用离线资源包把字体和模型一次打包,断网环境也能跑
  3. 关掉缓存失效选项前确认密钥无误,重翻才会重新计费

常见问题

原 PDF 会被改坏吗?

不会。BabelDOC 只读取原文件,翻译结果写入新文件,原件一个字节都不会动。

只能接 OpenAI 吗?

不是。任何 OpenAI 兼容接口都行,--openai-base-url填一下就能换模型,本地模型、中转站都支持。

扫描件和图片型 PDF 能翻吗?

工具内置扫描件检测,还能通过 OCR 兜底选项处理纯黑字白底的扫描件,但效果取决于扫描质量,建议先试小样张。

翻得不满意能重来吗?

可以。默认有翻译缓存(省钱省时),加--ignore-cache就能无视缓存强制重翻某次任务。

进阶玩法,也靠得住

  • 配置文件化:所有参数都能写进一份 TOML 配置,--config一键套用,告别每次敲一长串参数。
  • 离线资源包--generate-offline-assets把字体和模型打成 zip,拷到断网机器上--restore-offline-assets还原,内网部署不用折腾网络。
  • 缓存机制:相同文本不会重复请求翻译接口,批量跑几十篇论文时能明显省开销。
  • 开源透明:代码完全开放,核心流水线是插件式结构,中间表示层源码在 babeldoc/format/pdf/document_il/,看不懂的地方也可以直接翻源码。

给你的论文也来一次"汉化"

装好 BabelDOC,挑一篇压箱底的英文论文跑一遍,看看双语对照的效果再决定要不要批量处理。更多参数细节和语言支持列表,去官方仓库的文档目录里找,总有一款配置适合你。

【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/18 3:00:51

SQL Server数据库实例从入门到排查:概念、连接与实战配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/18 3:00:50

关于 TheAgentCompany 的 Bash 结论,TaoToken 发 Key 跑 APEX-Agents

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/18 3:00:27

HTTP与HTTPS核心差异:从信任链到TLS握手实战排障

“HTTP和HTTPS到底有什么区别?”这个问题我在各种场合被问到过不下几百次:面试应届生、帮同事排查线上故障、给测试组讲压测脚本、甚至教家里做电商运营的朋友理解为什么浏览器会提示“不安全”。大多数人第一反应是“HTTPS比HTTP多个S,更安全…

作者头像 李华
网站建设 2026/9/18 3:00:07

91 页报告说开源权重模型只差 4 个月,TaoToken 帮 DeepSeek 调用记账

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/18 3:00:02

把 OpenClaw 的模型 Base URL 改到 TaoToken 的 API 地址,Gateway 路由照旧

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/18 2:58:35

茶叶害虫识别:从图像处理到智能识别的完整技术实践

简介:一份系统整理图像处理技术在茶叶害虫智能识别中应用的专业文档,面向农业信息化、计算机视觉方向的学习者以及茶园植保相关人员。文档从传统人工识别的痛点切入,清晰梳理了基于图像处理的智能识别整体流程,涵盖害虫样本图像库…

作者头像 李华