PDFMathTranslate PDF 翻译:3 条命令拿到英文论文的中文版
2026/9/19 22:36:36 网站建设 项目流程

PDFMathTranslate PDF 翻译:3 条命令拿到英文论文的中文版

【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate

周四下午,同事把一个文件夹交给你:8 篇英文 PDF,共 260 页,周五评审要用中文讲清关键部分。逐句读不现实,丢进网页翻译器,公式和页码又全乱。开源工具 PDFMathTranslate(命令pdf2zh)就是干这个的:排版不动,把整篇英文 PDF 译成中文,再给出一份中英对照文档。下面是可以直接照做的步骤。

1. 一条安装命令加一条翻译命令,拿到中文版 PDF

先确认本机 Python 在 3.11 到 3.12 之间,然后执行:

pip install pdf2zh

该命令把 pdf2zh 和依赖一起装好。首次运行会下载一个版面识别模型,多等几分钟属正常;网络不顺时先设镜像端点(CMD 里set HF_ENDPOINT=https://hf-mirror.com,PowerShell 里$env:HF_ENDPOINT = "https://hf-mirror.com")再跑。

把论文放进当前目录:

pdf2zh report.pdf

结束后同目录生成report-mono.pdf(纯中文)和report-dual.pdf(原文与译文上下排布,边读边对)。想先看效果,可以看下面这段演示动画。

公式、目录、注释都留在原位置,页码、字体与原文一致。拿到文件后,下一件事是挑翻译引擎。

2. 如何把翻译引擎切换到本地模型

默认走 Google 翻译,不用配任何 API key。想让数据不出本机,可以接 Ollama:

set OLLAMA_MODEL=gemma2 pdf2zh report.pdf -s ollama

第一行指定本地模型,第二条命令里-s切换翻译服务;Ollama 默认在127.0.0.1:11434上监听,运行前确认本机 Ollama 已启动。DeepL、OpenAI、DeepSeek、Xinference 在内的 24 种服务及各自所需的环境变量,完整列表在 docs/ADVANCED.md。论文一篇接一篇地来,就该批处理了。

3. 一次翻完整个文件夹:批量参数与缓存复用

pdf2zh --dir ./papers/

--dir指向目录,里面所有 PDF 依次翻完,不用逐个敲文件名。两个高频参数:

  • -p 1-10只译第 1 到 10 页,时间紧时先扫摘要和结论;
  • -li en -lo ja指定源语言与目标语言,代码可用zhkofrde,中英日德法互译都行。

把常用参数写进config.json,再用--config config.json加载,同一套设置反复用。译文本身有缓存:同一文档重复翻译会直接复用已翻段落,不再重复消耗 API;想强制重翻就加--ignore-cache。服务器上没有 Python 环境时,用最后一节的容器方案。

4. 两条 Docker 命令启动网页版

docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zh

镜像里环境与模型都已备好,跑起来后浏览器打开http://localhost:7860/,把 PDF 拖进窗口、点 Translate 即可,全程不碰本机 Python。

要把它接进自己的工具,Python 与 HTTP 接口见 docs/APIS.md。最后是几个常见问题。

FAQ

翻译会覆盖原始文件吗?不会。工具只读取原始 PDF,结果以两个新文件输出在同目录,原文件逐字节不动。

能不调外部服务吗?可以。-s ollama配合本地模型后翻译全程离线;唯一需要联网的是首次下载版面模型,用HF_ENDPOINT指定镜像即可。

接自定义 OpenAI 兼容端点为什么报 404?确认BASE_URL/v1结尾,例如https://your-proxy:8000/v1,漏掉/v1就会直接 404。

首次运行报版面模型下载失败?通常是网络问题。设置HF_ENDPOINT指向镜像端点重试;仍失败时检查onnxruntime依赖是否装全。

扫描件能用自动 OCR 吗?目前是实验功能,面向白底扫描,只对纯图片页做识别,手写与行内公式可能识别错误;需先执行pip install 'pdf2zh[ocr]'安装扩展。

【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询