DOCX 英译中原理
适用于
DocxWorkflow+DocxTranslator+Docx2DocxExporter链路,实现在保持原始格式的前提下,将 DOCX 中的英文翻译为中文并可选的将译文插入原文下方。
整体架构
.docx 文件 │ ▼ DocxWorkflow.read_path() Document (content=bytes) │ ▼ DocxTranslator.translate() │ ├── 1. _pre_translate() → 解析 .docx → 提取文本段 ├── 2. send_segments() → 文本分片 → LLM 并发翻译 └── 3. _after_translate() → 回写译文 → 保存为 .docx bytes │ ▼ Docx2DocxExporter.export() │ ▼ Document(content=bytes) │ ▼ save_as_docx() / export_to_docx() .docx 文件(格式保留)核心设计哲学:在 OOXML 的 XML 层操作,不依赖中间格式(不转 Markdown/HTML)。利用 XML 深拷贝保留所有格式信息,只修改文本节点的内容。
一、文档分割(如何拆解 .docx)
拆分分两个层次:文档结构的遍历和文本段的分片。
1.1 文档结构遍历
代码遍历整个文档对象树,提取所有可翻译的文本段:
body(正文区域) ├── <w:p> 段落 │ └── Run 序列 → 分组为文本段(segment) ├── <w:tbl> 表格 │ └── 单元格 <w:tc> → 递归遍历内部段落 ├── <w:sdt> 内容控件 → 递归遍历 └── 超链接/修订标记/智能标签 → 递归遍历 页眉/页脚 ├── section.header ├── section.footer ├── section.first_page_header / .first_page_footer └── section.even_page_header / .even_page_footer 脚注/尾注 ├── doc.part.footnotes_part └── doc.part.endnotes_part遍历中的过滤规则
| 标签 | 处理方式 | 原因 |
|---|---|---|
w:proofErr | 忽略 | 拼写/语法检查标记,不是正文 |
w:lastRenderedPageBreak | 忽略 | 渲染分页符,不是文本 |
w:bookmarkStart/w:bookmarkEnd | 忽略 | 书签标记 |
w:commentRangeStart/w:commentRangeEnd | 忽略 | 批注范围标记 |
w:del/w:moveFrom/w:moveTo | 忽略 | 修订删除/移动的内容 |
w:smartTag | 递归遍历 | 智能标签内包裹着文本 |
w:sdtContent | 递归遍历 | 内容控件内包裹着文本 |
w:hyperlink | 递归遍历 | 超链接文本需要翻译 |
w:ins | 递归遍历 | 修订插入的内容需要翻译 |
w:fldChar(begin/end) | 中断当前段 | 域代码(目录TOC、页码PAGE)的指令部分跳过 |
文本框支持
<w:txbxContent>(文本框)中的文本会被提取并翻译。常见于流程图的文字标注、侧边栏等。
1.2 文本段的粒度控制
一个段落内部通常有多个<w:r>(Run),每个 Run 有自己的格式属性。翻译时不能简单按 Run 切分,否则会破坏句子的完整性。
Run 分组策略
<w:p><w:r><w:rPr><w:b/></w:rPr><w:t>Hello</w:t></w:r><w:r><w:rPr><w:b/></w:rPr><w:t>world,