私有化部署翻译工具:安全与合规的实践思考
起因
导师扔过来一篇 47 页的英文综述,要求一周内读完并做组会报告。打开 PDF 一看:双栏排版、满页公式、参考文献交叉引用。复制粘贴出来直接乱码——这种 PDF 大家都见过。
我花了一下午搭了一套工作流,最终拿到了可阅读的双语对照版。把过程记录下来,给同样被 PDF 折磨的学术党参考。
第一步:判断 PDF 类型
不是所有 PDF 都一样。先做一个快速判断:
- 文字型 PDF:能正常复制文字,选中文字时光标是"I"型。这种最友好,直接提取。
- 扫描型 PDF:复制出来是乱码或图片,需要先 OCR。
- 混合型:部分页面是文字、部分是扫描件。最烦,得分开处理。
判断方法:随便复制一段文字粘贴到记事本,能正常显示就是文字型。
第二步:提取文字流
文字型 PDF 直接用工具提取(Python 的 PyPDF2/pdfplumber 都行)。但提取出来的文字有几个坑:
- 断句问题:PDF 里的换行是"软换行",提取出来每行一个短句,读起来像诗。需要按段落重新拼接。
- 双栏串列:左右两栏的文字可能被解析器串在一起。第一段下半句接右栏开头,整段意思全废。
- 公式丢失:公式通常被提取成乱码或完全消失。
我的做法:提取后先人工扫一遍前三页,看有没有串列。有串列的话,换一个支持双栏识别的解析器(有些工具会自动检测分栏)。
第三步:翻译策略选择
根据文档类型选策略:
综述/教材(重内容):放弃 PDF 版式,转成 Markdown 翻译。格式松了,翻译质量反而高。公式用 LaTeX 原样保留,图注直接译。
论文(重版式):走对照式翻译,原文译文分开摆。公式和图表保留原图,只译文字部分。
合同/标书(重格式):这种最痛苦。我的做法是双份:一份对照译文用来看内容,一份只改关键文字的原文版式副本用来走流程。
第四步:翻译后处理
翻译完不是结束,还有三件事:
- 术语统一:检查专业术语是否前后一致。同一个概念出现 20 次,如果译法不统一,读起来像多人合译。
- 公式还原:确认公式没有被"翻译"成中文(见过把 E=mc² 翻译成 E等于mc平方的工具)。
- 图表标注:图注、表头、坐标轴标签是否都译了。
一个实用技巧
拿到 PDF 后先翻到最复杂的页面(通常是公式+表格+图并存的那页),用这一页试翻一遍。如果这一页能处理好,整篇就没问题;如果这一页就翻车,趁早换工具,别浪费时间。
工具选择
不点名推荐具体工具,只给判断标准:
- 双栏能不能正确切分(拿双栏论文试)
- 公式是还原成 LaTeX 还是直接贴图(还原更好)
- 表格有没有被挤崩(译文变长最容易把表格撑坏)
- 数字、变量名有没有被"顺手翻译"了(这是重灾区)
拿你最麻烦的那份 PDF 试一遍,什么水平立刻见分晓。
做翻译工具的人,天天跟各种 PDF 搏斗。关注我,分享更多文档处理实战经验。
- 点赞
- 收藏
- 关注作者
评论(0)