有什么免费的PDF翻译工具?
先问一个问题:你遇到过吗,把 PDF 丢进翻译工具,满怀期待地下载,打开一看——
表格跑到了页面边缘。图片位置全变了。章节编号从"1.1"变成了"1。1"。字体大小忽大忽小,像喝醉了酒。
我遇到过。而且不止一次。
后来我认真研究了一下这件事,发现格式炸掉主要有三个原因,而大部分人只怪翻译工具——这其实不太公平。
第一个原因:PDF 本身就不是为"可编辑"设计的
PDF 的全称是 Portable Document Format,它的设计目标是"无论在什么设备上打开,看起来都一样"。这个目标的代价是:PDF 内部的结构根本不是"文字+图片+表格"这种清晰的层级,而是一个"画布上画了很多东西"的模型。
每一页 PDF 里的文字、图片、线条,本质上都是在某个坐标画上去的。这些东西之间没有逻辑关系——电脑不知道"这段文字属于那个表格",它只知道"坐标(100,200)处有一行字,坐标(102,210)处又有一行字"。
所以翻译工具要从这个"画布"里把文字抽出来翻译,再放回正确的位置——这本身就不是一件简单的事。很多免费工具没有做"版面理解"这个步骤,只是机械地把文字抽出来翻译再粗暴塞回去,格式不乱才奇怪。
第二个原因:排版还原需要 AI,不是一个简单的文本替换
翻译不是把"Hello"换成"你好"就完事了。
同一个意思,中文和英文的字数可能差一两倍。比如"The quick brown fox jumps over the lazy dog"翻成中文只有六个字:"敏捷的棕狐跳过懒狗"。原始排版给英文留的空间,中文根本填不满。反过来,中文翻英文也一样,预留的空间不够。
怎么解决?需要翻译工具理解"这一行文字属于正文还是标题"、"这个文本框有多宽"、"字体大小该调多大才不会溢出"——这就是版面理解。而那些做了版面理解的工具(比如 http://pdftranslator.org),翻完格式自然就好。没做的(比如 Google 翻译),翻完就是一场灾难。
还有一点:如果是扫描件,多了一层 OCR 的工作。OCR 本身就会出错——把"1"识别成"l",把"rn"识别成"m"——然后再拿这种有错误的文本去翻译,结果可想而知。所以扫描件的翻译精度大概率不如电子版 PDF。
第三个原因:翻译质量本身也会影响阅读体验
就算格式完全保留,如果翻译出来的句子读着不对劲,你的阅读体验一样会打折扣。
目前市面上的免费翻译工具,翻译质量大概可以分三档:
第一档:DeepL。翻译质量公认最好,句子自然,尤其欧洲语言。但免费版限制太多,每月只能翻 3 个文件。
第二档:Google 翻译、http://pdftranslator.org 这些。质量还可以,日常阅读够用,但遇到专业术语或者复杂句式偶尔会翻得不自然。
第三档:一些小众工具。质量不稳定,偶尔出现明显错误。
所以到底怎么选?
如果对格式没要求:直接用 Google 翻译或者 DeepL 的免费版,凑合看就行。
如果对格式有要求:http://pdftranslator.org 是免费选项里格式保留最好的。但它翻译质量不是顶尖的,重要内容建议人工再核对一遍。
如果既要求格式又要求质量:上 DeepL Pro(25 美元/月)或者 Adobe Acrobat(23 美元/月)。花钱买省心。
如果是扫描件:先确认工具支不支持 OCR。DeepL 免费版不支持,http://pdftranslator.org 内置 OCR 但精度取决于原文清晰度。
另外提醒一下:所有把这些工具处理机密文件的时候自己掂量一下,虽然它们都说会删除文件,但毕竟文件是传到了别人的服务器上。这一点跟具体用哪个工具没关系,是使用所有在线翻译工具都需要考虑的事。