Filembly

为什么您的 PDF 转 Word 不成功

绝大多数失败的 PDF 转 Word 都能归结为五个原因之一,而每个原因的解法都不同。这里教您用大约十秒判断自己碰上的是哪一个。

只想用转换器?免费,几秒钟搞定:

先做这个十秒测试

打开 PDF,像准备复制那样用鼠标试着选中一句话。

如果文字能被选中,您的 PDF 含有真实文本,任何像样的转换器都能提取——您的问题属于下面的版面类。如果什么都选不中,或者整页作为一个整体被选中,您的 PDF 就是一张文档的照片,普通转换器读不了它。这一个测试就能告诉您本页哪一半适用于您。

原因一:这是扫描版 PDF

这是目前最常见的原因。扫描仪、手机相机或传真生成的 PDF 装的是页面的照片,不是文本。没有东西可提取,所以您得到空文档或一页页图片。

解法是 OCR——光学字符识别——读取字母的图像并重建文本。Google Drive 免费提供:上传 PDF,右键选择“通过 Google 文档打开”,它会对文件做 OCR。Adobe Acrobat 和 OneNote 也可以。手写、非常规字体和劣质扫描件会有识别错误。

原因二:版面散架

文字都在,但多栏交错、表格塌成一串文本、图片不见了。这与其说是缺陷,不如说是格式的本性。

PDF 是最终输出格式,记录的是每个字形在页面上的位置。它不记录“这是两栏版式”或“这是表格”——那些结构在生成 PDF 时就被丢弃了。转换器只能把结构猜回来,而复杂版面正是猜测失败的地方。

需要文字,就接受干净的无格式文本,在 Word 里重建版面。需要外观,就干脆不要转换——保留 PDF。

原因三:PDF 受密码保护

转换器打不开加密的 PDF,而且多数只会报告一个含糊的失败,不说真正的原因。保护有两种:打开密码,完全阻止读取;权限密码,允许阅读但禁止复制和编辑。任何一种都可能挡住转换。

如果您知道密码:打开文件,把它打印成新的 PDF,再转换那个副本。

原因四:文件超出工具的限制

每个在线转换器都有上传上限,很多把超限报告成一个笼统的错误。如果您的 PDF 有几十 MB——扫描件很常见——试着拆成小段分别转换,或改用没有大小上限的桌面工具。

原因五:文字提取出来是乱码

偶尔提取出的文本字符位置都对,语义却是胡话——该是单词的地方是一堆随机字母。这发生在 PDF 内嵌了字体子集却缺少正确字符映射时:文件知道画哪个形状,却不知道它代表哪个字符。

这个问题真的很难修,在较老的 LaTeX 工具链和某些设计软件生成的 PDF 中更常见。实际的绕行方案是 OCR:它无视损坏的文本层,直接读取渲染后的页面。

一次好的转换该期待什么

即使一切正常,把 PDF 转回 Word 也是重建,不是还原。文本类 PDF 的现实结果是:所有段落齐全且可编辑,标题大致保留,简单格式保留——多栏、表格和精确间距需要手工修补。

Filembly 的 PDF 转 Word 转换器提取文本并重建为干净的可编辑段落;当 PDF 没有可提取文本时,它会直接告诉您,而不是塞给您一个空文件。