我的 PDF 文件为什么这么大?
十页的 PDF 没有理由有 40 MB。原因几乎总在图片——要么扫描分辨率过高,要么内嵌时没有压缩。这里教您判断是哪一种,以及什么才能真正缩小体积。
先弄清空间被什么占了
用文件大小除以页数。纯文本 PDF 每页应远低于 100 KB;带几张照片的页面可能到 500 KB。如果每页有好几 MB,这个文档就是图片密集型——几乎肯定是扫描件。
第二个线索:试着选中文字。选不中,就说明每页都是图片,问题立刻清楚了。
原因一:扫描分辨率过高
这是超大 PDF 的头号成因。扫描仪常默认 600 dpi——适合照片的档案级复制,对打印信函则严重过剩。dpi 每翻一倍,数据量大约翻四倍。
对在屏幕上阅读或正常重印的文本文档,200 到 300 dpi 绰绰有余。用合理的分辨率重扫,往往能把文件砍掉 80% 以上,比任何事后压缩都有效得多。
原因二:图片未压缩就被嵌入
从设计工具导出,或从应用程序“打印为 PDF”,可能以极低甚至零压缩嵌入图片——有时一张照片就以原始像素数据存储,单张就能占几十 MB。
如果源文档还在,导出前先缩小图片是最干净的解法:显示宽度 10 厘米的照片不需要 6000 像素宽。
原因三:完整内嵌的字体
PDF 会内嵌字体,让文档在任何地方看起来一致。嵌入整个字体家族而不是只嵌用到的字符,可能增加几 MB。这主要影响短文档——一个没有任何图片的文件可能大半体积都是字体。
多数现代 PDF 写出工具会自动做字体子集。如果您用的工具不会,请在导出设置里找字体子集选项。
原因四:看不见的残留
PDF 会积累您看不见的东西:增量保存保留的历史版本、被裁掉却仍完整存储的图片部分、内嵌的附件文件、没用的表单字段。被反复编辑过的文档可能背着一大堆这些。
导出一份干净的副本——而不是覆盖保存原件——通常能把它们甩掉。
什么才能真正缩小体积
坦诚说明:Filembly 目前不提供 PDF 压缩。有意义的压缩需要对文档内嵌的图片重新编码,我们不愿上线一个几乎压不动的工具。当实际目标只是挤进邮件限制时,我们的拆分工具帮得上忙——删掉接收方不需要的页面,往往是最快的路。
- 用更低的 dpi 重新扫描。对扫描件而言没有任何方法能与之相比。
- 对 PDF 内部的图片降采样,这正是真正的压缩工具所做的。
- 发送前删掉不需要的页面。
- 导出一份全新副本,而不是覆盖保存编辑过的原件。
让 PDF 挤进邮件限制
多数邮件服务商把附件限制在 25 MB 左右,很多企业系统更严格,只有 10 MB。差得不多时,拆出相关页面比压缩更快也更可靠,而且接收方通常也更喜欢短文档。
扫描件远超限制?用 200 dpi 重扫几乎肯定比任何其他单一手段都更有效。