扫描版 PDF 怎么翻译成中文并尽量保留排版
AI智译产品团队
扫描版 PDF 本质上是一组页面图片,不能像普通 PDF 那样直接复制文字。要得到可核对的中文版,必须先识别文字和坐标,再翻译、回填,并对小字、表格和图纸标注进行人工检查。
第一步:先判断是不是扫描件
用 PDF 阅读器尝试框选正文。如果只能选中整页图片,或复制后没有文字,通常就是扫描件。部分文件是混合型:正文有文字层,但图纸和截图里的标注仍需要 OCR。
- • 可复制正文不代表图片里的文字也能识别
- • 页面倾斜、阴影和压缩痕迹会影响 OCR
- • 密码保护或损坏文件需要先解除可读取问题
第二步:OCR 不只识别文字,还要保留位置
普通 OCR 只输出一串文本,无法知道每句话来自表格哪一格或图纸哪条引线。保版翻译需要同时记录文字块的页面坐标、大小和阅读顺序,后续才能把中文放回对应区域。
- • 小字号建议使用清晰原件而不是聊天软件压缩图
- • 多栏页面要检查阅读顺序
- • 图纸标注应逐处核对是否串行
第三步:翻译后进行版面回填
中文通常比英文占用不同宽度,不能机械覆盖。系统会优先寻找原文附近的空白区域,必要时缩小字号或采用同页对照。遇到非常密集的页面,分页对照往往比强行塞入中文更安全。
- • 用于审阅时优先选同页或分页对照
- • 用于内部阅读可选择纯中文,但要保留原文件
- • 关键数字、单位和编号不应交给模型改写
第四步:按风险而不是按页数复核
并非每一页风险相同。应优先检查低清页面、密集表格、金额与日期、尺寸单位、安全说明和客户自定义缩写。发现 OCR 错误时,换用更高清原件通常比反复重译更有效。
常见问题
扫描 PDF 和普通 PDF 的翻译有什么区别?
扫描 PDF 需要先通过 OCR 从图片中识别文字和位置;普通 PDF 通常可以直接读取文字层,因此识别误差更少。
扫描件翻译能保证版式完全一样吗?
不能对所有文件做绝对保证。清晰度、页面密度、字体大小和背景都会影响结果,复杂文件应在下载后人工复核。
怎样提高扫描 PDF 的识别率?
尽量使用原始 PDF 或 300 DPI 左右的清晰扫描,避免倾斜、阴影、裁边和聊天软件二次压缩。