AI智译 · 方法与边界
AI智译如何处理一份文档
这页公开说明产品的基本处理方法,也明确哪些地方不能承诺绝对结果。目标是帮助用户判断文件是否适合自动处理,并在下载后知道该检查什么。
处理流程
1. 文件解析与分流
系统先识别文件格式和可读取内容。普通 PDF 优先读取文字层与坐标;扫描 PDF 和图片进入 OCR;Word 与 Excel 按各自的段落、文本框、单元格和工作表结构处理。
2. 文字识别与位置记录
对于扫描页和图片,OCR 不只提取文字,还需要记录它在页面上的位置。清晰度、倾斜、背景对比度和文字大小都会影响识别效果。
3. 分块翻译与术语约束
可翻译文字按块提交给翻译模型,数字、单位、型号和编码尽量保持原样。用户术语表用于锁定已经确认的译法;无法确认的专业缩写仍建议人工复核。
4. 版面回填
系统根据原文字块和空白区域,把中文放回对应页面、段落或单元格。PDF 会优先就近放置;空间不足时可能缩小字号、移动到附近空白,或采用分页对照。
5. 输出与复核
用户可根据文件类型选择同页对照、分页对照或纯中文。生成结果是可继续审阅的工作稿;正式报价、合同、生产和安全资料应由合适的负责人确认。
更适合自动处理的文件
- • 页面清晰、方向正常的 PDF 或图片
- • 文字层可读取的普通 PDF
- • 结构清楚的 Word 和 Excel 文件
- • 已有标准术语表的重复业务文档
- • 允许在交付前人工抽查的内部资料
需要重点人工复核的文件
- • 低清、倾斜、阴影严重的扫描件
- • 极小文字、密集引线或复杂背景图纸
- • 合同、正式报价和付款条件
- • 安全、医疗、法律或受监管资料
- • 带复杂宏、外部连接或插件的工作簿
我们不做这些绝对承诺
不承诺所有页面排版都与原文件像素级一致;不承诺 OCR 能识别每个低清小字;不承诺行业术语无需人工确认;不把 AI 译文描述为可以替代法务、工程、安全或报价审批。
产品会尽量保留结构、减少人工排版,并提供原文对照帮助复核。具体效果取决于文件质量、页面密度、语言、格式和专业程度。
文件与数据说明
上传文件用于完成当前翻译任务,处理文件在服务端临时保存并按系统清理机制删除,不用于训练公开模型。用户仍应遵守所在组织的数据制度;包含商业机密、个人信息或受监管内容时,应先确认是否允许上传第三方处理服务。