PDF 翻译质量验证方法
PDFTranslate 如何验证产品能力、输出文件、OCR 行为与已知翻译限制
PDFTranslate 会检查文档能否被处理、承诺的输出文件是否交付,以及重要页面结构是否仍然可用。这些检查用于建立产品行为,但不能证明每种语言、主题、扫描质量和页面结构都能获得完美翻译。
当前生产服务公开哪些能力?
公开的生产能力接口是应用所展示限制的事实来源。
| 能力 | 当前生产值 |
|---|---|
| 输入 | 原生和扫描 PDF 文档 |
| 文件限制 | 50 MB、100 个源页面 |
| 语言 | 13 种源语言和 19 种目标语言 |
| OCR | 支持纯图片页面 |
| 输出 | 同一任务生成纯译文 PDF 和双语对照 PDF |
| 用量估算 | 处理前展示源文件页数和所需点数 |
产品能力可能变化。如果受控发布调整了限制,应以产品界面和能力接口为准。
每次发布如何检查?
发布检查明确区分四个层级:
- 合同检查:验证文件限制、语言白名单、页数计量、任务状态、输出类型和失败行为。
- 文档检查:使用原生文字 PDF、纯图片扫描件、结构化页面、表格、链接和多语言文本。
- 产物检查:要求两种输出都是有效 PDF,页数符合预期,在适用时可提取文字,并且不包含开发水印。
- 运行态检查:发布后请求线上站点、服务端首屏 HTML、公开能力接口、索引控制和关键页面。
自动化测试是必要条件,但不是充分条件。版式和翻译质量仍需视觉检查和具备相应语言能力的人工复核。
目前有哪些一手证据?
受控发布验证已完成以下检查:
- 一页原生文字 PDF 完成保留版式翻译,并生成一页、可提取译文文字的结果。
- 一页纯图片英文扫描件完成 OCR、翻译和重建;纯译文版与双语对照版都包含可见、可提取的简体中文,原扫描字形没有覆盖译文。
- 输出处理已经通过纯译文与双语产物、按页点数结算、失败任务退还预占点数和按用户隔离下载的合同测试。
这些检查只能证明被测样本的链路工作,不是通用准确率,也不能证明手写、低清扫描、特殊字体、复杂表格、所有语言对和所有 PDF 生成器都有相同性能。
用户应预期哪些限制?
- 机器翻译可能出现误译、漏译或语义变化。
- OCR 质量会受到分辨率、对比度、旋转、手写和复杂背景影响。
- 译文变长可能改变换行与间距。
- 复杂表格、表单、批注、嵌入媒体和特殊字体不一定能完全复现。
- 认证、宣誓、法律、医疗、财务、移民及其他高风险用途需要有资质的专业人员人工复核。
在具备版本化的代表性语料、评分方法、复核流程和可复现实验结果前,我们不会公布翻译准确率百分比。
验证方法参考哪些组件?
文档处理链路使用公开的开源 OCR 与 PDF 重建工具。相关一手技术资料包括 OCRmyPDF 文档、Tesseract 用户手册和 BabelDOC 项目。这些资料用于说明工具本身;上面的产品声明来自 PDFTranslate 自己的合同与受控检查。
如需反馈具体结果,请通过联系页面发送信息,不要通过邮件附加机密 PDF。