PDF 翻译质量验证方法

PDFTranslate 如何验证产品能力、输出文件、OCR 行为与已知翻译限制

PDFTranslate 会检查文档能否被处理、承诺的输出文件是否交付,以及重要页面结构是否仍然可用。这些检查用于建立产品行为,但不能证明每种语言、主题、扫描质量和页面结构都能获得完美翻译。

当前生产服务公开哪些能力?

公开的生产能力接口是应用所展示限制的事实来源。

能力当前生产值
输入原生和扫描 PDF 文档
文件限制50 MB、100 个源页面
语言13 种源语言和 19 种目标语言
OCR支持纯图片页面
输出同一任务生成纯译文 PDF 和双语对照 PDF
用量估算处理前展示源文件页数和所需点数

产品能力可能变化。如果受控发布调整了限制,应以产品界面和能力接口为准。

每次发布如何检查?

发布检查明确区分四个层级:

  1. 合同检查:验证文件限制、语言白名单、页数计量、任务状态、输出类型和失败行为。
  2. 文档检查:使用原生文字 PDF、纯图片扫描件、结构化页面、表格、链接和多语言文本。
  3. 产物检查:要求两种输出都是有效 PDF,页数符合预期,在适用时可提取文字,并且不包含开发水印。
  4. 运行态检查:发布后请求线上站点、服务端首屏 HTML、公开能力接口、索引控制和关键页面。

自动化测试是必要条件,但不是充分条件。版式和翻译质量仍需视觉检查和具备相应语言能力的人工复核。

目前有哪些一手证据?

受控发布验证已完成以下检查:

  • 一页原生文字 PDF 完成保留版式翻译,并生成一页、可提取译文文字的结果。
  • 一页纯图片英文扫描件完成 OCR、翻译和重建;纯译文版与双语对照版都包含可见、可提取的简体中文,原扫描字形没有覆盖译文。
  • 输出处理已经通过纯译文与双语产物、按页点数结算、失败任务退还预占点数和按用户隔离下载的合同测试。

这些检查只能证明被测样本的链路工作,不是通用准确率,也不能证明手写、低清扫描、特殊字体、复杂表格、所有语言对和所有 PDF 生成器都有相同性能。

用户应预期哪些限制?

  • 机器翻译可能出现误译、漏译或语义变化。
  • OCR 质量会受到分辨率、对比度、旋转、手写和复杂背景影响。
  • 译文变长可能改变换行与间距。
  • 复杂表格、表单、批注、嵌入媒体和特殊字体不一定能完全复现。
  • 认证、宣誓、法律、医疗、财务、移民及其他高风险用途需要有资质的专业人员人工复核。

在具备版本化的代表性语料、评分方法、复核流程和可复现实验结果前,我们不会公布翻译准确率百分比。

验证方法参考哪些组件?

文档处理链路使用公开的开源 OCR 与 PDF 重建工具。相关一手技术资料包括 OCRmyPDF 文档Tesseract 用户手册BabelDOC 项目。这些资料用于说明工具本身;上面的产品声明来自 PDFTranslate 自己的合同与受控检查。

如需反馈具体结果,请通过联系页面发送信息,不要通过邮件附加机密 PDF。