一、先判断扫描件适不适合识别

先看文字是否基本可见、页面是否完整、是否有严重倾斜或反光。油印断线、纸张发黄、印章遮挡和折痕会让某些字无法可靠识别。不要从一开始就承诺整批自动完成,先拿一页代表性样本。

二、推荐的四步流程

  1. 图像整理:裁掉多余边缘,校正方向,保留原始文件作为校对依据。
  2. 文字识别:区分印刷体、手写体、繁体字和数字,不同区域可能需要不同处理。
  3. 版面重排:恢复标题、段落、表格或条目关系,不要只输出一长串无结构文本。
  4. 人工校对:重点复核人名、地名、年代、金额、编号和看不清的异体字。

三、为什么不能只看 OCR 文本

OCR 结果看起来通顺,不代表每个字都正确。历史档案中的专名和旧字没有足够上下文时,系统可能给出一个“像是对的”现代字。比较可靠的做法是保留原图、识别结果和不确定标记,让校对者逐项回看。

重光的处理原则:先识别和重排,再把不确定内容单独标出。它是初步整理和校对辅助,不是替代档案学者或资料持有人的最终定稿。

四、哪些资料适合先申请内测

如果资料包含身份证号、住址、联系方式或未公开合同,申请时先做脱敏。内测申请可以只描述问题,不必直接发送完整档案。

想判断一页样本是否适合处理?回到重光首页申请内测,并在邮件中写明资料类型、页数和目标格式。