一、先判断扫描件适不适合识别
先看文字是否基本可见、页面是否完整、是否有严重倾斜或反光。油印断线、纸张发黄、印章遮挡和折痕会让某些字无法可靠识别。不要从一开始就承诺整批自动完成,先拿一页代表性样本。
二、推荐的四步流程
- 图像整理:裁掉多余边缘,校正方向,保留原始文件作为校对依据。
- 文字识别:区分印刷体、手写体、繁体字和数字,不同区域可能需要不同处理。
- 版面重排:恢复标题、段落、表格或条目关系,不要只输出一长串无结构文本。
- 人工校对:重点复核人名、地名、年代、金额、编号和看不清的异体字。
三、为什么不能只看 OCR 文本
OCR 结果看起来通顺,不代表每个字都正确。历史档案中的专名和旧字没有足够上下文时,系统可能给出一个“像是对的”现代字。比较可靠的做法是保留原图、识别结果和不确定标记,让校对者逐项回看。
重光的处理原则:先识别和重排,再把不确定内容单独标出。它是初步整理和校对辅助,不是替代档案学者或资料持有人的最终定稿。
四、哪些资料适合先申请内测
- 油印、复印、扫描质量一般但文字仍可辨的旧文件。
- 家谱、家书、地方文献、会议记录、旧笔记等需要初步整理的资料。
- 繁体字、竖排文字或版面复杂,需要保留阅读顺序的页面。
如果资料包含身份证号、住址、联系方式或未公开合同,申请时先做脱敏。内测申请可以只描述问题,不必直接发送完整档案。
想判断一页样本是否适合处理?回到重光首页申请内测,并在邮件中写明资料类型、页数和目标格式。