档案数字化质量评估全流程实操指南 手把手教你落地标准化检查
一、前期准备工作
1.1 工具准备(全免费可直接使用)
- 文件批量管理工具:Everything 1.4.1.1022,直接下载地址:https://www.voidtools.com/Everything-1.4.1.1022.x64.zip,解压即可使用,无需安装
- 文本对比工具:WinMerge 2.16.24,直接下载地址:https://github.com/WinMerge/winmerge/releases/download/v2.16.24/WinMerge-2.16.24-x64-Setup.exe,点击下一步即可完成安装
- 图像分辨率检测工具:在线免费版,直接访问:https://checkdpi.com/,无需登录注册
1.2 对齐量化评估标准
直接套用国家通用档案数字化评估标准,核心指标合格阈值如下,可直接使用:
| 评估维度 | 合格阈值 |
|---|---|
| 图像分辨率 | 纸质档案≥300DPI,照片档案≥600DPI |
| 文字识别准确率 | 简体中文档案≥95%,古旧手写档案≥90% |
| 文件完整性 | 漏扫率≤0.1%,缺页错页率≤0.1% |
| 图像清晰度 | 无反光、无黑边裁切,歪斜角度≤3度 |
| 目录文件一致性 | 匹配准确率≥99% |
二、分步骤实操评估流程
2.1 文件完整性批量检查
该步骤可10分钟内完成批量检测,操作步骤:
- 1. 打开Everything,在搜索框输入 你的档案存储根目录 .pdf .jpg(根据你的实际文件后缀调整,比如是tiff就改成.tiff),按下回车键获取所有数字化档案的完整列表
- 2. 点击Everything菜单栏的「视图>导出」,导出格式选择csv,保存为档案文件列表.csv到本地
- 3. 打开导出的csv文件,统计导出的总文件数,对比原始档案目录的总页数/总件数,按公式计算漏扫率:漏扫率=(原始档案总数-导出文件总数)/原始档案总数×100%,对照合格阈值判断是否合格
- 4. 把文件列表按档案编号排序,检查是否存在断号,断号对应错页缺页,统计错页缺页率即可
2.2 图像质量抽样检查
按行业通用规则做抽样检测,操作步骤:
- 1. 按总档案量的10%比例随机抽样,单批抽样不低于10份,简单抽样方法:对排序后的文件,每隔10个文件抽取1份即可
- 2. 打开在线DPI检测网站https://checkdpi.com/,上传抽样的图像或PDF文件,直接读取分辨率数值,记录是否符合阈值要求
- 3. 逐张肉眼检查抽样图像,符合以下要求即为合格:所有文字边缘清晰,无大面积反光、黑边,页面旋转角度不超过3度,没有内容裁切,印章文字清晰可辨
2.3 OCR文字识别准确率检测
- 1. 从抽样档案中选取3份文字密度较大的档案,导出识别后的纯文本文件;如果没有附带OCR文本,可打开免费在线OCR工具https://www.ocrking.com/,上传档案直接导出文本,无需登录
- 2. 从每份档案中随机选取3段,每段不少于100字,手动整理出正确文本保存为正确文本.txt,OCR识别结果保存为识别文本.txt
- 3. 打开WinMerge,点击首页「打开文件」,分别选择两个txt文件,点击确定后软件会自动标出所有差异文字
- 4. 按公式计算准确率:准确率=(总字数-差异字数)/总字数×100%,取三份样本的平均准确率,对照阈值判断是否合格
2.4 目录与文件一致性检查
- 1. 导出数字化成果的目录Excel表,提取档案编号、题名两列,整理成标准目录表
- 2. 按10%比例抽样,逐一核对实际档案文件名、内容与目录的档案编号、题名是否一致,记录错误数量
- 3. 计算匹配准确率:准确率=(抽样总数-错误数)/抽样总数×100%,≥99%即为合格
三、最终结果判定与整改

所有指标检查完成后,按以下规则直接判定结果:
- 所有核心指标都达到合格阈值,整体评估为合格,可入库保存
- 仅有1项指标不达标,判定为基本合格,针对对应问题整改后重新复检即可
- 有2项及以上指标不达标,判定为不合格,全部退回重新数字化
常见问题整改方法:
- 分辨率不达标:重新扫描,扫描时直接设置分辨率为300DPI以上
- OCR准确率不达标:调整扫描清晰度后重新做OCR识别,手写体占比超过30%的档案可标记为无OCR要求,不判定不合格
- 错漏页:整理原始档案顺序后补扫,重新排序命名即可
- 图像歪斜/反光:重新扫描,扫描时抚平纸张,调整扫描灯角度即可解决
评估完成后,直接生成评估报告,核心内容包含:抽检比例、各指标检测结果、整体判定结果、整改要求即可,无需复杂格式。