深圳机关企事业单位合规档案数字化加工全流程实操落地指南
一、前期准备工作
1.1 硬件要求
根据深圳档案数字化进馆规范,需准备以下硬件:
- 扫描设备:加工量小可选普通CCD扫描仪,需支持A4幅面;批量加工推荐用A3零边框零边距扫描仪,可避免切割边缘内容
- 存储设备:需采用加密本地硬盘存储原始扫描数据,禁止直接存放在未加密的公共云盘
- 辅助工具:美工刀、脱酸纸、胶水,用于处理破损档案、剔除金属物
1.2 软件工具准备
所有工具均为免费工具,直接获取即可使用:
- 批量图像处理工具:IrfanView,官网下载地址:
https://www.irfanview.com/ - 批量重命名工具:Bulk Rename Utility,官网下载地址:
https://www.bulkrenameutility.co.uk/ - 中文OCR识别工具:PaddleOCR,CPU版本可直接通过pip安装,安装命令:
pip install paddlepaddle paddleocr
1.3 合规前提确认
涉密档案禁止私自加工,必须委托具备涉密信息系统集成(档案数字化类)资质的单位处理,违者违反保密规定;非涉密档案可按照本指南自行加工。
二、全流程实操步骤
2.1 第一步:档案整理拆卷
- 按照深圳档案管理要求,以「件」为单位整理,一件对应一个编号,逐件剔除所有金属物(订书钉、回形针、夹子),避免划伤扫描玻璃、留下黑影
- 破损缺页的档案,先用胶水裱糊在脱酸纸上修复,缺页漏页要登记在加工单上,注明缺页原因和位置
- 整理完成后按照顺序排列所有页面,确保不重不漏
2.2 第二步:规范扫描操作
- 分辨率设置:所有档案扫描分辨率必须设置为300DPI,图纸、照片类档案提高到600DPI,低于300DPI提交深圳市档案馆会直接被退回
- 色彩模式:永久保管的档案必须用24位真彩色扫描,短期保管档案可选择灰度模式,深圳进馆要求永久档案必须彩色扫描
- 扫描后逐批检查,出现漏扫、偏斜、模糊、黑边的页面立刻重扫
2.3 第三步:批量图像优化

全部扫描完成后,用IrfanView批量处理,步骤如下:
- 打开IrfanView,进入「文件-批量转换/重命名」,导入所有扫描好的图片
- 勾选「使用高级选项」,点击「高级」,勾选「自动修正倾斜」「自动裁剪黑边」,确定后返回
- 输出格式选择TIFF(深圳进馆标准格式),设置输出文件夹,点击「开始批量处理」即可一键完成优化
- 压缩要求:单页TIFF大小控制在10MB以内,JPEG格式品质设置为85,禁止过度压缩导致字迹模糊
2.4 第四步:OCR识别与文件命名
批量OCR识别可直接使用以下完整脚本,新建文件ocr_batch.py,复制以下内容后运行即可自动生成所有识别结果:
命名必须符合深圳档案规范,规则为:全宗号-目录号-年度-件号,示例:012-005-2023-0128.tif,批量命名操作:打开Bulk Rename Utility,选中所有图片,右侧设置规则为「固定前缀+顺序号」,输入对应前缀,设置顺序号为4位,点击「重命名」即可一键完成。
2.5 第五步:数据挂接与验收
- 元数据挂接:将档案的档号、题名、责任者、形成日期、保管期限5项必填元数据,对应绑定到图像文件,导入单位档案管理系统,深圳进馆要求这5项必须完整,缺一不可
- 自检:按10%比例抽查,要求OCR识别准确率不低于95%,图像清晰无黑边偏斜,命名准确,不合格的返工处理
- 提交进馆封装:按照要求打包为标准数据包,存储格式为TIFF或PDF/A,禁止使用加密压缩包。
三、常见卡壳坑点规避
- 分辨率不达标:很多新手为了省空间用200DPI扫描,最终提交被退回,必须严格设置300DPI,不要偷工减料
- 未剔除金属物:既划伤扫描仪玻璃,又会在扫描件上留下黑影,导致验收不通过,必须逐件剔除
- 元数据缺失:漏填责任者、保管期限等必填项,会直接影响档案归档,整理时就要同步填好元数据
- 涉密档案私自加工:深圳保密监管严格,无资质处理涉密档案会被处罚,务必提前确认档案密级