朝阳档案数字化全流程实操指南:从扫描到管理系统的部署
一、核心准备工作与设备选型
在开始数字化工作前,必须完成物理档案的预处理。这包括:
- 除尘与平整:使用软毛刷和专用档案除尘设备清除表面灰尘。对于褶皱严重的纸张,需使用档案专用压平机进行处理,温度不得超过50℃。
- 拆除装订:对于已装订成册的档案,使用档案拆线刀或裁纸刀小心拆除金属钉、棉线等,确保不损伤纸张边缘。
- 分类与编号:按照“全宗-目录-案卷-件”的规则对档案进行唯一编号。建议使用2B铅笔在档案背面右下角轻写编号,便于后期关联。
扫描设备选择与参数设置
选用专业平台式扫描仪(如柯达i3400系列、富士通fi系列),而非馈纸式,以避免卡纸和损坏老旧档案。
- 分辨率:永久保存级档案设置为600dpi,普通利用级设置为300dpi。
- 色彩模式:彩色档案选择“真彩色(24位)”;黑白文字档案选择“黑白二值”,阈值设为128。
- 文件格式:主格式保存为无损压缩的TIFF格式,用于利用的副本可转换为PDF/A格式。
- 命名规则:扫描时即按“全宗号_目录号_案卷号_件号.tif”的规则命名,如“001_05_012_103.tif”。
二、数字化图像处理标准流程
扫描后的图像必须经过标准化处理,确保质量统一。
1. 图像校正
使用扫描仪配套软件或专业图像处理软件(如Adobe Photoshop的批处理功能)进行自动化处理。操作步骤如下:
- 创建“动作”:在Photoshop中打开一张典型图像。
- 去黑边:菜单选择“图像”->“裁剪”->“裁切”,勾选“左上角像素颜色”和“右下角像素颜色”。
- 纠偏:菜单选择“图像”->“图像旋转”->“任意角度”,用拉直工具沿页面文字边缘画一条直线,软件自动校正。
- 去噪点:菜单选择“滤镜”->“杂色”->“蒙尘与划痕”,半径设为1像素,阈值设为2色阶。
- 停止记录动作,通过“文件”->“自动”->“批处理”对整个文件夹的图像进行批量处理。
2. 图像质量检查
建立双人校验机制。校验员使用ACDSee等看图软件,以“全屏幻灯片”模式快速浏览,重点关注:
- 图像是否完整,有无缺页、漏扫。
- 图像是否清晰,文字有无模糊、重影。
- 图像方向是否正确,有无倒置、倾斜。
- 图像命名与实体档案编号是否100%对应。
发现问题的图像需记录在《问题图像登记表》中,退回上一环节重新处理。
三、档案管理系统本地化部署
推荐使用开源解决方案,避免版权和定制化问题。以下以基于Python Django的Archivematica和AtoM(Access to Memory)组合为例。
1. 基础环境搭建
在Ubuntu Server 20.04 LTS系统上部署。
更新系统并安装必要组件:
``` sudo apt update && sudo apt upgrade -y sudo apt install -y python3-pip python3-dev libmysqlclient-dev mysql-server nginx git ```安装并配置MySQL数据库:
``` sudo mysql_secure_installation 根据提示设置root密码,并移除匿名用户、禁止远程root登录等。 sudo mysql -u root -p ```在MySQL命令行中创建数据库和用户:
``` CREATE DATABASE archivematica DEFAULT CHARACTER SET utf8 COLLATE utf8_unicode_ci; CREATE DATABASE atom DEFAULT CHARACTER SET utf8 COLLATE utf8_unicode_ci; CREATE USER 'arc_user'@'localhost' IDENTIFIED BY 'YourStrongPassword123!'; CREATE USER 'atom_user'@'localhost' IDENTIFIED BY 'AnotherStrongPassword456!'; GRANT ALL PRIVILEGES ON archivematica. TO 'arc_user'@'localhost'; GRANT ALL PRIVILEGES ON atom. TO 'atom_user'@'localhost'; FLUSH PRIVILEGES; EXIT; ```2. Archivematica(数字仓储系统)安装
Archivematica负责数字资产的长期保存和格式规范化。
添加Archivematica的APT源并安装:
``` echo "deb [arch=amd64] http://packages.archivematica.org/1.14.x/ubuntu focal main" | sudo tee /etc/apt/sources.list.d/archivematica.list wget -O - https://packages.archivematica.org/1.14.x/key.asc | sudo apt-key add - sudo apt update sudo apt install -y archivematica-storage-service archivematica-dashboard ```安装过程中会提示配置数据库,输入之前创建的archivematica数据库信息和arc_user用户密码。
启动服务:
``` sudo systemctl start archivematica-storage-service sudo systemctl start archivematica-dashboard sudo systemctl enable archivematica-storage-service archivematica-dashboard ```访问 http://你的服务器IP:62081 即可进入Archivematica仪表盘。
3. AtoM(档案信息描述与检索系统)安装
AtoM用于档案目录的编目、描述和提供在线检索。
使用一键安装脚本:
``` wget https://raw.githubusercontent.com/artefactual/atom/stable/install.sh chmod +x install.sh sudo ./install.sh ```脚本将自动安装PHP、Elasticsearch等依赖,并引导你完成配置。在配置数据库时,选择MySQL,并填入之前创建的atom数据库信息和atom_user用户密码。
安装完成后,访问 http://你的服务器IP,使用默认管理员账号(admin/admin)登录,并立即修改密码。
四、数据挂接与检索利用
1. 目录数据导入AtoM
将前期整理好的档案目录(Excel格式)转换为AtoM支持的CSV模板进行批量导入。
- 从AtoM后台“导入/导出”菜单下载“权威记录”或“档案描述”CSV模板。
- 严格按照模板字段填写,“标识符”字段必须与图像文件名(不含扩展名)完全一致,这是实现图文关联的关键。
- 在AtoM后台,选择“导入”->“CSV”,上传文件,字符编码选择“UTF-8”,导入类型根据数据选择。
2. 数字图像导入Archivematica并关联
在Archivematica仪表盘创建新的“处理配置”:
- “分配UUIDs给目录”:是。
- “文档格式识别”:使用FIDO工具。
- “提取策略”:从服务中提取。
- “规范化规则”:将TIFF、JPEG等格式规范化生成PDF/A和JPEG访问副本。
将处理好的TIFF图像文件夹上传至Archivematica的“源文件”区域,启动处理流程。系统将自动进行格式鉴定、病毒扫描、生成校验码、格式规范化,并打包成符合OAIS模型的归档信息包(AIP)保存。
3. 实现图文互查
这是关键一步,需要修改AtoM的模板,使其能调用Archivematica生成的访问副本(JPEG或PDF/A)。
登录AtoM服务器,编辑数字对象显示模板:
``` sudo nano /usr/share/nginx/atom/plugins/arDominionPlugin/modules/digitalobject/templates/_format.php ```找到显示数字对象的代码段,将其中的文件路径指向Archivematica的DIP(分发信息包)存储目录。例如,将原有的本地路径替换为:
```保存后,在AtoM前端编辑任意一条档案描述,在“数字对象”栏上传一个占位符文件(如一个空白文本文件,命名为与该条目录相同的标识符),AtoM就会根据上述模板规则,去指定URL寻找同名的图像文件进行显示。至此,用户在AtoM中检索到目录,即可直接在线查看对应的数字化图像。
五、后期维护与备份策略
数字化成果的长期保存至关重要。
- 数据备份:对Archivematica存储服务目录(默认/var/archivematica/sharedDirectory/)和MySQL数据库进行每日增量、每周全量备份。备份脚本示例:
将脚本加入crontab实现自动化。
- 定期校验:每半年使用Archivematica的校验功能,对保存的AIP进行完整性校验,确保比特级保存完好。
- 系统更新:关注Archivematica和AtoM的安全公告,定期使用
sudo apt update && sudo apt upgrade进行系统及软件的安全更新。