三步实现档案智能分类与检索:零代码AI解决方案实操指南

一、核心工具与准备工作

本方案基于开源工具构建,无需编写代码,所有操作均在图形界面完成。你需要准备一台运行Windows 10/11或主流Linux发行版的电脑,并确保网络连接正常。

1.1 软件环境安装

访问以下链接,下载并安装全部三个核心软件:

  • 文档处理引擎:https://github.com/qdrant/qdrant/releases/download/v1.7.4/qdrant-1.7.4-x86_64-pc-windows-msvc.zip (Windows) 或对应Linux版本
  • AI模型管理工具:https://ollama.com/download/OllamaSetup.exe (Windows) 或对应系统的安装脚本
  • 图形化操作界面:https://github.com/langgenius/dify/releases/download/v0.6.5/dify-windows-0.6.5.zip

安装完成后,请按顺序启动以下服务:

  1. 解压qdrant压缩包,双击运行文件夹内的qdrant.exe。看到命令行窗口显示“Qdrant 1.7.4 server started on 0.0.0.0:6333”即表示成功。
  2. 运行Ollama安装程序,安装完成后,在开始菜单找到并打开“Ollama”。打开浏览器,访问http://localhost:11434,页面显示“Ollama is running”则正常。
  3. 解压dify压缩包,进入文件夹,双击start.bat。等待约2分钟,在浏览器中访问http://localhost:3000,看到注册/登录界面即启动完毕。

二、构建AI模型与知识库

此步骤将建立一个能理解档案内容的AI大脑。

2.1 加载专用文本理解模型

打开系统命令行(CMD或终端),输入以下命令并回车:

``` ollama pull nomic-embed-text ```

该命令会下载一个约400MB的专用文本嵌入模型。下载完成后,输入以下命令验证:

``` ollama list ```

你应当看到名为“nomic-embed-text”的模型出现在列表中。

2.2 创建档案知识库

在浏览器中登录Dify(首次使用需注册一个账号),按顺序操作:

  1. 点击左侧导航栏的“知识库”,然后点击右上角“创建知识库”按钮。
  2. 在弹出窗口中,填写知识库名称为“公司档案中心”,点击“创建”。
  3. 进入新建的知识库,点击“上传文件”按钮。将你的档案文件(支持PDF、Word、TXT、PPT)直接拖拽到上传区域,或点击选择文件。系统会开始自动解析和索引文件内容。

关键配置:在上传文件后,点击知识库名称进入“设置”页面,找到“索引方式”选项,确保选择为“高精度模式”。

三、配置自动化分类与检索流程

我们将创建一个智能工作流,自动处理新入库的档案。

3.1 设计档案分类流程

三步实现档案智能分类与检索:零代码AI解决方案实操指南

在Dify中点击顶部“工作流”标签,然后点击“创建空白工作流”:

  1. 从左侧节点区拖拽“知识库”节点到画布中央。
  2. 双击该节点进行配置。在“知识库”下拉菜单中,选择刚才创建的“公司档案中心”。在“查询类型”中,选择“语义检索”。
  3. 从左侧拖拽“代码”节点到“知识库”节点右侧,并用连接线将两者连接起来。
  4. 双击“代码”节点,清空默认代码,粘贴以下完整的Python分类逻辑:
``` import json def classify_document(content): categories = { "人事档案": ["员工", "入职", "离职", "考核", "薪资", "合同"], "财务档案": ["发票", "报表", "预算", "报销", "审计", "账目"], "项目档案": ["立项", "验收", "周报", "会议纪要", "需求", "里程碑"], "行政档案": ["通知", "制度", "公章", "资产", "采购", "纪要"] } content_lower = content.lower() scores = {cat: 0 for cat in categories} for category, keywords in categories.items(): for keyword in keywords: if keyword.lower() in content_lower: scores[category] += 1 找出最高分的类别,如果最高分为0则归为“其他” max_score = max(scores.values()) if max_score == 0: return "其他档案" else: for category, score in scores.items(): if score == max_score: return category ```

配置输入输出:在该代码节点的“输入”设置中,添加一个变量,命名为“query_result”,并选择从上游“知识库”节点的“查询结果”映射过来。在“输出”设置中,添加一个变量,命名为“category”,类型选“字符串”。

3.2 设置自动化触发与结果存储

  1. 从左侧拖拽“HTTP请求”节点到画布最右侧,并与“代码”节点连接。
  2. 双击“HTTP请求”节点进行配置。方法选择“POST”,URL填写你计划存储分类结果的服务器地址,例如:http://your-server/api/archive/record
  3. 在“Body”选项卡中,选择“JSON”,并填写以下完整模板:
```json { "file_name": "{{knowledge_node.output.file_name}}", "category": "{{code_node.output.category}}", "summary": "{{knowledge_node.output.summary}}", "timestamp": "{{knowledge_node.output.timestamp}}" } ```

4. 点击工作流右上角的“发布”按钮,为工作流命名,例如“新档案自动分类归档”。

四、部署与日常使用

4.1 配置自动监控文件夹

在你的档案服务器或电脑上,创建一个用于存放待处理档案的文件夹,例如D:\待处理档案。创建一个文本文件,将其重命名为watch_folder.ps1(Windows)或watch_folder.sh(Linux),用文本编辑器打开,根据你的系统粘贴对应的完整脚本:

Windows PowerShell脚本 (watch_folder.ps1)

``` $folder = "D:\待处理档案" $api_url = "http://localhost:3000/api/workflow/run" 替换为你的Dify工作流API地址 $watcher = New-Object System.IO.FileSystemWatcher $watcher.Path = $folder $watcher.Filter = ".pdf" $watcher.IncludeSubdirectories = $true $watcher.EnableRaisingEvents = $true $action = { $path = $Event.SourceEventArgs.FullPath $changeType = $Event.SourceEventArgs.ChangeType if ($changeType -eq 'Created') { Start-Sleep -Seconds 2 $fileBytes = [System.IO.File]::ReadAllBytes($path) $fileEnc = [System.Text.Encoding]::GetEncoding('ISO-8859-1').GetString($fileBytes) $boundary = [System.Guid]::NewGuid().ToString() $LF = "`r`n" $bodyLines = ( "--$boundary", "Content-Disposition: form-data; name=`"file`"; filename=`"$(Split-Path $path -Leaf)`"", "Content-Type: application/octet-stream$LF", $fileEnc, "--$boundary--$LF" ) -join $LF Invoke-RestMethod -Uri $api_url -Method Post -ContentType "multipart/form-data; boundary=$boundary" -Body $bodyLines Write-Host "已处理新档案: $path" } } Register-ObjectEvent $watcher "Created" -Action $action Write-Host "开始监控文件夹: $folder" while ($true) { Start-Sleep -Seconds 1 } ```

保存后,右键点击该脚本文件,选择“使用PowerShell运行”。脚本会持续运行并监控指定文件夹,任何新放入的PDF档案都会被自动抓取并送入AI工作流处理。

4.2 进行档案检索

当需要查找档案时,在Dify平台:

  1. 点击左侧“应用”,然后点击“创建空白应用”。
  2. 在应用编辑页面的“提示词”区域,输入以下指令:
``` 你是一个档案管理员。请根据用户的问题,从知识库中查找最相关的档案信息。 如果用户的问题涉及分类,请先判断其属于人事、财务、项目、行政中的哪一类,再进行精确查找。 回答时,先说明档案的类别和文件名,然后给出最相关的原文片段。 ```

3. 在“关联知识库”区域,勾选“公司档案中心”。

4. 点击右上角“发布”。发布后,你会在该页面看到一个聊天窗口。直接在输入框中用自然语言提问,例如:“查找所有关于2024年第一季度项目预算审批的文档”或“张三的劳动合同在哪里?”,系统会自动从已上传的档案中找出相关内容并返回。

4.3 定期维护与优化

为确保系统长期稳定运行,请执行以下维护操作:

  • 每周一次:登录Dify,进入“知识库”,检查是否有文件“索引失败”。如有,重新上传该文件。
  • 每月一次:在命令行运行ollama ps,查看模型运行状态。如果发现内存占用过高,运行ollama restart命令重启服务。
  • 分类优化:如果发现某些档案分类不准确,编辑第三步中的“代码”节点,在categories字典里相应类别的关键词列表中,增加或减少关键词,然后重新发布工作流。
AI咨询
热线电话

028-85154420

15388110056

全国售前咨询电话

扫码咨询
安答联动微信公众号二维码

微信扫码关注安答联动

申请试用
热线电话
申请试用

安答联动档案管理系统