三步实现档案智能分类与检索:零代码AI解决方案实操指南
一、核心工具与准备工作
本方案基于开源工具构建,无需编写代码,所有操作均在图形界面完成。你需要准备一台运行Windows 10/11或主流Linux发行版的电脑,并确保网络连接正常。
1.1 软件环境安装
访问以下链接,下载并安装全部三个核心软件:
- 文档处理引擎:https://github.com/qdrant/qdrant/releases/download/v1.7.4/qdrant-1.7.4-x86_64-pc-windows-msvc.zip (Windows) 或对应Linux版本
- AI模型管理工具:https://ollama.com/download/OllamaSetup.exe (Windows) 或对应系统的安装脚本
- 图形化操作界面:https://github.com/langgenius/dify/releases/download/v0.6.5/dify-windows-0.6.5.zip
安装完成后,请按顺序启动以下服务:
- 解压qdrant压缩包,双击运行文件夹内的qdrant.exe。看到命令行窗口显示“Qdrant 1.7.4 server started on 0.0.0.0:6333”即表示成功。
- 运行Ollama安装程序,安装完成后,在开始菜单找到并打开“Ollama”。打开浏览器,访问http://localhost:11434,页面显示“Ollama is running”则正常。
- 解压dify压缩包,进入文件夹,双击start.bat。等待约2分钟,在浏览器中访问http://localhost:3000,看到注册/登录界面即启动完毕。
二、构建AI模型与知识库
此步骤将建立一个能理解档案内容的AI大脑。
2.1 加载专用文本理解模型
打开系统命令行(CMD或终端),输入以下命令并回车:
``` ollama pull nomic-embed-text ```该命令会下载一个约400MB的专用文本嵌入模型。下载完成后,输入以下命令验证:
``` ollama list ```你应当看到名为“nomic-embed-text”的模型出现在列表中。
2.2 创建档案知识库
在浏览器中登录Dify(首次使用需注册一个账号),按顺序操作:
- 点击左侧导航栏的“知识库”,然后点击右上角“创建知识库”按钮。
- 在弹出窗口中,填写知识库名称为“公司档案中心”,点击“创建”。
- 进入新建的知识库,点击“上传文件”按钮。将你的档案文件(支持PDF、Word、TXT、PPT)直接拖拽到上传区域,或点击选择文件。系统会开始自动解析和索引文件内容。
关键配置:在上传文件后,点击知识库名称进入“设置”页面,找到“索引方式”选项,确保选择为“高精度模式”。
三、配置自动化分类与检索流程
我们将创建一个智能工作流,自动处理新入库的档案。
3.1 设计档案分类流程

在Dify中点击顶部“工作流”标签,然后点击“创建空白工作流”:
- 从左侧节点区拖拽“知识库”节点到画布中央。
- 双击该节点进行配置。在“知识库”下拉菜单中,选择刚才创建的“公司档案中心”。在“查询类型”中,选择“语义检索”。
- 从左侧拖拽“代码”节点到“知识库”节点右侧,并用连接线将两者连接起来。
- 双击“代码”节点,清空默认代码,粘贴以下完整的Python分类逻辑:
配置输入输出:在该代码节点的“输入”设置中,添加一个变量,命名为“query_result”,并选择从上游“知识库”节点的“查询结果”映射过来。在“输出”设置中,添加一个变量,命名为“category”,类型选“字符串”。
3.2 设置自动化触发与结果存储
- 从左侧拖拽“HTTP请求”节点到画布最右侧,并与“代码”节点连接。
- 双击“HTTP请求”节点进行配置。方法选择“POST”,URL填写你计划存储分类结果的服务器地址,例如:http://your-server/api/archive/record。
- 在“Body”选项卡中,选择“JSON”,并填写以下完整模板:
4. 点击工作流右上角的“发布”按钮,为工作流命名,例如“新档案自动分类归档”。
四、部署与日常使用
4.1 配置自动监控文件夹
在你的档案服务器或电脑上,创建一个用于存放待处理档案的文件夹,例如D:\待处理档案。创建一个文本文件,将其重命名为watch_folder.ps1(Windows)或watch_folder.sh(Linux),用文本编辑器打开,根据你的系统粘贴对应的完整脚本:
Windows PowerShell脚本 (watch_folder.ps1):
``` $folder = "D:\待处理档案" $api_url = "http://localhost:3000/api/workflow/run" 替换为你的Dify工作流API地址 $watcher = New-Object System.IO.FileSystemWatcher $watcher.Path = $folder $watcher.Filter = ".pdf" $watcher.IncludeSubdirectories = $true $watcher.EnableRaisingEvents = $true $action = { $path = $Event.SourceEventArgs.FullPath $changeType = $Event.SourceEventArgs.ChangeType if ($changeType -eq 'Created') { Start-Sleep -Seconds 2 $fileBytes = [System.IO.File]::ReadAllBytes($path) $fileEnc = [System.Text.Encoding]::GetEncoding('ISO-8859-1').GetString($fileBytes) $boundary = [System.Guid]::NewGuid().ToString() $LF = "`r`n" $bodyLines = ( "--$boundary", "Content-Disposition: form-data; name=`"file`"; filename=`"$(Split-Path $path -Leaf)`"", "Content-Type: application/octet-stream$LF", $fileEnc, "--$boundary--$LF" ) -join $LF Invoke-RestMethod -Uri $api_url -Method Post -ContentType "multipart/form-data; boundary=$boundary" -Body $bodyLines Write-Host "已处理新档案: $path" } } Register-ObjectEvent $watcher "Created" -Action $action Write-Host "开始监控文件夹: $folder" while ($true) { Start-Sleep -Seconds 1 } ```保存后,右键点击该脚本文件,选择“使用PowerShell运行”。脚本会持续运行并监控指定文件夹,任何新放入的PDF档案都会被自动抓取并送入AI工作流处理。
4.2 进行档案检索
当需要查找档案时,在Dify平台:
- 点击左侧“应用”,然后点击“创建空白应用”。
- 在应用编辑页面的“提示词”区域,输入以下指令:
3. 在“关联知识库”区域,勾选“公司档案中心”。
4. 点击右上角“发布”。发布后,你会在该页面看到一个聊天窗口。直接在输入框中用自然语言提问,例如:“查找所有关于2024年第一季度项目预算审批的文档”或“张三的劳动合同在哪里?”,系统会自动从已上传的档案中找出相关内容并返回。
4.3 定期维护与优化
为确保系统长期稳定运行,请执行以下维护操作:
- 每周一次:登录Dify,进入“知识库”,检查是否有文件“索引失败”。如有,重新上传该文件。
- 每月一次:在命令行运行ollama ps,查看模型运行状态。如果发现内存占用过高,运行ollama restart命令重启服务。
- 分类优化:如果发现某些档案分类不准确,编辑第三步中的“代码”节点,在categories字典里相应类别的关键词列表中,增加或减少关键词,然后重新发布工作流。