ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Paperless-ngx 文档管理系统:扫描、分类、秒搜的无纸化方案

Paperless-ngx 文档管理系统:扫描、分类、秒搜的无纸化方案 Paperless-ngx 文档管理系统扫描、分类、秒搜的无纸化方案【免费下载链接】paperless-ngxA community-supported supercharged document management system: scan, index and archive all your documents项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ngx周六下午你从抽屉里翻出一沓皱巴巴的快递单和电费账单想找出去年那张水电费发票对账——翻到第12张放弃打算重新去银行打流水。这种文件明明存在但就是找不到的时刻就是 Paperless-ngx 要解决的一个把纸质文档变成可搜索电子档案的开源文档管理系统核心动作就三步扫描、OCR识别、归档。它到底能帮你做什么把扫描件自动转成带文字的PDF以后不用翻纸质文件。按标签和类型自动分类扔进去就不用管。输入关键词秒查任意一份历史文档连扫描件里的字都能搜。数据全部存在你自己的服务器上不经过任何第三方。仪表板文档总数、最近添加的文件一目了然5分钟跑起来一台有 Docker 的电脑Windows、macOS、Linux 都行2G 内存起步够了。打开终端粘贴这行bash -c $(curl --location --silent --show-error https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)这个安装脚本会问你几个问题数据库选默认的 PostgreSQL 即可管理员账号按提示设好然后自动拉取镜像、启动容器。跑完后浏览器打开http://127.0.0.1:8000能看到登录页就说明成功了。登录后把任意一张 PDF 或图片扔进安装目录里的consume文件夹——它就是系统的收件箱。刷新页面文件已经躺在文档列表里缩略图、文字内容全都有了。这就是你处理的第一份文档。处理完成的文档以卡片形式展示拖拽上传也可以直接扔进页面跟着场景走核心能力逐个拆场景一发票照片拍完就忘现在直接搜在顶部搜索框输入水电费回车。系统把命中文档按相关度排序并用高亮标出匹配的位置甚至能在预览里直接定位到那段文字。背后是OCR在起作用内置的 Tesseract 引擎支持 100 多种语言能把图片里的字变成可搜索的文本。注意一点扫描件拍得太糊低于200DPI识别率会明显下降拍照时保持文档平整、光线均匀。全文搜索结果按相关度排序命中内容高亮显示场景二一整箱旧文件批量扫进去把扫描好的文件全部丢进consume目录不用管文件名。系统会并行处理多份文档逐份完成 OCR、转成适合长期保存的 PDF/A 格式归档同时保留原始文件。注意文件名不用讲究Paperless-ngx 会自动按你配置的命名规则重命名你只管攒文件。场景三想手动整理批量修改标签表格视图里勾选几十份文档一次性改标签、改类型。适合刚导入一批没来得及分类的收尾工作。整理完成后可以用存储路径功能把它们分到不同文件夹里逻辑上和你在电脑里建目录是一个感觉。表格视图支持批量勾选和批量编辑元数据让它更懂你定制与自动化如果你希望同一类文档自动打上同一个标签去工作流Workflow里建一条规则触发条件选文档添加完成条件里写标题包含发票动作选自动分配标签、自动改标题。以后每来一份发票都不用你动手。工作流编辑器左边配触发条件右边配执行动作如果你希望邮件里的附件自动入库在设置里配一个 IMAP 邮箱和几条抓取规则系统会定时拉取邮件、下载附件、按规则打标处理完还能帮你把邮件标已读。如果你希望记录系统预设字段之外的信息比如合同金额、保险到期日用自定义字段加一列支持文本、数字、日期、布尔、日期区间等类型加了列之后就能像普通字段一样参与筛选。踩过的坑帮你避我把文件扔进 consume 目录了但页面一直没有新文档。原因是目录对不上——你放文件的路径和 compose 文件里挂载的consume路径不是同一个。改挂载路径指向你实际放文件的那个文件夹重启容器就好。目录确认没错文件只在容器启动时出现一次之后新增的不被处理。这是文件监听在某些网络盘/挂载盘上失效导致的。在环境变量里设置PAPERLESS_CONSUMER_POLL_INTERVAL改成定时轮询问题消失。OCR 出来的中文识别率差日志里还有 OCR failed 警告。原因是容器里缺对应语言包。在环境配置里把 OCR 语言设成engchi_sim或你需要的组合重建容器后重新消费文档即可。浏览器访问页面总是跳到/admin。这是旧版 Paperless 残留的浏览器缓存重定向清一下这个站点的缓存就正常了。往外延伸REST API完整的接口支持上传、搜索、批量管理文档入口在/api/schema/view/说明见 docs/api.md。插件机制消费流程支持插入自定义插件比如按条形码拆分多页文档接口定义在 src/documents/plugins/。多用户与权限内置按文档、按对象的细粒度权限适合和家人或小团队共用一套系统文档见 docs/administration.md。移动端界面是响应式的手机上浏览和搜索体验完整。移动端界面同样的搜索和文档列表单手可操作从一个晚上开始回到开头那沓账单。你不需要一口气数字化十年文件先做今晚能完成的那一小步把最近一个月最常用、最乱的那五六份文件扫进手机扔进 consume 目录第二天早上打开http://127.0.0.1:8000搜一个你记得的词——搜得到的那一刻less paper 就不只是一句口号了。【免费下载链接】paperless-ngxA community-supported supercharged document management system: scan, index and archive all your documents项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ngx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表