ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

novel-downloader小说下载器:油猴脚本一键批量离线保存全网小说

novel-downloader小说下载器:油猴脚本一键批量离线保存全网小说 novel-downloader小说下载器油猴脚本一键批量离线保存全网小说【免费下载链接】novel-downloader一个可扩展的通用型小说下载器。项目地址: https://gitcode.com/gh_mirrors/no/novel-downloader追了三年小说的目录页某个晚上点进去只剩一行灰字内容已删除。你截图存过几章备忘录里躺着半卷摘抄但剩下的两三百章从此只存在于别人剧透的碎片里。novel-downloader 是一款可扩展的通用型油猴脚本能在支持的小说网站上把整本书的章节解析下来自动打包成 TXT 和 EPUB 存到本地——断网、删书、平台整改都不影响你继续读下去。它为什么专门给会消失的书做下载先说清楚这个工具想解决什么。起点、晋江、SF 这类站点上的书经常毫无征兆地整本下架哪怕你已经买断入 V更可惜的是那些不够热、没人转载的作品原站一删互联网上就只剩空白。novel-downloader 出自404 小说文库项目除了把书存进你自己的硬盘还会在你同意的情况下把书籍详情页与目录页存档到互联网档案馆给删库时刻多留一份备份。真正让它跑得快的是模块化设计每个站点一套独立解析规则全部放在 src/rules/ 目录下按页面结构分成四类。新增一个网站只是往对应文件夹里放一个新规则文件路由和匹配表登记一下就行。规则类型目录适配的页面形态单页onePage/章节内容一页给全双页twoPage/目录页与正文页分离多索引页onePageWithMultiIndexPage/目录本身还要翻页加载特殊站点special/有登录墙、字体反爬等定制逻辑小说目录页是脚本解析的入口封面、简介、章节导航都在这一页上被识别3分钟装好脚本管理器加一次构建装脚本分两步。先给浏览器装一个用户脚本管理器——Tampermonkey、Violentmonkey、Greasemonkey 任选其一然后把脚本文件拖进管理器安装。想自己构建最新代码的话三条命令的事git clone https://gitcode.com/gh_mirrors/no/novel-downloader cd novel-downloader yarn install yarn build构建完成后把生成的 dist/bundle.user.js 拖进脚本管理器即可。验证是否装好打开任意支持网站的目录页页面右上角出现下载图标就说明它已经活了。从目录页到 TXTEPUB 双格式文件之后的流程简单到可以闭眼操作打开小说目录页点右上角下载图标脚本自动解析整本书的章节结构逐章抓取正文与插图结束后自动保存一份 TXT 和一份 EPUB。进度看右下角进度条或者按 F12 在控制台里盯详细日志。小贴士脚本下载期间会播放一段无声音频用来防止浏览器把后台标签页休眠中断任务属正常现象不是出错。两点需要提前知道TXT 用任何文本编辑器或阅读软件都能打开EPUB 丢进阅读器即可。至于付费章节未登录或未购买的会被自动跳过——这是有意设计不是 bug。批量下载进行中上方是章节列表与隐藏章节识别下方是逐章下载日志底部是正在生成的 ZIP 与 TXT 文件注意要下付费章节先登录对应网站的账号并确认已购买未购章节一律跳过请走正规渠道获取。一行筛选函数圈定只想下载的范围上千章的长篇一口气全下既慢又容易中途失败。按 F12在 window 下定义 chapterFilter就能精准圈选——只下前 100 章function chapterFilter(chapter) { return chapter.chapterNumber 100; }换条件即可按卷筛chapter.sectionNumber 1、按标题关键词筛chapter.chapterName.includes(武器)。想进一步掌控输出就在 window 下定义 saveOptions 对象改写章节标题成第x章 xxx、调段落缩进与行距、删掉 EPUB 里的空行冗余甚至让章节倒序排列。下载完想自动关页面再定义一个 customFinishCallback生成文件后脚本会自己调用它收尾。下载完成的 TXT 文件卷、章标题与正文段落完整保留可直接阅读或二次编辑常见坑Lofter 这类插图密集的博客会把图片一并下载注意浏览器内存约 800MB 上限建议用筛选函数分批执行。图文混合的章节它用三层解码硬扛有些站比如西瓜书屋怕被抓直接把正文文字替换成图片。novel-downloader 对这种情况内置了一套由快到准的三步解码方案相关实现集中在 src/lib/decoders/ 目录文件名映射先按图片文件名直接匹配文字速度最快哈希映射对不上就下载图片算哈希来匹配同样很快OCR 识别前两步都失败才启用 PaddleOCR 中文模型准确率最高但最慢。小贴士文件名与哈希映射表、OCR 模型首次使用时自动下载并缓存在脚本管理器本地存储中之后不再重复下载。卡住、乱码、限速三个高频坑的排查路径遇到状况别慌按这个顺序查。卡住先在设置里开启调试模式生成的 ZIP 包里就带着 debug.log这是第一手资料还没生成文件就卡死的话启用测试视图把日志选项卡整段复制出来排查。乱码多半是站点用了自定义字体日志里会有以 [jjwxc-font] 或 [fanqie-font] 开头的提示照提示补字体匹配即可。限速长佩这类反爬严格的站点每分钟只放行约 6 章耐心等就好别多开页面硬刚。小贴士并行下载线程数设 3~5 比较稳反爬严格的站点降到 1~2并把下载间隔调大。从用户到贡献者写一条规则的完整路径这个项目的势力版图还在持续扩张而扩张的门槛比想象中低。流程四步继承 BaseRuleClass 类实现 bookParse 与 chapterParse 两个方法在 src/router/download.ts 注册路由再往 src/header.json 的 match 字段登记匹配规则最后 yarn build 出新的 bundle.user.js。本地调试用 yarn dev会起一个本地代理脚本改一行代码就能在浏览器里立刻看到效果。项目对规则实现的要求是小而专优先写贴合目标站点的最小规则抓真实页面结构而不是猜选择器tools/dev/scrape-dom.mjs 可以帮你导出页面 DOM。写一条新站点规则、补一条字体映射、回答一个 issue都是实打实的开源贡献。现在打开你的脚本管理器装好 novel-downloader挑一本你最怕它消失的书把它带离那个随时会 404 的网页。合规提醒请只下载你已购买或合法获取的内容尊重创作者的劳动成果通过正规渠道支持正版同时控制下载频率避免对目标站点造成过大访问压力。【免费下载链接】novel-downloader一个可扩展的通用型小说下载器。项目地址: https://gitcode.com/gh_mirrors/no/novel-downloader创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表