ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

abogen:把 EPUB、PDF 一键转成带同步字幕的有声书

abogen:把 EPUB、PDF 一键转成带同步字幕的有声书 abogen把 EPUB、PDF 一键转成带同步字幕的有声书【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen如果你想过把手头一堆文档变成通勤路上能听的东西大概率被三件事劝退过手动抠文本、找 TTS 工具朗读、再单独做一遍字幕。abogen 是一个免费开源的文本转语音工具能把 EPUB、PDF、纯文本、Markdown 和字幕文件直接转成时间轴精确对齐字幕的有声书。图Web 界面仪表盘展示有声书转换的上传、任务队列与进度abogen 是什么文档转有声书工具abogen 面向想把可读文档变成可听内容的用户跨 Windows、macOS、Linux提供桌面版和 Web 版两个界面把文档解析、语音合成、字幕生成三步一次做完。核心能力支持 EPUB、PDF、TXT、MD 以及 SRT、ASS、VTT 字幕文件共 7 类输入格式音频可导出 WAV、FLAC、MP3、OPUS 和带章节的 M4B 五种格式字幕与音频同一次生成样式从整行、整句到逐词可选Web 版额外支持 Supertonic 合成引擎、LLM 文本规范和 Audiobookshelf 集成它是怎么工作的解析、合成、导出三步流水线整个流程像一条装配线。第一步book_parser.py把文档拆开按章节切分保留标题、封面等元数据。第二步文本经过规范化处理决定数字、日期、缩写该怎么读。第三步合成引擎逐句朗读并记录时间信息最后由exporters.py把音频和字幕打包成选定的格式。合成引擎藏在tts_plugin/插件接口后面目前内置 Kokoro-82M 和 Supertonic 两款换引擎不用改主流程。几个值得看的功能混音、队列与字幕语音混合器—— 把多个声音模型按权重混合出新声音先试听再保存为配置之后随时复用队列批量处理—— 一次加入多个文件排队转换每个文件保留加入时的设置挂着跑完即可章节标记与元数据—— 转换 EPUB/PDF 时自动按章拆分并把标题、作者、封面写进 M4B播放器可直接识别章节时间戳文本支持—— 文本里已含 HH:MM:SS 时间码时可按时间点朗读适合需要精确节奏的解说稿图语音混合器中调整各声音权重预览并保存混合后的新声音图队列管理器中把多个文件加入队列批量转换有声书用在什么场景通勤、播客与批量制作学生把学期讲义 EPUB 按章节转成带字幕的音频通勤时听出错只需重跑那一章技术博主把博客 Markdown 转成播客导出 MP3 配 SRT 字幕直接传到视频平台小团队用 Docker 部署 Web 版批量转换培训文档完成后一键推送进 Audiobookshelf 书库相比手动提取文本 单独 TTS 工具 手工压字幕的传统做法abogen 有出处的差异是输入格式一次覆盖 EPUB、PDF、TXT、MD、SRT、ASS、VTT无需先转格式字幕时间轴来自合成时的时间戳与音频天然同步逐词级样式目前仅限英语性能参考RTX 2060 Mobile 笔记本 GPU 上约 3000 字符文本 11 秒生成约 3 分 28 秒音频语言覆盖美/英英语、西班牙语、法语、印地语、意大利语、日语、中文共 9 种批量任务各自保存设置也可用当前主窗口设置统一覆盖队列上手与参与装完后的第一个转换任务先装系统依赖 espeak-ng再安装 abogenpip install abogenNVIDIA GPU 用户可用 uv 加 CUDA 参数安装启动桌面版abogen想用 Web 版则运行 abogen-web浏览器打开 8808 端口拖入文档选声音、语速、字幕样式和输出格式点开始开发文档见 docs/遇到 bug 可在项目 issues 页反馈改代码则 fork 仓库后提交 PRabogen 把文档变有声书从三步流程压成一次转换路线图里还列着扫描版 PDF 的 OCR 支持和界面多语言化装完跑一本自己的书试试就知道了。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表