ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

abogen:免费开源的 AI 有声书生成工具,把电子书变成带字幕的音频

abogen:免费开源的 AI 有声书生成工具,把电子书变成带字幕的音频 abogen免费开源的 AI 有声书生成工具把电子书变成带字幕的音频【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen把一本 EPUB 拖进窗口选一个声音、点开始几分钟后就得到一份带同步字幕的音频文件——这正是 abogen 每天在干的事。它是一个免费、开源MIT 协议的 AI 有声书生成工具底层使用 Kokoro-82M 文本转语音模型跨 Windows、macOS 和 Linux 平台把 EPUB、PDF 和纯文本内容转成自然听感的朗读音频并生成与之逐句对位的字幕。三步完成安装并打开 abogen所有平台都依赖一个外部组件 espeak-ng这是 Kokoro 发音合成的一部分需要先单独装好Windows从 espeak-ng 官方 releases 下载并运行.msi安装包。macOSbrew install espeak-ng。Linuxsudo apt install espeak-ngArch 用pacman -SFedora 用dnf install。装好 espeak-ng 之后安装 abogen 本身分两种情况。Windows 用户最省事的路径下载仓库源码git clone https://gitcode.com/GitHub_Trending/ab/abogen或直接下载压缩包解压后双击WINDOWS_INSTALL.bat。脚本会在一个自包含的python_embedded目录里装齐全部依赖包括 CUDA 版的 PyTorch不需要你本机装 Python。其余平台用 pip 或 uvpip install abogen # 或uv tool install --python 3.12 abogen有 NVIDIA 显卡的话建议用带 CUDA 扩展的方式安装速度会明显更好uv tool install --python 3.12 abogen[cuda] --extra-index-url https://download.pytorch.org/whl/cu128 --index-strategy unsafe-best-match老驱动可换cuda126新驱动可试cuda130。第一次转换时会按需下载模型和语音文件之后如果想断网使用可以在菜单里通过Pre-download models and voices把资源全部预取下来再开启Disable Kokoros internet access。安装完成后有两条命令abogen打开桌面界面abogen-web打开 Web 界面浏览器访问http://localhost:8808。两者功能大体一致但 Web 端还额外提供 LLM 辅助文本标准化和 Audiobookshelf 直推集成相关实现可以看 abogen/webui/。第一次转换从文件到带字幕音频桌面端的核心流程就三步把文件拖进输入区也可以直接用内置文本编辑器写文本调整设置点 Start。输入侧支持 EPUB、PDF、TXT、Markdown 以及 SRT、ASS、VTT 字幕文件。输出侧有五档音频格式WAV、FLAC、MP3、OPUS压缩率最高和 M4B唯一带章节标记的格式。对 EPUB、PDF、Markdown 文件abogen 会先解析出章节结构转成带章节标记的文本缓存在本地点 Edit 改的就是这些缓存文件——这也意味着改一处文字后只需重跑对应章节不必整书重来。字幕是默认生成项粒度从整行、整句、按逗号断句到每 1 到 3 个单词一组逐级可选。字幕文件可存为 SRT或宽/窄、居中不居中的几种 ASS 样式。这里有一个已知限制单词级模式只对英语生效因为 Kokoro 只为英文提供词级时间戳其他语言走按时长估算的句级兜底。声音的选择用字母表示首字母是语言a 美式英语、b 英式英语、e 西班牙语、f 法语、h 印地语、i 意大利语、j 日语、p 巴西葡萄牙语、z 普通话第二个字母 m 或 f 表示男声女声。语速在 0.1x 到 2.0x 之间连续可调点 Voice preview 可以先试听再开工。章节之间的静音时长在菜单里单独设置。批量任务用队列模式处理把多个文件拖入主窗口后点Add to Queue或直接在队列管理器里添加文本和字幕文件。每个条目入队时保留当时的参数快照之后改动主窗口设置不会影响已排队的文件需要统一参数时勾选Override item settings with current selection让所有条目改用当前设置然后整批按序跑完。进阶实践调一个专属声音做一本带章节的 M4B用语音混合器合成自定义声音默认声音不满意时不必在列表里逐个试听。打开 Voice Mixer把两个甚至更多声音模型叠在一起拖动各自的权重滑块合成出来的音色是列表里不存在的组合。试听效果满意后存成一个 profile之后选声音时它和内置声音平级随时可取。给纯文本手动加章节和元数据对 EPUB、PDF 和 Markdown章节和封面都是自动处理的。对纯文本文件可以手写两类标记达到同样效果。在需要分割的位置写入CHAPTER_MARKER:章节标题abogen 检测到标记后会询问是否按章节分别存音频、是否再合并一个整本文件。M4B 元数据则写在文件开头METADATA_TITLE:书名 METADATA_ARTIST:作者 METADATA_COVER_PATH:path/to/cover.jpg标题、作者、年份、流派、封面等字段会写进生成的 M4B 文件有声书播放器里能直接显示封面和完整信息。EPUB、PDF 的封面 abogen 会替你自动提取并填入。还有一类隐藏玩法文本里每段前带HH:MM:SS时间戳的文件会被当成定时播报脚本每段文字严格按你给的时间点开口。常见问题的直接答案问题结论提示 CUDA GPU is not available, Using CPUWindows 只支持 NVIDIA 显卡AMD 卡需要 Linux 加 ROCm 才能加速不处理也能跑只是走 CPU、速度较慢。老显卡可换装 cuda126 版本的 PyTorch想要词级字幕非英语语言没有正常现象。词级时间戳只覆盖英语其他语言用整句/按逗号模式即可日语发音不可用通常缺日文依赖按 README 中的说明为 Kokoro 补装对应组件想彻底离线菜单里Pre-download models and voices选 Download all再启用Disable Kokoros internet access程序行为异常看不出原因命令行跑abogen-cli它会打印完整报错Windows 安装版在python_embedded/Scripts下运行abogen-cli.exe想在无视频的画面上看字幕用 MPV 播放音频字幕轨会正常显示README 附了一份推荐配置另外两个值得知道的事实单词级之外的句级字幕依赖标点切句英文文本里 Mr. 这类缩写可能被切错菜单里开启 spaCy 分段可以修正Web 端设置的 LLM 标准化只需指向任意 OpenAI 兼容端点本地 Ollama 即可由它来处理引号、缩略词这类棘手的文本。下一步可以读什么安装细节、测试方法和插件架构的完整说明都在 docs/ 里。语音解析、转换管线这些核心逻辑在 abogen/domain/如果只是想确认某个行为是不是 bug翻那里的实现比猜快。abogen 采用 MIT 协议Kokoro 采用 Apache-2.0两者都允许商用内置的 kokoro 与 supertonic 两个 TTS 插件位于 plugins/插件契约见 docs/tts-plugin-architecture.md。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表