
如何把 EPUB 变成带同步字幕的有声书abogen 完整上手指南【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen把一本 200 页的 EPUB 拖进 abogen这款开源有声书生成工具会在几分钟后吐出一份带章节、带同步字幕的 M4B 音频整个过程不用手动剪辑任何一段声音。它基于 Kokoro-82M 语音合成模型把 EPUB、PDF、纯文本、Markdown 以及字幕文件读成自然语音同时生成与发音逐句对齐的字幕也支持 GPU 加速让长文档的批量 TTS 转换不必等太久。abogen 是什么把文档读成有声书这一节回答它到底能干什么。abogen 把一份电子文档转成可听、可看字幕的有声书文件输入是ePub、PDF、.txt、.md、.srt、.ass、.vtt输出是带同步字幕的音频格式可选 WAV、FLAC、MP3、OPUS以及带章节标记的 M4B。它提供两套界面——桌面应用abogenPyQt6和 Web 界面abogen-webFlask默认端口 8808后者额外带 Supertonic TTS、LLM 文本标准化和 Audiobookshelf 集成。 部署方式对比Windows、Linux、macOS、Docker这一节解决装到不同系统上要敲哪些命令。四条路线并列如下核心差别只在 espeak-ng 这个发音引擎的来源以及 GPU 加速包的不同。平台前置依赖安装命令启动方式Windowsespeak-ng下载.msi安装uv tool install --python 3.12 abogen[cuda]或双击WINDOWS_INSTALL.bat自动装全部环境abogenLinuxsudo apt install espeak-ngDebian/Ubuntuuv tool install --python 3.12 abogenAMD 卡改用abogen[rocm]abogen/abogen-webmacOSbrew install espeak-nguv tool install --python 3.13 abogenApple 芯片或--python 3.12Intelabogen/abogen-webDockerDockerdocker build -t abogen .再用docker run挂卷并映射 8808 端口http://localhost:8808Docker 路线适合固定环境或团队共用上传文件落在/data/uploads产物落在/data/outputsdocker build -t abogen . docker run --rm -p 8808:8808 -v ~/abogen-data:/data --name abogen abogen注意 Python 版本需落在 3.10–3.12 区间uv安装时用--python参数显式指定即可。一次完整转换从文档到带字幕的有声书这一节带你走一遍真实流程而不是罗列功能开关。拿到文件后把它拖进输入框或在 Web 界面用上传按钮EPUB/PDF/Markdown 会被先转成带章节标记的文本并缓存在本地。接着在配置区做四件事设语速、选音色或加载一个混音 profile、定字幕粒度、选输出格式与保存位置。音色用语言码 性别码两个字母表示例如a是美式英语、b是英式英语、e是西班牙语、f是法语、p是巴西葡萄牙语、z是普通话第二字母m/f代表男女声。点开始后后台按章节合成、拼接并写出字幕任务完成即可在队列里下载音频与字幕两份文件。核心参数速查这一节把最常调的几项整理成表方便配置时对照。参数取值 / 可选值默认说明语速 Speed0.1x–2.0x1.0x过高过低都会让语音变形正常语速听感最稳音色 Voice语言码 m/f—如am美式男声、bf英式女声字幕粒度Off / Line / Sentence / SentenceComma / SentenceHighlight / 1–3 wordsSentence词级1–3 words仅英语可用字幕输出格式SRT / ASS宽/窄/居中宽/居中窄SRT配视频用 ASS 更贴合音频格式WAV / FLAC / MP3 / OPUS / M4B—M4B 带章节OPUS 压缩比最高WAV 保真章节间静音秒0合并版里各章之间的停顿时长 进阶能力按需打开以下能力默认不占主流程需要时再启用。如果你要批量处理多份文件用队列模式把.txt与字幕文件直接拖进队列列表EPUB/PDF/Markdown 从主窗口点Add to Queue。每个文件保留加入时的配置勾选Override item settings with current selection可让整队统一套用当前主窗口参数。如果你想要一个独属音色打开 Voice Mixer给多个语音模型分配权重、试听后存成 profile下次直接调用。如果你要 GPU 加速装对应 CUDA 版本即可NVIDIA 卡在 Windows/Linux 用abogen[cuda]旧驱动换[cuda126]新驱动换[cuda130]AMD 卡只能在 Linux 上用abogen[rocm]Windows 不支持。如果你要按章节拆分、或出错时只重转某一章靠章节标记CHAPTER_MARKER:章节标题处理 EPUB/PDF/Markdown 时它会自动生成纯文本可手动写入。如果你需要精确控制每段何时开口用时间戳文本HH:MM:SS或带毫秒此时字幕粒度设置会被忽略。如果要把成品推到播放库M4B 支持写入元数据标签Web 界面还能直连 Audiobookshelf。常见现象与排查这一节合并了报错与性能问题统一按现象 → 原因 → 解法给出避免逐条问答。现象启动提示CUDA GPU is not available. Using CPU。原因PyTorch 没匹配到 GPU 版本回退到 CPUWindows 上只支持 NVIDIAAMD 需 Linux ROCm。解法按驱动重装对应 CUDA 的 torch或用uv换装abogen[cuda126]/abogen[cuda130]CPU 也能跑只是更慢。现象Linux 提示abogen-cli is installed in ~/.local/bin which is not on PATH。原因安装目录没进 PATH。解法把~/.local/bin追加进~/.bashrc并source生效。现象安装时报No matching distribution found。原因当前 Python 不在 3.10–3.12 区间。解法换用支持的版本或用uv tool install --python 3.12 abogen让 uv 自行管理版本。现象Windows 报[WinError 1114] A dynamic link library (DLL) initialization routine failed。原因torch 与 CUDA 环境不匹配常见于无 GPU 的虚拟机。解法用--force-reinstall装与驱动匹配的cu128版 torch。现象非英语下词级字幕1–3 words不生效。原因Kokoro 只为英语提供时间戳 token。解法其他语言改用句级或逗号级字幕模式。现象日语没有声音。原因Kokoro 的日语需要额外依赖。解法安装日语对应的文本处理依赖后再试。参考目录源码位于 abogen/桌面与 Web 两套界面、TTS 插件架构abogen/tts_plugin/与内置的 kokoro、supertonic 插件都在其中上手与架构细节见 docs/。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考