ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Ebook2Audiobook 完整上手:把 EPUB 转成有声书,AI 语音合成与语音克隆怎么调不踩坑

Ebook2Audiobook 完整上手:把 EPUB 转成有声书,AI 语音合成与语音克隆怎么调不踩坑 Ebook2Audiobook 完整上手把 EPUB 转成有声书AI 语音合成与语音克隆怎么调不踩坑【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook睡前想把一本几百页的小说听完却没人替你读Ebook2Audiobook 能把你的 EPUB、MOBI 电子书转成有声书用 AI 语音合成朗读还能用语音克隆让你的声音亲自出场覆盖 1158 种语言。它自带章节检测和完整元数据产物是一个能直接丢进播放器或 Audiobookshelf 的 m4b 文件。下面的写法按你想要什么来组织跟着做就能跑起来也尽量帮你绕开常见的坑。一分钟跑起来克隆仓库并启动如果你的机器还没装过只需两步把仓库克隆下来然后跑一次启动脚本。脚本会自己装好 Python 环境和依赖ffmpeg、calibre、tesseract 等再打开浏览器进入http://localhost:7860/。git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook ./ebook2audiobook.shWindows 上改成双击ebook2audiobook.cmd。如果第一次启动后脚本中断过记得刷新一下网页让它重新连上新的连接。你不需要手动建虚拟环境也不需要单独装库——这些都被启动脚本兜底了。场景一转——把一本 EPUB 小说变成能直接听的有声书你会先得到什么一个带章节、带封面元数据的 m4b 有声书文件浏览器里就能试听、直接下载。产物默认是单声道 m4b想要 mp3、wav、flac 也可以在输出格式里换。最小操作步骤在输入区拖入你的.epub选好语言默认是英语eng也可以填spa、fra、deu这类 ISO 代码处理器有卡就选 GPU、没卡就选 CPU点 Convert。如果这本书本身结构清晰它会自动把章节切好、给每个片段配音再拼回一整个文件。一个现实提醒EPUB 没有统一的什么是章节、什么是正文标准所以书里那些你不想被读出来的部分目录、版权页、译者注最好先手动删掉再转效果会干净很多。如果你的电子书是 PDF 或图片扫描件它还能走 OCR 识别文字。场景二克隆——用你自己的声音朗读这本书你会先得到什么整本书用你的声音读出来。你只需要上传一段人声样本工具会把它当成参考音色用 AI 语音合成复刻出你的声线。最小操作步骤上传一段干净的录音作为克隆样本——README 建议 1~5 分钟左右录音里有背景噪音或音乐也没关系它会自动做去噪清理。选好语言后命令行里带上--voice 你的声音.wav或在图形界面里把声音文件拖进 Cloning Voice 上传框即可。条件句帮你省点事如果你只有一小段、且是主要语种用 24000Hz 的 wav小语种用 22050Hz 更稳。如果你手头有自己训练好的 XTTS 模型也可以直接上传那个模型包它的ref.wav会被当作本次的发音人。场景三批量——一次转一整本 / 一整个目录你会先得到什么把一整个文件夹里的电子书排队转完每本各自出一个音频文件不用一本一本手动点。最小操作步骤用--ebooks_dir指向装书的目录其余参数照常./ebook2audiobook.sh --headless --ebooks_dir ./mybooks --language eng它会把目录里受支持的文件按自然排序逐本处理不认得的后缀会被跳过并提示。如果你希望目录里每本书用不同声音再配一个--voice_map的 JSON 文件把书 → 声音对应起来即可没写到的书会回退到--voice指定的默认声音。适合个人数字图书馆整理、机构批量做资源。参数调优与避坑遇到什么问题该怎么调别把所有旋钮都拧一遍真正影响听感的就这几个。默认引擎是 XTTS下面是听到什么 → 调哪里的对照听起来很平、很机械→ 把 Temperature 调高一点点默认 0.75 左右声音会更有起伏、更不像念经。反过来想更稳定、更单调可预测就调低。出现重复、口吃、来回绕同一句→ 把 Repetition Penalty 调高界面里常见 2.5默认 2.0专门压制重复。语速太慢或太赶→ 用 Speed范围大约 0.5 到 3 倍通勤想赶进度就往上拉。长文本卡顿、想更省资源→ 打开 Enable Text Splitting把长句拆成小块生成官方也提示它对特别长的输入更友好但代价是效率一般按需开。另外 Top-k / Top-p 这两个采样参数调低能出更安全的词、生成也更快默认 top_k40、top_p0.95追求速度再往下压。改参数前先听一小段别一次动好几个。能力边界与门槛格式与硬件吃什么格式epub、mobi、azw3、fb2、pdf、txt、rtf、docx、html、odt还有图片类可走 OCR等一大批想要最准的自动章节识别优先 epub 或 mobi。产物是 m4b、mp3、wav、flac 等默认单声道 m4b。最低与推荐配置内存 2GB 起步、8GB 更从容显存 1GB 起步、4GB 推荐。CPU 也能跑但现代引擎在 CPU 上很慢——如果你的机器没 GPU可以换 YourTTS、Tacotron2 这类更轻的引擎牺牲一点拟真换速度有 CUDA 显卡则能接近实时转换。设备支持 CPU / CUDA / MPS / ROCm / XPU / Jetson。两条边界先说清只处理非 DRM、合法获取的电子书语言代码用 ISO-639-3如eng、fra或两位的 ISO-639-1如en、fr都行默认eng。更多引擎和预设可以在 模型配置 里看到示例书在 示例目录 下。收尾Ebook2Audiobook 的价值在于从一本 epub 到一个能直接听、能批量、还能用你自己声音读出声的有声书中间几乎没有门槛。现在就把你想听的那本书拖进去点一下 Convert——有声书正在生成。【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表