ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

BabelDOC 高级配置:PDF 文档翻译实战手册

BabelDOC 高级配置:PDF 文档翻译实战手册 BabelDOC 高级配置PDF 文档翻译实战手册【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOCBabelDOC 是一个 PDF 文档翻译工具一次运行能同时产出双语版和单语版。本文写给已经会用基础命令的人从最烦人的输出打不开讲起把常用的高级参数整理成五个场景文末附速查表。翻译后的 PDF 打不开、显示乱掉这种情况多半是输出结构处理得过于激进换了个阅读器就出问题。BabelDOC 有三个开关各自对应一种毛病。--skip-clean跳过清理步骤也就是不移除未用资源、不压缩字体文件会大一点但老版本阅读器更宽容。--dual-translate-first把双语输出里的译文页排到原文页前面想原文和译文页交替出现的话另有--use-alternating-pages-dual。--disable-rich-text-translate让翻译请求不再携带加粗这类格式标记代价是译文里也丢不掉原有的加粗。参数改变什么什么时候开--skip-clean不做字体压缩和冗余资源清理老阅读器报错、要保留原始结构--dual-translate-first双语 PDF 译文页在前先读译文的工作习惯--disable-rich-text-translate翻译时不保留富文本格式某些阅读器显示乱码--enhance-compatibility上面三项一次全开不想逐个试babeldoc --files paper.pdf --openai -k your-key --enhance-compatibility只开一项能解决就别三项全开尤其 skip-clean 会让文件明显变大。扫描版 PDF 翻译怎么才清楚黑白扫描件的原文压在扫描底图上看译文直接盖上去会糊成一片。--ocr-workaround帮助文本里明确标注 experimental给每个字符补一块背景填充先把旧字擦掉再落新字。它一旦打开会自动连带--skip-scanned-detection和--disable-rich-text-translate一起生效不用手动补。还有一个--auto-enable-ocr-workaround先跑内置的扫描检测判断确实是重度扫描件才自动切换成上面的 workaround并跳过后续检测。手头文件多、又说不清哪些是扫描件时用它。babeldoc --files scan.pdf --openai -k your-key --ocr-workaround注意这只是显示层补丁扫描件本身没有文本层的话它帮不上忙得先 OCR 出文本再进翻译流程。本地模型翻译接上自己的端点任何说 OpenAI 协议的端点都能接默认模型是gpt-4o-mini。指向 Ollama 或 vLLM 这类本地服务只改地址babeldoc --files paper.pdf --openai --openai-base-url http://localhost:11434/v1 \ --openai-api-key ollama --openai-model llama3.1两个机制防止小服务被打爆。一是限流请求过一道漏桶阀门把突发摊成匀速水流--qps默认 4决定每秒放几个--pool-max-workers控制内部线程数默认和 QPS 同值一般不用动。二是缓存结果存进本地 SQLite 库键里含模型、提示词和原文同一段再遇到直接返回不发请求想强制重翻就加--ignore-cache。服务端限流时会自动指数退避重试最多 100 次每次等待上限 15 秒日志里刷 RATE_LIMITED 就等它自己过去。另外温度恒为 0同样输入必出同样译文风格不满意可以用--custom-system-prompt覆盖系统提示词。BabelDOC 术语表专业词不再忽前忽后长文档里同一个术语前后被翻成两种说法。两层防线。第一层是手写 CSV表头固定source,target,tgt_lng最后一列可省填了就只在目标语言匹配时生效。多个文件用逗号串进--glossary-files。匹配大小写不敏感且优先取最长命中所以 Machine Learning 和 machine learning 落进文本都吃同一条。第二层是自动提取默认开着。翻译过程中另一个模型默认与翻译模型相同可用--openai-term-extraction-model单独指定从段落里挑高频术语及其译法去重累积同一个词出现多种译法时取票数最多的一种。加--save-auto-extracted-glossary结果会以 CSV 落在输出目录审一遍就能进下一轮的手写表。手写条目始终占优先不会被自动结果覆盖。babeldoc --files paper.pdf --openai -k your-key \ --glossary-files terms.csv,acronyms.csv --save-auto-extracted-glossary大文件 PDF 翻译又慢又贵怎么办四个参数。--pages短参-p接受1-5,20-这类区间只翻需要的页是最直接的省钱手段。--skip-scanned-detection跳过扫描检测500 页的非扫描文件能省掉一轮检测。--max-pages-per-part把文档按页数切成几段分块翻译不设就不切。切段翻译时自动提取的术语在段间共享前后段用词不会打架。--watermark-output-mode控制输出默认 watermarked 带水印no_watermark 只出干净版both 两份都要旧的--no-watermark已弃用用新参数。译文字体不满意时--primary-font-family可强制 serif、sans-serif 或 script默认按原文自动选一般不用碰。babeldoc --files book.pdf --openai -k your-key --max-pages-per-part 100 \ --skip-scanned-detection --watermark-output-mode no_watermark高频参数速查参数默认值管什么--qps4翻译请求的每秒上限--openai-modelgpt-4o-mini翻译模型名--watermark-output-modewatermarked输出水印版 / 无水印 / 两者--min-text-length5短于该字符数的文本不发翻译--pool-max-workers同 QPS内部线程池大小--pages全部页只翻译指定页码区间这些参数不必背。出问题先判断属于上面五个场景里的哪一个再回这张表查拿不准就带上--debug跑一遍日志会告诉你大多数答案。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表