ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Dolphin-1.5 量化部署指南:文档解析提速 20 倍,显存只要 1.9GB

Dolphin-1.5 量化部署指南:文档解析提速 20 倍,显存只要 1.9GB Dolphin-1.5 量化部署指南文档解析提速 20 倍显存只要 1.9GB【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/DolphinDolphin-1.5 是字节跳动出品的 0.3B 参数轻量级文档解析模型量化部署后解析一页 PDF 仅需约 1.4 秒显存占用降到 1.9GB低配 NVIDIA 显卡也能稳定跑起专业级文档解析。 先看实测1.4 秒/页、1.9GB 显存的解析效果数字先行。用 TensorRT-LLM英伟达的高性能推理框架做完 INT8 量化后Dolphin-1.5 解析一页 PDF 只要约 1.4 秒显存占用 1.9GB。同样的任务原生 PyTorch 需要 28.6 秒——时间被压缩到约二十分之一一杯咖啡还没凉一页文档已经拆完。量化省下的不只是时间下面这张解析出来的表格连同正文与公式都来自真实推理输出。3 分钟看懂 Dolphin-1.50.3B 参数与两阶段解析架构Dolphin 的全称是 Document Image Parsing via Heterogeneous Anchor Prompting由字节跳动发布参数量只有 0.3B 左右比多数主流大语言模型小几十上百倍。它的核心是一套先分析、再解析的两阶段流水线页面级布局分析先扫描整页按自然阅读顺序生成元素序列标题、正文、公式、表格……元素级并行解析各元素并行处理用异构锚点给元素打标记再配合任务专属提示词判断它该被解析成什么。Dolphin-1.5 对这套流水线做了全面打磨文本解析错误率降低 26%公式识别准确率提升 19%表格结构恢复分数提高 13%。模型又小又准正是低配硬件愿意接住它的原因。两条路线怎么选TensorRT-LLM 与 vLLM 对比结论先说追极致速度、能等引擎构建选路线 ATensorRT-LLM想十分钟跑起来选路线 BvLLM。关键差异如下对比维度路线 ATensorRT-LLM路线 BvLLM量化方案INT8 权重量化AWQ INT4每页耗时1.4 s1.8 s显存占用1.9 GB2.1 GB上手成本需构建引擎首次较慢装好插件一条命令启动一句话理解量化位宽INT8 是把权重从 16 位压到 8 位体积砍半INT4 再砍一刀。代价是精度有小幅回落后面的数据表里细说。⚡ 路线 ATensorRT-LLM 三步完成 INT8 量化部署可以把 TensorRT-LLM 理解成把模型编译成专属你显卡的高速引擎然后直接跑。三步走第一步装依赖、拉模型环境要求Ubuntu 20.04 及以上其他 Linux 发行版亦可、Python 3.8~3.10、NVIDIA 显卡 ≥4GB 显存。先克隆仓库并安装 依赖清单git clone https://gitcode.com/GitHub_Trending/dolphin33/Dolphin cd Dolphin pip install -r requirements.txt再把模型权重约 1.2GB拉到./hf_modelgit lfs install git clone https://huggingface.co/ByteDance/Dolphin-1.5 ./hf_model第二步脚本一键完成权重转换与引擎构建pip install tensorrt_llm0.18.1 bash deployment/tensorrt_llm/convert_dolphin.sh转换脚本 会依次自动完成三件事Hugging Face 权重格式转换、TensorRT 引擎构建、INT8 量化参数优化。首次构建稍慢产物统一落在tmp/trt_engines/下。第三步启动推理服务python deployment/tensorrt_llm/api_server.py \ --hf_model_dir ./hf_model \ --visual_engine_dir tmp/trt_engines/Dolphin/vision_encoder \ --llm_engine_dir tmp/trt_engines/Dolphin/1-gpu/bfloat16 \ --max_batch_size 8--visual_engine_dir与--llm_engine_dir分别指向视觉编码器和 LLM 主体两个引擎--max_batch_size 8表示服务每轮并行处理 8 页。速度收益来自 INT8 权重量化、层融合、动态批处理与显存优化管理四件套。路线 B一行命令启动 vLLM AWQ INT4 服务vLLM 是开源的高吞吐推理引擎搭配官方插件即可直接加载 Dolphinpip install vllm0.9.0 vllm-dolphin0.1随后以 AWQ INT4 量化启动AWQ 是一种 INT4 量化方案权重按每值 4 位压缩显存更省python deployment/vllm/api_server.py \ --model ./hf_model \ --hf-overrides {architectures: [DolphinForConditionalGeneration]} \ --tensor-parallel-size 1 \ --quantization awq \ --max-num-batched-tokens 4096参数逐个过一遍--hf-overrides显式告诉 vLLM 模型架构是DolphinForConditionalGeneration少了它可能被误认--tensor-parallel-size 1表示单卡推理张量并行就是把模型切到多张卡上算--quantization awq打开 INT4 量化--max-num-batched-tokens 4096限制每轮调度的 token 预算。速度、显存与精度的平衡四种方案实测对比部署方案平均每页耗时显存占用精度保持率原生 PyTorch28.6 s8.7 GB100%vLLM FP164.2 s5.3 GB99.2%vLLM AWQ INT41.8 s2.1 GB96.5%TensorRT-LLM INT81.4 s1.9 GB95.8%怎么读这张表量化位宽越激进显存大致减半精度只掉几个百分点。对批量数字化、归档入库这类场景95% 以上的精度保持率完全够用若是不能出错的正式文档建议先用 BF16 或 FP16 跑一轮打底确认质量再换量化引擎上量。批量跑起来页面级与元素级命令示例服务起来之后仓库里的两个脚本就能批量干活。页面级整页解析适合完整 PDFpython demo_page.py --model_path ./hf_model --input_path ./demo/page_imgs --save_dir ./results --max_batch_size 8元素级单独解析某类元素例如只处理表格适合精细化任务python demo_element.py --model_path ./hf_model --input_path ./demo/element_imgs --element_type table --save_dir ./results --max_batch_size 16--element_type可换成其他元素类型--max_batch_size是并发上限显存吃紧就调小。⚠️ 踩坑自救显存不足与精度下降的解法报显存不足OOM时降并发把--max_batch_size 8改为--max_batch_size 4换 INT4vLLM 启动时保留--quantization awq拆卡分摊--tensor-parallel-size 2让两张卡一起扛模型。解析精度明显下降时量化方案改回 BF16精度优先、速度让位生成参数加--temperature 0.0让输出稳定不漂移把权重更新到最新的 Dolphin-1.5 版本。一句话收尾4GB 显存、1.4 秒一页、95% 以上的精度保持——Dolphin-1.5 的量化部署已经把专业级文档解析从高配专属变成了个人与小团队够得着的日常工具。更多架构细节与更新说明见仓库里的 README 与 中文文档。【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表