
阅读笔记Ocean-OCRTowards General OCR Application via a Vision-Language ModelTL;DR这篇论文用LLaVA 式三件套NaViT 变长视觉编码器 MLP 投影器做 2×2 token 压缩 Qwen-2.5-3B配合大规模高质量 OCR 数据把一个 3B 的多模态大模型MLLM训练到在 DocVQA / TextVQA / ChartQA / OCRBench 等基准上达到同规模最优并号称首个超越专业 OCR 工具TextIn / PaddleOCR的 MLLM。核心证据是OCR 基准平均 84.7与真实场景文档抽取 / 场景文字 / 手写多指标领先同规模乃至 7B–8B 模型。主要 caveat无消融实验、238.2M 自有数据闭源、训练超参全缺、部分对比存在有利偏差如英文文档抽取 Edit Distance 实际略输 TextIn——优势无法干净归因到架构复现性低。1. 研究内容1.1 研究问题、痛点与动机研究问题能不能用一个中等规模3B的 MLLM 既保留通用推理能力又把 OCR文档 / 场景文字 / 手写做到专业 OCR 工具水平痛点现有 MLLM 在密集图像里的细粒度文字识别不行——通用 MLLMLLaVA / InternVL / Qwen2-VL虽支持高分辨率但对密集文本仍力不从心专门的 OCR-MLLMUReader / Monkey / TextMonkey / mPLUG-DocOwl / Vary / TextHawk2 / GOT-OCR靠裁剪、分块、token 压缩等手段提精度但仍达不到实用要求。动机 / 为什么重要OCR 是文档数字化、票据处理、医疗报告录入等真实场景的刚需专业 OCR 工具PaddleOCR / TextIn在中文长文档、手写等长尾上仍有短板。若 MLLM 能在统一框架内追平甚至超越专业 OCR就能用一个模型通吃识别 理解省去多套系统拼接。领域定位应用导向的系统构建类工作百川出品的技术报告处于 MLLM 与专业 OCR 的交叉点上游是 NaViT、LLaVA、Qwen2-VL 等基础件下游是文档理解 / 实用 OCR 应用。1.2 核心贡献提出Ocean-OCR-3B3B 参数 MLLM用 NaViT 支持任意分辨率输入在通用能力不丢的前提下把 OCR 做强在 DocVQA / TextVQA / ChartQA / OCRBench 等 OCR 基准上达同规模 SOTA平均 84.7在真实 OCR 场景双语文档抽取、场景文字、双语手写上超越 TextIn、PaddleOCR 等专业工具并胜过 Qwen2-VL-7B、MiniCPM-V2.6-8B 等更大模型论文自述评估贡献定位偏增量集成而非新范式——NaViT、MLP 投影器、2×2 压缩、三阶段训练都是已有件本文的主要增量是用大量高质量 OCR 数据把这些件组装到位。是否真为新范式取决于消融而论文未给见 4.1。1.3 相关工作脉络NaViT (原生变长 ViT)Dehghani et al., 2024Ocean-OCR (本文)Chen et al., 2025LLaVA (grid 分块)Liu et al., 2023Qwen2-VL (朴素动态分辨率)Wang et al., 2024UReader (形状自适应裁剪)Ye et al., 2023TextMonkey (patch 分块)Liu et al., 2024TextHawk2 (16× token 压缩)2024GOT-OCR (通用 OCR 理论)2024关键传承NaViTDehghani et al., 2024提供了原生变长分辨率的视觉编码器使 Ocean-OCR 不必像 LLaVA 那样把图硬塞固定网格LLaVA 的编码器 投影器 LLM三件套骨架被直接沿用Qwen2-VL 的朴素动态分辨率思路在此被 NaViT 正式落地。分歧与 UReader / TextMonkey 的硬裁剪 / patch 分块不同Ocean-OCR 不切割图像靠 NaViT 原生变长 简单 2×2 token 压缩控量与 TextHawk2 的 16× 复杂压缩、mPLUG-DocOwl 的 token 压缩相比本文只用最朴素的相邻 2×2 池化把复杂度让给数据而非压缩器设计。2. 方法概要方法路线系统构建模型架构 三阶段训练流水线 大规模数据工程关键假设显式高分辨率图的视觉 token 可经相邻 2×2 压缩而不丢 OCR 关键信息MLLM 范式足以承载专业 OCR 级精度隐式读者识别OCR 精度主要由数据规模与质量驱动而非架构创新2×2 池化对极小字号 / 密排文本无损——论文未在 limitation 里讨论这一假设数据 / 实验设置数据71.3M 公开 238.2M 自有样本纯文本 / caption / 交错 / OCR QA 多类评测通用 benchmarkMMMU、MMBench、MME、SEEDBench、MathVista、RealWorldQA、HallusionBench用 VLMEvalKit 零样本OCR benchmarkDocVQA、TextVQA、ChartQA、OCRBench真实场景自建集文档 100 英100 中、场景 260 张、手写多粒度双语对比对象≤4B 通用 MLLMMM1.5-3B、Qwen-2-VL-2B、InternVL-2.5-2B/4B、BlueLM-3B、Phi-3.5-Vision 等与专业 OCRTextIn、PaddleOCR、GOT训练目标三阶段统一用next token prediction loss仅算文本 token无辅助损失、无 OCR 专属损失整体处理流程鸟瞰Ocean-OCR 是经典 LLaVA 式三件套NaViT 视觉编码器 → MLP 投影器 → Qwen-2.5-3B。任意分辨率图像送入 NaViT按 patch 切分为变长视觉 token 序列MLP 投影器把这些 token 映射到 LLM 词嵌入空间并在空间上把相邻 2×2 token 压成单 token以控制高分辨率图的 token 量压缩后的视觉 token 与文本 token 拼接送入 Qwen-2.5-3B用 next token prediction 端到端训练。训练分三阶段递进——先冻结编码器与 LLM、只练投影器做模态对齐再全参数预训练一半纯文本一半图文最后监督微调增强指令跟随。2.1 架构图图为原文 Figure 2NaViT 编码器产出变长 token → MLP 投影器2×2 压缩→ Qwen-2.5-3B。三件套结构清晰无独立 position-aware 模块或 OCR 专用 head。2.2 模块详解NaViT 动态分辨率视觉编码器输入任意分辨率图像 → 输出变长视觉 token 序列处理流程图像按固定 patch 大小切分但不强制reshape 到固定网格保留原始宽高比patch 数随分辨率自然变化高分辨率图产更多 tokenNaViT 的变长训练机制使编码器对任意 token 数都能稳定编码设计理由OCR 场景的图分辨率跨度极大票据特写 vs 整页 A4 论文固定分辨率会丢小字或截断版面变长 token 让模型按需看够像素关键参数原文未给具体 patch 大小、最大 token 数与位置编码细节uncertain只说支持任意分辨率MLP 投影器 2×2 token 压缩输入变长视觉 token → 输出压缩后的 LLM 空间 token处理流程一个 MLP 层把视觉 token 映射到 LLM 词嵌入维度在空间维度上把相邻 2×2 token 平均成单个 token最朴素的 2×2 池化压缩后 token 数降为 1/4再与文本 token 拼接送入 LLM设计理由高分辨率图经 NaViT 会产出海量 token直接喂 LLM 计算与显存都吃不消2×2 压缩是把 token 数压下来的最简方案且作者认为局部 2×2 信息聚合对 OCR本身关注局部笔画损失可控关键参数压缩比固定 2×2即 4→1论文未提供不同压缩比的对比Qwen-2.5-3B 语言模型输入视觉 文本 token → 输出文本处理流程拼接后的 token 序列按标准自回归方式处理三阶段训练始终只对文本 token 算 next token prediction loss设计理由在能力与体积间取平衡——3B 足够强的语言先验又小到便于部署选 Qwen-2.5-3B 而非更大模型是实用 OCR 落地端侧 / 低成本的工程取舍关键参数无微调专属配置披露uncertain2.3 算法 / 伪代码n/a —— 原文未给出独立 Algorithm / 伪代码块训练即标准三阶段 next token prediction无 OCR 专属算法步骤可转述。3. 关键结果主要发现OCR 基准上达同规模 SOTA平均 84.7DocVQA 91.4、TextVQA 80.0、ChartQA 84.6、OCRBench 82.7全面超过 MM1.5-3B、Qwen-2-VL-2B、InternVL-2.5-2B/4B、BlueLM-3B、TextHawk2-7B通用能力未因 OCR 专精而垮MMMU 42.0、MMBench-EN 75.3、SEEDBench 72.5、HallusionBench 46.0在 ≤4B 档里靠前真实场景双语文档抽取、场景文字、双语手写多指标超过 TextIn / PaddleOCR / GOT并在场景文字上以 3B 体型超过 Qwen2-VL-7B、MiniCPM-V2.6-8B证据强度基准数字为零样本单次评测无方差 / 置信区间 / 多 seed 重复真实场景评测集很小文档各 100 张、场景 260 张、手写每类 100 张效应量虽大但样本量低统计可信度受限最支撑结论的一条证据Table 3 的 OCR 基准平均 84.7 领先同规模——这是3B MLLM 可做专业级 OCR这一核心 claim 最干净的公开 benchmark 证据相比真实场景自建集更可信3.1 关键结果图 / 表原文 Figure 1左为三类 OCR 场景场景文字 / 文档 / 手写定性示例右为 OCR 基准上与其它 MLLM 的对比——Ocean-OCR 在多项上居同规模前列。Table 3 OCR 基准对比核心结果模型DocVQATextVQAChartQAOCRBench平均MM1.5-3B87.776.574.265.776.0Phi-3.5-Vision-4B*84.473.381.263.975.7Qwen-2-VL-2B90.179.673.478.380.4InternVL-2.5-2B88.774.379.280.480.7TextHawk2-7B89.675.181.478.481.1BlueLM-3B87.878.480.482.982.4InternVL-2.5-4B91.676.884.082.883.8Megrez-3B-Omni91.680.3-82.8-Ocean-OCR91.480.084.682.784.7*为作者复现其余为官方报告。重点解读Ocean-OCR 平均 84.7 领先 InternVL-2.5-4B83.8约 0.9 个点但单项上 DocVQA91.4略输 InternVL-2.5-4B91.6TextVQA80.0略输 Megrez-3B-Omni80.3——平均胜出靠 ChartQA84.6与均衡表现并非项项第一。同规模最优成立但领先幅度不大。Table 4 文档抽取英文 / 中文模型Edit Distance↓ (英/中)F1↑ (英/中)BLEU↑ (英/中)METEOR↑ (英/中)Ocean-OCR0.057 / 0.0620.937 / 0.9620.906 / 0.9120.945 / 0.916TextIn0.055 / 0.217--0.887 / 0.782PaddleOCR0.323 / 0.649---GOT-0.895 / 0.9280.835 / 0.805-重点解读中文文档抽取 Ocean-OCR 全面碾压Edit Distance 0.062 vs TextIn 0.217、PaddleOCR 0.649——这是最亮的成果。但英文 Edit Distance 上 Ocean-OCR0.057实际略输 TextIn0.055论文超越专业 OCR的措辞在此并不严格成立其余指标 F1/BLEU/METEOR 上海语仍领先。Table 5 场景文字识别模型Edit Distance↓F1↑Precision↑Recall↑BLEU↑METEOR↑Ocean-OCR0.1130.8750.8750.8870.4200.754Qwen2-VL-7B0.163-----MiniCPM-V2.6-8B0.146-----PaddleOCR0.130-----重点解读3B 的 Ocean-OCR Edit Distance 0.113 低于 7B/8B 对手看似亮眼。⚠ 但评测集用的是PaddleOCR 伪标签 人工抽检作 ground truth而 PaddleOCR 恰好是被比较的 baseline——用被比较者的输出来评自己存在循环 / 有利偏差风险见 4.1。Table 6 手写识别英文 / 中文模型Edit Distance↓ (英/中)F1↑ (英/中)BLEU↑ (英/中)METEOR↑ (英/中)Ocean-OCR0.145 / 0.1060.774 / 0.8850.532 / 0.7360.772 / 0.885Qwen2-VL-7B0.127 / 0.1130.760 / 0.8810.490 / 0.6660.756 / 0.859重点解读中文手写 Ocean-OCR 全面领先但英文 Edit Distance0.145反而比 Qwen2-VL-7B0.127差——论文却笼统称全面超越。F1/BLEU/METEOR 海语领先但 Edit Distance 这一更直接的字符级指标上英文是输的属 cherry-picking 式表述。原文 Figure 3场景文字识别案例展示对复杂背景、弯曲、艺术字等情形的鲁棒性。原文 Figure 4中英文手写识别案例覆盖段落级与行级粒度。原文 Figure 5PDF 文档文字识别 / 版面理解案例对应 Table 4 的文档抽取场景。原文 Figure 6医疗报告文字识别案例展示在专业领域版面表格、表单上的泛化。4. 批判性评估与价值4.1 批判性评估评估Ocean-OCR 最致命的短板是没有任何消融实验。模型把 NaViT 变长编码、2×2 token 压缩、三阶段训练、以及 238.2M 自有高质量 OCR 数据四件事捆在一起卖却没有任何一项去掉某件 / 换某件的对照——读者无法判断 OCR 精度的提升到底来自架构选择还是主要来自那 238.2M 闭源数据。反方最强论证Ocean-OCR 相对同规模模型的领先极可能主要由238.2M 自有高质量数据驱动而非 NaViT 2×2 压缩这套架构——NaViT 是 2024 年的现成件、2×2 池化是最朴素的压缩、Qwen-2.5-3B 是公开基座架构上并无创新若无消融“首个超越专业 OCR 的 MLLM这一 claim 更像用更多更好数据训出来的”与MLLM 范式本身追平专业 OCR是两回事。这条反方论证比论文自身的论证更有力故判 CRITICAL 级。其次几处评估存在有利偏差迹象(1) Table 4 英文文档抽取 Edit Distance 实际输给 TextIn0.057 vs 0.055但 abstract / 结论仍宣称超越专业 OCR措辞引导明显(2) Table 5 场景文字用 PaddleOCR 伪标签做 ground truth、又拿 PaddleOCR 当 baseline 比构成用对手的输出评自己的循环风险(3) Table 6 英文手写 Edit Distance 输给 Qwen2-VL-7B0.145 vs 0.127却笼统称全面超越——属在指标间 cherry-pick 有利项。复现性方面训练超参学习率 / batch / epoch / GPU 数 / 训练时长一个字都没给238.2M 自有数据不开源论文也未明确承诺开源模型权重与代码——这意味着结果无法独立验证、无法复现。“so what” 上作为百川的工业界技术报告价值在于验证了一条朴素路线——NaViT 变长 2×2 池化 大规模高质量 OCR 数据 三阶段训练在 3B 规模就能把 MLLM 推到专业 OCR 工具水平对想用 MLLM 做 OCR 的实践者有参考意义但学术贡献因无消融 数据闭源而大打折扣不宜当作架构创新引用。综合可信度中 —— 结果数字亮眼且对比范围合理但无消融、数据闭源、评估有有利偏差核心 claim 的归因与可复现性都站不稳。4.2 Limitations 与复现性论文自承未设独立 limitations 节仅隐含承认方法在某些指标上并非最强如英文文档 Edit Distance 输 TextIn但未明说读者发现无消融CRITICAL、238.2M 自有数据闭源、训练超参全缺、场景文字用 PaddleOCR 伪标签评 PaddleOCR循环风险、英文手写 Edit Distance 实际更差却被笼统称超越复现性代码 未承诺开源 (uncertain) · 数据 否238.2M in-house 闭源· 超参 否 · (uncertain) 论文未提权重是否释出4.3 可复用与后续可借鉴NaViT 变长 token 相邻 2×2 池化压缩是高分辨率图控 token 数最简洁有效的工程方案三阶段训练流水线对齐 → 预训练 → SFT值得作为 OCR-MLLM 的训练模板引用场景论证3B 级 MLLM 在 OCR 上可追平专业工具时引用注意 caveat优势部分来自数据而非架构BibTeX key 候选chen2025oceanocr下一步关注百川是否释出 Ocean-OCR 权重 / 代码释出再做独立复测对比后续 Qwen2.5-VL / InternVL-2.5 / GOT-OCR2.0 在同批 OCR 基准上的表现看领先是否被反超Verdict选读—— 工业界百川OCR 技术报告结果数字亮眼、对比范围合理作为用 MLLM 做通用 OCR的实践路线图有参考价值但无消融、数据闭源、训练超参全缺、评估多处有利偏差核心 claim 无法干净归因也无法复现——读它取其工程方案与数据配比思路即可学术借鉴需谨慎勿当架构创新引用。作者lusca 版本lusca-paper-read v1.10.1 出处https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-read