
核心目标论文提出一个名为NaviDC-OCR的统一文档解析框架旨在解决现有OCR系统在处理复杂布局、结构化内容公式/表格以及真实世界中存在几何畸变的相机拍摄文档时面临的性能瓶颈。主要研究内容与创新点1. 待解决的核心挑战文章指出现有方法的两个关键问题解耦方法先布局检测后内容识别严重依赖精确的布局分析在相机拍摄文档存在几何畸变如弯曲、折痕、透视时检测错误会级联传播导致最终解析失败。端到端方法虽对畸变更鲁棒但在高分辨率场景下易产生冗余生成、幻觉生成不存在的内容和结构推理不足尤其在处理复杂的表格和公式时力不从心。2. 提出的解决方案三大支柱A. 数据工程高质量数据构建多节点共识投票MCV利用多个异构模型的预测共识来筛选高置信度伪标签有效消除了单一模型偏差。形变感知数据合成通过模拟文档的几何变形弯曲、折痕将数字文档与相机拍摄文档的数据分布进行统一填补了数据鸿沟。自我评判VLM训练一个专门的视觉-语言模型通过比较“原始图像”与“预测结果渲染图”的一致性来自动过滤和修正错误的伪标签实现数据质量的自闭环提升。B. 核心训练策略两大创新机制形变感知训练首次将文档几何校正能力内化为VLM的一部分而非作为独立预处理模块。引入“点级区域级”的双重监督信号让模型直接学习文档的变形控制点和扭曲边界。提出曲率引导的道格拉斯-普克采样CGDP自适应地在高曲率区域如折痕、角落增加采样点更精细地刻画复杂几何变形。内容-结构解耦学习针对公式解析让模型先学习公式的语法结构如分式、根号、上下标关系再生成具体内容降低结构生成的随机性。针对表格解析让模型先预测表格拓扑结构OTSL行列关系、合并单元格再根据结构填充单元格内容。该策略有效解耦了“结构推理”与“内容生成”的强耦合显著提升了结构化任务的准确率。C. 模型与训练采用渐进式四阶段训练预训练建立基础视觉-语言对齐和OCR能力。形变感知训练注入几何建模能力适配相机拍摄文档。内容-结构解耦学习提升公式、表格等复杂结构解析能力。强化学习GRPO直接优化任务级指标如TEDS、CDM而非仅优化字符级损失进一步提升输出质量。3. 关键实验结果NaviDC-OCR在多个权威基准上取得了最先进的性能SOTA验证了其有效性基准测试 (Benchmark)场景核心结果OmniDocBench v1.6数字文档解析综合得分 96.87全面超越所有对比的专用VLM和通用大模型如GPT-5.2, Qwen3-VL。Wild-OmniDocBench相机拍摄文档综合得分 88.53在具有挑战性的真实畸变场景下表现优异。PureDocBench干净/退化/真实场景在真实退化Real Degraded场景下以70.85的综合得分显著领先其他解耦和端到端方法。ICDAR 2026 Sci-ImageMiner科学图表转表格排名第一TEDS指标66.39远超第二名64.31证明了其在科学领域强泛化能力。NaviDC-OCR通过数据工程、形变感知、结构解耦和强化学习四个维度的系统性创新成功构建了一个既能精细处理数字文档又能鲁棒应对现实世界中各类几何畸变的统一文档解析框架。其核心贡献在于将“抗畸变”和“懂结构”两大能力深度集成到单一VLM中为构建下一代高可靠性的文档智能处理系统如RAG、数据自动化流水线提供了强大的基础模型。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示模型预训练权重发布地址在这里如下所示文档解析旨在将非结构化文档转换为结构化的、机器可读的表示形式。视觉-语言模型VLM的最新进展显著推动了文档解析的发展。然而现有方法仍面临两大挑战。首先解耦的基于VLM的方法严重依赖于精确的布局分析而相机拍摄文档中的几何畸变可能会引入级联错误。其次尽管端到端的基于VLM的方法减轻了对显式布局检测的依赖但它们在高分辨率场景中常常遭受冗余生成、幻觉和结构推理不足的问题。为应对这些挑战我们提出了NaviDC-OCR一个统一的文档解析框架。NaviDC-OCR引入了形变感知学习将几何感知融入VLM并针对复杂布局表示提出了一种自适应采样机制。此外还开发了一种内容-结构解耦学习策略以显式地建模公式语法和表格结构从而实现更有效的结构化表示学习。大量实验证明NaviDC-OCR在多种文档解析基准测试中达到了最先进的性能。它在OmniDocBench v1.6、Wild-OmniDocBench和PureDocBench上分别取得了96.87、88.53和78.41的综合得分并在ICDAR 2026 Sci-ImageMiner挑战赛中排名第一。这些结果验证了NaviDC-OCR在复杂文档解析场景中的有效性和泛化能力。图1 NaviDC-OCR 实现了对数字文档和相机拍摄文档的统一解析在 OmniDocBench V1.6、Wild-OmniDocBench 和 PureDocBench 上相较于端到端和解耦方法均取得了最先进的性能。1 引言文档解析旨在将非结构化文档转换为结构化表示如Markdown并作为构建训练数据流水线和检索增强生成RAG系统的基本组成部分 Guo et al. (2025); Wang et al. (2025b)。由于解析结果直接影响下游应用准确的文本识别、布局理解和结构重构至关重要。随着文档获取条件的日益多样化文档解析系统需要同时处理带有复杂退化的数字文档和相机拍摄文档。为了评估这些场景下的性能已经引入了多个基准测试包括针对数字文档的 OmniDocBench V1.6 Wang et al. (2026) 和针对相机拍摄文档的 Wild-OmniDocBench Li et al. (2026a)。相应地现有的基于 VLM 的文档解析方法已发展为两种范式端到端方法和解耦方法。端到端方法通常对几何畸变更鲁棒而解耦方法在高分辨率数字文档上表现更好。然而解耦方法严重依赖于准确的布局分析错误可能传播到后续解析阶段。为了研究这个问题我们将文档去畸变预处理 Cai et al. (2025) 应用于 Wild-OmniDocBench 样本发现仅去除几何畸变就能显著提高两阶段解析的性能。同时先前的研究 Zhong et al. (2025) 表明结构化内容占比较高的文档通常表现出更高的预测熵这反映了在生成结构化表示时的不确定性更大。相比之下OCR任务主要依赖于字符到文本的映射因此涉及更稳定的生成过程。然而表格解析和科学图表转表格等任务要求模型不仅理解视觉内容还要进行结构建模和跨模态转换这进一步增加了学习和优化的难度。基于上述观察NaviDC-OCR旨在为解析数字文档和带畸变的相机拍摄文档提供一个统一的解决方案。为此NaviDC-OCR引入了一种全局点级和区域级形变感知学习策略将文档几何校正能力集成到VLM中。结合自适应采样点机制它用布局分割取代了传统的检测范式实现了细粒度的文档布局建模。NaviDC-OCR在Wild OmniDocBench v1.5上取得了88.53的综合得分超越了大多数现有的端到端文档解析方法。此外高度结构化的任务如公式解析和表格解析需要同时建模结构推理和内容生成增加了优化复杂性。为解决此问题NaviDC-OCR提出了一种内容-结构解耦学习策略将结构预测与内容生成显式分离。以表格解析为例模型首先预测表格的OTSL结构 Lysak et al. (2023)然后根据预测的结构重建单元格内容从而显式地建模结构信息并减少优化耦合。该策略通过增强结构建模能力对科学图表转表格任务同样有效使NaviDC-OCR在ICDAR 2026 Sci-ImageMiner挑战赛 Ahmed et al. (2026) 中获得第一名。贡献总结如下我们提出了NaviDC-OCR一个统一的文档解析框架通过全局点级和区域级形变感知学习以及自适应采样点机制将文档去畸变能力隐式地集成到VLM中实现了对数字和相机拍摄文档的统一解析。我们针对高度结构化的文档解析任务提出了一种内容-结构解耦学习策略该策略将公式语法和表格结构显式建模为中间推理过程。该策略有效降低了结构生成中的不确定性并显著提高了公式解析、表格解析和科学图表转表格任务的性能。我们在多个公共基准测试和竞赛中进行了全面评估。实验结果表明NaviDC-OCR 在数字文档、相机拍摄文档和科学文档解析任务中均取得了优越的性能。它在 OmniDocBench v1.6 上获得了 96.87 的综合得分在 Wild OmniDocBench v1.5 上获得了 88.53 的综合得分并在 ICDAR 2026 Sci-ImageMiner 挑战赛中排名第一验证了其有效性和泛化能力。2 相关工作2.1 基于 VLM 的文档解析方法现有的基于视觉-语言模型VLM的文档解析方法可大致分为两类端到端VLM方法和解耦VLM方法。端到端方法通过统一的视觉-语言建模将文档图像直接映射为结构化表示避免了传统流水线中的错误累积。近年来面向OCR的端到端模型引起了越来越多的关注。OvisOCR Lu et al. (2026) 通过优化视觉信息交互机制改进了高分辨率文档中的文本和布局解析。DeepSeek-OCR Wei et al. (2025) 探索了一种将视觉压缩与语言模型推理相结合的OCR范式降低了长文档解析的计算成本。HunyuanOCR Team et al. (2025) 通过高分辨率视觉编码器和轻量级语言模型实现了统一的多任务建模。此外Logics-Parsing An et al. (2026) 通过布局感知的强化学习增强了复杂布局理解。然而端到端方法在高分辨率场景中通常面临高计算开销且结构推理与内容生成之间存在强耦合限制了其在复杂文档解析中的可扩展性。相比之下解耦VLM方法结合了传统流水线的可控性和VLM的语义建模能力通常采用“布局分析后跟内容解析”的两阶段范式。Dolphin Feng et al. (2025) 引入了一种分析-然后-解析框架其中布局元素序列引导区域级内容解析。MonkeyOCR v1.5 Zhang et al. (2025) 和 GLM-OCR Duan et al. (2026) 分别从视觉一致性优化和高效解码的角度改进了表格识别和OCR推理效率。Youtu-Parsing Yin et al. (2026) 进一步探索了共享视觉表示和并行解码机制以降低推理成本。对于相机拍摄文档场景PaddleOCR-VL-1.5 Cui et al. (2026) 引入了多点边界框建模来处理物理退化的布局而PaddleOCR-VL-1.6 Zhang et al. (2026) 和 MinerU2.5-Pro Wang et al. (2026) 分别通过数据优化和多模型融合提升了解析性能。尽管如此现有的解耦方法仍然严重依赖于准确的布局分析。几何畸变会通过后续模块传播错误限制了其在复杂相机拍摄文档场景中的有效性。NaviDC-OCR遵循解耦VLM范式并通过用布局分割取代传统的矩形检测、融入形变感知学习以及引入内容-结构解耦策略进一步提升了其能力。这些设计使其能够统一解析数字和相机拍摄文档同时增强了在复杂结构化文档理解任务上的性能。2.2 用于增强解析的文档校正文档去畸变增强旨在校正相机拍摄文档中的透视畸变和几何变形从而提高后续解析性能。DDCP Xie et al. (2021) 预测固定数量的前景控制点并根据控制点与参考点之间的对应关系估计后向映射从而实现文档去畸变。DocGeoNet Feng et al. (2022) 引入分割监督来促使基于CNN的文本行特征提取器学习更具判别性的几何校正特征。RDGR Jiang et al. (2022) 首先检测文本行和边界信息然后通过网格正则化生成后向映射以在去畸变过程中保持文档结构的完整性。ForCenNet Cai et al. (2025) 进一步显式地建模文档前景区域并通过曲率一致性损失和掩码引导机制增强模型对前景几何结构的感知。与上述基于显式几何建模的方法不同本文将文档校正能力集成到视觉-语言模型VLM中使模型能够直接学习与形变相关的几何控制点。同时设计了区域级和全局点级形变感知机制将文档校正从独立的预处理模块转变为VLM内部的联合建模能力。这一设计提升了解耦VLM在相机拍摄文档场景中的解析性能。2.3 基于视觉-语言模型的分割基于多模态大语言模型MLLM的区域分割方法大致可分为两类一类通过端到端的序列预测直接生成分割结果另一类则引入专用的分割头进行任务适配。基于SAM的方法如SAM4MLLM Chen et al. (2024)利用外部分割模型获取高质量掩码但引入了额外的参数和部署开销。此外SAM3 Carion et al. (2025) 将基础分割模型扩展到概念提示分割、目标检测和跟踪任务进一步强化了外部模型范式。相比之下无SAM的方法通过轻量级密集预测头或统一的自回归建模来实现区域分割例如PerceptionGPT Pi et al. (2024)、UFO Tang et al. (2026) 和Qwen3-VL-Seg Yao et al. (2026)。对于端到端的序列预测VistaLLM Pramanick et al. (2024) 提出了一种基于梯度的动态采样策略将二值掩码转换为点序列表示。考虑到模型统一性和效率的要求本文进一步将传统的两点布局分析重构为基于VLM的序列预测任务。提出了一种曲率引导的道格拉斯-普克采样CGDP方法根据文档几何变形特征自适应地分布采样点从而增强VLM对复杂布局结构的建模能力。3 数据工程高质量、大规模的数据是构建高性能文档解析模型的基础。然而文档解析涉及多样化的结构信息包括文本、布局、表格和公式。依赖人类专家进行细粒度标注不仅成本高昂而且难以保持标注一致性。为应对这一挑战NaviDC-OCR开发了一条自动化的数据工程流水线集成了数据清洗、数据构建和模型辅助验证。在第一阶段多节点一致性投票聚合来自异构模型的预测以选择高置信度的伪标签并减少个体模型偏差。在第二阶段引入文档变形建模和几何感知采样策略以构建覆盖数字文档和相机拍摄文档之间领域变化的多样化训练数据。在第三阶段一个自我评估模型对解析结果进行视觉一致性验证实现自动伪标签过滤和错误修正。3.1 多节点共识投票现有方法主要依赖单一模型进行伪标签生成。例如MinerU2.5 Pro Wang et al. (2026) 采用多模型交叉验证来过滤单一模型的输出而PaddleOCR-VL-1.5 Cui et al. (2026) 则利用同一模型多次运行的推理一致性来进行样本选择。然而这些方法共有一个根本限制伪标签最终由单一模型生成因此受限于其自身能力。一旦模型出现系统性错误这些错误标签就可能被传播到训练集中降低后续优化和最终模型性能。3.2 统一数字文档与相机拍摄文档根据获取方式文档可分为数字文档和相机拍摄文档。与数字文档相比相机拍摄文档通常遭受各种退化如几何畸变、阴影和运动模糊其中几何畸变是影响解析性能的主要因素。特别是现有的两阶段文档解析框架通常依赖于规则矩形区域假设来进行布局检测。当文档发生弯曲或折叠时这一假设不再成立导致布局检测和后续解析性能下降。为验证这一观察我们首先将文档去畸变模型应用于 Wild-OmniDocBench Li et al. (2026a) 中的相机拍摄文档进行预处理。实验结果表明仅消除几何畸变就能显著提升两阶段解析模型的性能。这一发现表明形变感知是连接数字文档与相机拍摄文档的关键桥梁。受此启发我们将文档形变建模融入统一的文档解析框架中使其具备显式的几何感知能力而无需额外的去畸变模块。3.2.1 区域级和点级形变感知3.2.2 曲率引导的道格拉斯-普克采样前述的区域级表示依赖于均匀边界采样这假设所有边界位置具有相同的重要性。然而文档边界通常呈现不同的几何复杂度平坦区域可能包含冗余采样点而高曲率区域如角落和折痕可能采样不足。这种不平衡可能导致关键几何细节的丢失并限制轮廓建模的表示能力。3.3 自我评判 VLM尽管多模型投票可以产生高度一致的伪标签但它们仍可能包含样本偏差和残余错误。为解决此限制我们引入了一个自我评判模型该模型将结构化的预测结果渲染为视觉表示并针对原始文档图像进行模态内一致性评估。这一设计将传统的跨模态图像-文本验证转变为更稳定的图像到图像一致性评估。与MinerU 2.5 Pro Wang et al. (2026) 直接使用通用VLM评估原始图像与预测结果之间的一致性不同我们研究了Qwen3-VL-235B Yang et al. (2025) 在自构建的高质量基准上的零样本验证能力。结果表明其召回率低于 40%证明通用VLM不足以进行可靠的无人监督伪标签验证。因此我们将四类预测输出转换为统一的视觉表示并与原始文档图像对齐布局将预测的边界框、类别和方向信息投影到页面画布上以重建整体文档布局文本将文本内容规范化并重新组织成段落然后进行区域感知的重新布局以保留原始文本结构表格将表格结构转换为包含行列关系和合并单元格信息的HTML表示然后渲染为图像公式将LaTeX序列规范化并渲染为相应的公式图像。4 渐进式训练为便于复现我们提供了NaviDC-OCR架构和训练流水线的详细描述并发布了基于社区模型构建的完整实现和模型配置。NaviDC-OCR包含约12亿参数由从Qwen2.5-VL Bai et al. (2025) 继承的视觉编码器、一个Qwen3-0.6B Yang et al. (2025) 语言模型和一个从头训练的Aligner组成。Aligner采用标准的多层感知器MLP架构来对齐视觉和语言表示。图3 关键训练策略概览。NaviDC-OCR通过两种策略增强文档解析形变感知训练结合区域级和点级形变建模与形变增强实现对数字和相机拍摄文档的鲁棒解析以及内容-结构解耦学习实现对表格和公式的统一结构化解析。基于此统一架构NaviDC-OCR采用四阶段渐进式训练策略逐步赋予模型从基础视觉感知到复杂结构理解的文档解析能力。每个阶段针对特定的优化目标。阶段1进行视觉-语言对齐以建立基础的OCR识别和布局理解能力。阶段2引入区域级形变感知监督提升模型捕获相机拍摄文档中几何畸变的能力。阶段3采用内容-结构解耦学习策略实现对文本、布局、表格和公式等多样化文档元素的统一建模。阶段4通过强化学习进一步优化输出质量提升在复杂真实场景中的解析性能。4.1 阶段1文档解析预训练第一阶段侧重于将视觉编码器与语言模型对齐为后续的文档解析学习建立统一的视觉-语言表示。为使NaviDC-OCR具备基础的OCR识别和布局理解能力我们在视觉问答VQA数据上进行预训练。在此阶段仅优化Patch Merger模块中的两层MLP和视觉编码器而语言模型保持冻结。训练数据主要包括图像描述数据、图像-文本交错数据、视觉-语言对齐数据和OCR数据。训练配置模型训练一个周期批量大小为256。MLP层的学习率设置为 1×10−3视觉编码器为 1×10−4而语言模型参数保持冻结。4.2 阶段2形变感知训练4.3 阶段3内容-结构解耦学习在文档解析任务中公式、表格和科学图表通常被转换为结构化表示如LaTeX和OTSL。与主要关注局部字符级映射的光学符号识别不同结构化表示的生成需要更强的全局语义理解和结构关系建模。在阶段1建立基础的OCR识别能力后NaviDC-OCR引入了一种统一的内容-结构解耦学习策略以支持包括公式解析、表格解析和科学图表转表格在内的多样化结构化解析任务。具体来说对于公式解析我们构建了一个语法符号库并通过正则表达式匹配和语法验证从LaTeX标注中自动提取语法结构标签。这使得模型能够分别学习公式内容和语法结构。对于表格解析我们保留标准的OTSL语法符号但移除所有单元格内容使模型能够专注于表格拓扑结构和单元格合并关系。这种统一的内容-结构学习策略提升了模型进行结构化表示建模的能力尤其是在科学图表转表格任务中。在ICDAR 2026 Sci-ImageMiner挑战赛中融入结构学习使得TEDS性能相比其他参赛队伍具有竞争力。4.4 阶段4强化学习在前三个训练阶段之后NaviDC-OCR在文档识别和结构化解析方面获得了强大的能力。然而使用令牌级交叉熵损失的监督微调并不能直接优化文本、表格和公式解析的任务级目标。为了进一步提升下游解析任务的性能我们在阶段3的模型上引入了基于组相对策略优化GRPO的强化学习 Shao et al. (2024)。由于不同的文档元素具有不同的输出格式和评估标准我们为不同的解析任务设计了任务特定的可验证奖励函数。统一公式定义如下其中 y 和 y^ 分别表示真实值和模型预测。对于文本、表格和公式解析分别采用归一化编辑相似度NED、基于树编辑距离的相似度TEDS和公式结构匹配指标CDM作为任务特定奖励。所有奖励都被归一化到 [0, 1] 范围内值越高表示预测与真实值之间的一致性越强。5 实验评估为全面评估NaviDC-OCR我们在多个公共文档解析基准上进行了广泛实验包括涵盖10种文档类型、5种布局类别和5种语言的OmniDocBench v1.6 Wang et al. (2026)评估对真实世界拍摄文档鲁棒性的Wild OmniDocBench v1.5 Li et al. (2026a)以及包含干净、数字退化、真实退化三类文档的PureDocBench Li et al. (2026c)。我们进一步在ICDAR 2026 Sci-ImageMiner科学图表转表格任务上报告了结果以评估NaviDC-OCR在复杂文档理解和解析场景中的泛化能力。5.1 数字文档解析OmniDocBench v1.6 是一个具有代表性的页面级数字文档解析基准包含来自10种文档类别、5种布局类型和5种语言的 1,651 个PDF页面。与v1.5相比v1.6引入了用于公式评估的精炼元素匹配策略以及一个包含结构复杂页面的挑战性子集从而能够对先进解析模型进行更具区分度的评估。该基准评估文档解析的四个关键方面使用归一化编辑距离的文本识别、使用字符检测指标CDMWang et al. (2025a) 的公式识别、使用树编辑距离相似度TEDS和 TEDS-S Zhong et al. (2020) 的表格重建以及阅读顺序恢复。表3 现有文档解析模型在干净和退化场景下的性能比较。↑ 表示越高越好↓ 表示越低越好。5.3 科学图表转表格Sci-ImageMiner 挑战赛 Ahmed et al. (2026) 专注于真实研究论文中的科学图像理解重点是在原子层沉积和蚀刻ALD/E领域对科学图表进行定量分析。该挑战赛旨在弥合视觉内容理解与科学数据解释之间的差距。其中科学图表转表格是一项关键任务要求模型通过转换视觉元素包括曲线、坐标轴和图例从科学图表中恢复结构化的实验数据使其成为机器可读的表格。NaviDC-OCR通过内容-结构解耦学习策略改进了对科学图表中结构和语义信息的联合建模。它在科学图表转表格任务中取得了最佳的TEDS性能比排名第二的方法高出超过2个百分点。这些结果表明NaviDC-OCR不仅限于通用文档解析在特定科学领域也表现出强大的泛化能力。表4 ICDAR 2026 Sci-ImageMiner 挑战赛中前5名队伍和最佳基线方法的数据提取性能比较。附录A 提示设计与任务示例本节介绍NaviDC-OCR支持的各项任务的提示格式、输出规范和代表性示例。所有任务都遵循统一的提示接口每个输入仅包含一个 image 令牌和紧随其后的文本任务指令无需额外的少样本示例或结构化元数据。NaviDC-OCR支持8种文档解析任务其相应的指令和输出格式总结如下数字布局检测 (§A.1)— 检测数字文档中的内容区域并输出包含边界框、类别标签和旋转方向的结构化检测结果。相机拍摄布局分割 (§A.2)— 定位相机拍摄文档中的内容区域并输出基于多边形的区域边界、类别标签和旋转方向。文本识别 (§A.3)— 将裁剪的文本区域转录为相应的文本序列。公式识别 (§A.4)— 将裁剪的公式区域转换为LaTeX表示。表格识别 (§A.5)— 将裁剪的表格转换为基于OTSL的结构化Token序列包含单元格内容并进一步解析为HTML表示。代码块识别 (§A.6)— 将裁剪的代码区域转换为Markdown格式并同时预测相应的编程语言类型。科学图表分析 (§A.7)— 将裁剪的科学图表转换为由OTSL表示的结构化表格Token序列。印章识别 (§A.8)— 将裁剪的印章区域转录为文本序列。A.1 数字布局检测NaviDC-OCR保留了数字文档的布局解析能力能够精确地定位页面内的结构化区域。此任务输出每个检测到的区域的矩形边界框、语义类别和文本方向。模型以下采样的页面图像作为输入并生成由多个区域描述组成的结构化布局表示。提示image\n分析图像布局。(Analyze the image layout.)输出格式模型输出由换行符分隔的区域描述序列每个区域遵循统一格式box:x1 y1 x2 y2label:类别rotate_dir此输出格式改编自MinerU中引入的表示通过压缩区域描述以减少令牌消耗同时为数字和相机拍摄文档布局解析任务提供统一接口。具体来说x1 y1 x2 y2表示归一化到 [0, 999] 网格空间的矩形边界框坐标类别表示区域的语义类别标签rotate_dir表示文本方向。A.2 相机拍摄布局分割NaviDC-OCR通过集成全局点级和局部区域级形变感知建模能力将布局解析扩展到相机拍摄文档场景。此任务旨在定位相机拍摄文档中的结构化区域并输出每个区域的多边形边界点、语义类别和文本方向。提示image\n多点布局分割分析。(Multi-point Layout Segmentation Analysis.)输出格式模型输出由换行符分隔的区域描述序列每个区域遵循统一格式box:x1 y1 x2 y2 x3 y3 ... label:类别 rotate_dir这种表示在与数字布局检测任务保持一致的同时将矩形边界框扩展为可变长度的多边形点集。具体来说采样坐标的数量根据每个文档区域的局部形变复杂度自适应确定。简单区域用较少的点表示而具有复杂非刚性形变的区域则使用额外的采样点来捕获更精细的几何结构。A.3 文本识别文本识别任务旨在将裁剪的文本区域转换为相应的文本序列。输入包括来自数字文档布局和相机拍摄文档的裁剪区域。对于相机拍摄文档仅保留分割出的前景文本区域非文本区域用黑色像素掩蔽以减少无关视觉内容的干扰。提示image\n请输出图像中的文本内容。(Please output the text content from the image.)输出格式模型输出与输入文本区域对应的纯文本序列同时保留结构信息包括行内公式、下标、上标和特殊符号。A.4 公式识别公式识别任务旨在将裁剪的公式区域转换为 LaTeX 表示。提示image\n请使用LaTeX格式写出图像中公式的表达式。(Please write out the expression of the formula in the image using LaTeX format.)输出格式模型输出一个 LaTeX 数学字符串包含标准命令和环境例如\frac,\mathrm,\quad可直接编译。当输入图像中存在公式编号时模型使用\tag{...}保留相应的编号信息。A.5 表格识别表格识别任务旨在将裁剪的表格区域转换为基于OTSL优化表格结构语言的结构化Token序列。单元格内容被转录为文本其中行内公式使用单美元符号表示$...$。生成的OTSL序列进一步转换为HTML表示用于可视化和下游应用。提示image\n这是一张表格的图像。请以OTSL格式输出表格。(This is the image of a table. Please output the table in OTSL format.)输出格式模型输出一个展平的Token序列表示表格结构按行主序组织。OTSL表示提供了对常规网格表格和具有复杂单元格结构的表格的紧凑且明确的描述。生成后OTSL序列会自动转换为HTML用于表格渲染和下游系统集成。代码块识别图4 代码块识别的案例研究。NaviDC-OCR 实现了精确的源代码重建和编程语言识别。A.6 代码块识别代码块识别任务旨在从输入的代码截图中恢复源代码。它要求模型在识别代码块编程语言的同时保留原始的缩进、语法结构和格式。图5 科学图表转表格和印章识别的案例研究。科学图表来自 OmniDocBench v1.6印章来自匿名的互联网数据。提示image\n图像中包含一个代码片段请输出解析结果。(The image contains a code snippet, please output the parsing result.)输出格式模型以Markdown代码块格式输出恢复的代码其中第一行指定编程语言后跟相应的源代码示例给定一个来自OmniDocBench v1.6的示例图像相应的模型输出如图4所示。A.7 科学图表分析科学图表分析任务旨在从科学图表中恢复结构化的表格数据。NaviDC-OCR支持跨5大类别和19个细粒度类别的科学图表解析。五个类别包括单变量分布、多变量比较、基于矩阵的、空间定位和结构流程图。细粒度类别涵盖直方图、饼图、圆环图、玫瑰图、树状图、漏斗图、分组条形图、核密度图、条形分布图、堆叠条形图、堆叠折线图、多线图、雷达图、箱线图、热力图、有向邻接表、无向邻接表、气泡图和桑基图。提示image\n这是一张科学图表。请提取图表中隐含的表格。(This is a scientific figure. Please extract the table implied by the figure.)输出格式输出格式遵循表格识别任务。模型生成一个展平的OTSL Token序列表示结构化的表格随后转换为表格表示。一个代表性示例如图5所示。A.8 印章识别印章识别任务旨在从裁剪的印章区域中提取文本内容。由于其不规则的形状以及来自周围文本、线条和复杂纹理的干扰印章区域对准确的文本识别构成了挑战。NaviDC-OCR专注于提取前景印章文本同时抑制无关的背景信息。提示image\n印章识别(Seal Recognition:)输出格式模型仅输出印章区域内的文本内容排除无关的背景文本。一个代表性示例如图5所示。B 数据合成细节由于缺乏大规模、高质量的科学图表标注数据我们开发了一个合成数据生成流水线来增强科学图表理解。具体来说采用诸如Matplotlib之类的渲染引擎自动生成多样化的科学图表包括雷达图、热力图、线图、散点图和能谱图。生成的样本旨在模仿真实科学出版物的视觉特征和统计分布。图6提供了更多示例。该合成流水线建立了视觉图表模式与结构化表示之间的直接映射。每个合成图表都与其底层数值数据、坐标轴标签、图例和相应的数据表格配对提供了从视觉输入到结构化输出的端到端监督。通过控制图表类型、布局、数据分布和标注样式生成的数据集涵盖了多样化的科学可视化场景。为了进一步提高结构理解能力我们构建了两种互补类型的合成样本。第一种类型包含保留完整视觉信息包括数值、标签和图例的全内容图表使得能够进行准确的定量信息提取。第二种类型包含仅结构图表其中文本内容和数值被掩蔽但保留了几何布局和结构关系。这些样本鼓励模型学习内在的图表结构如坐标轴组织、空间对齐和层次化的表格拓扑。这种合成数据生成策略为科学图表理解提供了可扩展的监督并缓解了真实世界标注不足的限制。通过联合利用内容丰富和结构感知的样本模型在来自真实研究文献的多样化科学图表上实现了更强的泛化能力。图6 科学图表转表格的合成数据生成案例研究。C 与 SOTA 方法的定性比较本节展示了NaviDC-OCR与最先进方法在代表性文档场景包括原生数字文档、数字退化文档和真实世界拍摄文档上的定性比较。可视化结果评估了布局分析、文本识别、表格解析和公式提取的性能。C.1 布局识别NaviDC-OCR采用了解耦解析框架其中准确的布局识别对于后续的内容理解至关重要。我们比较了MinerU2.5 Pro Wang et al. (2026)、PaddleOCR-VL 1.6 Zhang et al. (2026) 和NaviDC-OCR在真实世界拍摄文档上的布局预测结果如图7、8、9和10所示。对于具有褶皱、几何畸变和复杂布局的文档MinerU2.5 Pro Wang et al. (2026) 和 PaddleOCR-VL 1.6 Zhang et al. (2026) 可能会产生区域缺失或类别预测错误限制了细粒度的布局理解。相比之下NaviDC-OCR结合了区域级和点级形变感知学习与形变增强以捕获真实世界文档中的几何变化从而实现了更完整和准确的布局识别特别是在密集文本区域和复杂表格结构方面。图7 对拍摄的结构化文档进行布局识别的定性比较。NaviDC-OCR 对有折痕的结构化表格提供了比其他SOTA方法更可靠的分析。图8 对旋转和折痕文档的布局识别定性比较。NaviDC-OCR 更好地覆盖了折痕区域并准确识别了小文本区域。图9 对复杂拍摄文档的布局识别定性比较。NaviDC-OCR 对密集和复杂的文档结构实现了更完整和细粒度的布局。图10 对严重畸变表格的布局识别定性比较。NaviDC-OCR 能够对高度畸变的表格文档进行结构化布局解析。C.2 表格解析我们比较了在具有挑战性的相机拍摄场景下的表格解析结果包括倾斜、透视畸变、页面弯曲、模糊和密集表格布局。总体而言NaviDC-OCR比竞争方法更可靠地保留了表格拓扑和单元格关系特别是在畸变或细粒度的表格方面。图11显示了一个带有倾斜、透视压缩和局部模糊的手写笔记页面。MinerU2.5-Pro 和 Paddle-VL-1.6 保留了部分表格内容但存在行列错位和内容合并的问题。NaviDC-OCR 更好地恢复了四列结构显示出对相机拍摄畸变更强的鲁棒性。图12中的报纸案例包含一个嵌入在密集文本中的小型表格并受到页面弯曲的影响。竞争方法引入了不正确的行跨度结构或遗漏了列而NaviDC-OCR 准确地恢复了三列布局并保留了作物年份、交付量和生产者价格之间的对应关系。图13展示了一个密集的财务分类账表格具有细粒度的网格和多级表头。此案例需要准确恢复层次化表头、窄列和空单元格。NaviDC-OCR 产生的结果更接近真实值GT而 MinerU2.5-Pro 和 Paddle-VL-1.6 倾向于丢失窄列、压缩网格或错误地合并单元格。这些结果证明了内容-结构解耦学习对表格拓扑建模的有效性。图11 对畸变的手写笔记表格进行定性比较。NaviDC-OCR 在倾斜和模糊条件下更好地保持了行列对齐和单元格对应关系。图12 对嵌入在相机拍摄的报纸页面中的小型表格进行定性比较。NaviDC-OCR 准确地恢复了三列结构和数值对应关系。图13 对密集的财务分类账表格进行定性比较。NaviDC-OCR 更好地保留了细粒度网格、层次化表头和空单元格结构。C.3 公式提取我们进一步比较了在真实世界退化条件下如褶皱、阴影、低分辨率和严重旋转的公式提取结果。NaviDC-OCR 在保留数学结构包括下标、上标、根式、分数、极限和括号范围方面表现出更强的鲁棒性。如图14所示此案例呈现了一个具有挑战性的公式识别场景包含纸张褶皱、局部阴影和低分辨率公式区域。MinerU2.5-Pro 和 Paddle-VL-1.6 能够识别主要元素如平方、根式和科学记数法但它们在处理变量下标、指数位置和最终数值数量级时存在困难。相比之下NaviDC-OCR 更准确地保留了根式内的求和关系、下标/上标结构和变量符号。图15进一步展示了一个更极端的相机拍摄条件页面严重旋转公式上下颠倒。该示例包含复杂的结构包括极限、分数、括号和乘积法则推导。MinerU2.5-Pro 检测到了一些公式符号但未能恢复全局方向和结构关系而 Paddle-VL-1.6 仅重建了部分公式片段。相比之下NaviDC-OCR 在这种颠倒条件下成功恢复了完整的公式表达式与真实值GT实现了高度一致。这说明了形变感知学习和公式结构感知解耦学习对于真实世界相机拍摄文档的互补优势。图14 对具有褶皱和阴影的低分辨率公式区域进行定性比较。NaviDC-OCR 更准确地保留了根式、下标、上标和数值表达式。图15 对具有褶皱和阴影的低分辨率公式区域进行定性比较。NaviDC-OCR 更准确地保留了根式、下标、上标和数值表达式。D 基准评估细节我们在 OmniDocBench v1.6、Wild OmniDocBench v1.5 和 PureDocBench 上评估文档解析性能。为了保持基准测试之间的一致性Wild OmniDocBench v1.5 和 PureDocBench 使用 OmniDocBench 风格的端到端协议进行评估。模型预测被转换为 Markdown 文件并使用 OmniDocBench 评估器中的quick_match策略与基准真实值进行匹配。评估涵盖四个元素组文本块、显示公式、表格和阅读顺序。文本块和阅读顺序通过归一化编辑距离衡量显示公式通过编辑距离和 CDM 衡量表格通过 TEDS 和编辑距离衡量。遵循 OmniDocBench v1.6我们报告 TextEdit, FormulaCDM, TableTEDS, TableTEDS-S 和 ReadOrderEdit。综合得分计算如下这里较低的 TextEdit 和 ReadOrderEdit 表示更好的性能而较高的 FormulaCDM、TableTEDS、TableTEDS-S 和 Overall 表示更好的性能。对于在同一基准上比较的所有模型我们保持评估器版本、匹配策略、指标集和超时设置固定。为了处理长或复杂的页面页面匹配超时和截断的快速匹配超时均设置为 1200 秒其中timeout_fallback_max_chunk_span 200和timeout_fallback_order_penalty 0.05。对于 Wild OmniDocBench v1.5 和 PureDocBench我们使用相同的指标和匹配设置仅将真实值文件和预测目录替换为相应的基准路径。值得注意的是PureDocBench 难度显著更高NaviDC-OCR 在少数案例上出现了严重的重复生成问题。对于这些样本我们在评分前移除了相应的无效 Markdown 预测文件。这不会影响评估公平性因为根据评估协议缺失的预测得分为零。移除的文件列于表5中。数字退化子集中没有移除任何预测。表5 为 PureDocBench 评估从 NaviDC-OCR 中移除的 Markdown 预测文件。E 畸变文档布局可视化为了评估模型理解复杂文档变形的能力我们在公共去畸变数据集 DocUNet Ma et al. (2018) 和 DIR300 Feng et al. (2022) 上进行了可视化评估代表性结果如图16和图17所示。NaviDC-OCR 直接对畸变文档执行布局和内容解析无需去畸变预处理或专用的校正模型展示了在复杂几何变形下的鲁棒解析能力。图16 DIR300 数据集上的解析评估。图17 DocUNet 数据集上的解析评估。