
首发于https://swhl.github.io/latest/blog/ovisocr2/系列说明本文为快速阅览笔记侧重梳理方案骨架与技术演进关系不深入实现细节后续若开展相关方向研究再补充精读分析。论文地址https://arxiv.org/abs/2607.13639v1模型地址https://huggingface.co/ATH-MaaS/OvisOCR2在线 demo: https://huggingface.co/spaces/ATH-MaaS/OvisOCR2现存痛点流水线方案准但是部署复杂且有级联误差端到端方案优雅但是精度有限部署要求高。核心思路模型结构没有改动采用的是 Qwen3.5-0.8B。数据构建真实数据 合成数据值得一提的是合成数据中采用一套 HTML 源码采用 Playwright 渲染为图像同时生成 markdown 格式标注。这样规避了很多噪声。同时合成数据也不是随机合成而是先找到真实数据中失败的数据合成的时候针对性合成。训练方法SFT RL OPD Model FusionSFT构建初始的端到端文档解析策略RL: 通过文本、公式和表格奖励进一步优化困难页面的策略OPD: 将 Qwen3.5-4B 教室模型的 reward-aligned 行为到 0.8B 的学生模型Model Fusion: 融合多个不同数据配比和训练配置的模型整体架构全文没有给出模型结构主要因为没有改动。简要评价这个挖掘难样本的策略让我想到 PaddleOCR-VL它也是这么做的。优势整体指标表现强势部署容易目前 SOTA。如果手头有正在用端到端的模型的可以切换为 OvisOCR2 试试。局限这个工作更像一系列工程组合得到的结果并无太大创新点但是仍然具有借鉴意义。