FEATURED · 精选文章

Docling 解析 LaTeX 学术论文实战:从 arXiv 2501.00089 天体物理论文看 Docling 的 LaTeX→Markdown 转换管线

发布时间 / 2026/9/8 22:50:32
来源 / 创域科博编辑部
栏目 / 资讯中心
Docling 解析 LaTeX 学术论文实战:从 arXiv 2501.00089 天体物理论文看 Docling 的 LaTeX→Markdown 转换管线 Docling 解析 LaTeX 学术论文实战从 arXiv 2501.00089 天体物理论文看 Docling 的 LaTeX→Markdown 转换管线【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling导读本文围绕 Docling 仓库中一份真实的 LaTeX 端到端E2E测试基准文件 tests/data/latex/groundtruth/2501.00089_main.tex.md 展开它是对 arXiv 2501.00089John F. Wu 的 Sparse Feature Network / SFNet 论文原文 main.tex 执行 Docling LaTeX 后端转换后生成的Markdown 期望输出groundtruth。读完本文你将理解 Docling 如何把一份包含aastex文档类、deluxetable表格、数学公式、\citep引用的天文学论文完整转化为结构化文本也能顺着文档逐节读懂 SFNet 的核心方法、实验结论与仓库中的回归测试校验机制。这份 groundtruth 文件在 Docling 仓库中的角色文件三件套.md/.json/.itxt在 tests/data/latex/groundtruth/ 目录下同一篇论文共沉淀了三种期望输出文件内容生成方式见 tests/test_latex/test_basic.py2501.00089_main.tex.mdMarkdown 导出结果doc.export_to_markdown(compact_tablesTrue)2501.00089_main.tex.itxt缩进文本indented text导出结果doc._export_to_indented_text(max_text_len70, explicit_tablesFalse)2501.00089_main.tex.jsonDoclingDocument 结构化 JSONverify_document(doc, gt_path .json)使用的标准文档序列化main.tex.md就是三种基准中被.md后缀命名的 Markdown 期望输出对应源代码位于 tests/data/latex/sources/2501.00089/。每个文件名的命名规则是f{父目录名}_{源文件名}由 conftest.py 中latex_pathsfixture 自动发现所有子目录下的main.tex后拼接而成。校验链路groundtruth 如何参与 E2E 回归在 tests/test_latex/test_basic.py 的test_e2e_latex_conversions中Docling 会为每一个latex_paths中的源文件依次用DocumentConverter(allowed_formats[InputFormat.LATEX])转换源.tex用export_to_markdown(compact_tablesTrue)得到预测 Markdown与gt_path .md比对用_export_to_indented_text(...)与.itxt比对用verify_document(doc, gt_path .json)与.json比对。其中GENERATE GEN_TEST_DATA来自 tests/test_data_gen_flag.py当该标志开启时测试会重新生成groundtruth 而非校验这意味着这类文件既是回归测试的标准答案也是观察 Docling 解析行为的快照。任何改动 LaTeX 后端解析逻辑的开发者在运行该测试时都必须保证新输出与这份基准逐字符一致。源文件的长相一篇天文学 AAS 期刊论文main.tex以\documentclass[apj,twocolumn,twocolappendix]{aastex631}开头是 AAS美国天文学会期刊模板正文里含有\title、\author[0000-...]{John F. Wu}、\affiliation、\email、\begin{abstract}、\keywords以及\section/\subsection、行内公式如$Z_{\rm gas} 12 \log(\mathrm{O/H})$、多个figure*对应SFNet_ResNet18-TopK.pdf、*_bpt_scatter_examples_3x3.pdf、equations.pdf、pca-comparison.pdf等图片资源、一个deluxetable*AAS 专用表格环境、\citep/\citet引用与\url。这是一份非常适合压力测试解析器的真实样例。Docling LaTeX 后端这份 Markdown 是如何被生成的后端入口与依赖Docling 的 LaTeX 解析核心是 docling/backend/latex/backend.py 中的LatexDocumentBackend。它并非自研语法解析器而是依赖开源库pylatexenc通过LatexWalker(text, tolerant_parsingTrue)将.tex文本切分成字符节点、宏节点、环境节点、数学节点与分组节点。若未安装该依赖后端会抛出带安装提示的ImportErrorpip install docling-slim[format-latex]后端通过supported_formats()声明支持InputFormat.LATEX并在is_valid()中拒绝空白文本supports_pagination()返回False说明 LaTeX 输入不支持分页语义。导言区处理\documentclass/\usepackage被剥离_do_parse_and_process首先用正则切出\begin{document}之前的内容作为 preamble并把\documentclass(?:\[[^\]]*\])?\s*\{[^}]*\}声明剥离。随后的_extract_custom_macros与_extract_preamble_metadata实现在 docling/backend/latex/handlers/macros.py负责\title→ 以DocItemLabel.TITLE写入正文对照测试test_latex_preamble_filter的断言标题会出现在输出里而usepackage命令本身不会\author、\date→ 以DocItemLabel.TEXT追加为元数据文本\section/\subsection/\paragraph等节级宏 → 经_get_heading_level映射为doc.add_heading(level...)从而在 Markdown 中以#/##层级呈现。这一点在 groundtruth 中非常直观源文件第一行\documentclass不出现在.md中但标题成为正文第一行# Insights on Galaxy Evolution...作者、机构、邮箱与 Abstract、keywords 依次保留。解析主流程节点遍历 Mixin 分工LatexDocumentBackend同时继承了四个 Handler Mixin见 docling/backend/latex/handlers/ 与 utils/MacroHandlerMixinmacros.py处理\cite以REFERENCE标签落文、\url、标题/作者宏、以及表格图片的\caption等EnvironmentHandlerMixinenvironments.py_process_environment分发figure、table、数学环境、列表环境等MathHandlerMixinmath.py_process_math_node统一处理行内/块级$...$与\[...\]TableHelperMixin与TextHelperMixinutils/table.py、utils/text.py负责表格与文本汇流。节点遍历时会对连续普通文本做缓冲-冲刷text_bufferflush_text_buffer把相邻文本合并为一个add_text段落避免把一个自然段切得支离破碎。若整体解析异常convert()还内置超时保护LatexBackendOptions.parse_timeout若超时未完成则退回整篇原始文本作为一个 TEXT 段落的降级策略对应测试test_latex_convert_error_fallback。从源码看这份.md中能观察到的转换行为对照 sources/2501.00089/main.tex 与 groundtruth 的 .md可以核对出以下转换特征均来自当前仓库文件的实际内容不构成对其正确性的价值判断标题层级映射\section{Introduction}输出为## Introduction\subsection{Emission line fluxes}输出为### Emission line fluxes与_get_heading_level的映射逻辑吻合。行内公式保留$n \sim 10^5$、$d \sim 10^3$、$A_{\tt SL\,17}$等以$...$原样保留在正文中上下标\rm、\tt等字体命令被透传。\lambda6584、\alpha、\beta等希腊字母命令则被展开成 Unicode 字符。逻辑排版命令转换\textit{detailed}→detailed之类强调语义丢失而文字保留\ion{O}{3}AAS 电离态命令被展开为[O3]连字符命令---在个别位置被转成-。图片以占位说明 注释形式出现每个\includegraphics对应一行Image: 文件名.pdf紧接一行!-- image --。比如架构图SFNet_ResNet18-TopK.pdf、BPT 散点17-bpt_scatter_examples_3x3.pdf等说明当前后端的图片资产以引用名入文PDF 等图片在 tests/data/latex/sources/2501.00089/ 下真实存在可供人工核对。deluxetable*表格行为这份.md中 AAS 专有表格环境没有渲染成管道式 Markdown 表格而是把表格声明行lcll[t!]、列数4、\tablecaption的标题文字以及各数据行SL17 62.9% very blue...以文本行的形式顺序保留且表格末尾的\enddata之后的数据行完整落盘。这份基准恰好如实记录了该版本对复杂表格环境的具体表现——这也正是需要由测试与基准文件把行为钉死的原因。尾部残留可见.md最末出现的main、aasjournal行对应源文件尾部\begin{document}之后aasjournal相关环境的解析残影再次说明groundtruth 是快照而非理想输出。逐节导读这篇基准论文讲了什么groundtruth 的主体内容本身是一篇内容完整、自洽的研究论文。为了便于在 groundtruth .md 中对照阅读下面按文档骨架提炼其技术内容。摘要与引言为什么要可解释的稀疏特征论文摘要指出星系的外观蕴含其形成与演化物理机器学习模型可以仅从星系图像切块image cutouts直接预测物理属性但深层神经网络的特征表征缺乏可解释性。为此作者提出Sparse Feature NetworkSFNet其可解释特征能被线性组合来估计星系属性如光学发射线比或气相金属丰度且不牺牲精度。引言从两个根因入手解释深度网络难解读叠加Superposition语义概念被分散到多个神经元上特征与神经元不是一一对应多义性Polysemanticity同一神经元可在多个无关语境中被激活、承载多重含义。两者帮助网络提升存储容量却让某个神经元具体在算什么无从谈起。稀疏编码每次仅激活少量基函数与近年大语言模型领域用稀疏自编码器SAE拆解内部激活的工作构成了 SFNet 的思路来源。Methodologyresnet18 加一层 Top-k方法与数据细节结合 main.tex 的 LaTeX 原文核对数据来自 SDSS Main Galaxy Sample要求 [N2] λ6584、Hα λ6564、[O3] λ5007、Hβ λ4861 四条发射线的信噪比均大于 3共 250,207 个星系另用 SED 拟合得到物理属性。图像为 Legacy Survey 的gri三波段 144×144 像素切块、0.262 角秒/像素重采样。网络结构与 resnet18 完全一致仅在最末线性层之前插入 top-k 运算保证每个预测都是 k 个稀疏特征的线性组合。默认潜在特征数 d512、k4后续消融实验中 k ∈ {2,3,4,6,8}。训练主干用 ImageNet 预训练权重初始化损失为均方根误差RMSE随机 20% 留作验证集随机翻转做数据增强训练 20 个 epoch采用 Ranger 优化器初始学习率 0.1配合平顶余弦退火调度。作者强调只添加 top-k 约束的改动不带来额外计算或内存开销且特征紧接卷积层激活因而形态学特征在像素空间上是局部的。结果一发射线流量预测论文训练 SFNet 同时预测 [N2]、Hα、[O3]、Hβ 四条谱线流量——这些线强度比可用于 BPT 图区分活动星系核 AGN 与恒星形成星系。最常激活的 8 个特征解释了数据集 99.99% 的方差其中前 4 个即解释 91.6%故研究聚焦于特征 SL17、SL138、SL157、SL322。BPT 图中各特征峰值所在区域不同SL17 偏更高的 [N2]/Hα 与 [O3]/Hβ指向更硬的电离辐射与更高气体密度SL138 大体相反。结果二气相金属丰度单独训练一个 SFNet 直接从图像预测Z_gas 12 log(O/H)。剔除金属丰度、恒星质量、恒星形成率估计无效的天体后剩 117,223 个星系。金属丰度本身离散度为 0.207 dex而 SFNet 仅用两个特征Z61 激活率 99.6%、Z256 激活率 87.9%即可预测到 0.087 dex再加入第三、四频繁特征激活率 40.2%、11.9%误差降至 0.086 dex。两个主要特征的物理解读即原表tab:features的全部内容见 groundtruth .md 对应小节Feature激活频率形态特征物理解读SL1762.9%非常蓝、致密或并合极端恒星形成、硬电离辐射SL13887.0%低表面亮度、正对face-on低气体密度、软电离辐射SL15795.8%红色、椭圆年老恒星族、高质量、高金属丰度SL32262.9%蓝色、不规则低质量、低金属丰度、恒星形成Z6199.6%红色、正对、明亮核心高金属丰度Z25687.9%蓝色、侧向edge-on盘低金属丰度值得注意的是论文指出 Z256 关联蓝色侧向盘星系与低金属丰度实际上复现了前人对 SDSS 光谱光纤观测偏差的解释侧向盘星系的光谱光纤会收集盘外围较低金属丰度区域的光而正对时则错过这些区域——SFNet 从形态上学会了这种观测偏差。讨论物理定律、性能与可解释性的权衡从图像学到物理公式因为预测是稀疏激活的线性投影论文可以直接写出金属丰度、[N2]/Hα、[O3]/Hβ 随特征激活变化的线性关系式。Z61/Z256 与金属丰度正/负相关且可同时激活SL17 与 SL157 与两个线比均正相关SL322 与 [O3]/Hβ 正相关却与 [N2]/Hα 负相关提示其对应更硬的电离谱。性能 vs 可解释性用训练集上由 SL17/SL138/SL157/SL322 拟合的线性 SVM 做 AGN 分类验证集准确率 0.85、F1 0.72改用全部非零特征反而降到 0.83/0.70说明只保留最频繁的四个特征能降噪。作为参照高调优 CNN 为 0.89/0.75条件扩散模型为 0.82/0.73分类口径略有差异而金属丰度用两个特征即可达 0.087 dex对比典型 CNN 的 0.085 dex。结论是SFNet 没有为可解释性牺牲精度。与 PCA 对比对常规 CNN 倒数第二层稠密激活做 PCA取前 k 个主成分作为特征训练多变量线性回归与重新训练三次的 SFNetk ∈ {2,3,4,6,8}比较 RMSE。完整结果见原表tab:dimredkSFNet金属丰度PCA金属丰度SFNet谱线PCA谱线20.0858 ± 0.00040.17530.2418 ± 0.00020.280630.0862 ± 0.00110.20320.2395 ± 0.00140.264640.0862 ± 0.00130.10340.2383 ± 0.00030.264660.0875 ± 0.00070.10200.2394 ± 0.00090.241980.0852 ± 0.00040.09210.2389 ± 0.00120.2396即便前 8 个主成分解释了超过 95% 的方差PCA 特征在金属丰度回归上始终明显落后于 SFNet论文将此归因于叠加与多义性使重要信息以高度非线性方式摊在多个 CNN 激活上——因为普通 CNN 训练时没有稀疏约束其少量主成分的线性组合并不保证可解释。与 GalaxyZooZoobot对比用与 SFNet 同架构去掉 top-k的 Zoobot resnet18 提取的 512 维特征预测金属丰度线性模型验证误差 0.183 dexXGBoost 也只有 0.180 dex而当作弊地拟合验证集时误差可降至 0.085 dex——证明 Zoobot 特征信息充足但无法被线性组合且不能跨随机划分泛化。另外用 Zoobot 特征岭回归预测 SFNet 的 Z61/Z256R² 仅 0.253 与 0.107说明两者学到的形态特征差异显著。既有可解释性方法的局限GradCAM 类方法与显著图saliency依赖分类标签而星系属性本质是连续回归问题显著图也无法捕捉深度学习真正擅长的多像素非线性模式。结论与附录结论重申SFNet 以不显著牺牲性能的方式学到硬电离辐射星暴、低气体密度、年老恒星族/高金属丰度、恒星形成区/低金属丰度等可解释形态特征其线性公式揭示了星系属性与外观之间稳健的线性联系用 top-k 约束训练的稀疏特征比CNN PCA 后处理更稳健。论文也明确不主张以机器替代天文学家——领域专家仍须审慎解释特征间的物理关联。未来方向包括去相关层如 ZCA、Cholesky 白化、L1 正则、更小感受野的架构以及激活最大化辅助解释。文档末尾的Why are deep neural networks so hard to decipher?实为论文附录用三臂旋涡星系特征散布多个神经元、以及同一神经元对三臂旋涡与近旁饱和恒星的 r 带光渗漏同时激活等例子直观解释叠加与多义性并指出稀疏自编码器只作用于已训练网络的固定层、仅有两层结构、蒸馏能力有限SFNet 的路线则是让网络在训练中天生具备稀疏字典学习能力从而直接产出可解释特征。如何在仓库中复现与进一步研究看源文件论文的完整 LaTeX 源、AAS 类文件与四幅插图 PDF 位于 tests/data/latex/sources/2501.00089/其余 arXiv 论文样例如 1706.03762、2305.03393 等可横向对比不同领域 LaTeX 文档的解析差异。跑回归测试在安装好docling-slim[format-latex]提供pylatexenc的前提下运行tests/test_latex/test_basic.py中的test_e2e_latex_conversions即可看到 Docling 输出与这份.md/.json/.itxt逐字符对拍。深入源码解析入口看 docling/backend/latex/backend.py各宏/环境/数学节点的处理逻辑分别位于 docling/backend/latex/handlers/macros.py、environments.py、math.py表格与文本汇聚工具见 docling/backend/latex/utils/超时等选项由 docling/datamodel/backend_options.py 中的LatexBackendOptions定义测试 test_basic.py 用parse_timeout0.05验证过降级分支。纵向比较同一篇论文在tests/data/latex/groundtruth/下还有.json完整 DoclingDocument 语义结构含标题、段落、引用等细粒度标签与.itxt层级缩进的人读摘要适合研究同一内容在三种导出形态下的信息取舍。小结2501.00089_main.tex.md的价值是双重的对外它是一篇可独立阅读的高质量机器学习天文学论文SFNet 的完整方法、结果与讨论的文本再现对内它是 Docling LaTeX 后端回归测试的金标准把aastex期刊论文这类高复杂度输入专用表格环境、双栏布局宏、复杂引用、图片引入的真实解析行为固定下来任何后端改动都必须与它保持一致。对照 main.tex 逐段研读这份 groundtruth是理解 Docling LaTeX 转换能力边界与后续演进方向最直接的途径。【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻