FEATURED · 精选文章

Aletheia如何工作?Superhuman研究级数学AI工作流完整拆解

发布时间 / 2026/9/18 18:50:42
来源 / 创域科博编辑部
栏目 / 资讯中心
Aletheia如何工作?Superhuman研究级数学AI工作流完整拆解 Aletheia如何工作Superhuman研究级数学AI工作流完整拆解【免费下载链接】superhuman项目地址: https://gitcode.com/GitHub_Trending/sup/superhumanSuperhuman是 Google DeepMind 超级推理团队Superhuman Reasoning开源的数学推理项目仓库核心亮点Aletheia是一个由 Gemini Deep Think 驱动的研究级数学智能体Math Research Agent能够迭代地生成、验证并修改数学证明产出可直接用于发表研究论文的完整 LaTeX 证明。本文将从仓库结构、工作流机制、评测基准到形式化验证带你完整拆解这套研究级数学工作流是如何运转的。一、Superhuman 仓库全景三大核心模块 ️打开仓库根目录的 README.md你会发现整个项目由三大板块组成模块定位一句话简介Aletheia研究级数学智能体生成、验证、修改研究级数学问题的证明IMO Bench数学推理评测基准400 道简答题 60 道证明题 1000 份人工评分LEAP形式化证明框架用 Lean 4 编译反馈迭代完善机器生成的证明这三者构成了一条完整的数学推理能力流水线IMO Bench 负责量尺Aletheia 负责攻关研究级问题LEAP 负责用形式化语言把证明钉死在编译器层面。二、Aletheia 如何工作生成 → 验证 → 修改三步循环 Aletheia 的核心机制写在 Aletheia 论文 中它不是一次性给出答案的问答机器而是一个持续迭代的智能体工作流。1. 输入研究级问题Aletheia 面对的难题远超竞赛数学包括Erdős 开放问题如泛化 Erdős-1051 并证明某类快速收敛级数的无理性见 BKKKZ26/BKKKZ26.tex代数几何证明模空间上 Hodge 丛的简单性无非平凡子丛见 HodgeBundle/HodgeBundle.tex拓扑学难题解决 Kirby 3 问题列表中关于非交换半自由 DGA 的 Problem 5.16见 Kirby/Kirby5-16.texFirstProof 挑战对第 2、5、7、8、9、10 题的多解法完整证明收录在 aletheia/FirstProof/2. 迭代生成与自检在 aletheia/Erdos/Erdos.tex 这样的输出文档中你能清晰看到工作流的过程考古每道题都以Problem 框给出原始陈述随后Solution 框呈现 Aletheia 的完整证明——证明内部按段落展开引用定理 → 构造对象 → 逐步推导 → 验证结论的标准研究论证结构。例如 Erdős-75 的证明中模型先定位到 Lambie-Hanson 2020 年的关键定理再层层推导到独立集规模不等式。3. 修订与人工校订值得注意的是aletheia/README.md 明确说明这些输出仅做了排版兼容性编辑其中许多包含小错误minor inaccuracies。这正是工作流的一部分——模型输出的证明需要被验证、被修订最终由研究者确认后成为论文素材。例如 Aletheia 还独立意识到 Kirby 问题列表的 3.39b 可直接化归为 Chen-Lodha 的最新结果展现了智能体在文献追踪上的能力。要点Aletheia 的价值不在于永远正确而在于它把研究者的重复劳动找引理、写初稿、检查细节压缩成了可迭代的智能体循环。三、IMO Bench如何衡量一个 AI 的数学成色 Aletheia 的强大需要标尺imobench/README.md 里的IMO Bench就是官方量尺包含四个数据集IMO-AnswerBench400 道简答难题answerbench_v2.csvIMO-ProofBench60 道专家审定的证明题proofbench_v2.csvIMO-GradingBench1000 份人工评分推动自动评测gradingbench.csvIMO-LeanProofBenchLean 形式化题目lean_proof_bench.csv题目覆盖代数、几何、组合、数论四大领域其中组合题最弱、几何与数论竞争最激烈各大模型在 AnswerBench 上按人类评审标准打分后的准确率对比Deep Think IMO Gold 版本在各类目均领先而 GradingBench 展示了一个关键事实证明题的评分分布远比对错二元复杂——Easy 档 61.8% 得满分但 Hard 档下错误与部分得分占大头这正是需要 1000 份人工评分数据训练自动评分器的原因四、LEAP把自然语言证明钉进 Lean 4 编译器 自然语言证明可能看起来对而LEAPLLM-in-Lean Environment Agentic Prover解决的就是这个问题详见 leap/README.md 与 LEAP.pdf分解用 AND-OR DAG 蓝图把复杂问题拆成小子目标迭代把 Lean 编译器的报错反馈回给 LLM配合 LLM 评审持续打磨验证证明通过编译器才算数成果相当硬核——在 leap/solutions/Putnam-2025/ 下是2025 年 Putnam 竞赛全部 12 题的 Lean 4 完整形式化解法100% 解决率可打开 putnam_2025_a1_solution.lean 感受机器证明的粒度leap/solutions/LEAN-IMO-Bench/ 则按 Basic / Advanced 两档组织了 IMO 风格题的正式证明最惊艳的是 leap/solutions/Open-Problems/ 中 Erdős 457 问题与 Knuth 哈密顿分解子问题的已验证证明。五、总结一条完整的研究级数学工作流 把三大模块串起来Superhuman 展示的是一条清晰路线Aletheiaaletheia/——智能体迭代生成、验证、修改研究级证明IMO Benchimobench/——用简答、证明、评分三层数据客观度量数学推理能力LEAPleap/——用 Lean 4 编译器反馈闭环让证明从可信升级为可验证。仓库内所有 LaTeX/PDF 素材均可直接查阅是研究 AI 数学推理工作流的绝佳一手材料。项目代码遵循 Apache 2.0 协议其余资料遵循 CC-BY 4.0 许可可在 LICENSE 中查看完整条款。【免费下载链接】superhuman项目地址: https://gitcode.com/GitHub_Trending/sup/superhuman创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻