FEATURED · 精选文章

通义甩出王炸!通义DeepResearch:首个媲美OpenAI的开源网络智能体

发布时间 / 2026/8/27 16:16:11
来源 / 创域科博编辑部
栏目 / 资讯中心
通义甩出王炸!通义DeepResearch:首个媲美OpenAI的开源网络智能体 前言通义DeepResearch开启开源 AI 研究智能体的新纪元从聊天机器人到自主智能体最近阿里团队推出了 **通义深度研究 (Tongyi DeepResearch)**这是首个完全开源的网络智能体 (Web Agent)在一系列基准测试中它的表现足以和 OpenAI 的同类研究智能体相媲美。通义深度研究展现了当前最顶尖的水平具体来看在学术推理任务 HLE (Humanity’s Last Exam) 中得分32.9在极其复杂的信息检索任务 BrowseComp 中得分43.4在中文信息检索任务 BrowseComp-ZH 中得分46.7在以用户为中心的 xbench-DeepSearch 基准测试中得分75这些成绩全面超越了市面上所有现有的闭源和开源同类研究智能体。除了模型本身该项目还分享了一套完整且经过实战检验的方法论揭示了如何打造这样一个先进的智能体。其核心贡献在于一套新颖的数据合成方案这套方案贯穿了整个训练流程——从用于冷启动的智能体持续预训练 (Agentic CPT)和监督微调 (SFT)一直到最后的强化学习 (RL)阶段。特别是在强化学习方面团队提供了一套全栈解决方案涵盖了算法创新、自动化数据整理和强大的基础设施。而在推理层面通用的 ReAct 框架展示了模型无需任何提示工程就具备的强大内在能力而先进的“重度模式” (Heavy Mode) 则进一步挖掘了其复杂推理和规划能力的上限。全合成数据驱动从持续预训练到后训练持续预训练数据为了给后续的训练流程打下一个坚实的智能体基础模型团队首次将智能体持续预训练 (Agentic CPT)的概念引入研究型智能体的训练中。为此他们提出了AgentFounder一个系统化、可扩展的大规模数据合成方案它通过整个后训练流程的数据创造了一个数据飞轮。1. 数据重组与问题构建这个方案会持续从各种来源收集数据包括文档、公开网页数据、知识图谱以及历史轨迹和工具调用记录比如带链接的搜索结果。如下图所示这些五花八门的数据源被重构成以实体为核心的开放世界知识记忆库。然后基于随机采样的实体及其相关知识生成各种风格的问题答案对。轨迹合成流程2. 动作合成基于多样化的问题和历史轨迹团队构建了两种动作合成数据一阶动作和高阶动作。这种方法能够在离线环境中大规模、全面地探索潜在的推理-行动空间从而避免了对商业工具 API 的额外调用。特别是在高阶动作合成中轨迹被重塑为多步决策过程以此来增强模型的决策能力。后训练数据高质量的合成问答对为了突破 AI 智能体的性能极限团队开发了一套端到端的全自动化数据合成解决方案。这个过程无需任何人工干预就能构建出超高质量的数据集。这套方法经过了长期的探索和迭代——从早期通过逆向工程从点击流生成问答对WebWalker到更系统的基于图谱的合成方法WebSailor再到形式化的任务建模WebShaper最终确保了卓越的数据质量和大规模的可扩展性。为了解决那些复杂且不确定性高的问题团队通过一个新颖的流程来合成基于网络的问答数据。首先通过随机游走和同构表构建从真实网站数据中建立高度互联的知识图谱确保了信息的真实结构。然后对子图和子表进行采样生成初始的问题和答案。最关键的一步是通过巧妙地模糊或混淆问题中的信息来刻意增加难度。这种方法背后有完整的理论框架支撑将问答难度形式化建模为实体关系上的一系列可控“原子操作”例如合并属性相似的实体从而能够系统地提升问题的复杂度。此外为了进一步减少结构化信息与问答推理结构之间的差异实现更可控的难度扩展团队基于集合论对信息检索问题进行了形式化建模。通过这种形式化开发出的智能体能够以受控的方式扩展问题最大限度地减少推理捷径和结构冗余进一步提高了问答质量。同时这种形式化建模也让问答正确性的验证变得高效解决了后训练中合成数据验证的难题。不仅如此团队还开发了一个自动化数据引擎用于生成博士级别的研究问题。这个引擎首先建立一个多学科知识库生成需要跨来源推理的“种子”问答对。然后每个种子都会进入一个自引导的“迭代式复杂性提升”循环。在这个循环中一个问题构建智能体配备了网络搜索、学术检索和 Python 执行环境等强大工具。在每次迭代中智能体不断扩展知识边界、深化概念抽象甚至构建计算任务形成一个良性循环上一轮的输出成为下一轮更复杂的输入确保了任务难度可控且系统性地升级。通过 SFT 冷启动提升智能体能力为了提升模型的初始能力团队基于 ReAct 和新提出的 IterResearch 框架下文会详述通过拒绝采样构建了一批 SFT 轨迹数据。一方面ReAct 作为经典的多轮推理格式为模型注入了丰富的推理行为并强化了其遵循结构化格式的能力。另一方面团队引入了IterResearch这是一种创新的智能体范式。它通过在每一轮动态重建一个精简的工作空间来释放模型的全部推理潜力确保每个决策都经过深思熟虑。利用 IterResearch团队构建了一批融合了推理、规划和工具使用的轨迹从而增强了模型在面对复杂任务时持续规划的能力。推理模式在研究智能体的推理范式上团队进行了广泛的探索。最终的模型支持多种推理格式包括原生的 ReAct 模式和带上下文管理的“重度模式”。原生 ReAct 模式这个模型在原生的 ReAct 推理模式下无需任何提示工程Prompt Engineering就能展现出卓越的性能。它严格遵循“思考-行动-观察”的循环通过多次迭代来解决问题。得益于 128K 的模型上下文长度它可以处理大量的交互轮次充分发挥与环境扩展交互的潜力。ReAct 的简洁和通用性最清晰地证明了模型内在的能力和训练流程的有效性。选择 ReAct 在很大程度上是受到了 AI 领域的“惨痛教训” (The Bitter Lesson) 理论的启发该理论认为利用可扩展计算的通用方法最终将超越那些依赖复杂、人为设计的知识和精巧设计的方法。重度模式 (Heavy Mode)除了原生的 ReAct 模式团队还开发了专为复杂、多步研究任务设计的“重度模式” (Heavy Mode)。该模式基于新的IterResearch范式构建旨在将智能体的能力推向极限。IterResearch 范式的提出是为了解决一个痛点当智能体把所有信息都堆积在一个不断膨胀的上下文中时容易出现“认知窒息”和“噪音污染”。而 IterResearch 则将任务分解为一系列的“研究回合”。IterResearch 范式在每个回合中智能体只利用上一回合最核心的结果来重建一个精简的工作空间。在这个专注的工作空间里智能体分析问题将关键发现整合到一份持续更新的中心报告中然后决定下一步行动——是收集更多信息还是给出最终答案。这种“合成与重建”的迭代过程让智能体在漫长的任务中也能保持清晰的“认知焦点”和高质量的推理。在此基础上团队还提出了“研究-合成”框架。在该模型中多个研究智能体利用 IterResearch 过程并行探索问题。最后一个合成智能体负责整合它们提炼出的报告和结论从而产生一个更全面的最终答案。这种并行结构让模型能在有限的上下文窗口内探索更广泛的研究路径将其性能推向极限。端到端的智能体训练流程训练流程图为了训练出这样的智能体模型整个模型训练流程都需要被重新思考从预训练、微调到强化学习。团队为智能体模型训练建立了一种新范式将智能体 CPT→智能体 SFT→智能体 RL连接起来为 AI 智能体创建了一个无缝的端到端训练闭环。下面重点介绍最后阶段——强化学习是如何实现的这对校准智能体的行为至关重要。在线智能体强化学习 (RL)用强化学习来构建高质量的智能体是一项复杂的系统工程挑战。如果把整个开发过程看作一个“强化学习”循环那么任何一个环节的不稳定或不健壮都可能导致错误的“奖励”信号。以下是团队在强化学习方面的实践经验涵盖算法和基础设施两个方面。在强化学习算法方面团队取得了多项突破采用了一种定制的在线 (on-policy)组相对策略优化 (Group Relative Policy Optimization, GRPO)算法。首先采用严格的在线训练方案确保学习信号始终与模型当前的能力相关。其次为了进一步减少优势估计的方差采用了留一法 (leave-one-out) 策略。此外对负样本采取保守策略因为未经筛选的负样本轨迹会显著降低训练稳定性甚至在长时间训练后导致“格式崩溃”。为此团队会选择性地将某些负样本排除在损失计算之外例如那些因超长而未能产生最终答案的样本。从训练动态来看学习是有效的奖励呈现持续上升趋势。同时策略熵保持在较高水平表明模型在持续探索避免了过早收敛。一个有趣的发现是算法虽然重要但可能不是智能体强化学习成功的唯一决定因素。数据和训练环境的稳定性可能才是决定强化学习成败的关键。团队曾尝试直接在 BrowseComp 测试集上训练模型但效果远不如使用合成数据。推测原因在于合成数据提供了一个更一致的分布让模型能更有效地学习和泛化。相比之下人工标注的数据如 BrowseComp本身就更嘈杂且规模有限难以形成一个可学习的潜在分布。在基础设施方面训练一个带工具的智能体需要一个高度稳定和高效的环境模拟训练环境依赖实时网络 API 进行开发成本高、速度慢且不稳定。团队通过创建一个使用离线维基百科数据库和定制工具套件的模拟训练环境来解决这个问题。这个平台经济高效、快速可控极大地加速了研究和迭代。稳定高效的工具沙箱为了确保工具使用的可靠性团队开发了一个统一的沙箱。该沙箱通过缓存结果、重试失败调用以及使用备用 API 等方式来优雅地处理并发和故障为智能体提供了快速和确定性的体验。自动化数据整理数据是模型能力提升的核心驱动力。为了应对这一挑战团队通过训练的动态过程来实时优化数据。一个完全自动化的数据合成和过滤管道会动态调整训练集通过打通数据生成与模型训练的闭环不仅确保了训练稳定性也带来了显著的性能提升。在线异步框架基于 rLLM团队实现了一个定制的步级异步强化学习训练循环。多个智能体实例并行地与环境交互每个实例都生成轨迹。通过这些措施整个智能体训练流程形成了一个“闭环”。从一个原始模型开始通过 CPT 预训练初始化工具使用技能然后用专家级数据进行 SFT 冷启动最后进行在线强化学习让模型自我演进。这种全栈方法为训练能够在动态环境中稳健解决复杂任务的 AI 智能体提出了一种新的范式。实际应用与影响通义深度研究不仅仅是一个技术展示它已经在阿里内外的实际应用中发挥价值高德地图伴侣小高团队与高德合作共同开发了 AI 副驾“小高”。它能利用高德应用的丰富工具集执行复杂的旅行规划指令比如创建一个包含特定景点和宠物友好酒店的多日自驾游路线。通过多步推理小高能自主研究并整合信息生成详细的个性化行程。通义法睿法律研究智能体在深度研究架构的赋能下法睿成为了一个真正的法律智能体。它能自主执行复杂的多步研究任务模拟初级法律助理的工作流程——系统性地检索判例法、交叉引用法规并综合分析。更重要的是所有结论都基于可验证的司法来源并附有精确的判例和法规引用确保了专业级的准确性和可信度。通义法睿局限性未来的工作将主要解决三个关键局限性上下文长度当前 128K 的上下文长度对于最复杂的长程任务仍然不够需要探索扩展上下文窗口和更复杂的信息管理技术。模型规模当前的训练流程在远超 30B 规模的 MoE 基础模型上的可扩展性尚未得到验证。RL 效率计划通过研究部分推演等技术来提高强化学习框架的效率这将需要解决离线策略训练带来的分布偏移等挑战。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻