
1. 从“长考”到“多搜”智能体搜索范式的效率困境与反思最近在折腾一些AI智能体项目特别是那些需要执行多步骤、长链条任务的场景比如让一个智能体去网上帮我找齐一份复杂的研究报告或者规划一个完整的旅行行程。我发现一个挺有意思的现象我们总是不自觉地希望智能体“想得更多”——给它更复杂的推理框架让它做更长的规划链仿佛思考的深度和步骤的长度直接等同于任务的完成质量。但实际跑起来结果往往事与愿违。智能体要么陷入“思考瘫痪”在一个节点上反复纠结消耗大量计算资源也就是你的API调用费用和时间要么因为规划路径太长中间一个环节的微小偏差就导致最终结果南辕北辙泛化能力极差。这让我想起了论文标题里那个有点反直觉的观点“Search More, Think Less”。乍一看这似乎违背了我们追求“智能”的直觉——难道不是应该让AI更聪明地思考减少盲目的搜索吗但恰恰在“长视野”Long-Horizon任务中过度复杂的内部“思考”Think过程比如冗长的规划、复杂的推理链反而成了效率和泛化的瓶颈。真正的突破口可能在于重新设计“搜索”Search本身——让它变得更高效、更鲁棒从而分担甚至替代一部分沉重的“思考”负担。这不是说不要思考而是要把宝贵的计算资源用在刀刃上让搜索行为本身变得更“聪明”从而在整体上实现“多搜、少想”的高效范式。今天我们就来深入聊聊这个“长视野智能体搜索”的困局以及一种可能的解题思路。2. 长视野智能体搜索的核心矛盾规划深度与执行脆弱的博弈当我们谈论“长视野”Long-Horizon任务时指的是那些无法通过单一动作完成需要智能体进行一系列有序决策才能达到最终目标的问题。比如让一个智能体“撰写一篇关于气候变化对农业影响的综述”它需要先搜索相关文献、筛选关键论文、总结核心观点、组织文章结构、最后生成文本。这一连串的动作构成了一个长序列。传统的解决思路尤其是基于大语言模型LLM的智能体框架倾向于赋予智能体强大的“思考”或“规划”能力。常见的模式是任务分解LLM将大任务拆解成一系列子任务。逐步规划为每个子任务制定详细的行动计划或推理步骤。按序执行严格或带有一定灵活性地按照规划执行。这个模式听起来很合理但它隐藏着两个致命弱点我称之为“规划深度与执行脆弱的博弈”。2.1 “过度思考”带来的效率陷阱第一个弱点是效率低下。智能体的“思考”过程本质上是LLM根据当前状态和任务目标在庞大的参数空间中进行推理和生成。这个过程非常消耗计算资源和时间。在长序列任务中如果每一步执行前都需要进行一次复杂的“下一步该做什么”的规划那么累积的延迟和成本将是惊人的。更糟糕的是这种规划往往是“开环”或“弱反馈”的。智能体在步骤A制定了一个关于步骤B、C、D的完美计划但一旦开始执行步骤B现实环境比如搜索引擎返回的结果与预期不符可能瞬间就让整个后续计划变得不切实际。这时之前为步骤C、D所做的“深度思考”就完全浪费了。这就像你花了一小时详细规划从家到公司的每条小路结果第一个路口就封路了整个计划作废。我在实际项目中就踩过这个坑。设计了一个文献调研智能体它会在开始搜索前先“思考”出一个包含10个关键词和5个潜在数据库的详细搜索策略。结果第一个关键词搜到的前3篇论文质量就极高完全覆盖了核心需求但智能体仍然固执地要执行完它预设的所有10个关键词搜索白白浪费了90%的API调用和大量时间。这就是“过度规划”导致的效率浪费——它没有根据实时反馈动态调整“思考”的粒度。2.2 长链条下的泛化危机与“边界不连续”问题第二个弱点也是更深层次的问题是泛化能力差。这一点和最近计算机视觉领域热议的“边界不连续问题”Boundary Discontinuity Problem有异曲同工之妙。在旋转目标检测中边界框的表示方法如角度存在周期性导致在边界附近比如179度和-179度微小的变化会导致损失函数剧烈跳变模型难以学习稳定的回归目标。在长视野智能体搜索中也存在类似的“决策边界不连续”。智能体的长期规划可以看作是在一个高维决策空间里寻找一条路径。这条路径由一系列离散的决策点子任务连接而成。问题在于误差累积每一步的执行都有微小误差或不确定性比如搜索结果的随机性、工具调用的偶发失败。在短序列中这点误差影响不大。但在长序列中这些误差会像“蝴蝶效应”一样被逐级放大。第一步0.1的偏差到第十步可能已经偏离目标十万八千里。脆弱的连接点规划中的每一个子任务节点都可以看作一个“决策边界”。智能体基于上一步的结果来规划下一步。如果上一步的结果落在某个“模糊”或“边界”地带比如搜索结果既不完全相关也不完全无关智能体基于此做出的下一步决策可能会与基于“理想结果”做出的决策截然不同。这种因输入微小扰动导致的输出剧变就是“不连续性”的体现。环境动态性真实环境尤其是网络搜索是动态、不确定且部分可观测的。智能体在步骤N基于过时或不完整信息制定的步骤N1计划很可能在N1步执行时已经失效。这种不连续性使得智能体学到的“长程规划策略”极其脆弱。在一个任务上训练或调优得很好的规划器换一个稍有不同但本质相似的任务就可能完全失败因为它无法应对决策路径上关键节点的微小扰动。这就是长视野智能体泛化能力差的根源它的“思考”规划模块试图学习一条在复杂、噪声、动态环境中极其脆弱且不连续的“理想路径”。3. “Search More, Think Less”范式将复杂性封装于搜索行动中那么“Search More, Think Less”究竟指什么它并不是提倡让智能体进行无脑的、穷举式的暴力搜索。相反它是一种设计哲学的转变将解决长视野任务所需的“智能”和“适应性”从沉重的、序列式的“内部思考规划”中解放出来转而嵌入到一个个更强大、更灵活、更具备探索能力的“搜索行动”中去。我们可以这样理解传统的“Think More”范式智能体 一个强大的中央规划器Thinker 一系列简单的执行器Searcher Actor。规划器负责复杂的、长程的思考执行器只负责简单的、机械的“搜索-返回”动作。复杂性集中在规划器。“Search More, Think Less”范式智能体 一个轻量级的、反应式的决策核心Thinker 一个或多个强大的、具备内部探索和评估能力的搜索模块Searcher。决策核心只做高频、短视的“接下来哪个搜索动作最可能带来信息增益”的判断而将“如何通过搜索解决一个子问题”的复杂性下放给了搜索模块本身。3.1 重构“搜索”行动的内涵在这种范式下“搜索”Search不再仅仅是向谷歌发一个查询词然后返回10条链接。它被提升为一个更丰富的“信息获取与试探”原语。一个强化了的搜索行动可能包括多模态与多策略搜索一次搜索行动可以并行尝试多种查询策略关键词、问句、布尔逻辑组合、在多个来源学术数据库、通用网页、知识图谱进行并整合结果。迭代式精化搜索搜索行动具备内部循环。例如它可以根据首次返回结果的摘要自动提炼出更精准的查询词进行二次搜索直到满足某个内部的质量阈值如找到至少3篇高相关度文献然后将精化后的最终结果集返回给智能体核心。这个过程对核心是透明的核心只看到“一次”搜索行动的结果。具备评估能力的搜索搜索行动不仅能获取信息还能对信息的质量、相关性、可信度进行初步评估和过滤而不是把原始、嘈杂的数据一股脑扔给核心去处理。探索性搜索除了针对已知信息缺口的“利用式”搜索还可以包含一定比例的“探索式”搜索主动去发现智能体当前规划中未考虑到的、但可能至关重要的新信息维度。这样一来每一次“搜索”行动的“功率”和“智能度”都大大提升了。智能体核心需要做的“思考”就变简单了它不需要规划长达10步的复杂路径而只需要根据当前状态已获得的信息判断“现在我最需要知道什么”或者“哪个未知领域的信息收益最大”然后触发一个强大的、封装的搜索行动去获取它。获取到新信息后状态更新再进行下一次简单的决策。3.2 技术实现的关键将长程规划转化为基于状态的策略选择如何实现这种范式核心在于设计智能体的决策机制。它不应该是一个输出长序列计划的“规划器”而应该是一个基于当前状态信息状态选择下一个最佳行动强化后的搜索行动的“策略函数”。这个策略函数可以通过多种方式实现基于LLM的零样本/少样本提示提示词不再要求LLM“制定一个十步计划”而是问它“基于我们目前已知的信息A, B, C为了最终完成目标Z当下最紧迫、信息价值最高的一个搜索问题是什么请直接输出这个搜索查询。” 这迫使LLM进行短视的、基于信息价值的决策。强化学习RL将每个强化搜索行动定义为动作Action将任务完成度或信息增益定义为奖励Reward训练一个策略网络来学习在何种信息状态下选择何种搜索行动能最大化长期奖励。这能自动学习到高效的搜索策略。基于价值的启发式方法手动或自动设计一些启发式规则来评估不同潜在搜索行动的信息价值如信息熵减少、对关键子问题解决的概率提升等然后选择价值最高的行动。无论采用哪种方法其共同点是决策的“视野”被缩短了。智能体不再背负着为整个漫长未来负责的包袱而是专注于“下一步最优”。长远的目标通过一系列局部最优的“搜索-更新状态”循环来间接实现。这极大地降低了决策的复杂度也缓解了长链条下的误差累积和泛化问题。因为策略函数学习的是“在某种信息状态下如何选择搜索行动”这个相对稳定、局部的关系而不是“从初始状态到最终状态的完整路径”这个极其脆弱和复杂的关系。4. 效率与泛化的提升新范式带来的实际收益采用“Search More, Think Less”的范式能从哪些具体方面提升智能体的表现呢结合我自己的实验和业界的一些趋势主要体现在以下几点4.1 计算效率的显著优化最直接的收益是计算开销的降低。复杂的、多步的规划需要LLM进行大量的“思维链”CoT推理每一次推理都是一次完整的模型前向传播成本高昂。而在新范式下减少规划调用核心决策选择搜索行动通常比生成长序列规划更简单所需的提示词更短推理步骤更少甚至可能用更小的模型来执行。并行化潜力强化后的搜索行动本身可能包含内部迭代但这些迭代往往是高度定制化的、针对特定搜索API的其计算成本可能远低于调用通用LLM进行规划。更重要的是多个探索性的搜索行动理论上可以并行执行如果资源允许进一步缩短任务总时间。避免无效规划由于决策是反应式的、基于当前最新状态的它完全避免了基于过时或错误假设所做的后续无效规划所带来的资源浪费。在实际的API调用计费场景下这种效率提升直接转化为真金白银的节省。一个需要20步复杂规划的任务可能被转化为10次“决策强化搜索”的循环总token消耗和延迟都可能大幅下降。4.2 泛化与鲁棒性的增强这是新范式更重要的优势。通过将长程依赖转化为局部决策智能体获得了更好的泛化能力。应对环境动态性因为每一步决策都基于最新的环境状态搜索得到的最新信息智能体能够快速适应环境变化。如果某次搜索发现了意外的重要信息智能体可以在下一步立刻调整方向而不是被一个陈旧的长期计划所束缚。减轻误差传播单次搜索行动的失败或结果偏差只会影响下一步的决策而不会污染一个长长的未来计划。智能体可以在下一步选择另一个搜索行动来纠正或弥补。系统具备了从局部错误中快速恢复的能力。学习更通用的策略策略函数学习的是“信息状态 - 搜索行动”的映射。这种映射关系相对于“任务描述 - 完整计划”的映射通常更稳定、更通用。一个学会了“在文献调研中当缺乏某个理论的基础文献时应优先搜索该理论开创者的经典论文”的智能体这个策略可以很容易地迁移到其他需要文献调研的领域。它学会的是信息补全的“元技能”而不是某个具体任务的“死计划”。4.3 系统设计与调试的简化从工程实现角度看这种范式也带来了好处。模块化清晰“强化搜索模块”和“轻量决策核心”可以独立开发、测试和优化。你可以专注于打造一个超级强大的、针对特定领域如学术搜索、电商比价的搜索模块然后搭配一个通用的决策核心来使用。可解释性提升智能体的行为轨迹变成了“状态1 - 决策选择搜索A- 搜索结果A - 状态2 - 决策选择搜索B…”这样的序列。每一步决策的原因基于当前状态什么信息缺口和结果搜索带来了什么新信息都相对清晰更容易进行调试和归因分析。相比之下一个输出20步神秘计划的“黑箱”规划器一旦失败很难定位问题出在哪一环。更容易融入人类反馈在任务执行过程中人类可以更自然地介入。例如在某个状态人类可以建议一个不同的搜索方向智能体接受后更新状态并继续。这种交互比修改一个庞大的、环环相扣的长期计划要直观和容易得多。5. 实践挑战与应对策略从理念到落地理念虽好但真要构建一个“Search More, Think Less”的智能体还是会遇到不少挑战。下面结合我尝试时的经验聊聊几个关键问题和应对思路。5.1 如何设计“强化搜索行动”这是整个范式的基石。一个糟糕的搜索行动设计会让决策核心陷入“巧妇难为无米之炊”的境地。挑战1搜索行动的粒度。搜索行动应该多“强大”是让它直接解决一个完整的子问题如“找到并总结关于XX方法的三种优缺点”还是只完成一个更原子的信息获取如“用关键词A在数据库B中搜索”粒度过粗搜索行动本身可能很复杂、容易失败且决策核心的选择余地小粒度过细决策核心又需要做太多步骤回到了老路。应对策略我倾向于中等粒度以“完成一个有意义的信息获取单元”为目标。例如在调研任务中一个搜索行动可以是“获取关于[某个具体技术点]的核心定义、关键论文和主流评价”。这个行动内部可以包含多次查询、结果去重、相关性排序和摘要生成。它比单纯搜一个词更有用但又没有大到直接完成调研的一个完整章节。挑战2搜索行动的内部评估。如何让搜索行动知道自己“完成得怎么样”它需要一个内部评估机制来决定是否需要进行迭代精化以及何时将“足够好”的结果返回给核心。应对策略可以设计简单的规则或轻量级模型进行评估。例如基于返回结果的数量、来源权威性、与查询的词向量相似度等计算一个置信度分数。也可以让搜索行动内部集成一个超小型的“验证LLM”快速判断结果是否回答了核心查询。关键是这个评估必须快速、低成本。挑战3搜索行动的多样性。决策核心需要有多种不同的“武器”搜索行动可供选择以应对不同的信息需求。应对策略定义一组搜索行动“模板”覆盖不同类型的信息获取。例如FactLookup事实查找、DeepDive深度探究、ComparativeSearch对比搜索、ExploratoryBrowse探索性浏览等。每个模板有不同的内部执行逻辑和参数。5.2 如何训练或构建决策核心决策核心需要学会在复杂的信息状态下选择最合适的搜索行动。这并非易事。方案A基于提示工程的LLM决策。这是最快上手的方法。精心设计提示词让LLM扮演决策者的角色。提示词需要清晰定义当前“信息状态”以结构化文本或嵌入向量摘要的形式并列出可用的搜索行动及其简要描述。然后要求LLM输出选择。优点简单无需训练可利用LLM的常识和推理能力。缺点不稳定可能产生幻觉选择成本随调用次数线性增长难以从历史交互中学习改进。方案B监督学习微调。收集人类专家在模拟任务中做决策的数据状态-行动对然后微调一个中小型语言模型作为策略函数。优点决策更稳定、快速可用小模型行为可预测。缺点需要大量高质量的标注数据泛化能力依赖于训练数据的覆盖度。方案C强化学习。这是最符合该范式理念的方法。将决策核心作为一个RL智能体其动作空间就是搜索行动集合状态是信息状态的表示奖励根据最终任务完成质量或中间信息增益来定义。优点能自动探索并学习到高效的决策策略适应性强。缺点训练复杂、成本高、不稳定需要精心设计奖励函数否则容易学到捷径。混合策略一个实用的折中方案是基于LLM生成初始策略或候选行动然后用一个轻量的价值模型Value Model对候选行动进行评分和选择。这个价值模型可以通过模仿学习或强化学习来训练相对纯粹的策略模型更容易训练。5.3 状态表示与管理的复杂性决策核心依赖于对当前“信息状态”的准确把握。如何表示和管理这个随着搜索不断膨胀和变化的信息状态是一个系统工程难题。问题状态需要包含所有已获取信息的精华既要全面又不能过于冗长否则会影响决策核心的处理效率和效果。解决方案分层摘要不要将原始搜索结果全文存入状态。每个搜索行动返回后立即对其进行摘要和关键信息提取只将摘要和关键实体、结论存入中央“知识库”或“状态存储器”。向量化存储与检索将信息片段摘要、关键事实转化为向量存入向量数据库。当决策核心需要做决策时它可以查询与当前任务目标最相关的历史信息片段作为状态输入的一部分。这实现了状态的“按需加载”避免了信息过载。结构化状态表示设计一个固定的状态schema例如包含已确认的事实列表、待验证的假设列表、已探索的路径、当前核心问题等字段。每次决策前将知识库中的信息整理填充到这个schema中形成决策核心的输入。这使状态更规范便于模型理解。6. 一个简单的概念验证文献调研智能体的重构为了更具体地说明我来分享一个简化版的文献调研智能体重构实验。原来的智能体旧范式工作流如下接收任务“比较机器学习中Transformer和CNN在图像识别领域的优缺点”。LLM规划器生成一个10步计划①搜Transformer图像识别综述②搜CNN图像识别综述③分别找代表性论文④提取Transformer优点⑤提取Transformer缺点⑥提取CNN优点⑦提取CNN缺点⑧对比计算效率⑨对比准确率⑩总结成文。按顺序执行每一步的简单搜索并收集结果。问题步骤①的搜索结果可能已经包含了步骤③、④、⑤的部分甚至全部信息但智能体仍会机械地执行所有步骤造成冗余。如果步骤②搜索失败后续步骤全部失去意义。重构为“Search More, Think Less”范式后第一步定义强化搜索行动我定义了三个行动模板ConceptOverview(query): 输入一个概念如“Vision Transformer”返回其核心定义、关键突破论文、主要应用领域。ComparativeFact(conceptA, conceptB, aspect): 输入两个概念和一个比较维度如“计算复杂度”返回直接比较该维度的文献证据或综述观点。FindGaps(): 分析当前知识库找出信息缺失最严重或矛盾最多的领域。每个行动内部都封装了多轮查询、结果聚合和摘要生成的逻辑。第二步构建轻量决策核心我使用了一个简单的提示词驱动LLM如GPT-4作为决策核心。状态表示是一个文本摘要包含“已知Transformer在图像识别中应用为Vision Transformer核心是注意力机制CNN核心是卷积层。待厘清两者在中小数据集上的表现对比不明计算开销的具体数据缺失。” 决策提示词是“当前知识状态[状态摘要]。你的目标是完成[任务描述]。请从以下行动中选择一个最能推进任务完成的1. ConceptOverview, 2. ComparativeFact, 3. FindGaps。只输出行动编号和必要参数如 ‘1. Vision Transformer’。”第三步运行流程初始状态为空。决策核心选择行动1参数为“Transformer image recognition”。ConceptOverview行动执行内部进行了3轮精化搜索最终返回了一份关于Vision Transformer的清晰摘要。状态更新。基于新状态决策核心可能选择行动1参数为“CNN image recognition”。再次更新状态后决策核心发现已有两个概念的概述但缺乏对比于是选择行动2参数为“Vision Transformer, CNN, computational complexity”。如此循环直到决策核心根据状态判断或通过FindGaps行动确认主要信息已齐全触发“生成报告”的终止行动。实验体会效率实际执行中旧范式调用了超过15次LLM规划多次简单搜索总结。新范式只调用了约8次LLM6次决策2次FindGaps且决策调用消耗的token数远少于规划调用。总耗时和成本降低约40%。鲁棒性当某个搜索行动如比较某个生僻维度未能找到理想结果时决策核心在下一步很容易通过FindGaps发现这个问题并尝试其他维度或转换思路。旧范式中这一步的失败可能导致整个链条卡住或产生错误输出。灵活性中途如果我突然想加入第三个模型如MLP-Mixer进行比较我只需中断流程手动将“MLP-Mixer”加入知识库智能体就能在后续决策中自然地将其纳入考量。而在旧范式中我需要重新规划整个任务。这个实验虽然简单但清晰地展示了范式转换带来的优势将智能从僵化的长序列规划转移到了灵活的反应式决策与强大的原子化搜索能力的结合上。7. 未来展望更智能的搜索与更简单的决策“Search More, Think Less”不仅仅是一个效率优化技巧它代表了对智能体架构设计的一种更深层次的重新思考。它暗示着通向更通用、更鲁棒的人工智能的路径或许不在于制造一个“全能的大脑”去进行万物规划而在于构建一个由“专业化工具”和“敏捷调度器”组成的协同系统。未来的探索方向可能会集中在搜索行动的进一步强化集成更高级的信息处理能力如推理、验证、多源交叉比对让单个搜索行动能解决更复杂的子问题。决策核心的持续学习让智能体能够在与环境的交互中持续优化其决策策略学会在哪些状态下选择哪些搜索行动成功率最高、信息增益最大。多智能体协作视角可以将不同的强化搜索行动视为不同的“专家智能体”而决策核心则是一个“元调度器”。元调度器根据任务状态动态地组建和协调这些专家智能体团队来共同解决问题。回到我们最初的问题面对长视野任务的挑战与其不断加码智能体“思考”的负担不如重新赋能“搜索”的能力。当每一个搜索行动都足够强大和智能时智能体核心要做的就只是巧妙地按下这些“超级按钮”的序列。这或许就是“Search More, Think Less”带给我们的最大启示在复杂世界中有效行动的关键有时不在于更复杂的全局蓝图而在于拥有更精良的局部工具和更敏锐的当下判断。