FEATURED · 精选文章

系统综述 Agent 的瓶颈,不是找不到论文,而是拿不到可分页的 citation graph

发布时间 / 2026/8/6 17:11:44
来源 / 创域科博编辑部
栏目 / 资讯中心
系统综述 Agent 的瓶颈,不是找不到论文,而是拿不到可分页的 citation graph 导语过去一周关于 Agentic AI for Science 的讨论继续升温。但一旦场景从“找几篇相关论文”进入“做系统综述、追 related works、补 citation chain”很多科研 Agent 会暴露同一个短板它们能召回片段却拿不到完整、可分页、可扩展的论文关系层。科研 RAG 的下一步不只是 semantic search而是把论文、引用、参考文献和相关工作真正变成可调用的数据工作流。正文热点背景Agent 能写代码了但科研工作流的瓶颈转向“验证与扩展”7 月 28 日OpenAI 发布《Scientific computing in the age of agentic AI》讨论科研软件正在进入 agent-assisted 的新阶段。更早一些Anthropic 在 6 月 30 日推出 Claude Science把科研工作台直接做成了带技能、连接器和本地算力调度的工作环境。这类信号说明一件事科研 Agent 的问题已经不只是“能不能回答一个问题”而是“能不能把检索、验证、扩展、追溯做成稳定工作流”。在这个阶段单纯返回若干高相关 chunk 已经不够因为系统综述、综述扩写、related works 补全本质上都依赖一个可扩展的 citation network。技术问题semantic chunk 命中了不等于论文关系拿全了很多团队第一次做科研 RAG默认思路是用自然语言问题做语义检索。取前 5 到 10 个 chunk。让模型总结结论。这个链路适合“快速找证据”但不适合“系统性扩展文献池”。原因很简单。chunk-level 检索回答的是“哪些片段和问题相关”而系统综述常见的问题是这篇 paper 被谁引用了它引用了哪些关键前作与它相关、但没有被当前 query 命中的 works 是什么如果 citations 或 references 很长Agent 怎么持续翻页而不是只看截断列表这也是为什么 Sciverse 把meta-paper-relations单独做成公开接口而不是把引用关系混在meta-search的结果里。根据最新llms-full.txt官方明确把它定义为“paginate a paper’s citations, references, and related works”并强调它存在的原因是论文关系本身可能是无界数组meta-search里最多只会内联截断信息。行业对比地图、索引和工作流数据层不是一回事下面这个对比不是为了说谁替代谁而是为了区分定位。维度SciverseOpenAlexSemantic ScholarCrossref结构化元数据检索支持强支持强语义证据片段检索支持agentic-search非核心部分场景可替代非核心论文关系分页支持独立meta-paper-relations可做图谱查询但常需自行封装强于关系发现但 Agent 工作流封装程度因接入方式而异非核心原文上下文回读支持content非核心非核心非核心Figure / Table 资源支持resource非核心非核心非核心面向 Agent 的调用链明确按检索、关系、上下文、资源拆层更像开放学术图谱更偏 paper discovery / citation use case更偏 DOI 与出版元数据基础设施如果用一句话概括OpenAlex 更像地图Crossref 更像出版索引Semantic Scholar 强在 paper discovery 和 citation use case而 Sciverse 更像面向科研 Agent 的 AI-ready 科学数据层重点不在“返回一张论文表”而在“让 Agent 能沿着 evidence、metadata、relation、content 一层层往下走”。Sciverse 的切入点把“论文关系扩展”做成 Agent 可调用接口Sciverse 当前公开定位不是普通搜索框而是面向科研 Agent 的 scientific evidence data API / research-agent data layer。它的价值在于把科研工作流拆成几层彼此可组合的接口meta-search先定位目标论文取到unique_idmeta-paper-relations再按CITATIONS、REFERENCES、RELATED_WORKS分页扩展关系content必要时按doc_id offset回读原文上下文resource进一步拿 Figure / Table 等资源meta-catalog让 Agent 先知道哪些元数据字段能筛、能排、能投影这套拆法很重要。因为在科研 Agent 里“找论文”只是入口“扩文献池”和“证据回读”才是后半程。技术拆解一个系统综述 Agent 的最小关系扩展链路如果今天要做一个 Literature Review Agent更合理的链路通常不是“semantic search 一步到位”而是下面这样步骤接口作用关键返回1meta-search先按标题、DOI、年份或关键词定位目标论文unique_id、title、doi、doc_id2meta-paper-relations拉取完整引用、参考文献或 related works并分页遍历items、total_count、page、page_size3meta-search或agentic-search对关系结果二次筛选构建候选论文池元数据或 evidence chunk4content对关键论文做原文回读和证据核验text、next_offset、more5resource在需要图表证据时补 Figure / Table二进制资源文件这里最容易被忽略的点有两个。第一meta-paper-relations用的是unique_id不是doc_id。第二semantic chunk 检索和论文级关系扩展不是一回事。前者解决“相关性入口”后者解决“系统性完备性”。代码示例先定位论文再分页拉 citations以下字段以最新线上文档 / OpenAPI 为准。importosimporttimeimportrequests BASE_URLhttps://api.sciverse.spaceAPI_TOKENos.environ[SCIVERSE_API_TOKEN]HEADERS{Authorization:fBearer{API_TOKEN},Content-Type:application/json,}sessionrequests.Session()session.headers.update(HEADERS)defpost_with_retry(path:str,payload:dict,retries:int3):urlf{BASE_URL}{path}forattemptinrange(retries):respsession.post(url,jsonpayload,timeout30)ifresp.status_code429:# 官方公开资料提到默认分钟级保护通常是 30 req/min# 实际额度以账号配置为准遇到 429 时做指数退避。ifattemptretries-1:raiseRuntimeError(Sciverse API rate limited after retries)wait_seconds2**attempt time.sleep(wait_seconds)continueresp.raise_for_status()returnresp.json()raiseRuntimeError(Unexpected retry loop exit)# 1. 先用 meta-search 定位目标论文拿 unique_idpaper_query{query:graph neural network drug discovery review,fields:[title,doi,publication_published_year,publication_venue_name_unified,unique_id,doc_id],page:1,page_size:5}search_datapost_with_retry(/meta-search,paper_query)resultssearch_data.get(results,[])ifnotresults:raiseRuntimeError(No papers found)targetresults[0]unique_idtarget[unique_id]titletarget.get(title,)doc_idtarget.get(doc_id)print(Target paper:,title)print(unique_id:,unique_id)print(doc_id:,doc_id)# 2. 再分页拉取引用关系relations_payload{unique_id:unique_id,relation:CITATIONS,# 也可以换成 REFERENCES / RELATED_WORKSpage:1,page_size:25}relations_datapost_with_retry(/meta-paper-relations,relations_payload)itemsrelations_data.get(items,[])total_countrelations_data.get(total_count)pagerelations_data.get(page)page_sizerelations_data.get(page_size)print(fFetched{len(items)}citation items)print(fpage{page}, page_size{page_size}, total_count{total_count})foriteminitems[:5]:print({id:item.get(id),id_type:item.get(id_type),title:item.get(title)})这段代码的意义不在于“又多调了一个接口”而在于它把 Agent 的工作方式从“命中几个相关片段”改成了“先锚定论文再沿关系层可控扩展”。对于系统综述、综述补全、citation grounding这一步通常决定了文献池是否完整。为什么这件事今天更重要Agentic AI 正在把科研软件的门槛拉低但也把“验证”和“边界感”推到了前台。对科研场景来说最危险的不是模型没输出而是它输出得很像对的却缺了关键前作、忽略了引用链、或者把局部 chunk 当成全局结论。所以今天真正有价值的数据层不只是把论文搜出来而是把下面几类对象都交给 Agent论文级 identity关系级 pagination原文级 context资源级 figure / table元数据级 filter / facet / count这也是 Sciverse 和“只返回 paper list 的 API”之间最核心的区别。它面向的不是单次查询而是可追溯、可扩展、可复核的科研工作流。评测 / 验证章节本文未进行实测跑分仅提供可复现评测方案。如果要验证“citation pagination 是否真的提升系统综述 Agent”可以用下面这套方案评测项方案任务定义选择 20 个有明确综述边界的问题如某一技术路线近 5 年关键 papersBaseline A仅用agentic-search取 Top-K chunk 后总结Baseline B用meta-search定位论文再用meta-paper-relations扩展 citations / references观察指标是否漏掉公认关键前作、是否能覆盖 related works、是否能给出更完整的候选论文池复核方式由人工或已有综述目录做对照不比较模型文风只比较检索与扩展完整性注意事项不把单次命中率误当系统综述质量关系扩展和原文核验要分开看如果你的科研 Agent 下一步要接入 Cursor、Claude、Codex 或 MCP真正值得优先补上的往往不是更多 prompt而是更完整的 relation layer。结尾 CTA如果你正在做 Literature Review Agent、Scientific RAG、Claim Checker 或 paper screening workflow可以先从 Sciverse 的meta-search和meta-paper-relations开始把“找论文”升级成“可分页扩展的文献关系工作流”。再往后再接content做原文回读接resource做图表证据。文档可以直接从 Sciverse 官方文档和llms-full.txt开始如果你已经在用 Cursor、Claude、Codex 或 MCP也可以直接接入 Sciverse Agent Tools把这些接口变成真正的科研 Agent 工具链。参考来源Sciverse 官方文档总览Sciversellms-full.txtSciverse OpenAPISciverse API 文档meta-searchSciverse API 文档meta-paper-relationsSciverse API 文档contentSciverse Agent ToolsOpenAIScientific computing in the age of agentic AI2026-07-28AnthropicClaude for Life Science Teams / Claude Science
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻