FEATURED · 精选文章

From Chat to Interview: Agentic Requirements Elicitation with an Experience Ontology——基于经验本体的智能体需求获取

发布时间 / 2026/9/10 23:49:54
来源 / 创域科博编辑部
栏目 / 资讯中心
From Chat to Interview: Agentic Requirements Elicitation with an Experience Ontology——基于经验本体的智能体需求获取 一、研究背景与问题现状与挑战需求获取访谈是需求工程中最关键也最耗时的环节严重依赖分析师的个人经验容易导致隐含需求遗漏、提问冗余、结果不可解释。现有LLM方法的局限直接让LLM进行自由对话式提问缺乏结构化引导早期问题通用、后期覆盖不全且难以控制与解释。核心洞见经验丰富的分析师会隐式遵循一套结构化的认知框架即“经验本体”按层次方面→维度→槽位系统性地探索需求。二、核心方法OntoAgentOntoAgent是一个由经验本体引导的LLM智能体包含两大阶段1. 经验本体归纳Ontology Induction自动从领域需求文本如Web应用描述中构建一个三层树状本体方面Aspect最高层如“交互”“内容”“样式”由专家预先定义。维度Dimension功能点如“登录”“搜索”“显示”。槽位Slot可澄清的具体细节如“过滤选项”“排序规则”。采用保守扩展策略合并 扩展 新增利用LLM提取维度和槽位并合并语义重叠项保证粒度稳定。2. 本体引导的访谈Ontology-Guided Interview在每一轮对话中OntoAgent执行四个核心操作来决定问什么再结合上下文生成自然语言问题ParseUser解析用户回答识别确认/拒绝意图支撑剪枝。ScoreOnto根据初始需求描述为各节点赋初始优先级。ReRankOnto动态重排候选槽位优先级适应对话上下文变化。GatePrune包括方面级和维度级剪枝当用户明确无需求时剪除无关分支减少冗余提问。QuestionGen基于选中的槽位和对话历史生成上下文感知的问题。三、实验设计数据集使用ReqElicitGym101个Web应用场景本体归纳数据来自WebGen-Bench训练集保证与测试场景隔离。评估指标IRE隐含需求获取率衡量最终覆盖了多少隐含需求。TKQR轮次折扣关键问题率衡量提问效率奖励早期获取关键需求。对比基线包括Non-CoT、CoT、LLMREI-short/long、Mistake-guided Prompting等五种自由对话式LLM方法。额外实验消融研究、不同LLM主干敏感性、需求类型分析、归纳数据规模影响、人工评估与案例分析。四、主要结果显著优于基线IRE提升33%0.52→0.69TKQR提升21%0.49→0.59。各模块均有贡献经验本体贡献最大大幅提升IRE和TKQRScoreOnto、ReRankOnto、GatePrune依次带来额外增益。跨LLM鲁棒在6种不同LLM开源/闭源、不同规模上均保持稳定性能。需求类型平衡在交互、内容、样式三类需求上均优于基线尤其在“样式”需求上从几乎为零提升至0.55。数据规模影响增加本体归纳数据可提升覆盖率但过多会因搜索空间扩大而略微降低效率。人工评估在有效性、效率、适应性三个维度上均显著优于基线p 0.05。五、研究意义与贡献理论贡献首次将“经验本体”显式融入LLM驱动的需求获取访谈将自由对话转变为结构化、可解释、可控的智能体流程。实践贡献提供开源的代码、数据集和轻量工具支持在其他领域扩展应用。方法启示证明单纯依赖LLM生成能力不足以完成复杂访谈任务结构化知识引导是提升自动化需求获取效果的关键。六、局限性有效性威胁评估主要基于Web应用领域外部泛化性有待更多领域验证。模拟环境ReqElicitGym和真实用户行为之间存在差距但已通过人工访谈补充验证。人工评估样本量较小6人但统计显著且与定量结果趋势一致。OntoAgent通过将分析师经验建模为本体引导LLM进行分层次、动态优先、可剪枝的结构化访谈显著提升了需求获取的覆盖率和效率为自动化需求工程提供了一个可解释、可泛化的新范式。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要——需求获取访谈在需求工程中至关重要且耗时但严重依赖需求分析师的个人经验。尽管大型语言模型LLMs的最新进展为自动化此过程创造了新的机遇但现有方法仅依赖LLMs进行自由形式的对话未考虑访谈和开发经验。这导致了隐含需求的遗漏和问题的冗余。实际上经验丰富的分析师在进行需求获取时会隐式地遵循一个结构化的认知框架。受此观察启发本文提出了一种名为OntoAgent的访谈智能体用于在经验本体指导下进行需求获取。∙ OntoAgent自动分析特定领域的需求描述以构建经验本体该本体将需求关注点组织成一个本体结构以支持系统化和可解释的访谈。∙ 在访谈过程中OntoAgent首先在本体指导下执行四个操作即ParseUser、ScoreOnto、ReRankOnto、GatePrune来识别相关的需求关注点。然后将选定的关注点与当前对话上下文结合生成获取性问题。为了验证OntoAgent我们使用广泛采用的网站应用领域进行了全面的定量实验。结果表明OntoAgent在获取有效性和提问效率方面均显著优于现有基线IRE提升了33%TKQR提升了21%。消融研究进一步验证了每个关键设计组件的贡献。此外一项定性用户研究证明了其在实际场景中的实用优势。我们相信OntoAgent也可以扩展到其他领域的需求访谈任务。关键词——需求获取访谈需求智能体大型语言模型本体工程I. 引言需求获取是需求工程的核心活动之一为准确捕获利益相关者的需求奠定了基础[1]。在各种方法论中访谈仍然是最广泛采用的获取技术[2][3]。然而有效的访谈严重依赖于经验丰富的需求分析师。这不仅需要大量的时间投入还会产生显著的培训和人力成本[3][4]。此外访谈本身容易受到人为偏见和沟通误解的影响这可能导致需求不完整或模糊[5]。在人工智能辅助软件开发快速发展的时代这些挑战变得更加突出。因此自动化或智能地支持需求获取访谈已成为需求工程中一个紧迫且重要的研究问题。图1. 本工作的动机。左图自由形式的LLM聊天会产生临时性问题导致冗余和对隐含需求覆盖不完整右图经验丰富的分析师隐式地遵循结构化的访谈经验系统地探索需求维度。随着大型语言模型LLMs在对话生成[6][7]和角色扮演能力[8][9]方面的快速发展研究人员开始探索使用LLMs自动化需求获取访谈[5][10]如图1左侧所示即提示LLM扮演访谈者角色并依赖其生成能力提出自由形式的问题。在本文中我们将这种方法称为自由形式获取方法。尽管它提供了一个直接的解决方案但一项实证研究[10]揭示其存在两个主要局限性即难以揭示隐含需求和在对话早期阶段生成通用性问题。此外生成的访谈问题缺乏可解释性和可控性使得难以融入有效的人机协同监督。这些局限性对需求获取的有效性和效率产生了负面影响。与自由形式获取方法相比经验丰富的需求分析师隐式地遵循一个从长期访谈经验中形成的结构化认知框架。该框架将需求关注点组织成层次结构从而指导系统性的提问以探索需求。我们将这种结构化知识称为经验本体。图1的右面板展示了经验丰富的分析师进行系统性访谈的过程。当面对一个规定不充分的初始需求如“我想要一个允许用户搜索股票并生成报告的网站”时经验丰富的分析师首先从Web应用的高级方面例如交互和内容进行推理。然后他们将访谈缩小到特定的功能维度例如搜索和显示最后识别每个维度内缺失的实现细节例如搜索机制和报告格式。通过这种层次化扩展访谈过程形成了一个连贯且逐步深入的提问流程在提高覆盖率的同时减少了冗余。受上述结构化访谈过程的启发我们提出了OntoAgent一个由经验本体引导的需求获取访谈智能体。与自由形式获取不同OntoAgent将访谈经验显式地建模为本体。该本体作为一个结构化的提问空间通过将“问什么”与“怎么问”解耦来指导访谈过程中的动态决策和问题生成。本体决定应该探索哪些需求槽位而LLM则根据对话上下文生成自然语言问题。具体来说OntoAgent包含两个核心阶段经验本体归纳。给定一组特定领域的需求文本OntoAgent自动分析它们以构建经验本体。该本体被设计为一个三层级的层次树由方面、维度和槽位组成。本体引导的访谈。OntoAgent在经验本体上执行四个关键操作即ParseUser、ScoreOnto、ReRankOnto和GatePrune以动态地优先排序和选择最相关但尚未充分探索的需求槽位。根据选定的槽位和当前对话上下文它生成具有上下文感知和目标导向的获取性问题。参考文献 [[78, 771, 488, 906], [507, 63, 918, 286]]我们进行了广泛的实验来评估OntoAgent。1我们在ReqElicitGym [10]中的101个网站需求获取场景上评估了OntoAgent。我们采用了两个互补的指标即隐含需求获取率IRE[10]和轮次折扣关键问题率TKQR[11]。结果表明OntoAgent显著优于以前的基线。OntoAgent的IRE提升了高达33%表明其在揭示隐含需求方面的有效性增强。OntoAgent的TKQR也提升了21%表明其提问效率和质量更高。2我们通过将四个关键设计模块即经验本体、ScoreOnto、ReRankOnto和GatePrune逐步添加到基础LLM上进行了消融研究。结果证明了每个组件的独立贡献。3我们通过切换OntoAgent的六个不同基础LLM来评估其敏感性显示了强大的泛化能力。4我们进行了一项人工评估从获取有效性、效率和适应性三个方面评估生成的访谈过程。结果表明OntoAgent在所有三个方面都优于基线。5我们进行了一个案例研究定性比较了OntoAgent和基线方法的访谈过程。结果表明OntoAgent在实际场景中实现了更结构化的获取访谈。我们将本文的贡献总结如下我们提出了OntoAgent一个用于需求获取的访谈智能体。它使用本体显式地建模访谈经验并将经验本体与LLMs集成以促进访谈问题的生成。我们引入并开发了访谈经验本体这是一个由需求方面、维度和槽位组成的三层级层次树它作为一个结构化和可解释的提问空间。我们设计了一种本体引导的访谈机制包含四个决策操作用于动态选择需求槽位并生成具有上下文感知的获取性问题。我们在101个需求获取场景上进行了广泛的实验。定性和定量分析显示了OntoAgent的有效性和实际适用性。II. 背景与相关工作需求获取被广泛认为是需求工程中关键且具有挑战性的阶段因为对利益相关者需求理解不足仍然是项目失败的主要原因[12]。在各种获取方法中访谈是最传统和常用技术之一[2][13]。它使分析师能够直接与利益相关者接触提出问题以了解他们对产品或服务的需求、偏好和期望[14][15]。在访谈过程中访谈者可以提问以引出一系列利益相关者偏好解决可能存在的围绕多方面和冲突观点的歧义[16]并深入了解受访者可能持有的隐性知识[13]最终获得一份需求列表[17]。尽管访谈形式多样但进行访谈涉及诸多挑战。特别是利益相关者的偏好通常是隐性知识需要付出巨大努力才能提取[13]。现有文献描述了进行恰当访谈的各种标准。其介绍如下。在LLMs出现之前研究主要集中在支持人类分析师包括以下标准恰当的访谈开场和收尾[18]合适的氛围和流程[19]问题框架[20]问题内容[18]以及避免常见错误[21]。例如Zaremba等人[20]提出了一套系统性问题以改进访谈准备。其他研究调查了提升人类访谈技巧的教学策略例如从常见获取错误中学习[22]和采用基于角色的培训方法包括角色扮演、同行评审和自我评估[23][24]。此外Debnath等人[25]开发了AnnoteREI以促进访谈数据的转录和标注。因此这些研究主要旨在辅助或增强人类主导的访谈。相比之下我们的工作侧重于使用LLMs自动化需求获取访谈过程。随着LLMs的快速发展近期的研究开始探索对需求获取访谈的智能支持。一条研究方向调查了使用LLMs生成访谈脚本或问题模板[26]。另一条研究方向利用LLMs直接从对话记录中提取或合成需求旨在减少需求整合所需的手动工作量[27]。这些研究证明了LLMs在支持准备和记录方面的强大能力。最近研究人员开始探索直接使用LLMs进行访谈。KornGV等人[5]调查了LLM驱动的对话式获取的可行性并引入了两个基于提示的访谈聊天机器人名为LLMREI-long和LLMREI-short。类似地Shen等人[3]研究了基于LLM的需求获取后续问题生成并提出了错误引导提示以提高问题质量。此外Jin等人[10]提出了一个名为ReqElicitGym的评估环境用于评估多轮对话环境中的访谈能力并对六个主流LLM进行了实证研究。结果表明仅依赖自由形式的LLM聊天通常难以系统地揭示隐含需求并在对话早期阶段生成通用性问题。我们的工作遵循这一方向试图通过将结构化访谈经验与基于LLM的问题生成显式集成来缓解上述局限性并提高自动化需求访谈的有效性和可解释性。III. 方法本节介绍OntoAgent即用于需求获取的访谈智能体。我们在第一小节描述OntoAgent方法的概述并在后续小节中描述细节。A. 概述OntoAgent的设计原则是将结构化访谈经验显式建模为本体并将其与基于LLM的问题生成集成。因此OntoAgent包含两个相互关联的阶段经验本体归纳和本体引导的访谈。这两个阶段以流水线方式工作如图2所示。经验本体归纳。给定特定领域的需求文本 ROntoAgent自动分析它们以归纳出一个层次树来表示经验本体 T该本体捕获了重复出现的需求方面、维度和细粒度的澄清槽位。本体引导的访谈过程。给定归纳出的本体 TOntoAgent与利益相关者进行多轮对话直到 T 中没有符合条件的槽位或达到预定义的最大轮数。在每一轮OntoAgent执行四个关键操作即ParseUser、ScoreOnto、ReRankOnto和GatePrune以动态选择最相关但尚未充分探索的需求槽位 S。然后它将当前对话上下文 C 与选定的槽位 S 结合生成一个获取性问题 Q 以进行后续交互。B. 经验本体归纳此阶段旨在从特定领域的需求文本中自动构建经验本体。为此我们首先定义经验本体的模式。然后设计一个自动化构建流程。本体模式。OntoAgent将需求获取经验本体构建为一个三层树结构。第一层代表需求方面它是系统需求的最高层抽象提供了需求空间的宏观划分。例如Web应用领域的这一层包括交互、内容和样式。为保证本体的稳定性方面层由领域专家提供。第二层代表需求维度它捕获核心功能点并作为需求的一个连贯类别。例如Web应用领域的这一层可能包括登录、搜索和显示。第三层代表需求槽位它对应于每个维度下可澄清的需求细节。例如在搜索维度下槽位可能包括过滤选项和排序规则。形式上经验本体是一个三层树 T(A,D,S,πD,πS)其中 A,D, 和 S 分别表示方面、维度和槽位的集合πD​ 是将每个维度映射到一个方面的映射πS​ 是将每个槽位映射到一个维度的映射。维度归纳。维度归纳的目标是在预定义的需求方面下从特定领域的需求文本中自动构建一组需求维度。考虑到传统聚类方法存在粒度不稳定和可解释性有限的问题OntoAgent采用渐进式扩展方法并使用LLM来自动化此过程。具体来说OntoAgent首先使用手动定义的需求方面初始化本体每个方面下没有分配维度。给定一个需求描述OntoAgent利用LLM和一个精心设计的提示 Pd​ 来提取其底层的功能维度并将它们与相应的需求方面关联。LLM被指示要么1当检测到语义重叠时将提取的维度合并到现有维度中要么2引入仅当不存在合适的抽象时才引入新维度。重要的是OntoAgent采用保守的扩展策略优先考虑语义合并而非引入新维度。该策略防止了树的失控增长并保持了跨维度的一致性粒度。图2. OntoAgent框架概述。用户提示 Ps​ 用于槽位归纳两层本体{current ontology}新的需求文本{instruction}任务1) 识别需求文本涉及哪些维度。2) 如果文本描述详细请输出一个澄清性问题如果仅提及请输出“您需要 [X] 吗”形式的问题。3) 返回系统指令中指定的严格 JSON 格式。4) 省略指令未提及的主题。C. 本体引导的访谈为了将经验本体与基于LLM的对话生成集成OntoAgent将访谈过程形式化为一个受本体约束的迭代决策循环。在多轮对话过程的每一轮中OntoAgent首先在经验本体上执行四个操作即ParseUser、ScoreOnto、ReRankOnto和GatePrune以确定最合适的需求槽位进行澄清。随后一个QuestionGen操作通过结合选定的槽位和当前对话上下文来生成后续的获取性问题。算法1总结了本体引导访谈的整个过程。五个核心操作详述如下sup2/sup。ParseUser此操作解释利益相关者的回应以支持剪枝和确认决策。它包含两个变体。在方面层面它分析对宏观确认问题例如特定方面是否还有其他关注点的回应从而实现方面级别的GatePrune。在维度层面它确定一个特定的需求维度是否被明确确认或拒绝例如不需要登录这支持维度层面的 GatePrune。ScoreOnto。在对话开始前ScoreOnto根据初始需求描述为本体中的节点分配初始优先级分数。这是必要的因为早期对话缺乏上下文反馈。如果智能体简单地遵循固定的树遍历顺序早期阶段的问题可能会偏离利益相关者的主要关注点。通过估计初始描述与本体节点之间的语义相关性ScoreOnto确定探索顺序确保访谈从最可能与用户意图相关的分支开始。ReRankOnto。在访谈过程中用户的回应不断引入新的上下文。因此先前的优先级分数可能变得过时。在每一轮之前ReRankOnto根据更新的对话历史动态地重新评估和重新排序当前活动分支下的候选槽位。此操作确保智能体始终选择最可能揭示隐含需求的槽位。参考文献 [[76, 877, 488, 906], [506, 61, 919, 242]]GatePrune。为减少冗余提问并加速收敛OntoAgent引入了两种门控剪枝机制。方面级别的GatePrune在同一个方面下连续 N 次询问未获取到新需求时被触发。在这种情况下OntoAgent会提出一个宏观确认问题例如“与交互相关的还有其他需求吗”。如果利益相关者明确表示没有其他关注点则整个方面分支被剪枝。维度级别的GatePrune在更细的粒度上操作。如果利益相关者明确拒绝某个需求维度例如表示不需要注册/登录则该维度下的相应槽位会被立即剪枝。这些剪枝策略在保持系统性覆盖的同时逐步缩小搜索空间。QuestionGen。给定选定的槽位和当前的对话历史QuestionGen合成一个自然且具有上下文感知的访谈问题。通过将问题生成建立在结构化本体的基础上OntoAgent避免了临时性的提问并保持了可解释性。IV. 研究设计为评估OntoAgent框架的性能我们进行了一项多方面的研究来回答五个研究问题RQs。本节描述我们研究的细节包括研究问题、基线、数据集和指标。A. 研究问题RQ1有效性与现有基线相比OntoAgent在进行需求获取访谈方面的有效性如何此RQ旨在评估我们提出的框架的有效性即提高隐含需求获取和提问效率。在实验中我们选择GPT-5.1作为我们框架的基础LLM。我们从WenGen-Bench中为每种应用类型采样5个场景来构建本体。跨不同LLMs和场景数量的泛化能力将在RQ3和RQ5中进一步检验。RQ2消融研究OntoAgent中每个组件的贡献是什么此RQ考察每个模块如何促进获取覆盖率和提问效率。OntoAgent包含四个核心组件用于增强需求获取访谈性能(1) 经验本体(2) ScoreOnto(3) ReRankOnto和 (4) GatedPrune。基于RQ1中的实验设置我们通过将这些组件逐步添加到GPT-5.1基础模型上进行消融研究以分析它们各自的贡献。RQ3敏感性OntoAgent在不同的LLM上的鲁棒性如何此RQ关注OntoAgent在使用不同底层LLM时的鲁棒性和泛化能力。我们评估当GPT-5.1被其他LLMs替代时OntoAgent是否仍然有效验证我们框架的模型无关设计。具体来说我们遵循先前工作[10]选择了如表I所示的六个其他LLMs。表 I 为 RQ3 选择的 LLMs。所有模型均通过官方 API 访问。模型类型创建者发布年份使用年份Claude Opus 4.5闭源Anthropic2025.112026.02Gemini 3 Flash闭源Google2025.122026.02DeepSeek V3.2开源DeepSeek2025.122026.02Kimi K2.5开源Moonshot AI2026.012026.02GLM-4.7闭源Zhipu AI2025.112026.02Qwen3 235B开源Alibaba2025.072026.02RQ4类型分析OntoAgent在获取不同类型的隐含需求方面表现如何隐含需求可能属于不同的方面。每种类型可能表现出不同的获取特征和难度级别。此RQ调查OntoAgent是否在不同需求类型上提供均衡的覆盖。具体来说我们进行方面级别的分析以检查OntoAgent是否均匀地提高了获取有效性还是偏向于特定方面。RQ5可扩展性归纳数据的大小如何影响OntoAgent的性能由于经验本体是从领域需求文本构建的其质量可能取决于可用的归纳数据量。此RQ研究OntoAgent对用于本体归纳的需求指令规模的敏感性。通过改变用于训练的完整数据的比例我们评估所提出框架的可扩展性和数据效率。B. 基线我们将OntoAgent与来自三项近期研究 [5] [3] [10] 的五个代表性基于LLM的获取基线进行比较。这五个基线都使用自由形式获取方法。它们介绍如下。Non-CoT。它遵循ReqElicitGym [10]中采用的标准推理设置。具体来说LLM在没有明确推理指令的情况下进行多轮对话。在每一轮LLM直接生成一个澄清或探究性问题。CoT。它采用了ReqElicitGym [10]中采用的思维链CoT提示。具体来说LLM被指示在生成每个问题之前明确推理对话上下文。LLMREI-short。它源自LLMREI [5]中提出的零样本提示策略。具体来说它采用一个简洁的系统提示指示LLM扮演专业访谈者的角色并提出一个聚焦的问题。LLMREI-long。它对应于LLMREI [5]中提出的从最少到最多提示策略。具体来说它采用一个更长且结构更清晰的系统提示其中嵌入了明确的访谈指南、角色定义和程序指令。错误引导提示Mistake-guided Prompting。此基线源自错误引导的问题生成框架[3]。在每一轮LLM被提供受访者的陈述以及预定义的访谈者错误标准并被指示生成一个后续问题。C. 数据集用于访谈的评估数据集。我们使用ReqElicitGym [10]评估OntoAgent和所有五个基线这是一个为访谈设计的交互式自动评估环境。ReqElicitGym包含跨越10种应用类型的101个Web应用场景。每个场景由一个规定不充分的初始需求描述、一个完整最终规约以及一组按需求方面分类的手动标注的隐含需求组成。此外评估环境包含一个模拟的交互式神谕用户和一个任务评估器用于与访谈者交互并对其进行评估。因此任何自动化访谈者的方法都可以通过与环境的交互来评估。用于本体归纳的训练数据集。为构建经验本体OntoAgent需要一个领域特定需求描述语料库来分析重复出现的需求关注点。在本工作中我们利用WebGen-Bench [28]的训练集作为本体归纳的数据源。值得注意的是ReqElicitGym中的所有评估场景均源自WebGen-Bench的测试集。因此通过将本体构建限制在WebGen-Bench训练数据上我们确保了本体归纳和访谈评估之间的严格分离。这种设计有效防止了数据泄露并保证归纳出的本体反映的是可泛化的获取经验而不是对评估场景的记忆。D. 评估指标我们使用两个互补的指标评估性能隐含需求获取率IRE[10]和轮次折扣关键问题率TKQR[11]。IRE衡量隐含需求的总体覆盖率而TKQR通过强调顺序来评估提问效率。这两个指标同时捕获了获取访谈的有效性和效率。V. 结果与分析RQ1有效性与现有基线相比OntoAgent在进行需求获取访谈方面的有效性如何设置。我们在ReqElicitGym中的101个网站需求获取场景上评估了五个基线和我们的OntoAgent。评估指标如第IV-D节所述即IRE和TKQR。对于所有指标分数越高表示性能越好。结果。表II显示了在ReqElicitGym上的实验结果。分析。(1)OntoAgent提高了隐含需求获取覆盖率。表II显示OntoAgent的IRE达到0.69优于所有基线。最强的基线即错误引导提示达到0.52。与它相比OntoAgent获得了33%的相对提升证明了其系统性地揭示缺失隐含需求的能力。自由形式基线与OntoAgent之间的性能差距表明仅依赖LLMs聊天不足以进行结构化访谈。相反显式地建模访谈经验并将其与LLMs集成对于实现更高的获取覆盖率至关重要。(2)OntoAgent也达到了最高的提问效率。在TKQR方面OntoAgent达到0.59优于所有基线。它比最佳基线即LLMREI-short获得了21%的相对提升。这一提升表明OntoAgent不仅获取了更多的隐含需求而且在交互中更早地识别了它们。由于TKQR会惩罚延迟发现更高的分数表明OntoAgent能够在早期对话轮次中引出高价值的需求维度。表 II 在 REQELICITGYM 上的总体有效性比较。相对提升是针对表现最佳的基线计算的。方法IRETKQRNon-CoT0.130.09CoT0.080.19LLMREI-short (RE’25)0.390.49LLMREI-long (RE’25)0.380.09Mistake-guided Prompt (RE’25)0.520.48OntoAgent (Ours)0.69 (↑ 33%)0.59 (↑ 21%)对 RQ1 的回答OntoAgent在隐含需求获取有效性和提问效率方面均显著优于基线。特别是它在IRE上获得了33%的相对提升在TKQR上获得了21%的相对提升。显著的改进证明我们提出的本体增强方法更有前景。RQ2消融研究OntoAgent中每个组件的贡献是什么设置。从一个基础LLM即GPT-5.1开始我们逐步添加OntoAgent的四个核心组件即经验本体、ScoreOnto、ReRankOnto和GatedPrune。所有变体都使用相同的ReqElicitGym环境进行评估。我们报告与RQ1相同的两个指标即IRE和TKQR。结果。消融研究的实验结果如表III所示。分析。(1)经验本体提供了最大的性能提升。添加经验本体将IRE从0.13显著提高到0.41TKQR从0.09提高到0.34。这一显著提升表明显式建模需求访谈经验以指导LLM远比仅依赖自由形式生成更有效。本体可以有效地将获取过程从基于LLM的聊天转变为结构化访谈。(2)ScoreOnto和ReRankOnto进一步改善了早期阶段的对齐和效率。引入ScoreOnto进一步将IRE提高到0.58TKQR提高到0.37。这表明该组件使智能体能够在早期对话轮次中聚焦于更相关的需求维度。添加ReRankOnto带来了额外的增益将IRE提高到0.64TKQR提高到0.62。尽管提升相对较小但它也证明了根据累积的对话上下文动态调整提问方向的必要性。(3)门控剪枝在保持覆盖率的同时提高了效率。引入GatedPrune进一步将IRE提高到0.69TKQR提高到0.59。TKQR的增加表明剪枝减少了冗余问题从而能够更早地获取关键需求。重要的是剪枝并未损害覆盖率。相反它提高了IRE表明消除无效的提问路径有助于将探索集中在有效的维度上。表 III ONTOAGENT 在 REQELICITGYM 上的消融研究。每一行逐步向基础 LLM 添加一个组件。方法IRETKQR基础 LLM (GPT-5.1)0.130.09 经验本体0.410.34 ScoreOnto0.580.37 ReRankOnto0.640.52 GatePrune0.690.59表 IV ONTOAGENT 在不同 LLM 主干上的性能。主干 LLMIRETKQRClaude Opus 4.5 OntoAgent0.630.74Gemini 3 Flash OntoAgent0.640.48DeepSeek V3.2 OntoAgent0.550.71Kimi K2.5 OntoAgent0.640.59GLM-4.7 OntoAgent0.630.47Qwen3 235B OntoAgent0.680.52对 RQ2 的回答四个模块对于我们方法的性能都至关重要。经验本体在覆盖率和效率方面提供了最大的提升。ScoreOnto和ReRankOnto改善了早期交互阶段的对齐和效率。门控剪枝通过减少冗余问题在不损害覆盖率的情况下进一步提高了效率。RQ3鲁棒性OntoAgent在不同LLM上的鲁棒性如何设置。为评估OntoAgent相对于不同主干LLM的鲁棒性我们将GPT-5.1替换为表I中的几个代表性LLM。我们在与RQ1相同的评估环境下报告IRE和TKQR。结果。表IV总结了OntoAgent在不同主干LLM下的整体性能。分析。(1)OntoAgent在不同主干上保持有竞争力的性能。在六个代表性LLM中OntoAgent的IRE稳定在0.55至0.68之间TKQR在0.47至0.74之间。尽管模型规模和训练范式存在差异但所有主干在与OntoAgent集成时都表现出了有效的隐含需求获取能力。这表明OntoAgent能够泛化到异构的LLM能力而不是依赖于单一特定的主干。(2)主干质量影响性能但并不唯一决定结果。具有更强推理和规划能力的模型例如Claude Opus 4.5往往获得更高的IRE或TKQR分数。然而最高和最低IRE之间的差距是适中的即0.13表明主干的差异并不会根本性地改变获取的有效性。这表明OntoAgent减少了对LLMs纯粹隐性推理能力的依赖。表 V 方面级别的隐含需求获取性能。IRE_INT、IRE_CON 和 IRE_STY 分别表示交互、内容和样式需求的获取比率。方法IRE_intIRE_conIRE_styNon-CoT0.190.13 0.01CoT0.120.09 0.01LLMREI-long0.560.500.05LLMREI-short0.590.510.09Mistake-guided Prompt0.700.650.17OntoAgent0.740.640.55对 RQ3 的回答OntoAgent在不同的主干LLM上表现出很强的鲁棒性。尽管主干质量导致适度的变化但整体的获取有效性和效率保持稳定。这表明OntoAgent在决定性能方面起主要作用而不是特定的模型能力。RQ4需求类型分析OntoAgent在获取不同类型的隐含需求方面表现如何设置。遵循ReqElicitGym [10]隐含需求被分为三个维度交互、内容和样式。对于所有基线和OntoAgent我们通过将真实需求和已获取需求集限制在每个需求类型来计算方面级别的IRE。结果。表V展示了五个基线和OntoAgent的方面级别获取性能。分析。(1)OntoAgent在所有需求类型上均持续优于所有基线。OntoAgent在交互即0.74、内容即0.64和样式即0.55方面均取得了最高的IRE展示了其在异质需求维度上提供均衡覆盖的能力。相比之下基线方法表现出不均衡的性能尤其在样式需求方面表现不佳。(2)样式需求对基线方法尤其具有挑战性。Non-CoT和CoT在样式需求上都取得了接近零的性能0.01表明自由形式的对话生成在没有明确结构指导的情况下很少探索美学或展示相关的方面。即使是基于结构化提示的基线也仅分别达到0.05、0.09和0.17这表明仅靠提示工程不足以引出样式或非功能性偏好。相比之下OntoAgent显著地将与样式相关的IRE提升至0.55。对 RQ4 的回答OntoAgent在所有需求类型上都实现了均衡且显著的改进。最大的提升体现在样式需求上而这部分需求在很大程度上被基线方法所忽略。RQ5可扩展性归纳数据的大小如何影响OntoAgent的性能设置。对于WenGen-Bench训练集中的每种应用类型我们分别随机采样5、10、15和20个场景来归纳本体。然后固定所有归纳出的本体并在与RQ1相同的ReqElicitGym环境下进行评估。对于每种数据量设置我们报告IRE和TKQR。图3. 本体归纳数据量对性能的影响。结果。图3显示了OntoAgent在不同归纳数据量下的性能。分析。(1)增加归纳数据适度地进一步提高了获取覆盖率。当归纳场景数从5增加到15时IRE从0.69提高到0.73表明更丰富的领域数据有助于构建更全面的本体并改善对隐含需求的覆盖。(2)过多的归纳数据可能会降低提问效率。当数据量进一步增加到20个场景时TKQR从0.60下降到0.57。这表明过大的本体扩展了搜索空间并引入了更多的候选槽位使得早期的提问选择不够聚焦。对 RQ5 的回答增加归纳数据提高了获取覆盖率表明OntoAgent受益于更丰富的本体构建。然而过大的归纳数据可能会因为搜索空间的扩大而对提问效率产生负面影响。VI. 人工评估与案例分析在本节中我们通过一项人工评估研究和跨案例分析补充第V节中的定量结果。我们的目标是检验OntoAgent在指标之外的实用有效性和行为特征。A. 人工评估第V节中呈现的实验是在ReqElicitGym模拟环境中进行的。为进一步检验OntoAgent的实际有效性我们进行了一项补充性的人工评估研究。参与者。我们招募了6名具有软件工程背景的参与者4名研究生和2名高年级本科生。所有参与者都有先前的需求分析课程或项目经验。他们均未参与OntoAgent的开发。研究设计。我们设计了一项涉及真实访谈的实验并采用了被试内设计[29]。具体来说每位参与者在预定场景中扮演利益相关者并与四种方法即LLMREI-short、LLMREI-long、Mistake-guide Prompting和OntoAgent进行交互。预定场景来自先前的一项研究[24]并已在多项需求相关研究中使用[5][24][30]。它们包括(1)沙龙场景。一个寻求数字解决方案来管理预约和员工排班的美发和美甲沙龙。(2)滑雪场场景。一个为其三个地点需要数字预订和业务管理平台的滑雪场。在每次会话之前参与者会收到一份描述概述他们作为利益相关者的角色以及访谈后应如何操作的说明。然后基于上述方法的聊天机器人分别进行访谈。每位参与者依次完成与它们的访谈会话。每次访谈会话持续约20分钟。完成后要求参与者填写一份问卷评估该方法的有效性。参与者在7点李克特量表sup4/sup上从三个维度评估有效性即获取有效性、提问效率和提问适应性。表 VI 人工评估结果平均李克特分数1-7分制。方法有效性效率适应性LLMREI-Short4.584.925.14LLMREI-Long4.473.264.74Mistake-guided Prompt5.115.265.08OntoAgent5.87 (± 15%)5.79 (± 10%)6.12 (± 19%)结果与分析。人工评估结果如表VI所示。我们的OntoAgent在三个方面均优于所有基线。具体来说OntoAgent在获取有效性上比当前最优基线高出15%在提问效率上高出10%在提问适应性上高出19%。所有p值均远小于0.05表明改进具有统计学显著性。这些改进证明了我们的OntoAgent在辅助需求获取访谈方面的优越性。此外我们承认参与者的数量相对有限。人工评估旨在补充第V节中的大规模定量结果两项评估中一致的趋势进一步证明了OntoAgent的有效性。B. 案例分析为更好地理解OntoAgent和对比基线的行为我们对ReqElicitGym中的六个代表性场景进行了跨案例分析。图4展示了三个基线和我们的OntoAgent在轮次级别的IRE进展。从这些例子中我们得到以下发现。(1)更快的早期收敛。OntoAgent显示出明显更快的早期IRE增长通常在最初3-5轮内就能引出关键隐含需求而自由形式基线在初始对话阶段通常表现出长期的停滞。这表明OntoAgent使其能够立即聚焦于高影响力的需求维度而不是将早期轮次花费在表面的澄清上。(2)更高的最终覆盖率。OntoAgent持续达到最高的最终IRE经常接近完全的隐含需求覆盖。相比之下自由形式基线通常在中等覆盖率水平上趋于平稳表明遗漏了不太显著但至关重要的需求方面。这突显了将需求空间显式建模为结构化的层次本体以预防系统性盲点的优势。(3)减少了中期停滞。OntoAgent的进展曲线表现出稳定、逐步的改进且较少的长时间停滞反映了对需求维度的系统性遍历。相比之下基线显示出临时的跳跃和延长的停滞阶段表明不系统的探索和冗余的提问。图4. 六个代表性场景的轮次级别IRE进展。VII. 有效性威胁构念效度。构念效度关注处理与结果之间的关系。潜在威胁来自于所采用的指标以及本体归纳和评估所涉及的数据集。第一个威胁是这些指标可能无法完全捕获访谈性能的所有定性方面。为缓解此问题我们采用了两个互补的定量指标即IRE和TKQR它们从不同角度衡量获取有效性和轮次级别的效率并进一步通过一项人工评估研究对其进行补充该研究使用李克特量表评分从多个维度评估获取质量。第二个威胁与评估基准和用于本体归纳的数据有关。尽管ReqElicitGym是一个模拟的需求获取环境但先前的工作[10]已将其验证为评估对话式需求访谈能力的可靠基准。用于本体构建的数据也可能影响OntoAgent的性能。为解决此问题我们强制实施了本体归纳数据和访谈评估数据之间的严格分离确保归纳出的本体是在未接触任何评估实例的情况下构建的。此外我们进行了一项实证研究以检验归纳数据量对OntoAgent性能的影响这进一步加强了观察到的改进并非归因于数据泄露或记忆的信心。内部效度。内部效度涉及研究进行方式中潜在的威胁。首先模型配置和评估设置可能影响性能。为确保稳定性和可重复性所有LLM均使用贪婪解码进行评估。此外所有方法的最大对话轮数统一设置为20以保证在相同交互预算下的公平比较。其次基线方法的重新实现可能引入偏差。为减轻此威胁我们严格遵循相应论文中描述的原始提示设计和实验方案未作修改。没有应用额外的调整或优化来偏袒OntoAgent。第三人工评估过程可能受到参与者偏差或顺序交互多个系统时的学习效应影响。为减少这种影响我们采用了被试内设计并确保所有参与者在之前阅读了场景描述。我们承认残留的主观偏差可能仍然存在。然而将定量指标与人工评估相结合有助于减少任何单一评估来源的影响。外部效度。外部效度考虑我们发现的普遍性。一个主要威胁是我们的评估依赖于ReqElicitGym作为实验环境。尽管ReqElicitGym涵盖了多种应用类型但它仍局限于Web应用领域。为缓解此问题我们通过一项在ReqElicitGym环境之外的两个额外广泛使用的真实场景上进行的人工评估研究来补充基于基准的评估。这有助于验证OntoAgent在更自然和多样的交互环境下的有效性。VIII. 结论我们提出了OntoAgent一个本体增强的需求获取智能体它将自由形式的LLM访谈转变为结构化和可解释的询问过程。通过将访谈经验显式建模为层次本体并通过动态优先级排序和剪枝来指导问题选择OntoAgent能够系统性地探索隐含需求。在101个场景上的实验表明与强大的LLM基线相比在获取覆盖率和提问效率方面均有显著改进。人工评估进一步验证了其实际有效性。OntoAgent也证明了本体引导的LLM智能体对于推进自动化需求开发的重要性。
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻