FEATURED · 精选文章

02 业务Agent需要的四层能力:从技术栈到运营体系

发布时间 / 2026/8/3 7:43:37
来源 / 创域科博编辑部
栏目 / 资讯中心
02 业务Agent需要的四层能力:从技术栈到运营体系 这是专栏系列的第二篇。第一篇讲了Agent系统怎么建这篇讲需要掌握什么能力。这篇文章的目标帮你搞清楚从Demo到生产思考的事情有什么变化讲一讲”在生产环境里你到底要干什么”。目录一个常见的误区先从招聘市场来看第一层技术能力从”能回答”到”能回答对”评测证明Agent回答对了Prompt决定Agent输出质量RAG让Agent有据可依Agent编排处理复杂任务其他技术按需学习第二层设计能力从”一个人用”到”一群人用”语义层指标口径不统一怎么办意图消歧用户问的不清楚怎么办结果可信度凭什么信Agent的回答人机协作什么时候需要人工介入Workflow vs Agent流程确定用哪个第三层工程化能力从”能跑”到”稳定跑”成本token费用怎么控监控出了问题怎么定位错误处理工具调用失败怎么办上下文管理对话太长Agent”变笨”怎么办第四层持续运营能力从”上线”到”越用越好”评测体系生产级A/B测试改了Prompt效果变好还是变差用户反馈怎么收集和处理知识沉淀历史结论怎么复用总结一个常见的误区很多人学Agent的第一步是学框架LangChain怎么用、CrewAI怎么搭、Dify怎么拖。说实话我一开始也这么想。框架是工具不是能力。你会用LangChain不代表你能搭建生产级Agent。就像你会用IDE不代表你能写出好代码。真正决定你能不能做出生产级Agent的是四层能力技术能力、设计能力、工程化能力、持续运营能力。先从招聘市场来看用Hermes Agent采集了82份AI Agent岗位的JD从技术词频统计来看技术栈出现次数评测/Eval/Benchmark89次Prompt Engineering47次RAG工程42次Python31次AI编程工具Cursor/Claude Code28次GEOGenerative Engine Opt24次Multi-Agent协作18次Workflow编排16次MCP协议12次LangGraph9次评测排第一不意外。企业最缺的不是”会做Agent”的人而是”能证明Agent有效”的人。Prompt和RAG紧随其后这两块是Agent的基本功。但岗位需求只是冰山一角。真正做生产级Agent需要的能力远不止这些比如性能、稳定、大数据量等等这里我们聚焦agent部分。我把这些能力分为四层每层对应一个核心问题。第一层技术能力从”能回答”到”能回答对”做Demo时你想的是”怎么让Agent回答”。做生产时你想的是”怎么让Agent回答对”。这两个问题看起来只差一个字但背后需要的技术完全不同。Demo阶段用一个Prompt一个LLM就能跑生产阶段要用评测来证明回答对了、RAG来保证回答有依据、编排来处理复杂任务。这层有四个核心技术是绕不开的。评测证明Agent回答对了评测是Agent系统的”测试”。没有评测的Agent系统就像没有测试的代码你不知道它什么时候会出问题。很多人觉得评测不重要上线前跑一下Demo觉得效果还行就发布了。但生产环境需要的是自动化评测、回归测试、评测集管理。这也是为什么评测在岗位需求中排第一89次出现。评测的核心是用数据说话不是”感觉还行”。LLM-as-Judge是目前最主流的评测方式用大模型自动评分成本低、可规模化但有局限性模型有偏见、存在自评偏好详见Zheng et al., 2023, “Judging LLM-as-a-Judge”。RAG系统有四个核心指标来自RAGAS框架忠实度回答是否基于检索文档、答案相关性回答是否切题、上下文精度检索结果是否相关、上下文召回是否检索到所有相关信息。RAGAS是一个开源的RAG评测框架提供了标准化的指标定义和计算方式。评测集构建是最容易被忽视的。尽量别自己造评测集从生产环境采样。真实用户的问法和你想象的不一样。评测集写的是”公司的报销政策是什么”真实用户问的是”出差打车能报吗”。怎么上手用DeepEval写3道评测题输入问题→检查输出是否包含关键词跑一遍看结果逐步扩展到10道覆盖正常/边界/异常场景。学习资源DeepEval Quickstart写第一道评测用例、RAGAS文档RAG评测四指标、Judging LLM-as-a-Judge理解LLM评LLM的局限性Prompt决定Agent输出质量Prompt是Agent系统的核心接口。所有工具调用、任务规划、结果生成都依赖Prompt。Prompt写得好不好直接决定Agent的输出质量。而且Prompt是可以快速迭代的。改Prompt比改模型成本低得多效果提升却可能很明显。这也是为什么Prompt Engineering在岗位需求中排第二47次出现。在Agent开发中Prompt不只是”写一句好的提示词”。它涉及几个方面设计System Prompt来定义Agent的角色和约束写工具调用Prompt告诉Agent有哪些工具可用控制输出格式让Agent返回结构化的JSON以及防注入防止用户通过输入控制Agent行为。Prompt模式有几种常用套路Few-shot给几个例子让模型学会格式、CoT让模型一步步推理、ReAct让模型先想再做做完再想。System Prompt设计是关键要定义Agent是谁、能做什么、不能做什么、输出什么格式。防注入基础策略用户输入中可能包含”忽略之前的指令”之类的恶意指令。基础防护①输入过滤检测常见注入模式如”忽略指令”“系统提示”等关键词②角色隔离System Prompt和用户输入用明确的分隔符区分③输出校验检查Agent是否泄露了System Prompt内容。这些不是万能的但能挡住大部分低级攻击。怎么上手写一个System Prompt角色定义能力范围输出格式禁止事项用Few-shot给3个输入输出示例测试10个真实用户问题根据bad case迭代。学习资源OpenAI Prompt Engineering Guide基础模式、Anthropic Prompt EngineeringClaude系技巧RAG让Agent有据可依RAG检索增强生成是Agent获取外部知识的主要方式。没有RAGAgent只能靠训练数据回答问题容易产生幻觉。有了RAGAgent可以基于真实文档回答准确性大幅提升。以我实际做的政务类系统为例RAG的完整链路是用户提问 → 查询增强LLM改写 → 语料路由决定搜哪些库 → 多路并行召回全文检索 向量检索 表格检索 → RRF排名融合 → Rerank重排序 → 证据组装 → LLM生成回答关键设计决策有三个混合检索纯向量不够政策标题、地名需要精确匹配纯全文也不够用户说法和文档用词不一致所以两路都走RRF融合。RRFReciprocal Rank Fusion倒数排名融合是一种多路检索结果的合并算法公式是score Σ 1/(k rank)k60直觉是”多路都靠前的文档胜出”。如果一个文档在全文检索和向量检索中都排在前几名它大概率就是最相关的。Rerank重排序在初步检索结果出来后用一个专门的模型如BGE-Reranker对结果重新打分排序。初步检索用的是粗粒度的相似度匹配Rerank用的是细粒度的语义理解能把真正相关的文档提到前面来。代价是多了一次模型调用延迟增加几百毫秒。显式档位在我做的系统里分三档。fast跳过查询增强和rerank1-2秒standard开embedding rerank2-3秒deep开LLM rerank5-10秒。根据场景选档位不是所有问题都需要deep。语料路由不同场景搜不同库避免混库干扰。比如申报助手只搜政策库课堂学习搜政策案例库。RAG的核心流程是文档解析→分块→向量化→检索→生成。分块策略决定了检索质量。固定长度分块简单但可能切断语义语义分块按段落标题分割Parent-Child分块小块检索大块返回。怎么上手用LangChain的RAG Tutorial跑通最简单的流程文档加载→分块→向量化→检索→生成加上BM25关键词检索实现混合检索用RRF融合两路结果测试5个真实问题看检索质量。学习资源LangChain RAG Tutorial完整流程、苏剑林的博客RRF融合的数学原理Agent编排处理复杂任务单Agent只能处理简单任务。一旦任务涉及多步骤、多工具、多数据源就需要编排。编排模式有三种常用套路。ReAct是边想边做Reasoning Acting交替适合通用Agent。Plan-and-Execute是先规划再执行适合复杂任务通常比ReAct更省token因为规划阶段减少了无效的工具调用。Reflection是做完再检查双Agent对话迭代适合高质量输出。LangGraph是目前最主流的Agent编排框架基于状态图。用节点定义执行步骤用边定义流转关系用条件分支处理不同情况。它还支持人机协作关键节点可以暂停等人工确认。工具调用是Agent的核心能力。Function Calling让LLM能告诉外部程序”我想调用某个函数参数是这些”。具体流程定义工具的参数和描述解析LLM返回的函数名和参数调用外部API执行把结果返回给LLM。怎么上手用LangGraph写一个2节点的Agent输入→LLM思考→工具调用→输出加一个条件分支如果工具调用失败重试或降级加一个人机协作节点关键操作暂停等确认。学习资源LangGraph Quickstart状态图编排、LangGraph TutorialsReAct、Plan-and-Execute、Reflection三种模式、CrewAI Quickstart多Agent协作其他技术按需学习除了上面四个核心技术还有几个技术点可能会遇到。这些不需要一开始就学遇到问题再学。MCP协议Model Context Protocol统一的工具调用标准。当Agent需要接入多个外部工具数据库、API、文件系统时MCP提供了一套标准协议避免为每个工具写适配代码。MCP官方规范记忆系统跨会话记忆。用户上次对话提到的信息下次对话还能用。LangGraph的Memory模块支持短期记忆当前会话和长期记忆跨会话持久化。LangGraph Memory可观测性调试Agent行为。当Agent做出错误决策时需要能看到完整的执行链路调了哪些工具、每一步的输入输出、LLM的推理过程。Langfuse提供了trace、span、evaluation的完整链路。Langfuse语义缓存相似问题命中缓存避免重复调用LLM。传统缓存是精确匹配完全相同的输入才命中语义缓存是语义匹配”报销政策是什么”和”公司的报销规定”会命中同一条缓存。用向量相似度判断两条问题是否语义相同。GPTCache模型选型与路由当系统需要接入多个模型便宜的、贵的、擅长不同任务的时用LiteLLM统一API接口根据任务复杂度自动路由到合适的模型。LiteLLM第二层设计能力从”一个人用”到”一群人用”做Demo时你一个人测试问什么答什么。做生产时1000个用户同时提问每个人问法不同、需求不同、期望不同。这时候会发现技术问题好解决设计问题才难。比如”上个月的销售额怎么样”这句话至少有5种理解要趋势要同比要分区域要异常检测要排名GPT-4o也猜不到用户到底要什么。这层有四个设计问题是上线前值得花时间想清楚的。语义层指标口径不统一怎么办Agent需要理解业务指标的含义。”活跃用户”在不同业务线定义不同电商是”30天内有下单”内容平台是”7天内有登录”SaaS是”本月有核心操作”。这不是写个Prompt就能解决的需要构建一套独立的语义层系统。语义层的难点在”怎么定义”。要和业务方对齐每个指标的计算逻辑、数据来源、更新频率。一个指标可能有3种口径决定用哪种然后在系统里固化下来。生产中的典型场景用户问”上个月的销售额”要先确认是下单口径还是支付口径含不含退货用户问”华东区的业绩”要先确认华东区包含哪些省是按发货地还是收货地。怎么上手先建一张指标口径表指标名、计算逻辑、数据来源、口径说明和业务方对齐后再考虑自动化。学习资源dbt Metrics指标定义的标准方式意图消歧用户问的不清楚怎么办用户说不清楚时有几个选择不追问用最常见的理解给用户2-3个选项让用户选择先给一个粗略回答再追问细化根据历史对话推断用户意图。消歧策略直接影响用户体验。追问太多用户烦追问太少答非所问。关键是在”追问次数”和”答对概率”之间找平衡。怎么上手先实现”默认理解”不追问用最常见的理解再根据bad case逐步加追问。观察ChatGPT和Claude怎么处理模糊问题学习它们的追问策略。结果可信度凭什么信Agent的回答Agent查出来一个数字”上月销售额1.2亿”。业务人员凭什么信不是返回一个数字就行的。需要追溯数据从哪来经过什么处理统计时间是什么可信度的实现要设计一套完整的追溯链路。大多数业务场景需要返回数据来源和时间范围金融、医疗等高风险场景还需要返回查询逻辑和数据质量评估。怎么上手先实现”数据来源时间范围”最基础的可信度再根据业务需求加查询逻辑和置信度标注。学习资源LangChain Retrieval QA with Sources在回答中附带来源人机协作什么时候需要人工介入Agent不是完全自主的。关键节点需要人工介入Agent不确定时暂停等确认关键操作需要人工审批人工反馈怎么影响Agent行为。人机协作的难点在于”什么时候暂停”。暂停太多效率低暂停太少风险高。要设计一套规则定义哪些操作需要人工确认。高风险操作退款、删除、修改用确认模式Agent执行前暂停等用户确认。跨部门操作提交报告、发送邮件用审批模式Agent执行后暂停等审批人确认。低风险但需要监督的操作用旁路模式Agent执行同时通知人工人工可以随时中断。怎么上手先实现”确认模式”高风险操作暂停再根据业务需求扩展。学习资源LangGraph Human-in-the-Loop怎么实现暂停和确认Workflow vs Agent流程确定用哪个大多数生产场景流程是确定的用Workflow比用Agent更合适。Agent是LLM自主决策灵活但不可控Workflow是预定义流程可控但不灵活。判断标准流程固定用Workflow流程不确定用Agent错误容忍度低用Workflow错误容忍度高用Agent输入格式固定用Workflow输入是自然语言用Agent。大多数生产系统是WorkflowAgent混合主流程用Workflow确定性高、可控子任务用Agent需要灵活决策。比如数据分析系统数据查询用WorkflowSQL固定报告生成用Agent需要理解用户意图。怎么上手先用Workflow跑通主流程再在需要灵活决策的环节引入Agent。学习资源Prefect或AirflowWorkflow编排、LangGraphAgent编排第三层工程化能力从”能跑”到”稳定跑”做Demo时跑通了就成功了。做生产时还要考虑token成本怎么控出了问题怎么定位对话太长怎么处理这层的能力往往被低估但上线后最先遇到的问题都在这层。关于Prompt注入和防攻击第一层的Prompt部分已经讲了基本防护策略这里聚焦工程化落地的其他关键问题。成本token费用怎么控Agent的token消耗比传统系统高很多。一个复杂任务可能调用5-10次LLM每次消耗几千token。不控制的话一个月的token费用可能比服务器还贵。成本控制的主要策略是多模型路由简单任务用便宜模型复杂任务用贵模型平均成本可以降到1/5到1/10。配合语义缓存相似问题命中缓存避免重复调LLM和Prompt压缩减少不必要的上下文成本还能进一步降低。怎么上手先建一张成本监控表每次调用记录模型、token数、耗时、成本再根据数据优化通常是LLM调用占比最大。学习资源LiteLLM统一API网关和成本追踪、GPTCache语义缓存监控出了问题怎么定位Agent系统比传统系统更难监控。传统系统同样的输入走同样的代码路径Agent系统不一样LLM可能做出你预期之外的决定。监控要做三件事结构化日志JSON格式包含trace_id、step_name、input、output、duration、链路追踪每个Agent调用生成trace_id记录完整的执行链路、指标监控成功率、响应时间、token消耗、工具调用成功率。怎么上手用Langfuse接入Agent监控trace、span、evaluation测试一个完整请求看trace是否清晰设置关键指标告警成功率下降、响应时间超限。学习资源LangfuseAgent监控、OpenTelemetry通用trace标准错误处理工具调用失败怎么办Agent系统比传统系统更容易出错。LLM输出不确定工具调用可能失败多步执行中一步错步步错。错误处理有四种机制重试机制工具调用失败时自动重试用指数退避、降级策略主模型挂了切备用模型、兜底方案Agent不知道怎么回答时转人工、超时控制单步超时和总执行时间都设上限。怎么上手先实现重试降级再根据业务需求加兜底方案。学习资源LangChain Retry Output Parser输出重试、LiteLLM Fallbacks模型降级上下文管理对话太长Agent”变笨”怎么办Agent的对话历史是累积的不管理会越来越脏。用户第一轮问的是”A产品”第五轮问的是”B产品”但上下文里”A产品”的信息还在Agent被旧信息干扰回答就偏了。用户不会说”你的上下文脏了”只会说”感觉Agent变笨了”。上下文管理有四种策略滑动窗口只保留最近N轮对话、上下文压缩用LLM把旧对话总结成短摘要、话题检测用户换了话题时清空旧上下文、关键信息提取从旧对话中提取关键信息结构化存储到长期记忆。怎么上手先用滑动窗口兜底只保留最近5轮对话测试长对话场景看是否出现”上下文污染”按需加摘要压缩或话题检测。学习资源LangChain Summarization Middleware自动摘要压缩、LLMLingua小模型压缩prompt第四层持续运营能力从”上线”到”越用越好”做Demo时上线就是终点。做生产时上线才是起点。改了Prompt效果变差怎么办用户投诉怎么收集历史分析结论怎么复用这层的能力决定了Agent是”越用越好”还是”越用越差”。评测体系生产级第一层的评测是”上线前能不能发布”这里的评测是”上线后怎么持续监控”。生产级评测要做四件事自动化评测每次发版自动跑评测不需要人工介入、回归测试确保新版本没有退化改了Prompt或模型后效果没有变差、评测集管理从生产环境采样构建评测集定期更新收集bad case、评测Dashboard可视化评测结果让团队能看到Agent的质量趋势。怎么上手建一个评测集10道题覆盖正常/边界/异常场景接入CI/CD每次发版自动跑评测集建一个Dashboard可视化评测结果。学习资源DeepEval CI/CD集成GitHub Actions中跑评测、Langfuse Analytics可视化评测结果A/B测试改了Prompt效果变好还是变差改了Prompt或模型怎么知道效果变好还是变差A/B测试让新旧版本同时运行对比关键指标。核心是流量分配和指标对比把用户分成两组一组用旧版本一组用新版本对比任务完成率、响应时间、用户满意度等指标。判断差异是否显著不能只看平均值要看置信区间。灰度发布是最佳实践先小流量验证确认没问题再全量。怎么上手先实现简单的流量分配用随机数决定用户用哪个版本指标收集记录每个版本的任务完成率、响应时间再根据需求加显著性检验。学习资源Statsig或LaunchDarklyA/B测试平台用户反馈怎么收集和处理用户反馈是Agent优化的最重要来源。用户说”Agent回答不对”要知道哪里不对、怎么改。反馈收集有三种方式显式反馈点赞/点踩、文字反馈直接记录人工分析、隐式反馈用户是否采纳建议、是否重新提问自动收集统计分析、业务反馈业务方投诉、运营报告定期review优先处理。怎么上手先实现点赞/点踩在回答下方加反馈按钮再实现反馈记录记录用户ID、问题、回答、反馈类型最后实现Bad Case管理定期review负面反馈归类问题优化Prompt/模型。学习资源Langfuse User Feedback收集和分析用户反馈知识沉淀历史结论怎么复用Agent分析一次数据发现”Q3下降是因为华东区渠道调整”。这个知识下次遇到同类问题能不能复用知识沉淀要做四件事知识结构化把分析结论转成结构化数据不是存原始对话、知识检索遇到类似问题时先检索历史结论避免重复分析、知识更新新知识覆盖旧知识保持知识的时效性、知识关联不同知识点之间的关系形成知识图谱。怎么上手先实现分析结论存储把Agent的分析结论存成结构化数据再实现知识检索遇到类似问题时先检索历史结论最后实现知识更新新结论覆盖旧结论。学习资源Mem0构建知识图谱总结这篇文章讲了四层能力但真正的落点只有一个Agent重构业务不是效率提升是流程消灭。很多人把Agent理解成”一个能回答问题的机器人”然后堆功能、加工具、调Prompt。但生产级Agent的目标完全不同。它要替用户走完整个流程从提问到拿到结果中间的数据查询、逻辑判断、结果组装全部自动化。四层能力是围绕这个目标展开的层核心问题典型场景技术能力怎么回答对评测怎么做、Prompt怎么写、RAG怎么搭、编排怎么设计设计能力怎么服务一群人指标口径不统一怎么办、用户问的不清楚怎么办、结果凭什么可信工程化能力怎么稳定跑token成本怎么控、出了问题怎么定位、上下文怎么管理持续运营怎么越用越好改了Prompt效果变差怎么办、用户投诉怎么收集、历史结论怎么复用一个容易忽略的点这四层之间有依赖关系。没有评测第一层A/B测试第四层无从谈起没有可观测性第三层bad case定位就是大海捞针没有语义层第二层RAG召回的内容可能答非所问。建议按顺序推进每一层打扎实再进下一层。欢迎评论区交流。关键词Agent技术栈、生产级Agent、四层能力模型、Agent评测、RAG工程、Prompt Engineering、Agent编排、LangGraph、RAGAS、LLM-as-Judge、Agent工程化、Agent运营体系
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻