FEATURED · 精选文章

Dify知识库分段与数据清洗实战:优化LLM检索效率与回答精准性指南

发布时间 / 2026/8/27 14:35:31
来源 / 创域科博编辑部
栏目 / 资讯中心
Dify知识库分段与数据清洗实战:优化LLM检索效率与回答精准性指南 前言将内容上传至知识库后要对内容进行分段与数据清洗。该阶段是内容的预处理与数据结构化过程长文本将会被划分为多个内容分段。1 分段由于LLM的上下文窗口有限无法一次性处理和传输整个知识库的内容因此需对文档 中的长文本分段为内容块。即便部分大模型已支持上传完整的文档文件但实验表明检索效率依然弱于检索单个内容分段。LLM能否精准回答出知识库中内容关键在知识库对内容块的检索与召回效果。类似在手册中查找关键章节即可快速得到答案而无需逐字逐句分析整个文档。经分段后知识库能基于用户问题采用分段 TopK 召回模式召回与问题高度相关的内容块补全关键信息从而提高回答精准性。进行问题与内容块的语义匹配时合理分段大小很关键能帮助模型准确找到与问题最相关内容减少噪音信息。Dify 提供“通用分段”和“父子分段”两种分段模式分别适应不同类型的文档结构和应用场景满足不同的知识库检索和召回的效率与准确性要求。2 清洗为保证文本召回效果通常需在将数据录入知识库之前便对其进行清理。如文本内容中存在无意义字符或空行可能影响问题回复质量需清洗。LLM收到用户问题后能否精准回答知识库中内容取决知识库对内容块的检索和召回效果。匹配与问题相关度高的文本分段对 AI 应用生成准确且全面的回应至关重要。好比智能客服仅需帮助 LLM 定位至工具手册的关键章节内容块即可快速得到用户问题的答案而无需重复分析整个文档。在节省分析过程中所耗费的 Tokens 的同时提高 AI 应用的问答质量。3 分段模式知识库支持两种分段模式通用模式与父子模式。首次创建知识库推荐父子模式。选定分段模式并完成知识库的创建后后续无法变更。知识库内新增的文档也将遵循同样的分段模式。3.1 通用模式系统按用户自定义规则将内容拆分为独立的分段。当用户输入问题后系统自动分析问题中的关键词并计算关键词与知识库中各内容分段的相关度。根据相关度排序选取最相关的内容分段并发送给 LLM辅助其处理与更有效地回答。该模式下需根据不同的文档格式或场景要求参考以下设置项手动设置文本的分段规则。① 分段标识符默认\n即按文章段落分块。可遵循正则表达式自定义分块规则系统将在文本出现分段标识符时自动执行分段。例如 的含义是按照句子进行分段。不同语法的文本分段效果② 分段最大长度指定分段内的文本字符数最大上限超出该长度时将强制分段。默认值为 500 Tokens分段长度的最大上限为 4000 Tokens。③ 分段重叠长度对数据进行分段时段与段之间存在一定重叠部分。这种重叠可帮助提高信息的保留和分析的准确性提升召回效果。建议设置为分段长度 Tokens 数的 10-25%。④ 文本预处理规则过滤知识库内部分无意义的内容。提供以下选项替换连续的空格、换行符和制表符删除所有 URL 和邮件地址配置完成后点击“预览区块”即可查看分段后的效果。可直观看到每个区块的字符数。如重新修改分段规则需重新点击按钮以查看新的内容分段。若同时批量上传多个文档轻点顶部的文档标题快速切换并查看其它文档的分段效果。分段规则设置完成后接下来需指定索引方式。支持“高质量索引”和“经济索引”详细说明请参考设定索引方法。3.2 父子模式父子模式采用双层分段结构来平衡检索的精确度和上下文信息兼得精准匹配全面的上下文信息父区块Parent-chunk保持较大的文本单位如段落提供丰富上下文信息子区块Child-chunk是较小的文本单位如句子用于精确检索。系统先通过子区块进行精确检索以确保相关性然后获取对应的父区块来补充上下文信息从而在生成响应时既保证准确性又能提供完整的背景信息。你可以通过设置分隔符和最大长度来自定义父子区块的分段方式。如AI智能客服场景用户输入的问题将定位至解决方案文档内某具体句子再将该句子所在的段落或章节联同发送至 LLM补全该问题的完整背景信息给出更精准回答。3.2.0 实现原理① 子分段匹配查询将文档拆分为较小、集中的信息单元如一句话更精准匹配用户所输入的问题子分段快速提供与用户需求最相关的初步结果② 父分段提供上下文将包含匹配子分段的更大部分如段落、章节甚至整个文档视作父分段并提供给LLM父分段为LLM提供完整背景信息避免遗漏重要细节助 LLM 输出更贴合知识库内容的回答该模式下需根据不同文档格式或场景要求手动分别设置父子分段的分段规则。3.2.1 父分段分段选项段落根据预设的分隔符规则和最大块长度将文本拆分为段落。每个段落视为父分段适用于文本量较大内容清晰且段落相对独立的文档。支持以下设置项分段标识符默认值为\n即按照文本段落分段。可遵循正则表达式自定义分块规则系统将在文本出现分段标识符时自动执行分段。分段最大长度指定分段内的文本字符数最大上限超出该长度时将强制分段。默认值为 500 Tokens分段长度的最大上限为 4000 Tokens全文不进行段落分段而直接将全文视为单一父分段。出于性能原因仅保留文本内的前 10000 Tokens 字符适用于文本量较小但段落间互有关联需完整检索全文的场景。父子模式下的段落和全文预览3.2.2 子分段子分段文本在父文本分段基础上由分隔符规则切分而成用于查找和匹配与问题关键词最相关和直接的信息。如果使用默认的子分段规则呈现的分段效果当父分段为段落时子分段对应各段落中的单个句子父分段为全文时子分段对应全文中各单独的句子在子分段内填写以下分段设置分段标识符默认值为 即按照句子进行分段。可遵循正则表达式自定义分块规则系统将在文本出现分段标识符时自动执行分段。分段最大长度指定分段内的文本字符数最大上限超出该长度时将强制分段。默认值为 200 Tokens分段长度的最大上限为 4000 Tokens还可用文本预处理规则过滤知识库内部分无意义的内容替换连续的空格、换行符和制表符删除所有 URL 和电子邮件地址配置完成后点击“预览区块”即可查看分段后的效果。你可以查看父分段的整体字符数。背景标蓝的字符为子分块同时显示当前子段的字符数。如果重新修改了分段规则需要重新点击“预览区块”按钮以查看新的内容分段。若同时批量上传了多个文档轻点顶部的文档标题快速切换至其它文档并预览内容的分段效果。父子分段模式为确保内容检索的准确性父子分段模式仅支持使用“高质量索引”。3.3 模式区别内容区块的分段形式通用模式的分段结果为多个独立的内容分段父子模式采用双层结构进行内容分段即单个父分段的内容文档全文或段落内包含多个子分段内容句子不同分段方式影响 LLM 对知识库内容的检索效果。相同文档中采用父子检索提供的上下文信息更全面且精准度方面也保持较高水平远优于传统的单层通用检索方式。通用模式与父子模式的内容检索效果对比。最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻