
上个月整理自己的 AI 使用记录时发现过去大半年我攒下了 1047 条有效对话。这个数字让我有点吃惊更让我吃惊的是统计出来的结果67.2% 的对话是在重复请求类似的内容24.6% 是在调试同一类问题真正属于全新场景的只有不到 10%。也就是说我每天都在用 AI 做高强度的重复劳动只是每次换了个说法而已。那天晚上我把所有对话导出、清洗、打了标签然后花了整整两个周末去拆解这些记录。最后沉淀出来的东西我管它叫“技能炼金术”——一套从对话垃圾堆里提炼可复用技能的完整流程。这篇文章就是把这套流程、三个提炼出来的典型技能样例、以及我在这个过程中踩过的坑完整地分享出来。如果你也是重度 AI 用户或者正在做 AI 产品、智能体Agent、提示词工程相关的工作这篇内容应该能帮你少走不少弯路。1. 为什么要做“技能炼金”从 1000 对话里看到的三个真相先说清楚一个背景我的 AI 使用场景比较杂包括写代码辅助、内容创作、数据分析、方案设计、学习新领域知识等等。过去大半年基本是“遇到问题就直接开聊”的状态完事就关掉窗口几乎没有做过任何系统性的复盘。这次做统计的时候我把所有对话按“用户的真实意图”做了分类结果非常扎心。1.1 真相一80% 的对话都在重复劳动我把对话按意图聚类之后发现排在前十位的意图几乎覆盖了全部对话的八成以上。排名第一的是“帮我想方案”占了 21.3%排名第二的是“帮我写代码片段”占了 17.8%第三是“优化我这段文字”占了 13.5%。再往后分别是“解释某个概念”“梳理某个流程”“检查某段逻辑”等等。问题在于这些对话的请求方式完全是发散的。比如同样是“帮我想方案”我今天可能说“我想做一个用户增长方案帮我列一下思路”下周可能会说“我们想推广一个新功能你给点建议”再过两周又变成“帮我想想这个活动怎么设计”。AI 确实都给出了不错的回答但每次回答的质量高低完全取决于我当时的提示词状态——状态好的时候一次到位状态差的时候反复拉扯五六轮才能聊到点上。这就相当于一个厨师每天做菜但每次都从洗菜切菜开始从不准备半成品。效率能高才怪。1.2 真相二真正有效的对话往往长得很像在标记对话质量的时候我发现了一个特别有意思的规律那些一次就能聊到点子上的对话结构高度相似。基本都是“背景清楚——目标明确——约束条件完整——输出格式有要求——附带参考样例”这样的结构。而那些翻来覆去聊了很多轮的对话往往是最初的目标就含糊或者缺少关键约束。举一个我自己的例子。同样是让 AI 帮我写一个 Python 函数低质量的对话是这样的“帮我写个函数处理一下日期”然后 AI 反问你要处理成什么格式、输入是什么类型、要不要考虑时区……来回折腾七八轮最后给出的代码还得自己改半天。高质量的对话是“我有一个字符串列表格式是‘2024-01-15 14:30:00’请帮我解析成 datetime 对象再转换成‘2024年1月15日’的格式时区统一用 Asia/Shanghai异常值返回 None顺便写两个测试用例。”一次到位而且基本不用改。这个发现让我意识到AI 回答质量的下限往往不是模型本身决定的而是由你给出的上下文结构决定的。只要把那些有效对话里的结构抽出来变成固定的“套路”就能把每次对话的平均质量拉到相当高的水平。1.3 真相三AI 的能力边界是被“上下文结构”定义的最后一层观察是跳出单条对话来看整体。同一批对话里有些任务 AI 完成得特别好比如总结、改写、代码生成有些任务则一直做得不好比如需要精确多步推理的、需要实时数据的、需要长链路规划的。一开始我把原因归结为“模型能力不够”但对比之后发现不对。做得不好的任务里往往是我没有给 AI 搭好“脚手架”。比如让 AI 做一个竞品分析我直接说“帮我分析一下某某产品的优劣势”它当然只能给你一个泛泛而谈的框架。但如果我把分析维度、判断标准、数据来源、输出格式都定义好它的表现立马就不一样了。这些发现让我确定了一件事我要做的不是积累更多对话而是从对话里提炼出可复用的“技能”。所谓技能就是把上下文结构、执行步骤、输出格式、质量检查标准固化成一套模板下次遇到同类任务直接调用而不是每次重新临场发挥。2. 技能炼金术的核心流程从对话记录到可复用技能的四个步骤明确了目标之后我花了两周时间跑通了一套完整的提炼流程。一开始很粗糙后面逐步打磨成四个明确的步骤对话归档与清洗、模式抽取与特征识别、技能封装、验证与迭代。下面把每个步骤的执行方法和思考逻辑都讲清楚。2.1 第一步对话归档与清洗这一步听起来简单做起来极其繁琐。我用的工具是 Claude 和 ChatGPT 的对话导出功能加上自己的本地记录先想办法把所有对话变成统一的纯文本格式。清洗的核心工作是去重。很多人觉得对话怎么会重复实际上重复的情况非常多同一段代码你可能在不同的对话里让 AI 生成了四五遍同一类型的方案你可能问了不同的模型、用了不同的措辞得到了大同小异的回答。我按照“意图相似度 关键语义”做了初步聚类把明显重复的合并剩下 612 条不重复的对话进入下一步。然后给每条对话打标签。我用的标签体系分三层场景标签如“代码开发”“内容创作”“方案设计”、任务标签如“生成函数”“写文章大纲”“竞品分析”、质量标签如“一次到位”“多轮调试”“结果不可用”。质量标签是后面技能提炼最关键的筛选条件。这个过程没有工具能全自动化我试过让 AI 帮我打标但准确率不稳定最后还是人工为主、AI 为辅。2.2 第二步模式抽取与技能特征识别清洗完对话之后我开始在“高质量对话”和“低质量对话”之间做对比分析找出决定质量差异的特征变量。我在 Excel 里建了一个对照表左边是成功对话的共性特征右边是失败对话的共性特征。成功对话普遍包含 4 到 5 个关键要素清晰的任务目标、必要的背景信息、明确的约束条件、期望的输出格式、参考样例有时有。而失败对话普遍缺少其中两到三个。更具体的做法是逐条拆解。每一轮 AI 回答我都记录三个问题它问了我什么它哪里理解偏了它给的答案哪里不符合预期把这些“碰撞点”标注出来之后模式的轮廓就出来了。比如做代码生成时AI 最常问的是“输入格式是什么”“边界情况怎么处理”“依赖版本是什么”——这些高频反问就是你的技能模板里必须提前交代清楚的字段。做完这一步我得到了 32 个候选技能模式。再往下筛选的时候我给自己定了两个标准一是这个模式在历史对话里至少出现过 5 次二是提炼成技能后能覆盖 80% 以上的同类新请求。最后保留了 12 个值得封装的技能剩下的先搁置等样本更多再说。2.3 第三步封装成“技能模板”有了模式接下来就是把模式变成一套可以直接调用的技能模板。我设计的模板结构包含六个要素触发条件、上下文结构、执行步骤、输出格式、质量校验清单、反例。触发条件解决的是“什么情况下该用这个技能”的问题。很多人做提示词模板失败就是因为把触发条件写得模棱两可导致该用的时候没用不该用的时候瞎用。我给每个技能都配了一组明确的触发场景描述有些甚至配了反触发条件——遇到哪些情况不应该调用这个技能。上下文结构是这个模板里最核心的部分。它不是让你把所有信息都堆给 AI而是让你按照固定的字段顺序组织信息先背景、再目标、再约束、再输出要求、最后参考样例。这个顺序很重要因为模型对文本的注意力分布是有规律的把最重要的目标信息放在足够靠前、且不被噪音干扰的位置回答质量会明显更高。执行步骤是给 AI 看的操作指引。比如做竞品分析的时候明确要求 AI 先列分析框架、再逐个维度展开、最后做交叉对比总结而不是上来就写结论。这一步本质上是把人类做事的思维链注入到模型里约束它的推理路径。输出格式当然要明确。我吃过不少亏AI 洋洋洒洒写了一千字结果我要的是一个表格。所以现在每个技能模板里都明确写清楚输出是 Markdown 表格、代码块、还是分点列表甚至注明篇幅范围。质量校验清单是很多提示词模板最容易忽略的部分。它是一组检查项用于验证 AI 的输出是否符合标准。比如做代码生成时清单里会有“是否处理了空值输入”“是否有单元测试”“是否用了我指定的 Python 版本语法”。这一步能在不额外花对话轮次的情况下把答案质量稳定在高位。2.4 第四步验证、迭代与版本管理技能封装完不能直接上线必须经过验证。我的验证方法是在历史对话里找一批同类型任务用新技能重新跑一遍跟历史最佳效果做对比。记录三个指标一次成功率、首轮有效输出率、以及人工修正所需时间。一次成功率就是整个对话从头到尾不用任何补充提示就能得到可用结果的比例。首轮有效输出率稍微宽松一些允许对话中有一轮澄清但整体效率还算可以。人工修正时间则是把 AI 的输出改成最终可用版本需要花的分钟数。这套指标能比较客观地判断一个技能是否值得长期使用。迭代是永无止境的。技能模板不是一成不变的我每用一次就会在结尾处追加一条备注记录这次有没有遇到模板里没覆盖的边界情况等积累了 5 条以上新备注就升一个小版本号。现在我的“技能炼金术”文件夹里已经维护着 12 个技能有些已经迭代到 v0.4 甚至 v0.6 了。3. 关键实操三个提炼出来的典型技能样例说了这么多抽象的方法论来看三个具体的例子。这三个是 12 个技能里最有代表性、覆盖场景最广的分别对应需求沟通、代码开发、内容创作三大类。每个例子我都给出提炼前后的对比以及完整的技能模板。3.1 样例一“需求澄清”技能这个技能是从 20 多段失败对话里反向提炼出来的。我统计了一下凡是涉及到“帮我做个方案”的对话AI 第一轮反问率高达 86%但凡是先做了需求澄清的对话整体满意度提升了两个档次。技能模板的核心是三步。第一步要求 AI 先列出所有未知的关键信息用提问的方式补全需求第二步是把用户回答映射到固定的需求框架里——目标用户是谁、核心场景是什么、成功标准是什么、限制条件有哪些第三步才是输出方案框架。我目前用的“需求澄清”模板长这样你的角色是需求分析师。在提供任何方案之前先完成以下步骤向用户提出不超过 5 个关键澄清问题覆盖目标用户、核心场景、成功标准、约束条件、优先级。将用户回答整理成一段结构化的需求描述并请用户确认。用户确认无误后再给出方案框架框架必须包含执行步骤、资源需求、风险评估三个部分。输出格式需求描述用段落方案框架用 Markdown 列表风险用表格。提炼之前我用的提示词基本是“帮我做个方案”提炼之后每次都能在 3 轮内锁定需求而且方案落地性强了很多。这个技能现在是我所有方案类对话的默认入口。3.2 样例二“代码审查”技能这个技能是从代码相关的 200 多条对话里长出来的。早期我让 AI 检查代码基本就是整段代码丢进去说“帮我看看有没有 bug”结果它每轮只能发现零散问题还经常给出错误的修改建议。后来我在高质量对话里发现了一个共性做代码审查时如果我把审查维度划分好AI 的表现会完全不同。于是我做了一个代码审查技能的模板核心是让 AI 按照六个维度逐项检查正确性逻辑是否准确边界条件是否完整性能是否有不必要的复杂度是否能优化安全性是否存在注入、越权、数据泄露风险可读性命名是否清晰函数是否过长注释是否有效健壮性异常处理是否完善外部依赖是否可控可测试性代码是否容易编写单元测试模板要求 AI 在每个维度下面列出具体问题并注明问题所在的代码行号和修改建议。如果某个维度没有问题必须明确写“通过”不能省略。加上这个结构之后审查覆盖率显著提升误报的情况也少了。我还专门在模板结尾加了一句对于不确定的问题标注“需要人工确认”而不是给出确定性结论——这一条直接降低了 AI 幻觉对审查结果的污染。3.3 样例三“报告结构化”技能第三个技能来自内容创作场景。我的日常有一块是把零散素材整理成结构化报告早期这些对话特别痛苦素材多、需求杂AI 每次生成的框架都飘忽不定要么太细、要么太粗。这个技能的提炼特别有意思它不是我主动设计的而是我在给 AI 做了一次“反向总结”之后得出的。有一次我把 AI 生成的一篇质量特别高的报告拉出来反向追问它“你是基于哪些信息来组织结构的”它列出的判断依据其实就是一套隐性规则。我把这些规则显性化做成了结构化报告技能的模板。模板包含四个要素素材整理规则同类信息合并、冲突信息标注、冗余信息删除、报告框架先结论、再论据、再附录、层级规范每个二级标题下至少两个三级标题每个论点必须有数据或案例支撑、篇幅控制按用户指定范围默认 1500 到 2000 字。实测下来用这个技能生成的报告比自由对话稳定非常多。以前每次都要改两三轮结构现在基本首轮就能过审我只需要微调细节。4. 日常踩坑记录与避坑指南技能炼金术听起来很理想实际操作过程中坑多到数不清。这里把最典型的几个问题写出来希望能帮你省掉一些试错成本。4.1 常见问题与排查思路第一个问题是“技能模板太泛”。我第一次做技能的时候总想把一类场景全部概括进去结果模板变得又长又空AI 执行起来无所适从。后来我学到的经验是宁可一个技能只管一个窄场景也不要试图用一个万能模板覆盖所有情况。太泛的技能本质上是没有技能。第二个问题是“上下文结构堆得太满”。很多人以为给 AI 的信息越多越好其实不是。我试过在模板里塞入大量背景资料结果 AI 反而抓不住重点回答变得绵软无力。上下文的关键是精炼和层级清晰不是信息量堆砌。系统提示词里真正有用的信息控制在 300 到 500 字超过这个范围边际收益就很低了。第三个问题是“过度依赖特定模型”。同一个技能模板在不同模型上的表现差异非常大。GPT-4 上跑得很顺的模板换到开源模型上可能完全失灵。我现在的策略是每个技能模板标注一个“最低模型能力要求”并且针对不同模型做微调。这种适配工作很琐碎但没办法模型之间的能力差异是客观存在的。第四个问题是“过度抽象不敢复用”。有些人把技能模板设计得非常精巧每一句话都精心打磨反而导致它在真实场景里很难被复用。因为我每次都要花大量时间去修改模板本身这样效率反而更低。我的建议是第一版模板不需要完美能覆盖 70% 的常见情况就先用起来后续再靠版本迭代慢慢打磨。4.2 避坑清单速查问题表现解决办法技能过泛模板覆盖太多场景执行效果飘忽不定按场景拆分为多个窄技能每个技能定义明确的触发条件上下文过载背景资料太多AI 抓不住核心目标控制系统提示词长度在 300–500 字按重要性排序模型依赖模板在 A 模型上有效在 B 模型上失效记录每个技能的适配模型范围按模型微调模板校验缺失AI 输出看似合理但存在事实错误在模板里加入质量校验清单强制逐项检查缺少版本管理改完模板后旧版本无法回退用简单的文件夹结构或 Git 维护历史版本脱离真实数据凭感觉设计模板不基于实际对话复盘先积累 20 条以上对话样本再做模式抽取这六个问题是我真实踩过的尤其是“上下文过载”和“模型依赖”几乎每个人都逃不掉。特别是模型依赖这个坑我刚换模型的时候曾经大面积翻车后来才意识到不是模型变笨了而是我的模板从一开始就是针对上一个模型的脾气写的。4.3 小技巧如何让 AI 自己帮你提炼技能最后分享一个特别实用的操作技巧——让 AI 自己参与技能提炼。我在清理对话的时候就试过把 50 条同场景的高质量对话丢给 AI让它总结这些对话里共性的提问结构和上下文组织方式它给出的分析准确度相当高。具体做法是选一批成功对话至少 20 条把它们复制到一个新对话里然后用这个提示词让 AI 分析请分析以下对话记录找出用户在提问时隐含的“高质量要素”。重点关注这些对话在背景描述、目标设定、约束说明、输出要求上有什么共性哪些信息在对话早期出现对后续回答质量产生了关键影响如果要把这些对话的提问方式总结成一套模板这个模板应该包含哪些字段 请用结构化列表输出分析结果。这个方法能自动完成 60% 的模式抽取工作你只需要最后人工审查和打磨。它最大的好处是不容易漏掉那些“无意识的成功经验”——很多你自己都没注意到的高质量提问习惯AI 能从文本里找出来。另一个技巧是让 AI 做反例分析。把一组失败对话和一组成功对话放到一起让 AI 对比分析差异。分成“目标是否明确”“上下文是否完整”“约束是否清晰”“反馈是否及时”四个维度AI 能给出非常细的对比结论。我那个“需求澄清”技能的第一版就是用这个方法提炼出来的。做完这一轮复盘之后我现在的工作方式完全变了。新开一个项目第一件事不是写提示词而是翻技能库看看之前沉淀的 12 个技能里有哪些可以直接调。上个月做了一个新功能的方案设计整个过程只用了一次对话就完成了放在以前至少得来回聊五六轮。这种感觉怎么说呢就像你终于把散落一地的工具收到了工具箱里用的时候不再是东翻西找而是打开对应那层抽屉直接拿。如果你也想做一遍技能炼金我建议从今天开始做两件事第一从现在起给每条重要对话打标签标记场景、任务、质量哪怕是在文件名里加个后缀也好第二攒够 20 条以上同场景对话后用我上面那个提示词让 AI 帮你做一次模式分析。只要跑通一次这个循环你以后再跟 AI 配合的时候大概率就回不到从前那种“每次都从零开始”的状态了。