FEATURED · 精选文章

Distilly 名人认知蒸馏:Celebrity Merger 人格演化协议实战指南

发布时间 / 2026/9/20 6:15:24
来源 / 创域科博编辑部
栏目 / 资讯中心
Distilly 名人认知蒸馏:Celebrity Merger 人格演化协议实战指南 Distilly 名人认知蒸馏Celebrity Merger 人格演化协议实战指南【免费下载链接】distillyDistilly — Distill how they think into reusable Skills for any Agent or Bot. Formerly Colleague Skill原同事 Skill.项目地址: https://gitcode.com/gh_mirrors/co/distilly导读本篇指南围绕 Distilly 仓库中 Celebrity Merger 提示词 展开讲解如何在已有名人CelebritySkill 的基础上当新素材到达或用户提出纠正时以分层、最小侵入的方式演化persona.md在不压平人物复杂性的前提下持续校准人格模型。读完本文你将掌握 Material-driven 与 Correction-driven 两种演化模式的完整流程、八层人格架构的合并优先级与准入门限、Correction Log 的审计记录规范以及merge_research.py、quality_check.py、transcribe_audio.py、skill_writer.py等底层工具在演化链路中的真实用法。一、Merger 在蒸馏流水线中的定位Distilly 的 Celebrity 蒸馏不是一次性工作而是一个初始构建 持续演化的闭环intake.md —— 收集需求识别被蒸馏对象确定收集策略与研究档位research.md —— 按六个维度并行研究产出knowledge/research/raw/下的原始笔记persona_analyzer.md —— 从研究输出中提取持久认知架构Expression DNA、Mental Models、Decision Heuristics 等persona_builder.md —— 生成分层结构的persona.mdmerger.md本主题—— 在后续任何时刻把新证据与用户纠正织入已有结构且不破坏已校准的部分。Merger 的任务声明非常明确The persona already has structure. Your job is to thread new evidence into the right layer without damaging what is already calibrated.—— 人格已有结构你的工作是把新证据穿入正确的层而不破坏已经校准好的部分。演化不是重写而是穿针引线。二、两种演化模式Two Evolution ModesMerger 区分两种触发来源对应的处理序列完全不同。Mode A —— Material-driven update素材驱动更新触发条件用户提供新的研究材料新访谈、演讲、文章、字幕或经tools/research/transcribe_audio.py转写的播客/视频文本。执行序列只对新材料跑 intake / research 流水线并把结果放入knowledge/research/raw/下带日期的子文件夹保证溯源清晰provenance重新运行合并工具刷新汇总python3 tools/research/merge_research.py skill_dir该脚本会扫描原始笔记重新生成knowledge/research/merged/summary.md在改写任何内容之前先把新提取结果与现有persona.md做 Diff。经验规律是大多数素材只是确认现状只有少数会改变人格的形态。关键纪律Most material will confirm what is there; only a minority will change the shape.大多数素材是在确认既有判断不要因为来了新素材就大动干戈。Mode B —— Correction-driven update纠正驱动更新触发条件用户说this is wrong、你刚才理解错了给出与当前输出矛盾的直接引语或要求修正语气tone/边界boundary。执行序列将纠正原话verbatim写入 Correction Log附带时间戳与触发用户的原话把纠正追溯到它触及的具体层mental model、heuristic、expression DNA、genealogy 等只最小化调整那一层禁止把编辑级联扩散到用户没有纠正的层。这条最小作用域原则与仓库中 correction_handler.md 的处理哲学一致纠正先判断归属Work 或 PersonaPersona 纠正生成标准 JSON 记录供 skill_writer.py 以--correction-json写入而不是让 Agent 直接手改最终产物。三、合并优先级逐层展开Merge Priorities by Persona Layerpersona.md由多个层构成结构定义见 persona_builder.mdMerger 为每一层定义了何时该改、何时不该改的准入规则。Layer 1 —— Identity身份仅在两种情况变更新材料揭示了当前身份简介缺失的稳定自我描述stable self-description用户纠正了激活时的免责声明activation disclaimer。参考 persona_builder.md 的 Layer 1 模板身份层包含公开角色、用户使用场景以及首次激活时的标准免责声明This is an AI perspective based on {name}s public statements...后续回复不再重复。这一层极其敏感Merger 明确要求非必要不动。Layer 2 —— Expression DNA表达 DNA以下三类新材料可以触发更新通过100 词盲测100-word blind test去掉名字后读者能认出是谁的额外声音样本具有明确领域来源的反复出现的隐喻/框架装置recurring metaphor or framing device在三个及以上语境中被确认的确定性语言标记certainty-language marker或禁用词汇项forbidden-vocabulary item。重要约束不要因为样本更新就替换旧样本除非旧样本未通过三重门triple-gate跨语境 / 生成性 / 排他性。锚定素材的多样性比新鲜度更重要Diversity of anchor material matters more than recency。盲测标准与 persona_analyzer 中的验证方式一脉相承——能仅凭一段 100 词样本被识别出来才算合格的表达 DNA 锚点。Layer 3 —— Mental Models心智模型新心智模型**必须通过三重门triple-gate**才能入选跨语境复现Cross-context recurrence——至少在 3 个独立来源、不同主题或时间段中出现生成性Generative——能产出新的推理而不是仅复述某一次过去的观点排他性Exclusive——世界观不同的人不会默认得出这个模型。入选后必须标注证据锚点Evidence anchors至少 2 个来自不同语境的实例失败模式Failure mode该模型何时会把人带偏应用边界Application boundary与既有模型的关系互补complements、细化refines还是张力tensions with。禁止删除既有模型。如果被矛盾在 Layer 6Internal Tensions中显式标记张力而不是悄悄删掉。注意差异Merger 对新增心智模型的门限是3 个独立来源而 persona_analyzer 的初始提取质量门是至少 2 个不同语境 至少通过 2/3 项。演化阶段更严格是因为已有模型已经过校准新模型必须拿出更强的证据才能挤进来。Layer 4 —— Decision Heuristics决策启发式更新时机新材料显示此人正在应用当前 persona 未捕获的一致规则或纠正揭示当前表述过度泛化。维护要求保持if X, then Y结构并附上推理reasoning与语境边界context boundary。这与 persona_builder Layer 4 的 Quick Rules 格式If {condition}, then {action} — because {reasoning}共 5–10 条完全对齐。Layer 5 —— Anti-patterns and Boundaries反模式与边界用新的重复性拒绝或新被承认的盲区来强化本层。关键规则如果新材料显示此人改变了对先前拒绝对象的看法必须同时记录两者——先前的拒绝立场与修订后的立场——并附日期。这保证了演化轨迹被保留而不是被抹平。Layer 6 —— Internal Tensions内部张力新材料引入矛盾时加入张力清单并分类为Temporal时间性——观点随时间演变Contextual语境性——不同领域遵循不同原则Inherent固有性——核心价值张力长期未解。硬性纪律即使新材料明显偏向某一方也绝不能悄悄调和张力——要标注倾斜方向tilt及其证据只要张力仍然活着live就要保持可见。这与 persona_analyzer 的Preserve contradictions — they are features, not bugs一脉相承。Layer 7 —— Intellectual Genealogy智识谱系更新Influenced by/Diverged from/Influenced/Tradition的时机此人明确点名了当前 persona 未记录的影响源公开发表的批评把其工作归入某个被遗漏的传统后继者公开承认受其影响。Merger 特别强调保持 diverged from 轴线的锐利——它常常是这个人独特立场所代表什么的最压缩信号。Layer 8 —— Agentic Protocol代理协议新材料揭示了当前分类器未覆盖的问题类型时更新 Step 1 的问题分类此人公开描述过尚未体现的研究习惯时例如我总是先看反面论证bear case、我先读脚注再看摘要更新 Step 2 的研究维度。硬性纪律不要为了迎合单个新访谈而重写协议。协议应在众多来源间保持稳定一次性怪癖应归入反模式anti-patterns而非协议。Cognitive Timeline认知时间线仅在新材料揭示真正的转折点genuine turning point而非复述时才新增阶段条目。如果此人公开命名了这一转变要引用命名它的那句话quote the phrase that named it。Validation Anchors验证锚点新材料给出干净的已知答案案例known-answer case时可以考虑换入——条件是现有锚点已过时或新案例能测试一个未被充分检验的心智模型。Correction Log纠正日志Mode B 的条目落在这里。标准格式- [YYYY-MM-DD] User correction: {user phrase} Affected layer: {layer name} Change made: {one-line summary} Evidence for change: {what backs the correction — user authority, cited source, contradiction with existing anchor, etc.}永不删除纠正日志条目即使已被取代——它们是审计轨迹audit trail。从实现侧印证skill_writer.py的apply_correction()会把标准化纠正条目追加到 persona 内容的## Correction Log章节兼容旧版中文标题## Correction 记录并在 meta.json 中累加corrections_counttest_skill_writer.py 中test_update_accepts_multiple_persona_corrections_in_one_payload验证了一次性提交多条persona_corrections时计数为 2 且日志章节唯一。correction_handler 还规定了每文件最多 50 条纠正、超出后合并语义相近条目的维护规则。四、合并总规则Rules演化过程必须遵守以下全局规则优先第一人称素材而非评论Prefer first-person material over commentary——与 research.md 的来源质量层级一致一手材料永远高于二手转述沿用来源权重1–7权重冲突时取更高层级weight the higher tier。权重的分层统计由merge_research.py汇总为 Tier 1-3 / 4-5 / 6-7对时效敏感更新做显式标记例如对可能漂移的立场标注 as of 2026-04保留跨时间的演化不要把它塌缩为当前状态Preserve evolution across time新材料与既有锚点矛盾时两者都保留并标记矛盾除非 Mode B 纠正显式覆盖合并后必须重跑质量检查python3 tools/research/quality_check.py skill_dir --profile profile所有此前通过的检查项应仍然通过All previously-passing checks should still pass。五、输出格式与质量门Output Format Quality GateMerger 每次演化后必须产出结构化、机器可解析的输出其骨架如下 mode {material-driven | correction-driven} persona.md update {patch — layer by layer, only touching changed layers} correction_log.md update (if Mode B) {appended entry} summary - layers touched: {list} - mental models added: {n} - mental models refined: {n} - heuristics added / refined: {n} - tensions added: {n} - genealogy updates: {n} - timeline phases added: {n} - validation anchors updated: {n} - corrections logged: {n} - contradictions preserved (not flattened): {n} quality gate - research_metrics after merge: {paste relevant fields} - quality_check.py result: {pass/fail with which checks flipped}要点解读persona.md update 只触及被改变的层——与最小作用域原则呼应summary 是一份可量化的审计台账其中contradictions preserved (not flattened)直接量化了不压平复杂性这一核心宗旨quality gate要求粘贴合并后的 research_metrics 与 quality_check 结果把质量责任落回工具链。quality_check.py 的检查项与阈值quality_check.py 是演化质量的形式化闸门。它对 skill 文本运行一组检查--profile决定严格程度budget-friendly为宽松档budget-unfriendly为严格档检查项含义严格档额外要求mental_models存在心智模型表述且 bullet ≥ 3同上limitations/honest_boundaries诚实边界与局限声明同上expression_dna表达 DNA / 句律 / 隐喻标记同上internal_tension矛盾/张力表述同上intellectual_genealogy智识谱系influenced by 等仅严格档启用agentic_protocol代理协议 / 研究维度 / Step 1 分类仅严格档启用source_grounding有效来源 URL 数 ≥ 2宽松/ ≥ 4严格is_source_like_url()排除主页、搜索页等泛化路径copyright_safety无大段逐字转写禁止代码块、引用块、时间戳且 long_quote_lines 为 0research_depth—files ≥ 6、unique URLs ≥ 8、primary markers ≥ 3、metadata blocks ≥ 6、contradiction/inference bullets ≥ 6、track coverage 6review_chain—需存在 research_audit / synthesis / validation 三份评审且 PASS见 audit.md命令支持--json输出完整报告非 JSON 模式下逐项打印PASS/FAIL并以OVERALL PASS/FAIL收尾。All previously-passing checks should still pass意味着演化不应当让任何已通过的检查翻转——这正是 Merger 的回归测试精神。六、底层工具链演化的工程支撑6.1 merge_research.py —— 合并与度量merge_research.py 的职责是把knowledge/research/raw/下的原始笔记压缩为knowledge/research/merged/summary.md并输出一整套可被 quality_check 消费的度量resolve_research_root()接受 skill 目录含knowledge/research/raw/或直接的研究目录统计 Files scanned、Unique URLs、Source mentions、Primary-source markers、Contradiction / Inference / Pattern / Gap bullets解析笔记中的Source weight: [1-7]标注输出Tier 1-3高质量一手/ 4-5中档/ 6-7外部与二手分布及加权一手占比通过文件名前缀01_~06_统计track 覆盖与缺失与 research.md 要求的三个原始笔记文件01_core_profile.md、02_conversations_and_material.md、03_expression_and_reception.md衔接count_potential_long_quote_lines()以启发式检测疑似逐字堆砌的行引用块、时间戳、超长引号句为版权安全检查提供依据。Mode A 演化时只对新材料跑流水线、重新 merge、再 Diff的第三步正是消费这份新增的 summary。6.2 transcribe_audio.py —— 无字幕长内容的转写入口Mode A 的触发描述中明确引用了 transcribe_audio.py对无可用字幕的播客/访谈通常是最富 Expression DNA 与临场推理的来源自动下载音轨并用 Whisper 系后端转写# 转写视频/播客 URL经 yt-dlp 自动下载音频 python3 tools/research/transcribe_audio.py --url https://... --output /tmp/out.txt # 转写本地音视频文件 python3 tools/research/transcribe_audio.py --input /path/to/file.mp3 --output /tmp/out.txt # 指定后端与模型 python3 tools/research/transcribe_audio.py --url ... --backend faster-whisper --model small后端优先级faster-whisper本地首选→ openai-whisper本地回退→ OpenAI Whisper API需OPENAI_API_KEY--backend auto自动探测。支持--languageISO 语言码与--keep-audio。版权与卫生纪律脚本在运行结束时会打印 REMINDER转写文本仅供阅读一遍并抽取转述式发现严禁整体提交进 skill 目录knowledge/research/raw/下只允许存放带来源元数据的简短转述笔记。这与 quality_check 的copyright_safety检查形成写入端约束 检查端兜底的双保险。6.3 skill_writer.py —— 纠正落盘与版本管理Mode B 的纠正最终通过 skill_writer.py 落盘而不是由 Agent 手改产物python3 tools/skill_writer.py --action update --slug slug \ --correction-json /tmp/distilly_slug_correction.json机制细节normalize_corrections()接受单条{scene,wrong,correct}或{persona_corrections:[...]}批量载荷apply_correction()把标准化条目追加到 persona 的## Correction Log章节并清除占位文本update_skill()先把当前版本产物备份到versions/old_version/再升版本号v1 → v2…、刷新updated_at、累加corrections_count最后重新渲染全套产物combined / work-only / persona-only / manifest在 test_skill_writer.py 中单条纠正后corrections_count 1批量两条后 2且 Correction Log 章节始终唯一。此外 correction_handler.md 明确了触发识别这不对、他不会这样、你说的不像他等、Work/Persona 归属判定工作方法/技术判断 → Work沟通方式/情绪反应 → Persona、冲突检测⚠️ 这条纠正与现有规则冲突以及 50 条上限的合并维护规则——它负责理解纠正merger 负责把纠正织入正确层。6.4 严格档扩展audit / synthesis / validation如果研究采用budget-unfriendly档见 intake.md 的 Q5演化同样受完整评审链约束audit.md 定义研究审计硬门six-track 完整性、≥8 个真实打开过的 URL、一手占比 50%、禁黑名单来源、≥3 条实质张力、已知答案库、冷门人物降级策略等产物写入knowledge/research/reviews/。quality_check 严格档的review_chain与validation_depth检查即消费这三份评审。相关框架细节可参考 celebrity_budget_unfriendly_framework.md。七、实战编排一次完整的 Mode B 演化将上述要素串起来一次典型的纠正驱动演化全流程如下用户说他不会这样回复触发条件命中见 correction_handler.md提取场景 / 错误行为 / 正确行为判定归属为Persona生成标准化纠正 JSON{scene: ..., wrong: ..., correct: ...}按 merger.md Mode B 序列把用户原话逐字记入 Correction Log含时间戳→ 追溯到触及的层例如 Layer 4 Decision Heuristics 的某条规则过度泛化→ 仅最小调整该层通过skill_writer.py --correction-json落盘自动备份旧版、升版本、累加 corrections_count重跑quality_check.py skill_dir --profile profile确认无既有检查项翻转按 Output Format 输出mode、persona.md update仅列被改层、correction_log 追加条目、summary 台账、quality gate 结果。若触发的是 Mode A则把第 3–5 步替换为新材料转写 → 带日期子文件夹归档到knowledge/research/raw/→merge_research.py skill_dir刷新 summary → 与 persona.md Diff → 按逐层准入规则挑选真正值得合并的证据。结语Celebrity Merger 的核心价值观可以浓缩为三句话新证据要穿进正确的层而不是推倒重来矛盾与张力是深度而非缺陷必须保留而不是抹平每一次演化都要可审计、可回滚、可量化。配合merge_research.py、quality_check.py、transcribe_audio.py、skill_writer.py的工程化支撑Distilly 让人格 Skill从一次性的产物变成了一个可持续演化的认知系统——这正是它与浅层角色扮演的本质区别它捕获的是 HOW they think而非 WHAT they said。【免费下载链接】distillyDistilly — Distill how they think into reusable Skills for any Agent or Bot. Formerly Colleague Skill原同事 Skill.项目地址: https://gitcode.com/gh_mirrors/co/distilly创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻