FEATURED · 精选文章

用AI检验我的中医辨证评分卡:被戳穿的四个破绽与三轮修复

发布时间 / 2026/9/9 16:44:23
来源 / 创域科博编辑部
栏目 / 资讯中心
用AI检验我的中医辨证评分卡:被戳穿的四个破绽与三轮修复 做中医量化这件事我被人问最多的一句话就是你凭什么觉得望闻问切那套东西能塞进表格里坦白说我自己也没底。模型表做出来之后我一直处于一种既兴奋又心虚的状态——兴奋的是辨证逻辑终于能一行行写进评分卡里了心虚的是这套权重说白了是我根据教材共识和自己的临床观察估出来的没有经过大样本验证。所以我把这张表完整发给了豆包请它用真实的医学数据、公开病案和教材逻辑帮我做一轮检验。它没有跟我客气给了我一堆直白的评价有认可也有把我戳穿的批评。这篇内容就是把这次检验的完整过程、豆包的评价原文逻辑以及我拿到评价之后对模型做的三轮修改一并整理出来。如果你也在折腾中医数字化、辨证辅助工具、或者想让AI帮自己审一套诊断评分体系这份记录应该对你有用。1. 我这张模型表把中医辨证拆成了什么1.1 不搞玄学先把辨证变成评分卡我的模型表本质上就是一张多维度的加权评分表。输入是患者的四诊信息——症状、舌象、脉象、病程、诱因、体质倾向输出是疑似证型、病机推定和参考方剂方向。中间最关键的东西叫“项目权重表”也就是每个症状对每个证型的支持程度。拿风寒束表证举例结构大概是这样的四诊项目症状描述对风寒束表证的权重实际得分主症恶寒重、发热轻0.302.4主症无汗0.201.6伴随症头身疼痛0.151.2伴随症鼻塞流清涕0.100.8舌象舌淡红、苔薄白0.100.8脉象脉浮紧0.151.2合计--8.0然后拿合计得分去跟其他证型的得分做横向比较比如风寒犯肺、风热犯卫、气虚感冒。哪个证型总分最高模型就把哪个判定为最可能证型。整个逻辑非常朴素和中风危险因素评估表、压疮风险评分表的思路几乎一样就是把临床判断过程显性化、可审计化。这个方向我在做的时候是很坚持的。因为中医辨证长期面临一个问题——师徒传承时靠“悟”病例讨论时靠“掰扯”年轻医生想复核一个老医生的辨证依据经常发现对方自己也说不清每一步是怎么推的。评分卡天然适合解决这个问题每一项取舍、每一个权重都能被摊在桌上讨论。1.2 评分权重最初是怎么来的权重来源我给豆包交代得很清楚主要依据三样东西。第一是《中医诊断学》教材和各科辨证分型章节里的共识描述比如风寒束表必然“恶寒重发热轻”、风热犯卫必然“发热重恶寒轻”这类条目在教材里属于高频共性描述我直接把它们拆成评分项目。第二是公开医案里出现的高频症状搭配我整理过一批常见病医案把出现频次超过一定阈值的症状组合纳入评分项。第三是我自己见过的一部分病例记录经验这部分占比最少但恰恰是后来被批评最多的部分。说白了这套权重是一个“经验编码”的产物——把经验翻译成了数字而不是从数据里“长”出来的数字。当时我没觉得这是问题豆包一轮检验下来我才发现这个差别不是学术洁癖而是要不要命的差别。2. 为什么要找豆包来检验而不是自己再检查一遍2.1 人看自己的模型天然带着滤镜自己做的模型每个症状的权重都是自己定的所以回头看的时候大脑会自动补全所有合理的解释这个偏低是因为少见、那个偏高是因为典型。这种自洽感非常害人。哪怕我把模型拿给同行看只要对方碍于情面轻描淡写提两句“挺好的这里再调调”我依然会带着沾沾自喜继续用。我需要的是一个不会给我留面子的审阅者。豆包没有师徒关系、没有人情压力也不会因为怕我不高兴就在关键问题上含糊它可以直接指出这个权重逻辑缺乏统计学依据、那个症状独立性假设站不住脚。这一点非常重要——做工具的长期卡点不是技术不够而是没有外部视角帮自己捅破认知边界。2.2 AI能模拟“读大量病案”的检验方式还有一个现实问题我没有办法短时间内拿几千份真实临床病案来做模型验证因为涉及数据获取和伦理审批。豆包的知识库里包含大量公开的医学教材、临床指南、辨证分型标准以及脱敏公开的病案论述它可以基于这些资料做大规模的交叉比对。我得先把预期管理做好——豆包这种检验方式属于“知识库仿真验证”不是临床试验也不替代真实世界的回顾性队列研究。它能做的是拿我的模型逻辑去和教材共识、指南描述、公开病案文本做逐条对照找出逻辑漏洞、权重矛盾和潜在的临床误导。这相当于给你的模型做一次高强度的“逻辑审稿”非常疼也非常值。3. 豆包用真实医学数据检验后的四个直接结论3.1 先说它认可的部分豆包不是全盘否定。它明确指出的第一个优点是模型的结构是清晰可解释的每个证型判定都能溯源到具体的四诊条目和权重这在教学场景下特别有价值。它原话逻辑是“如果目标是让初学者理解‘为什么这个病例被判为风寒束表’这套表格比一段文字描述更直观也更容易被学生质疑和纠正。”第二个被认可的点是模型内部保持了辨证体系的自洽性。比如证型之间的鉴别项设置没有出现大的矛盾——被归类为寒证的证型在恶寒、无汗、分泌物清稀这些条目的权重方向是一致的没有被搞乱说明拆分证型的时候整体思路是成体系的。它还认可了表格的可扩展性。因为每个证型就是一行行评分项新增一个证型不需要推翻整个系统只需要在表里追加一组权重这个特性让模型有持续迭代的基础。3.2 再说它发现的核心破绽这部分才是硬货豆包一共戳了四个破绽我一个个说。第一症状独立性假设在真实病例里不成立这是最要命的。我的模型默认每个症状独立贡献分数但真实患者的信息是高度相关的。“恶寒”“发热轻”“无汗”“头身疼痛”“脉浮紧”这组症状在风寒表证里几乎成群出现不是五个独立信息而是同一个病机的五次重复表达。模型逐项加分等于给同一个病机连续投了五次票寒证虚高的概率非常大。这个问题直接导致模型在典型病例上空前准确在非典型病例上系统性偏判。第二权重来源是经验的缺一步统计校准。豆包反复对比了我给不同证型相同症状的权重——比如“脉浮”在风寒束表和风热犯卫里的权重差异来源于我的经验估计而不是从数据集里回归出来的。如果拿同一份真实病案数据做逻辑回归或随机森林每个症状对证型的贡献度是可以被算出来的。权重应当来自数据而不是来自拍脑袋否则模型始终只是一份“看起来量化”的经验总结。第三舌脉量化过于粗糙。我的模型对舌象只记录了“舌淡红”“苔薄白”这种单层标签但真实病案里到处都是“舌淡胖边有齿痕、苔白腻而厚”“舌尖红、苔根黄腻”这种复合舌象。多层信息被压缩成一个标签后信息损失太大直接导致模型在寒热错杂、虚实夹杂的病例上表现明显失真。第四缺少不确定性输出。模型的设计是输出一个证型、一个推荐方但真实世界大量病例属于兼夹证——风寒夹湿、气虚外感、寒热错杂。模型没有置信度概念没有“疑似”选项也没有“当前信息不足以判定”的安全出口。豆包给了一句很重的话一个没有不确定提示的模型在医疗相关场景里是危险的因为它会给用户一种“机器判断一定对”的错觉。3.3 它举了一个具体病案为了让我理解前两个破绽的实际后果豆包模拟了这样一个病案患者恶寒重、发热轻、无汗、头痛、四肢酸痛、鼻塞流清涕、咳嗽、痰白稀、舌淡红、苔薄白、脉浮紧——这个病例模型识别为风寒束表没问题推荐方也是荆防败毒散方向评价是“诊断与教材共识一致”。但第二个病例它就翻车了同样是外感风寒主诉里多了“平时容易乏力、气短、脉缓弱”这几个信息。模型给出的最高分依然是风寒束表气虚感冒的分数被远远甩开。问题出在哪因为我给“乏力”“气短”“平时易感冒”这些气虚条目的权重太低了低到在典型风寒症状的围攻下完全不起作用。而真实世界的临床上气虚外感的发生率一点也不低——尤其是老年人。这个案例让我心里一凉模型在“教科书式病案”上表现良好在真实人群里很容易跑偏。4. 豆包评价中最戳中我的三句话4.1 “你这不是量化是经验编码”这句话我消化了很久。量化这个词的门槛不是“有没有数字”而是数字能不能被交叉验证、被统计检验。我的模型表里有数字、有加权求和、有阈值判定形式上很量化但只要追问一句“这个0.30从哪来的”答案就变成了“我根据教材和经验估的”。真正的量化至少要做到权重能从数据里自动学习出来并且在独立数据集上有可重复的验证结果。我得承认我那个表更准确的名字是“经验编码的证型评分卡”而不是“中医量化模型”。这个命名修正非常重要因为对着“量化模型”你会误以为自己的结果有数学上的严谨性而对着“经验编码评分卡”你会老老实实去找数据验证它。4.2 “在模型告诉你它有多确定之前不适合用于任何医疗相关提示”当时看到这句话第一反应是难受第二反应是它说得对。没有置信度输出的模型相当于一个从来不承认自己没把握的医生。用户输入症状后只能拿到一个确切的证型和方剂建议一旦判断错误用户没有任何提示来分辨这个错误边界。真正的做法是每一组证型判定都要配一个置信度。得分差距悬殊时置信度高可以给出参考建议得分接近或信息不足时主动输出“疑似A证型但不能排除B证型建议完善信息或线下就诊”。这应该是中医辅助工具的底线而不是加分配置。4.3 “诊断建议和生活方式建议要分开”豆包特别提醒我辨证模型输出的是“证型推定”属于诊断层面的描述。但真正对用户产生行为指导的是“推荐方剂”和“生活调护”这些内容。这两者的风险等级完全不同。证型估错用户可以当成一种知识参考方子推荐错了可能直接影响用户用药行为。所以模型必须明确区分层级“疑似证型”是分析建议可以大胆展示思考过程“推荐方剂”必须加安全边界和就医提示。这条建议直接改变了我模型表的输出结构——从原来的一次性给出证型方剂改成了“证型分析”和“方剂参考”两个明显分隔的模块并且后者强制附加线下就医提示。5. 根据这次检验我改掉了模型表的三个地方5.1 给症状组引入相关性惩罚第一步是解决“同一病机重复投票”的问题。我的改法不复杂把高度相关的症状做成“症状组”同一组内的症状共享一个权重池。还是拿风寒束表举例“恶寒重”“发热轻”“无汗”“头身疼痛”“脉浮紧”这五个症状被划成一组它们对风寒束表证型的支持力总和封顶为3.0而不是在原有基础上逐项累积。这意味着凑齐一组里的三个症状和凑齐五个症状得分差异会明显缩小。表面上看模型变“钝”了实际上反而更接近临床判断——因为临床医生见到第3个典型症状的时候基本已经能确认病机第4个、第5个只是加强确认不应当把分数翻倍。这个改动直接让非典型病例的误判率降了一截。5.2 输出端增加置信度与就医兜底原来的模型只有一个输出结果前面说过这很危险。现在所有证型判定的末尾都会加一个置信度参数同时把结论分三个层级判定情况输出形式最高分证型明显领先且症状组支持度充分输出疑似证型较高置信度附就医提示最高分和第二名差距不大输出并列候选证型标注“兼夹证可能”不直接给方剂建议症状信息不足或总得分过低输出“当前信息不足以支持证型判定”明确建议线下完善四诊改完之后我心里踏实多了因为模型不再假装自己全知全能它有了承认“不知道”的能力。在医疗辅助场景里这个能力比准确率更值钱。5.3 用公开病案做小样本回溯校准第三个改动最费时间。我从公开的中医内科学病案资料里整理了100例感冒和咳嗽的病例把模型表套上去做回溯判定看看每一条病例的证型判定是否和病案原文的最终辨证一致。结果不算好也不意外典型病例的判定一致率在75%左右非典型病例直接掉到不到40%。这个数据让我重新调整了气虚外感、风寒夹湿、风热夹湿这几个兼夹证的权重结构——不是一次性大改而是每调整一次就拿50例样本重新跑一轮观察一致性变化。我特别想强调一下这种回溯校准只能说明模型自洽性提高了离“临床有效”还有十万八千里。真正的验证至少需要前瞻性设计、大样本、多中心对照这部分远远超出了我一个人能做的范围。我目前能做的只是让模型不至于在已知病案上犯低级错误。6. 模型表的边界它到底适合被拿来做什么6.1 适合辨证思维复盘、教学演示、病例结构化记录这套模型表经过豆包检验、加上我这几轮迭代之后我能比较放心的使用场景有三个。第一个是个人辨证思维复盘——自己看完一个病例后先在表里打分再看模型给出的候选证型对照差距在哪这个过程对提升辨证敏感度很有用。第二个是教学演示——给初学中医的人展示为什么一个病例被辨为风寒束表而不是风热犯卫每一个评分项的增减都是可讨论的比干讲教材直观太多。第三个是病例结构化记录——把原来一大段口语化描述转换成结构化的四诊条目方便归档对比。这也是我反复跟身边人说的一件事工具不能替代临床但工具可以逼你把自己的判断过程说清楚。对学习阶段的人这个“说清楚”的过程本身价值巨大。6.2 不适合代替医师诊断、指导用药、处理复杂危重病案经过这轮检验我对模型不适合做的事有了更清醒的认知。它不适合代替医师诊断因为它的权重来自经验编码而非临床大样本验证它不适合直接指导用药因为方剂推荐是纯方证对应逻辑没有考虑剂量配比、合方变化、药物相互作用和个体差异它绝对不适合处理复杂危重病案——那些寒热错杂、虚实夹杂、多脏同病的病例评分卡式的线性逻辑远远不够用。豆包在最开始检验的时候给我标记了一行警示“任何情况下模型输出不构成执业医疗建议。”这句话我现在印在了模型表的第一页。不是为了免责而是真的意识到一个辅助工具一旦越界去当“虚拟医生”特别容易害人不浅。6.3 重新理解“AI评价中医模型”这件事最后说一点更深的体会。我之前以为让AI帮我检验模型是要让它来判定我的模型对不对、方向好不好。做完之后才明白AI真正提供的不是“对错裁判”而是一面多棱镜——它能从逻辑链条上看出你的建模缺陷能从教材与公开病案里找到和你矛盾的地方还能对你的安全边界提出无情但合理的底线要求。用它检验中医量化模型最大的价值不是得到一个“你的模型很优秀”的结论那几乎不可能也最没用而是它会把你的模型从“我觉得还行”拖进一个必须面对数据、必须面对假设、必须面对用户安全的修罗场里。在这个修罗场待过一轮之后再做任何中医辅助工具我都会先问自己三个问题这个判断的置信边界在哪用户会不会因为工具的输出做出有风险的行为这个权重和逻辑能不能被独立数据检验问完这三句话工具做出来就不会太离谱。下一步我准备把公开病案的样本量从100例扩大到300到500例同时把舌象和脉象的复合信息拆成更细的子维度看看兼夹证的判定能不能再稳定一些。这次检验让我学到的最实在的一件事就是自己的模型被狠狠挑一遍毛病远比闭门打磨精雕细琢有用得多。如果你手上也有类似的评分表、辅助诊断工具或者任何形式的经验模型建议你也拿去给AI做一轮数据检验记得让它别嘴下留情。
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻