
摘要宏基因组数据具有重要的生物学潜力但其功能解读常受限于不完整的蛋白功能注释。准确的酶功能注释对于阐释宏基因组数据集中微生物群落的代谢能力至关重要。为应对这一挑战作者开发了FEDKEAfine-tuned ESM-2 and distance-based KNN for Enzyme Annotation基于微调 ESM-2 与距离 KNN 的酶注释工具并提供配套的 Web 平台。此外作者设计了一套用户友好的、基于 FEDKEA 的宏基因组流程MEnzMapMetagenomic Enzyme Map in microbes涵盖从原始数据质控到功能预测及下游分析的完整工作流。将 MEnzMap 应用于 iHMP2 项目的人体肠道宏基因组数据作者生成了健康个体与炎症性肠病inflammatory bowel disease, IBD患者全面的酶谱景观。这些工具为微生物暗物质的功能注释提供了高效方法并促进疾病相关酶的识别。Keywords宏基因组酶功能注释大语言模型蛋白质语言模型ESM-2FEDKEAMEnzMapEC 编号微生物暗物质炎症性肠病文献信息Zheng, L., Li, B., Xu, S., Chen, J., Liang, G. (2026). Large language models enhance annotation of enzymes in metagenomes.Science Advances, 12, eaee4389.DOIhttps://doi.org/10.1126/sciadv.aee4389期刊Science AdvancesIF ≈ 13.9JCR Q1中科院综合性期刊1区在线发表时间2026 年 8 月 19 日研究总结大语言模型增强宏基因组酶注释背景宏基因组功能注释受困于微生物暗物质人体微生物酶调控消化与宿主互作现有酶注释工具在精度与适用性上受限方法UniProt Swiss-Prot 2024年前数据微调ESM-2蛋白语言模型层级EC编号预测框架距离KNN处理少数类MEnzMap宏基因组流程iHMP2队列健康与IBD对比主要结果FEDKEA在酶识别F1达0.9485四级EC预测精度超越主流深度学习工具健康人核心酶以组氨酸激酶最普遍IBD中抗氧化相关酶显著下降Bacteroides来源过氧化氢酶在IBD中耗竭意义为微生物暗物质功能注释提供高效路径揭示IBD中氧化应激响应的酶水平重塑背景介绍微生物组由栖息于人体各部位的高度多样且复杂的微生物群落构成在健康与疾病中发挥关键作用。高通量测序技术的出现彻底改变了微生物组研究产生了海量宏基因组测序数据。然而这些宏基因组数据集的功能注释仍是一项重大挑战——许多微生物基因与通路仍未表征或知之甚少常被称为微生物暗物质microbial dark matter。人体微生物组产生的微生物酶在消化、生物合成、宿主-微生物互作及其他生理过程中发挥关键作用对宿主健康至关重要并为理解微生物组相关疾病提供线索同时在纠正菌群失调方面具有治疗潜力。鉴于微生物组中大量未注释的蛋白功能迫切需要通过新型计算方法对微生物酶功能进行注释。已有若干基于序列相似性、同源建模、结构分析、机器学习和深度学习的酶功能注释工具被开发出来并展现出前景然而在宏基因组分析方面仍有显著的改进空间。本研究利用蛋白质大语言模型protein large language models与ECEnzyme Commission酶学委员会分类的层级结构开发了 FEDKEA。为进一步契合宏基因组应用作者基于 FEDKEA 开发了用户友好的流程MEnzMapMetagenomic Enzyme Map in microbes涵盖从原始数据质控到功能预测及下游分析的整个工作流。作者重新分析了 iHMP2 项目的宏基因组数据以描绘人体微生物组的酶学景观并识别出炎症性肠病患者相较于健康对照组抗氧化相关酶的减少。重要结果结果1数据汇聚与 FEDKEA 模型架构作者收集了 2024 年前 UniProt Swiss-Prot 数据库中的蛋白序列用于模型开发。2024 年前的 UniProt Swiss-Prot 数据库共包含482,290条蛋白序列其中233,921条带 EC 编号的序列经实验验证为酶Fig. 1A。作者排除了占总酶数 6.9% 的多功能酶聚焦于单功能酶的预测最终获得217,828条酶序列与248,369条非酶序列分别作为酶识别任务的阳性与阴性对照。所有数据按 8:1:1 比例分层采样划分为训练集、验证集与测试集。酶的分类学分布分析显示151,110 条酶69.4%来源于细菌54,493 条25.0%来源于真核生物9,960 条4.6%来源于古菌2,265 条1.0%来源于病毒Fig. 1C。细菌与真核生物共享 858 个不同的 EC 编号细菌与古菌共享 494 个细菌与病毒共享 68 个Fig. 1D。鉴于宏基因组数据的复杂性及跨界具有相同 EC 编号的酶之潜在存在作者选择纳入所有分类学的酶用于模型开发。模型构建中发现184,386 条酶具有完整的四级 EC 编号占总量的 84.6%其余缺乏完整四级 EC 编号fig. S1B。考虑到 EC 编号的层级结构以及不完整 EC 编号酶的存在模型采用层级递进预测每一级 EC 编号的策略。同时针对数据集的数据不平衡问题——410 个 EC 编号各包含超过 100 条蛋白而大多数3,451 个仅由 1-10 条蛋白代表Fig. 1B——作者使用MLPMultilayer Perceptron多层感知机分类器识别酶并预测前几级 EC 编号这些级别拥有足够样本用于模型训练而使用基于距离的 KNNK-Nearest NeighborK近邻模型这一零样本方法恢复最后几级 EC 编号以辅助少数类的注释。所有分类器均以微调后的ESM-2嵌入作为输入。在识别酶时微调 ESM-2 的最后四层预测 EC 编号时微调最后三层。为选择 KNN 的超参数 k作者评估了 k1、3、5、7、9观察到k1时精度最高table S1。这些框架最终集成为 FEDKEA——一个同时实现酶识别与 EC 编号预测的集成模型Fig. 1E。Figure 1 图例(A) 2024 年前 UniProt Swiss-Prot 数据库酶序列统计(B) EC 编号的样本数分布显示严重的数据不平衡© 酶的分类学来源分布(D) 不同界间共享 EC 编号数量(E) FEDKEA 整体模型架构包含酶识别与层级 EC 编号预测。结果2微调策略与消融实验验证为解析微调的贡献作者进行了消融分析。在酶识别任务中微调模型达到峰值F1 0.913略优于未微调模型Fig. 2A。微调层数消融表明微调 ESM-2 最后四层在各项评估指标上均取得最佳性能fig. S2A。为评估模型在低相似度序列上的鲁棒性作者使用 CD-HIT-2D 构建了 90% 与 40% 序列同一性阈值的两个额外测试集。尽管性能随相似度降低而略有下降但微调模型在准确率、精确率、召回率、F1 分数、AP 与 AUC 等指标上始终优于未微调模型Fig. 2B 及 fig. S2 B-F。对于一级 EC 预测微调模型在测试数据上平均 F1 得分为0.8829而未微调模型为 0.8656Fig. 2C。第 33 层嵌入的 t-SNE 可视化进一步显示微调模型比未调模型更清晰地区分七个酶类Fig. 2D, E。类似地微调层数消融证明微调三层效果最佳fig. S3A90% 与 40% 相似度测试集也证实了准确率、平均精确率、平均召回率与平均 F1 分数的持续提升Fig. 2F 及 fig. S3 B-D。Figure 2 图例(A) 微调与未微调二分类模型在测试集上各项性能指标准确率、精确率、召回率、AUC、AP、F1的对比(B) 不同序列相似度测试集下两模型的准确率比较© 一级 EC 编号预测中微调与未微调模型的性能对比(D, E) 模型第 33 层嵌入的 t-SNE 可视化(F) 不同序列相似度下一级 EC 预测模型的准确率比较。结果3FEDKEA 与主流酶注释工具的基准比较作者通过将 FEDKEA 与四个近期发表的基于深度学习的 EC 编号注释工具——CLEAN、GraphEC、ECRECer与DeepEC——系统比较考察其预测性能。CLEAN 使用来自 UniProtKB/Swiss-Prot 的完整 EC 编号酶采用对比学习策略但仅限于 EC 编号预测不支持酶识别。GraphEC 在相同数据集上训练使用几何图学习框架整合 ESMFold 预测的蛋白结构与预训练蛋白质语言模型同样仅限于 EC 编号预测。ECRECer 采用层级双核多任务学习框架可同时预测酶身份与 EC 编号。DeepEC 使用卷积神经网络高效识别酶并预测 EC 编号。作者构建了独立测试集UniProtKB 2025_05——包含 2024 年 1 月 1 日至 2025 年 5 月 9 日发布的 1,451 条酶序列与 1,426 条非酶序列所有序列均严格排除在待测模型的训练数据之外以确保无偏基准验证。在酶识别任务中FEDKEA 在各种多标签精度指标上均取得最高分包括准确率0.9486、精确率0.9585、召回率0.9387与 F1 分数0.9485Fig. 3A。为专门评估 FEDKEA 在低同一性序列上的性能作者合并 FEDKEA 与 ECRECer 训练集、去冗余并消除标签冲突使用 MMseqs2 将二分类测试集与该统一数据集比对构建不同同一性级别的测试数据集。在 UniProtKB_2025_05 基准上FEDKEA 在所有同一性级别包括 ≤30% 级别的各项指标上均取得最高分Fig. 3B 及 fig. S4 A-C。对于 EC 编号预测作者在来自不同来源的两个独立测试集Price-180与NEW-691上评估性能两者均包含多功能酶。FEDKEA 在不同 EC 级别上均优于其他方法在 NEW-691 上四级 EC 准确率达0.4964在 Price-180 上达0.3556Fig. 3C, D。在仅保留单功能酶子集NEW-657 与 Price-166的公平比较下FEDKEA 表现出优于所有其他方法的性能Fig. 3E 及 fig. S4 J-K。为排除训练集相似度偏差作者使用 Needleman-Wunsch 算法全局比对移除更接近 FEDKEA 训练集的序列后FEDKEA 仍保持最高精度。在 NEW-691 的低同一性≤30%子集上FEDKEA 持续优于 CLEAN、GraphEC 与 ECRECerFig. 3F 及 fig. S4 T-V。此外在 NEW-691 与 Price-180 中定义为训练集少于 10 条序列的少数类中NEW-691 的 116 条蛋白中有 52.6%、Price-180 的 72 条蛋白中有 58.3% 在全部四级 EC 上被准确预测表明 FEDKEA 对实验注释有限的稀有酶类仍保留中度预测能力Fig. 3G, H。Figure 3 图例(A) UniProtKB_2025_05 上酶识别任务各工具性能对比(B) 不同序列同一性水平下 FEDKEA 与 ECRECer 的酶识别准确率(C, D) NEW-691 与 Price-180 上四级 EC 预测准确率对比(E) 单功能酶子集上的性能对比(F) NEW-691 低同一性子集上的四级 EC 预测性能(G, H) 少数类酶预测准确率。结果4健康人体肠道微生物组的酶学景观作者进一步开发了新型流程MEnzMap可利用宏基因组数据识别编码酶的微生物基因Fig. 4A。MEnzMap 首先质控测序数据随后使用 SPAdes 或 Megahit 将 reads 组装为高质量重叠群contigs再用 Metabat2 将重叠群分箱binning通过 CheckM 评估分箱质量仅选取高质量分箱进行后续分析。使用 Prodigal 预测这些高质量分箱的完整蛋白 ORF 序列然后应用 FEDKEA 识别潜在的微生物酶基因。作者应用 MEnzMap 通过 iHMP2 项目中 126 名健康个体的宏基因组数据系统刻画酶学景观。作者识别出在所有受试者中普遍存在的核心酶集合。这些核心酶——主要参与复制、转录、翻译、细胞壁生物合成与代谢通路等基本生物过程fig. S5——代表了健康人体微生物组的基本功能元件。其中**组氨酸激酶histidine kinase, EC 2.7.13.3**最为普遍存在于所有健康受试者n126中并在 103 个个体中表现为丰度最高的酶。Wilcoxon 秩和检验证明组氨酸激酶与所有其他功能酶之间存在显著丰度差异P0.05。MEnzMap 能够刻画这些核心酶的分类学来源。例如预测编码组氨酸激酶的基因在健康人体微生物组内所有微生物分类单元基因组中普遍存在fig. S6。值得注意的是**拟杆菌属Bacteroides**中这些基因的普遍程度显著高于非拟杆菌分类单元Fig. 4B。此外给定微生物物种内组氨酸激酶基因的数量与肠道生态系统中微生物总 ORF 数呈正相关Fig. 4C。鉴于氧化应激响应能力对维持微生物稳态的关键作用作者进一步研究了所有氧化应激相关酶在个体间的分布模式揭示了从普遍存在于所有个体到仅限于特定人群子集的普遍程度谱系Fig. 4D。对于分布广泛且丰度水平相当的酶其微生物来源表现出显著的个体间差异。例如虽然硫氧还蛋白-二硫键还原酶thioredoxin-disulfide reductase在所有个体中普遍存在但其微生物来源在某些个体中为单一主导分类单元在其他个体中则为多样化分类单元阵列。除通用氧化应激酶外作者还识别出一个酶子集——包括超氧化物还原酶superoxide reductases、铁氧还蛋白氢化酶ferredoxin hydrogenases与谷胱甘肽酰胺还原酶glutathione amide reductases——仅特定于某些个体存在于不到 15% 的人群中且通常由特定微生物分类单元编码。例如超氧化物还原酶主要由 Bacteroides uniformis 编码。Figure 4 图例(A) MEnzMap 流程概览(B) 拟杆菌属与非拟杆菌分类单元中组氨酸激酶基因的普遍程度对比© 微生物总 ORF 数与组氨酸激酶基因数的正相关(D) 健康人群中氧化应激相关酶的普遍程度谱系及微生物来源多样性。结果5炎症性肠病患者酶谱的改变作者使用 MEnzMap 流程分析了 iHMP2 项目中 126 名健康个体、88 名克罗恩病Crohn’s disease, CD患者与 72 名溃疡性结肠炎ulcerative colitis, UC患者的肠道微生物组酶学景观。作者还识别了所有 CD 患者或所有 UC 患者中存在的核心功能酶figs. S7, S8。值得注意的是IBD包括 CD 与 UC患者的核心功能酶与健康个体之间存在大量重叠fig. S9表明关键酶功能在健康与疾病间基本保守。这些核心酶大多参与基本生物过程包括核酸代谢、蛋白修饰、细胞壁相关活动、能量代谢与信号转导。进一步分析揭示了健康个体与 IBD 患者间酶丰度与多样性的显著差异模式。UC 组的微生物酶多样性较健康对照组显著降低P0.033Fig. 5A表明功能多样性明显丧失。健康、CD 与 UC 组的酶谱形成显著不同的簇PERMANOVA反映出 IBD 相关菌群失调不仅是分类学的也是功能性的。与健康个体相比若干酶类的丰度发生显著改变。氧化还原酶Oxidoreductases, EC 1.-.-.-在 UC 患者中相对丰度显著升高P0.009水解酶Hydrolases, EC 3.-.-.-在 UC 患者中相对丰度显著降低P0.040连接酶Ligases, EC 6.-.-.-在 CD 患者中也显著降低P0.011。值得注意的是参与碳水化合物与氨基酸代谢的酶在 CD 与 UC 患者中均大幅耗竭Fig. 5C提示关键代谢通路特别是与短链脂肪酸产生和营养加工相关的通路受损。相比之下某些与氧化应激响应相关的酶类在 IBD 中富集Fig. 5D, E反映了对炎症肠道中升高的氧化应激的潜在适应性微生物响应。然而虽然某些氧化还原酶类富集特定的抗氧化酶如 EC 1.11.1.1、EC 1.11.1.6 与 EC 1.15.1.1在 CD 患者中却出现耗竭tables S6-S8提示肠道微生物组内存在复杂且可能失衡的氧化应激响应。作者进一步考察了过氧化氢酶catalases, EC 1.11.1.6在健康个体、CD 与 UC 患者中的微生物组分布发现来自Bacteroides thetaiotaomicron、Bacteroides dorei 与 Prevotella sp. 的过氧化氢酶在 IBD 中完全耗竭Fig. 5F 及 figs. S10-S12提示抗氧化酶产生的丧失可能是维持肠道稳态与限制炎症的重要机制。Figure 5 图例(A) UC 组酶多样性Shannon 指数显著低于健康对照组(B) 健康、CD、UC 三组酶谱的 PERMANOVA 聚类© 各 EC 大类及碳水化合物/氨基酸代谢相关酶在组间的丰度差异(D, E) 氧化应激响应相关酶在 IBD 中的富集情况(F) 来自 B. thetaiotaomicron、B. dorei 等的过氧化氢酶在 IBD 中完全耗竭。方法学参考原始宏基因组readsfastp质控加host去除bowtie2过滤宿主序列组装SPAdes或MEGAHIT分箱MetaBAT2或ComeBin质量评估CheckM completeness≥90 percent contamination≤5 percent高质量bins中ORF预测Prodigal meta模式FEDKEA酶注释微调ESM-2嵌入加MLP加KNN酶丰度量化RPKM标准化酶多样性与组间差异Shannon指数加PERMANOVA健康与IBD酶谱比较可供参考的关键方法① 使用 CD-HIT 在 100% 同一性下去冗余构建 482,290 条蛋白的非冗余训练集② 采用层级预测策略——前几级 EC 使用 MLP 分类器样本充足最后一级使用距离加权 KNNzero-shot处理少数类③ 微调 ESM-2 的最后三/四层在 33 层 6.5 亿参数模型上获得任务优化的蛋白嵌入④ 通过 CD-HIT-2D 构建 90% 与 40% 同一性阈值的测试集系统评估低相似度场景下的鲁棒性⑤ MEnzMap 流程中严格筛选高质量 bins完整性≥90%、污染≤5%随后以 RPKMreads per kilobase per million mapped reads量化酶丰度使用 Shannon 指数评估酶多样性PERMANOVA 评估组间差异。总结本研究针对宏基因组功能注释受困于微生物暗物质的挑战开发了基于蛋白质大语言模型的酶注释工具FEDKEA及其配套的宏基因组流程MEnzMap。FEDKEA 利用微调后的 ESM-2 嵌入结合 EC 编号的层级结构采用 MLP 分类器逐级预测前几级 EC 编号并以距离 KNN 模型处理数据稀疏的最后一级在酶识别任务中达到 F10.9485在四级 EC 编号预测上超越 CLEAN、GraphEC、ECRECer 与 DeepEC 等主流深度学习工具尤其在低序列同一性≤30%场景下保持优越性能。基于 FEDKEA 的 MEnzMap 流程被应用于 iHMP2 项目的人体肠道宏基因组首次在人群尺度上绘制了健康个体与 IBD 患者的酶学景观。研究发现组氨酸激酶EC 2.7.13.3是健康人体肠道中最普遍的酶在 126 名健康个体中全部存在并且拟杆菌属显著富集该酶基因。更为重要的是通过健康与 IBD 的对比分析研究揭示了 IBD 中抗氧化相关酶如超氧化物歧化酶、过氧化氢酶的显著下降——特别是来自 B. thetaiotaomicron、B. dorei 等拟杆菌的过氧化氢酶在 IBD 中完全耗竭与此同时UC 患者中氧化还原酶整体相对丰度升高而水解酶与连接酶显著降低碳水化合物与氨基酸代谢相关酶大幅耗竭。这些发现共同指向 IBD 中氧化应激响应的复杂重塑一方面炎症肠道升高的氧化应激驱使某些氧化还原酶富集另一方面关键抗氧化酶的产生能力下降可能形成炎症-氧化应激-菌群失调的正反馈环路。作者也审慎指出了 FEDKEA 的局限性由于酶数据的不平衡少数类的预测精度仍有限当前模型无法注释多功能酶仅占数据库 6.9%但实际比例可能更高跨界功能转移特别是真核酶数据用于预测原核蛋白功能需谨慎解读。未来改进方向包括引入数据增强或少样本学习提升少数类性能、整合域水平预测或多标签分类以处理多功能酶、以及融入更丰富的不确定性校准。总之FEDKEA 与 MEnzMap 为微生物暗物质的功能注释提供了高效方法并通过释放本研究生成的精心整理的数据集旨在促进社区复用与基准测试加速对宏基因组暗物质的探索。这些工具可进一步扩展至更好地处理多功能酶、融入不确定性校准并推动从功能预测走向蛋白设计与工程化深化我们在复杂生物系统中解读与操纵酶功能的能力。参考文献Zheng, L., Li, B., Xu, S., Chen, J., Liang, G. (2026). Large language models enhance annotation of enzymes in metagenomes.Science Advances, 12, eaee4389. https://doi.org/10.1126/sciadv.aee4389训练数据与独立测试集https://zenodo.org/records/19727805 测试集https://github.com/Stevenleizheng/FEDKEA/tree/main/Testset/dataFEDKEA 代码https://github.com/Stevenleizheng/FEDKEA MEnzMap 代码https://github.com/Stevenleizheng/MEnzMapFEDKEA Web 平台www.viromelab.com/software/fedkeaiHMP2 宏基因组数据NCBI SRA BioProject PRJNA398089Science Advances期刊主页https://www.science.org/journal/sciadv 2026 IF ≈ 13.9, JCR Q1