
pLDDT和PAE怎么读AlphaFold置信度判读指南【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafoldAlphaFold 模型跑完、彩色的结构图也渲染出来了。可面对pLDDTpredicted Local Distance Difference Test曲线和PAEPredicted Aligned Error矩阵哪段能直接拿去做分子对接、哪段只是看着像下面把这两个数从模型输出的 logits 一路算到判读结论。先建立直觉一个精度圈的类比GPS 报定位精度 ±5 米地图上给你画个模糊圈。AlphaFold 的置信度指标类似pLDDT 就是这个精度圈一个残基一个圈只回答这个残基本身定位得准不准PAE 回答的是对齐之后这两个残基之间的相对位置差多少。一个是单点精度一个是两点关系的稳定性——后者决定图上两个结构域靠在一起这件事能不能信。指标一 pLDDT每个残基可信吗pLDDT回答什么问题一句话模型对第 i 个残基的局部骨架几何CA 原子位置有多大把握。取值 0–100粒度是逐残基、纯局部——它只关心这一小块对不对不关心整条链别的部分在哪。pLDDT怎么从logits算出来模型并不直接输出一个分数。PredictedLDDTHead对每个残基输出 50 个 logits见 modules.pynum_bins: 50配在 config.py对应把 (0, 1] 的 LDDT 区间均匀切成 50 个桶。转成概率后取期望就是 confidence.py 里这 7 行def compute_plddt(logits: np.ndarray) - np.ndarray: num_bins logits.shape[-1] bin_width 1.0 / num_bins bin_centers np.arange(start0.5 * bin_width, stop1.0, stepbin_width) probs scipy.special.softmax(logits, axis-1) predicted_lddt_ca np.sum(probs * bin_centers[None, :], axis-1) return predicted_lddt_ca * 100注意桶中心是 0.01、0.03、…、0.99——所以 pLDDT 取不到 100最高也就 99 附近。概率分布越尖、越偏向高分桶分数越高分布摊平了模型在猜分数就掉到中间。pLDDT分数判读对照表分档与代码里_confidence_category的 D/L/M/H 一一对应区间等级含义你能做什么50D大概率无序别当结构用50–70L拓扑或可只看大方向70–90M骨架可靠二级结构层面分析≥90H原子级精度直接做对接、定点突变pLDDT告诉不了你的事分数高 ≠ 在复合物里的绝对位置对。局部指标不评判这段和另一段靠得对不对多域蛋白的域间朝向它完全没意见。分数低 ≠ 预测错了。天然无序区IDR就该低这是真实特征而非模型缺陷。指标二 PAE两个残基的相对关系稳不稳PAE回答什么问题PAE 是一个 N×N 矩阵PAE_ij 表示把预测骨架和真实骨架做最优刚性对齐后残基 i 与 j 之间的距离还差多少 Å。它测的是关系——对角区块内是域内置信度非对角区块是域间/链间关系的置信度。模型输出 64 个误差桶桶宽 0.5Å覆盖到 31Å最后一桶兜底到 ∞所以矩阵值域约为 0–31.5。PAE的计算链路PredictedAlignedErrorHead吃 pair 表示[N_res, N_res, 128]直接线性映射出 [N_res, N_res, 64] 的 logits同时给出桶边界breaks linspace(0, 31, 63)。后处理同样是 softmax 取期望def compute_predicted_aligned_error(logits, breaks): aligned_confidence_probs scipy.special.softmax(logits, axis-1) predicted_aligned_error, max_predicted_aligned_error ( _calculate_expected_aligned_error( alignment_confidence_breaksbreaks, aligned_distance_error_probsaligned_confidence_probs)) return { aligned_confidence_probs: aligned_confidence_probs, predicted_aligned_error: predicted_aligned_error, max_predicted_aligned_error: max_predicted_aligned_error, }内部的_calculate_expected_aligned_error核心就是一行np.sum(probs * bin_centers, axis-1)桶中心由_calculate_bin_centers从桶边界加半步得到末尾补一个兜底桶。PAE矩阵判读对照表矩阵模式数值含义你能做什么对角区块低2域内结构可靠直接用非对角区块低2域间关系可靠敢用这个复合物非对角区块高8相对朝向不定按单域拆开分析PAE告诉不了你的事它基于骨架对齐反映的是相对距离误差绝对坐标、侧链精度都不在讨论范围。对单链单域蛋白PAE 信息量很小几乎全矩阵都是低值没什么可读的。两个指标打架时怎么判信号一致快速判定pLDDT≥90 且 PAE 对角区块 2Å → 原子级直接进下游。两者都低 → 这段大概率是柔性/无序当无序处理。一致时 30 秒内能下结论。信号矛盾典型冲突场景场景pLDDTPAE最可能原因下一步动作本地自信关系不稳高非对角区块高多域蛋白域间朝向不定切分结构域逐域分析分数低关系却稳低全矩阵低天然无序区无序预测工具复核边界骤变某残基突降出现方块分界结构域边界沿分界切段建模型决策流程端到端工作流一个函数走完判读import numpy as np from alphafold.common import confidence def interpret_confidence(prediction_result): # Step 1: 逐残基pLDDT (0-100) plddt confidence.compute_plddt( prediction_result[predicted_lddt][logits]) # Step 2: PAE矩阵 (Å, N_res x N_res) pae confidence.compute_predicted_aligned_error( logitsprediction_result[predicted_aligned_error][logits], breaksprediction_result[predicted_aligned_error][breaks]) # Step 3: 全局分: 单体均值, 多聚体0.8*iPTM0.2*pTM ranking prediction_result[ranking_confidence] # Step 4: 低置信残基 (pLDDT70) low_mask plddt 70 # Step 5: 非对角PAE均值, 排除自对角 off_diag pae[np.triu_indices(len(pae), k2)] return { mean_plddt: float(np.mean(plddt)), ranking_confidence: float(ranking), low_plddt_residues: np.where(low_mask)[0] 1, mean_off_diag_pae: float(np.mean(off_diag)), }人眼解读顺序先看全局ranking_confidence和 pLDDT 均值定基调再看曲线标出 70 的段判断是连续还是零散然后看矩阵非对角区块和对角区块比找高值方块交叉验证低 pLDDT 段若 PAE 也低指向无序PAE 高指向关系不确定回结构复核unrelaxed PDB 的 B-factor 列就是 pLDDT见 run_alphafold.py低分残基逐一眼看底层机制速览两个预测头各吃一份表示。pLDDT 头从单链表示structure_module走 LayerNorm 两层 ReLU 线性层输出 50 桶 logitsPAE 头直接从 pair 表示线性映射出 64 桶 logits。一个看点一个看点对输入源不同这是两个指标视角分叉的根源。分数 概率分布的期望值。两个指标共享同一套数学logits 过 softmax 变成分桶概率再乘桶中心加权求和。$$\mathrm{pLDDT}i 100 \sum{k1}^{50} p_{ik}, c_k$$$p_{ik}$残基 i 的 LDDT 落在第 k 个桶的概率softmax 输出$c_k$第 k 个桶的中心值0.01 到 0.99 等距排列$k$桶编号共 50 个桶乘 100把 (0, 1) 的期望值缩放到 0–100 刻度PAE 同理只是桶中心和数量换成 0.5Å 宽度的 64 个误差桶。推论分数本质是模型自我评估的概率加权平均分布摊平时分数落在中间值所以 50 附近的 pLDDT 往往就是模型在猜。实战FAQ你看到的现象最可能的原因怎么处理 整条 pLDDT50pTM 很低MSA 太薄同源序列近零换/加 MSA 数据库重跑仍低则标记为低可信结果 N端/C端低、中部高末端天然柔性别删末端先查无序预测工具确认 局部 pLDDT 骤降结构域边界或长 loop按域切段对照 PAE 方块验证边界位置 PAE 非对角整体偏高多域/多链相对朝向不确定换多聚体模型下游按单域单独处理 pLDDT 高但结构明显别扭MSA 里有强模板模型过度自信人工核查 MSA 覆盖度与模板质量速查清单pLDDT≥90 且 PAE 对角块 2Å → 原子级pLDDT50 先查无序别急着扔PAE 非对角块高 → 域/链相对朝向不可信单体排名看 pLDDT 均值多聚体看 iPTMunrelaxed PDB 的 B-factor 列就是 pLDDT50 附近的分数 概率摊平 模型在猜【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考