
AlphaFold输出解析指南打开结果目录后先做什么、怎么判断能不能用【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafoldAlphaFold 2 是 DeepMind 开源的蛋白质结构预测工具。一次预测跑完后output_dir里会摊开一堆 PDB、JSON 和 pickle 文件。这篇 AlphaFold输出解析 指南不按文件类型罗列而是顺着你的实际操作顺序走拿到目录先打开什么、五分钟怎么给整体质量打分、哪些残基区域要重点核查以及两个位点之间的相互作用到底有多可靠。拿到输出目录从哪个文件下手 以 run_alphafold.py 跑完的单个序列为例目录里与你直接相关的是这几组文件ranked_0.pdbranked_N.pdb所有模型按置信度排序后的结构ranked_0.pdb是排名最高的那份是你该第一个拖进 PyMOL 的文件unrelaxed_{model}.pdb与relaxed_{model}.pdb同一模型的松弛前、松弛后结构confidence_{model}.json与pae_{model}.json逐残基置信度与 PAE 矩阵result_{model}.pkl、features.pkl模型输出与输入特征留给深度诊断用ranking_debug.json、timings.json、relax_metrics.json模型排序依据、耗时与松弛指标。先看 ranked 还是 relaxed如果只想快速看一眼结构直接打开ranked_0.pdb。它要么是松弛后的结构要么是未松弛结构取决于models_to_relax参数取best、all还是none所以文件名不能告诉你这份结构是否经过松弛。需要确认时对照relax_metrics.json里对应模型的记录即可。PDB 的每一列ATOM 行与 B 因子AlphaFold 输出的 PDB 遵循标准格式包含 HEADER、ATOM、ANISOU各向异性温度因子可选、TER 几类记录。其中 ATOM 行的排布是ATOM 原子序号 原子名 残基名 链ID 残基序号 x坐标 y坐标 z坐标 占有率 [pLDDT值] 元素比如ATOM 1 N MET A 1 8.500 2.300 1.100 1.00 92.50 N这里 92.50 就是该残基的 pLDDT 置信度评分写在占有率后面的 B 因子温度因子列里。这个设计很实用任何支持 B 因子着色的可视化软件都能直接按颜色梯度显示模型逐位置的置信度分布不需要额外加载 JSON。五分钟快速体检pLDDT 四级分类速查表pLDDTpredicted Local Distance Difference Test取值范围是 0–100可以把它理解为给每个残基打的可信度评分。alphafold/common/confidence.py 中的_confidence_category函数把它切成四档分类分数区间含义H90–100高置信度结构明确M70–89中等置信度可靠度尚可L50–69低置信度可能有构象波动D0–49极低置信度常对应无序区域对应的判断逻辑就是一段阈值比较0 score 50归 D50 score 70归 L70 score 90归 M90 score 100归 H。confidence JSON 里读三个数组confidence_{model}.json由confidence_json函数生成内容是三个平行数组{residueNumber:[1,2,3,4,5],confidenceScore:[92.5,88.3,76.2,61.5,45.3],confidenceCategory:[H,H,M,L,D]}residueNumber残基序号从 1 开始confidenceScore每个残基的 pLDDT保留两位小数confidenceCategory对应的 H/M/L/D 标签。五分钟体检的路线先整体扫一遍confidenceCategory如果绝大多数是 H/M结构可以直接进下游流程如果 D/L 连成大片就要把注意力放到下一节。哪些区域不能信低置信度区域怎么处置pLDDT 低的区域不等于预测失败它经常对应生物学上真实的柔性区或内在无序区。区分这两种情况可以结合序列特征比如带电荷残基比例高、缺乏疏水核和你自己的功能背景判断而不是简单删掉残基。松弛处理动了多少RMSD 与残基违例ranked_0.pdb这类结构通常先经过 Amber 分子动力学松弛alphafold/relax/relax.py 中的AmberRelaxation类负责优化键长键角、缓解空间冲突底层的能量最小化在 alphafold/relax/amber_minimize.py 里完成。松弛过程会记录初始坐标与优化后坐标的 RMSDrmsd np.sqrt(np.sum((start_pos - min_pos)**2) / start_pos.shape[0])RMSD 偏小比如小于 1Å说明原始预测本身已经很规整偏大则意味着松弛阶段做了较多调整读结构时多留意调整过的区域。relax_metrics.json里还有remaining_violations列出了松弛后仍残留的立体化学违例类型是检查结构物理合理性最直接的证据。两个位点间的相互作用可靠吗PAE 矩阵三步读法 pLDDT 只回答单个残基摆得准不准回答不了残基 i 和残基 j 的相对位置准不准。后者靠 PAEPredicted Aligned Error预测对齐误差矩阵可以把它理解成一张残基两两之间的相对位置误差表。pae JSON 的结构pae_{model}.json由 alphafold/common/confidence.py 中的pae_json函数生成核心是两个字段predicted_aligned_errorN×N 矩阵N 为残基数每个元素 PAE[i][j] 表示残基 i 与 j 相对位置上的预期误差和max_predicted_aligned_error误差上限。矩阵的上游计算在compute_predicted_aligned_error中先对模型输出的 logits 做 softmax 得到每个误差分箱的概率再对分箱中心求期望得到期望对齐误差。三步读法先看max_predicted_aligned_error它给出整张图的色标上限在热图上定位你关心的两个位点各自所在的行、列看交叉区块的误差水平——误差低说明这对残基的相对位置预测可信高则说明构象间关系不确定看对角线形态对角线附近误差带窄而低表示局部结构可靠出现明显偏移的块状低误差区常提示不同结构域可以各自独立运动。如果 pLDDT 整体很高但 PAE 里某个区块异常偏大优先怀疑该区块涉及的长程相互作用而不是整条链。深度诊断原始特征与多模型选择features.pkl 里的模型输入features.pkl以及每个模型的result_{model}.pkl保存了特征字典关键条目包括aatype氨基酸类型独热编码、msa多序列比对、residue_index、seq_length以及template_*系列。它们的构建在 alphafold/data/pipeline.py 中make_sequence_features用residue_constants.sequence_to_onehot生成aatypemake_msa_features生成msa。MSA 文件本身由 alphafold/data/parsers.py 的parse_stockholm和parse_a3m解析模板结构信息则经 alphafold/data/templates.py 处理残基的物理化学常量集中在 alphafold/common/residue_constants.py。当你想弄清模型为什么在这个区域给出低置信度时回看对应位置的 MSA 覆盖度和模板特征是最有效的路径。多个模型选哪个ranking_debug.json记录了每个模型的ranking_confidence和最终排序order单体模型的排序标签是plddts多聚体模型是iptmptm。默认models_to_relaxbest只对排名最高者做松弛如果你想对比松弛前后差异可以改跑all代价是时间开销成倍增加。拿到ranked_0.pdb后把 pLDDT 分布、PAE 关键区块、remaining_violations三项核对一致再把它送进对接、突变设计等下游实验是目前最稳妥的使用方式。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考