
AlphaFold预测结果怎么看PDB、pLDDT、PAE三大输出文件逐列讲透【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold你刚跑完一条序列终端吐出一串文件ranked_0.pdb、confidence_*.json、pae_*.json、features.pkl。AlphaFold 输出文件到底怎么读这篇文章以 run_alphafold.py 实际保存的文件为例把这几份结构预测结果解读的核心路径一步步拆开。开箱先看拿到哪些文件 跑完一次 run_alphafold.py输出目录里的文件各有分工。你最该关心的就四个文件内容unrelaxed_*.pdb/relaxed_*.pdbAmber 松弛前后的结构模型ranked_*.pdb按置信度排名的模型ranked_0.pdb是第一名confidence_*.json逐残基 pLDDT 分数与 H/M/L/D 类别pae_*.jsonN×N 的预测对齐误差PAE矩阵另外还有features.pkl模型输入特征、ranking_debug.json排名明细、timings.json耗时统计等。下面把前三个逐一拆开。手把手读一条 PDB 记录 打开任意一个 PDB 文件你会看到这样的行ATOM 1 N MET A 1 8.500 2.300 1.100 1.00 92.50 N逐列看原子序号、原子名N、残基名MET、链 IDA、残基序号1接着是 x/y/z 三个坐标、固定为 1.00 的占用率然后是那个92.50的 B 因子列末尾的 N 是元素符号。这个 PDB 文件解析里最关键的巧思就在倒数第二列。B 因子本来是描述原子热运动幅度的AlphaFold 把它改存为残基的 pLDDT 置信度格式由 alphafold/common/protein.py 的to_pdb函数固定下来f{pos[0]:8.3f}{pos[1]:8.3f}{pos[2]:8.3f} f{occupancy:6.2f}{b_factor:6.2f} 也就是说如果这一列是 92.5意味着模型对这个残基的位置非常确信如果是 30多半是模型只能放个大概的柔性区域。而正因为塞进了标准 B 因子字段任何支持按 B 因子上色的可视化软件都能直接显示置信度。再提醒一句想看松弛前的原始模型去翻unrelaxed_*文件ranked_0.pdb则是默认只松弛最优模型流程下排名最好的那份。pLDDT 四档置信度H/M/L/D 到底怎么分 pLDDT 可以理解成每个残基的信用评分取值 0–100。分档逻辑在 alphafold/common/confidence.py 的_confidence_category里def _confidence_category(score: float) - str: if score 50: return D elif score 70: return L elif score 90: return M return H对照四个档次就是 pLDDT 解读的核心H90–100骨架基本可信M70–89整体折叠可靠、回环细节可能偏差L50–69只信二级结构层次D0–49模型自认猜不准常对应固有无序区。在 PyMOL 里加载 PDB 后执行color by b链就会按置信度着色四档边界一眼可见不用翻 JSON。PAE 矩阵判断两个残基靠不靠谱的尺子 pLDDT 回答的是这一个残基的位置可信吗PAE 回答的则是这两个残基的相对位置可信吗——可以理解为模型对这两个残基之间相对位置猜得准不准的自我评分单位是埃Å。PAE 热力图读法很直接蓝色区域误差低说明这对残基的相对位置可靠红色区域误差高说明模型心里没底。比如两个结构域各自 pLDDT 都不错但交叉区块是一整片红色——这意味着两个域单独都折得对而它们的相对取向纯属碰运气。所以判断多结构域蛋白、蛋白-蛋白复合物或者两个区域的相对方向能不能用时必须看 PAE 而不仅仅是 pLDDT。文件由 alphafold/common/confidence.py 的pae_json写出核心片段rounded_errors np.round(pae.astype(np.float64), decimals1) formatted_output [{ predicted_aligned_error: rounded_errors.tolist(), max_predicted_aligned_error: max_pae, }]其中predicted_aligned_error是 N×N 矩阵max_predicted_aligned_error是误差分箱的上限单位同样是埃。进阶特征文件里藏着什么 这里有个容易混淆的点推理时保存的模型输入特征在features.pklpickled 字典并不是 npz 文件。里面包含aatype每个残基氨基酸类型的独热编码、msa整数化的多序列比对是进化信息的主通道、template_*来自已知模板结构的特征等由 alphafold/data/pipeline.py 的make_sequence_features与make_msa_features构建。真正的.npz文件是模型权重params_{model_name}.npz由 alphafold/model/data.py 的get_model_haiku_params加载下载脚本见 scripts/download_alphafold_params.sh。想深挖模型为什么这么预测时可以加载features.pkl先看msa比对——保守性模式常常就是高置信区域背后的证据。拿到结果后的三步检查清单 ✅整体折叠用 PyMOL 打开ranked_0.pdb看二级结构是否连续、有无明显原子冲突松弛已修正不少。置信度分布用confidence_*.json画 pLDDT 曲线把 D/L 区域标记为不可信区长段 D 通常是固有无序区不算预测失败。关键位点 PAE针对你关心的结构域或结合界面查 PAE 热力图对应区块误差高就谨慎使用相对取向。常见的误判提醒pLDDT 高 ≠ 全局正确——各区域单独置信度高不代表区域间的相对方向是对的这正是 PAE 矩阵要抓的。总结AlphaFold 输出文件其实就四件事PDB 存原子坐标B 因子列顺带存 pLDDTconfidence_*.json存 H/M/L/D 四档置信度pae_*.json存残基两两之间的可靠性。读结果走三步整体折叠 → 置信度分布 → 关键位点 PAE并记住 pLDDT 高不等于全局正确。想弄清这些文件是怎么生成的直接顺着 run_alphafold.py 的数据流看一遍即可。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考