AlphaFold 结构预测可靠性:判断预测结构能不能用的 5 项自查完整指南
【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold
结构跑出来了,能直接用吗?这篇文章带你做 AlphaFold 结构预测可靠性判断:两个核心指标 pLDDT、PAE,外加 5 项自查清单,帮你 5 分钟内决定这个结构能不能直接进下游分析。
场景开场:结构在手,先别急着跑对接
你花了一周时间,CASP 级别的跑批终于结束,PDB 文件躺在硬盘里。同事问:这个结构能用吗?
你的第一反应可能是"模型不都挺漂亮的吗"。但漂亮不等于可信。 AlphaFold 的可靠性评估和预测本身同等重要——错误的结构解读会直接带偏后面的对接、突变设计和论文结论。
好消息是,AlphaFold 给你留了"体检报告":pLDDT 看每个残基的可信度,PAE 看残基之间相对位置的误差。下面按"主诉"逐项问诊。
主诉一:pLDDT 曲线——每个残基的"信用评级"
它测什么
pLDDT(predicted Local Distance Difference Test)给每个氨基酸残基打一个 0–100 的分,衡量"这个残基的 Cα 位置预测得有多准"。你可以把它理解成逐残基的信用评级:分越高,这条残基越值得你依赖。
三步读数法
- 第一步,看整体水位:曲线的平均值和分布决定你该期待多少。大部分残基都在 80 以上,说明整体折叠稳。
- 第二步,找长尾:把曲线和序列特征(无序区、linker、PTM 位点)对照,看低分区是"真无序"还是"模型没把握"。
- 第三步,圈目标:标出你的活性位点、结合口袋、突变位点在曲线上落在哪一档,后面怎么用就看这一档。
拿到结果怎么用
AlphaFold 官方把 0–100 划成四档,阈值如下:
| 档位 | 分值区间 | 怎么看待 | 适合的下游应用 |
|---|---|---|---|
| H(高) | 90–100 | 非常可靠 | 分子对接、突变效应分析等精细操作 |
| M(中) | 70–90 | 整体可信、细节可能偏 | 功能区域分析、表位大致定位 |
| L(低) | 50–70 | 误差可能较大 | 只作参考,别单独下结论 |
| D(无序) | 0–50 | 大概率是内在无序区 | 不建模,实验上也难定结构 |
四档的判定逻辑就在源码里,对照着看不会错:_confidence_category函数按上面这组阈值输出 D / L / M / H。
主诉二:PAE 热图——残基对的"GPS 误差地图"
它测什么
pLDDT 只说"这个残基自己在哪",PAE(Predicted Aligned Error)回答的是"这两个残基之间的相对距离准不准"。它是一张残基对矩阵:横纵轴都是残基序号,颜色代表这对残基对齐后的预测误差(单位 Å)。就像 GPS 误差地图——单点定位可能看着准,误差地图才告诉你两段路之间的相对位置可不可信。
热图三步读法
- 看对角线:对角线附近常年是深色低误差区,说明局部二级结构、小片段内部相对可靠,这是正常现象。
- 看色块分界:热图通常被切成若干低误差色块,块与块之间的边界往往对应结构域边界。若两域之间的色块也是低误差,域间排布可信。
- 看跨区域:远离对角线的大片高误差区,意味着这两段之间的取向模型没把握。做界面分析时,跨链区块高误差 = 复合物的取向和结合模式要打个问号。
拿到结果怎么用
- 域间取向、构象异质性判断,优先信 PAE 而不是 pLDDT。
- 蛋白-蛋白界面可信度,看跨链区块的误差高低。
- pLDDT 高但 PAE 对应区块高,说明"各自站得稳,但站得相对不稳",下游别把取向当定论。
复合物加查项:pTM 和 ipTM
预测复合物(多链、蛋白-配体大复合体)时,pLDDT 和 PAE 之外还有两个整体指标:
- pTM:预测 TM 分数,0–1,越高表示整体构象与真实结构越接近,看"整体像不像"。
- ipTM:界面版 pTM,只统计不同链之间的残基对,专门衡量复合物界面质量,看"握没握上手"。
两者都由 PAE 的概率分布算出,实现见 alphafold/common/confidence.py 的predicted_tm_score函数(interface=True即 ipTM)。复合物场景下,pTM / ipTM 高而某条链 pLDDT 低,常见于"大框架对、小区域乱"的情况,解读时分开处理。
🔍 用前自查清单:5 项全过再用
把结构拉去做下游分析前,对着这张表逐项打钩:
| # | 检查项 | 通过标准 |
|---|---|---|
| 1 | pLDDT 整体水位 | 核心区多数残基落在 M/H 档,无大面积 D 区混在目标区域 |
| 2 | 目标区域定位 | 活性位点、结合口袋、突变位点明确落在 H 或 M 档 |
| 3 | PAE 对角线与色块 | 局部区块低误差;关心的域间/链间区块也是低误差 |
| 4 | 复合物指标(如适用) | 链组成输入正确;pTM、ipTM 无异常偏低 |
| 5 | 交叉验证与跑法 | 与同源结构/实验数据比对过;大目标已考虑加种子与回收次数 |
第 5 项展开说:官方技术说明 docs/technical_note_v2.3.0.md 建议对大型或复杂目标把每个模型的种子数加到 20、最大回收(recycling)次数也提到 20,并用 AlphaFold-Multimer 处理复合物。跑过的同学可以回看自己的参数是否按这个档位来。
收束:预测的边界在哪
预测结构是假说的起点,不是终点——无序区、动态构象、配体结合状态,模型都可能给不了答案。所以第 5 项永远是最后一道闸:和 X 射线晶体学、冷冻电镜、NMR 或定点突变实验交叉验证,再签字放行。
指标定义与计算全部开源在 alphafold/common/confidence.py,版本细节与跑参建议看 docs/technical_note_v2.3.0.md。报告读完了,结构能不能用,现在该你拍板。
【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考