
3~8 条链的复合物怎么算AlphaFold-Multimer 蛋白质复合物预测实操手册【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold当你手上有 3~8 条亚基的序列想知道这些链拼在一起长什么样、链间相对位置可信度有多高时AlphaFold 官方的 AlphaFold-Multimer 模型就是为此设计的入口。这篇指南不讲原理推导只讲四件事模型怎么选、FASTA 怎么喂、命令怎么跑、结果怎么读——按顺序做完一次把蛋白质复合物预测跑通。先选对模型monomer / multimer / monomer_ptm 怎么选--model_preset决定跑哪套权重选错方向后面全白跑。判断标准就一条复合物计量比每条链几个拷贝是否已知。模型适用场景备注monomer已知单体结构或计量比完全未知单链默认配置multimer计量比已知FASTA 里给出全部亚基输出链间相对位置 PAEmonomer_ptm单体目标但想要 pTM 分数和 PAE 矩阵多出来的只有指标不是复合物模型什么时候multimer反而不划算计量比不清楚的时候。官方技术文档的原话是计量比未知的场景比如基因组尺度批量预测下单链 AlphaFold 平均更准——除非那条链本身长达数千残基。别赌计量比先把monomer结果拿出来和文献对。定好模型后是 MSA 数据库这一档--db_preset直接对应硬件门槛预设解压后磁盘占用硬件门槛适用--db_presetreduced_dbs~600 GB8 CPU 核、8 GB RAM快速试跑、中小目标--db_presetfull_dbs~2.62 TB12 CPU 核、32 GB RAM、建议 SSD正式预测、大型复合物数据库下载用 scripts/download_all_data.sh 一把拉齐模型参数由 scripts/download_alphafold_params.sh 单独补下。多聚体 FASTA 输入格式避坑 一条规则要刻进肌肉记忆一个 FASTA 文件里放多条序列AlphaFold 就把它当作一个多聚体来跑文件里每条 entry 对应一个亚基文件基名会成为输出目录名。同源三聚体——三条重复序列要老老实实列三遍不能写一条就指望它自己复制seq_A_copy_1 MALWMRLLPLLAL... seq_A_copy_2 MALWMRLLPLLAL... seq_A_copy_3 MALWMRLLPLLAL...异源多聚体2A 3B 的 A2B3 复合物每个拷贝单独一条 entrychain_A_1 MALWMRLLPLLAL... chain_A_2 MALWMRLLPLLAL... chain_B_1 MKTAYIAKQRQ... chain_B_2 MKTAYIAKQRQ... chain_B_3 MKTAYIAKQRQ...高频坑只有一个但杀伤力最大亚基顺序会影响预测结果。链间相对排布、PAE 的链间读数都和输入顺序相关所以 FASTA 里的亚基排列应与已知复合物结构或文献中的链顺序一致。同一套序列换个顺序重跑结果里的链 3 贴链 5可能直接变成链 3 贴链 1对着实验数据核对时先核对这一点。一条命令跑起来关键参数标注 ⚡入口统一是 docker/run_docker.pyDocker 封装了全部依赖。两条开箱即用的命令# 单体 python3 docker/run_docker.py \ --fasta_pathsmonomer.fasta \ --max_template_date2022-01-01 \ --model_presetmonomer \ --db_presetreduced_dbs \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/output# 多聚体 python3 docker/run_docker.py \ --fasta_pathscomplex.fasta \ --max_template_date2022-01-01 \ --model_presetmultimer \ --num_multimer_predictions_per_model5 \ --db_presetfull_dbs \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/multimer_output三个最常动的参数参数默认值调它干什么--model_presetmonomer单体 / 多聚体 / pTM 模型三选一--num_multimer_predictions_per_model5每个模型用多少随机种子各预测一次5 个模型 × 5 种子 25 个模型subbatch_size64alphafold/model/config.py 里的global_config.subbatch_size分块大小显存吃紧调小富余调大提速单卡 A100 的参考耗时秒来自官方 README 的 benchmark残基数100500100020005000预测时间4.9299645018824约 5 小时5000 残基那格值得盯着看——排期前先算账。大复合物的调优三板斧一句话带过种子数从 5 拉到 20、subbatch_size调大提吞吐、--enable_gpu_relaxfalse让松弛退回 CPU 保稳定。PAE 矩阵 30 秒速读法 PDB 文件只是终点的一部分真正决定敢不敢信的是三把尺子都在result_model_*.pkl里pLDDT这个残基的局部几何可信吗0~100 逐残基打分高值区放心用。pTM整条链的全局装配可信吗一个标量反映对整体折叠和结构域堆积的信心。PAE这两段残基的相对位置可信吗[N×N] 矩阵是判断复合物交互的关键。PAE 速读只抓两点贴近对角线的数值低说明链内结构可靠远离对角线出现大片高值块说明对应两段常常是两条链的相对位置预测不可信——交互结论要打折处理。反过来某两条链的交叉块整体偏低才配得上预测到了结合界面这句话。输出目录结构每个目标一个目录$OUTPUT_DIR/fasta_basename/ ranked_0.pdb # 置信度最高的结构 relaxed_model_{1..5}.pdb # AMBER 松弛后的结构 result_model_{1..5}.pkl # pLDDT / pTM / PAE 原始数据 msas/ # MSA 检索结果 timings.json # 各阶段耗时--benchmarktrue 时写入用 PyMOL 打开ranked_0.pdb配合 pLDDT 上色彩虹映射一眼定位低置信区是最低成本的结果体检。翻车了按症状开药症状 1显存 OOMsubbatch_size从 64 降到 32 再试--db_presetreduced_dbs换精简库对 MSA 质量有轻微折损先跑通再说--enable_gpu_relaxfalse把松弛挪回 CPU目标实在太大就按结构域拆开先各自monomer再拼症状 2大面积 pLDDT 50先查序列是否含无序区IDR——IDR 预测不出结构属于正常现象不是 bug换--db_presetfull_dbs重跑MSA 深度直接决定置信度上限单体目标改用monomer_ptm它的 PAE 读数更稳症状 3亚基相对位置不合理--num_multimer_predictions_per_model20拉高种子数多组结果里挑链间 PAE 最低的那组回查 FASTA 亚基顺序是否与已知复合物一致见第二章确认参数文件是 v2.3.0 权重——多聚体模型专门针对大复合物重训过旧参数不通用复合物计量比不明时该怎么退、v2.3.0 在训练数据截止 2021-09-30训练片段从 384 扩到 640 残基和链数上限上的具体变化docs/technical_note_v2.3.0.md 里都有原文依据notebooks/AlphaFold.ipynb 则是一份从下载数据到出图的社区实操教程第一次部署环境照着走能省不少事。模型跑得越多这些参数在肌肉里的手感越准。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考