ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何编写 AlphaFold Server 批量建模任务的 JSON 作业文件

如何编写 AlphaFold Server 批量建模任务的 JSON 作业文件 如何编写 AlphaFold Server 批量建模任务的 JSON 作业文件【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafoldAlphaFold Server 的建模任务可以用 JSON 作业文件描述。一个作业文件里可以声明多个建模 job适合把重复性的任务例如筛选一条链与若干其他分子的相互作用一次性提交。如果你已经习惯在 AlphaFold Server 的 Web 界面里建模本文给出对应 JSON 文件的完整字段规范顶层结构、五种实体蛋白链、DNA 链、RNA 链、配体、离子的写法、允许取值列表以及提交后如何核对结果。规范以仓库内的 server/README.md 为依据仓库还附带一个可直接下载的完整示例文件 server/example.json。作业文件的顶层结构整个文件是一个列表即使只有一个 job也必须用单元素列表包裹列表的每个元素是一个 job 描述字典包含三个字段name字符串作业名。这是该 job 在任务历史表job history table中的显示名称。modelSeedsuint32 种子的字符串列表例如[1593933729, 4273]。文档推荐提供空列表——此时建模使用单个随机种子。sequences实体字典列表承载本次建模的所有分子。最小骨架如下字段与 server/README.md 一致{ name: Test Fold Job Number One, modelSeeds: [], sequences: [...] }最省事的起步方式先在 AlphaFold Server GUI 里跑一次建模 job下载结果 zip里面有一个名为job_name_job_request.json的文件job_name即你提交时的作业名它记录的就是该 job 的输入。这份文件可以直接在普通文本编辑器或 Google Colab 等编程环境中改写作为新作业文件的模板。填写 sequences五种实体怎么写sequences列表中的每个元素是“单键字典”键是实体类型值是该实体的描述。文档列出的实体类型与 Web 界面一一对应共五种proteinChain蛋白、dnaSequence单链 DNA、rnaSequence单链 RNA、ligand允许的配体、ion允许的离子。蛋白链 proteinChainsequence蛋白序列字符串只允许 IUPAC 定义的、对应标准氨基酸的字母仅支持 20 种标准氨基酸。count这条链的副本数整数。glycans可选糖基化描述列表每个条目含residues定义糖残基的字符串格式说明与允许的糖清单见 AlphaFold Server 的 FAQ和position糖基所连接的氨基酸位置整数1 起始索引。modifications可选翻译后修饰列表每个条目含ptmType修饰的 CCD 码与 UI 允许的码一致和ptmPosition被修饰氨基酸的位置整数。文档列出的允许修饰共 23 种CCD_SEP、CCD_TPO、CCD_PTR、CCD_NEP、CCD_HIP、CCD_ALY、CCD_MLY、CCD_M3L、CCD_MLZ、CCD_2MR、CCD_AGM、CCD_MCS、CCD_HYP、CCD_HY3、CCD_LYZ、CCD_AHB、CCD_P1L、CCD_SNN、CCD_SNC、CCD_TRF、CCD_KCR、CCD_CIR、CCD_YHA。README 给出的示例片段文档示例{ proteinChain: { sequence: PREACHINGS, glycans: [ { residues: NAG(NAG)(BMA), position: 8 }, { residues: BMA, position: 10 } ], modifications: [ { ptmType: CCD_HY3, ptmPosition: 1 }, { ptmType: CCD_P1L, ptmPosition: 5 } ], count: 1 } }DNA 链 dnaSequencednaSequence指的是单链DNA。要建模双链 DNA需要再加一个dnaSequence实体承载反向互补链的序列。sequenceDNA 序列字符串只允许字母A、T、G、C。count这条 DNA 链的副本数整数。modifications可选修饰列表每个条目含modificationTypeCCD 码和basePosition被修饰碱基位置整数。允许的修饰共 9 种CCD_5CM、CCD_C34、CCD_5HC、CCD_6OG、CCD_6MA、CCD_1CC、CCD_8OG、CCD_5FC、CCD_3DR。RNA 链 rnaSequencesequence单链 RNA 序列只允许字母A、U、G、C。count副本数整数。modifications可选条目含modificationTypeCCD 码与basePosition整数。允许的修饰共 13 种CCD_PSU、CCD_5MC、CCD_OMC、CCD_4OC、CCD_5MU、CCD_OMU、CCD_UR3、CCD_A2M、CCD_MA6、CCD_6MZ、CCD_2MG、CCD_OMG、CCD_7MG、CCD_RSQ。配体 ligand内层ligand字段存放配体的 CCD 码与 UI 允许的码一致count为整数副本数。文档给出的允许配体共 20 种CCD_ADP、CCD_ATP、CCD_AMP、CCD_GTP、CCD_GDP、CCD_FAD、CCD_NAD、CCD_NAP、CCD_NDP、CCD_HEM、CCD_HEC、CCD_PLM、CCD_OLA、CCD_MYR、CCD_CIT、CCD_CLA、CCD_CHL、CCD_BCL、CCD_BCB。{ ligand: { ligand: CCD_ATP, count: 1 } }离子 ionion字段存放离子的 CCD 码离子电荷由 CCD 码隐含指定count为整数副本数。允许的离子共 10 种MG、ZN、CL、CA、NA、MN、K、FE、CU、CO。{ ion: { ion: MG, count: 2 } }注意配体与离子的写法是两层同名键外层键是实体类型内层同名键保存 CCD 码字符串与序列类实体的结构不同照抄文档示例的键名即可。在单个文件中声明多个 job一个 JSON 文件可以包含多个 job 字典。README 给出的第二个 job 示例文档示例一条蛋白链加两条回文 DNA 序列的副本DNA 链通过count: 2声明两份{ name: Test Fold Job Number Two, modelSeeds: [], sequences: [ { proteinChain: { sequence: TEACHINGS, count: 1 } }, { dnaSequence: { sequence: TAGCTA, count: 2 } } ] }把多个这样的 job 放进同一个列表就是完整的批量作业文件。仓库根目录的 server/example.json 提供了覆盖全部五种实体的完整可下载示例其中第一个 job 同时包含两条蛋白链带糖基化与 PTM、两条 DNA 链其中一条带修饰、一条带修饰的 RNA 链、两种配体和两种离子第二个 job 是蛋白链加 DNA 链的组合。改写它比从零手写更不容易出结构错误。提交后如何核对作业是否被正确识别提交后任务历史表中应以你在name字段填写的名称显示该 job名称缺失或写错通常意味着文件没被按预期解析为 job 列表。job 完成后AlphaFold Server 会产出一个包含建模结果的 zip 文件zip 内可以找到job_name_job_request.json。把它和你实际提交的 JSON 比对能确认服务端接受的输入与你的文件一致后续要改参数时把它当作新的模板即可。限制与检查清单JSON 文件不允许注释说明文字只能写进文档或代码。每个序列实体的外层键必须是且仅是proteinChain、dnaSequence、rnaSequence、ligand、ion之一与文档示例保持一致配体和离子采用两层同名键结构。实体取值必须落在文档列出的允许列表内蛋白 PTM 23 种 CCD 码、DNA 修饰 9 种、RNA 修饰 13 种、配体 20 种、离子 10 种蛋白序列仅限 20 种标准氨基酸字母DNA 仅A/T/G/CRNA 仅A/U/G/C。糖基position是 1 起始索引所有count、ptmPosition、basePosition都是整数。modelSeeds元素是字符串如4273而非数字推荐留空列表由系统随机分配种子。文档未给出 JSON 文件提交入口的具体界面步骤起步建议优先使用“GUI 跑一次 → 取回_job_request.json→ 改写”的路径这也是官方文档明确推荐的做法。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表