苹果机器学习研究团队对外发布 SimpleDesign 蛋白质协同设计模型,相关预印论文公开。这套模型延续 SimpleFold 的技术路线,采用端到端架构,可同步生成蛋白质氨基酸序列与对应的三维空间结构,跳过传统方案中自编码器、结构离散化编码等中间环节。训练依托超过 200 万组序列 – 结构配对样本,模型在蛋白质共设计、无条件生成、逆折叠等多项基准测试取得不错结果,简化蛋白质生成的技术链路。

SimpleDesign能力
SimpleDesign 采用混合 Transformer 架构,原生处理氨基酸序列与三维坐标两类数据。训练阶段随机对序列做掩码、对三维结构叠加噪声,通过调整破坏程度,同时学习蛋白质折叠、逆折叠、全新蛋白共设计三类任务。
输入结构约束,模型输出适配该构象的氨基酸序列;输入序列信息,模型还原对应的三维折叠形态;无前置条件时,从零生成全新蛋白序列与配套立体结构。
模型输出可导出标准生物信息文件,用于后续仿真、分子动力学评估。整套方案不依赖领域专用几何模块,通用 Transformer 组件即可完成计算,降低推理部署的硬件门槛。
SimpleDesign原理
现有蛋白质共设计模型大多分两段训练,先用自编码器把三维结构转为离散标记,再在隐空间训练生成网络。
SimpleDesign 直接在原始数据空间训练,序列采用交叉熵损失,三维结构采用流匹配回归目标,两种模态在同一模型内联合优化。
混合 Transformer 模块对不同模态做针对性处理,同时维持全局自注意力,捕捉氨基酸残基与空间坐标之间的关联,减少多阶段训练带来的信息损耗。
SimpleDesign适用场景
新药研发领域,快速生成候选蛋白结构,开展靶点结合仿真,筛选潜在药物分子载体。
合成生物学项目,设计全新酶蛋白,用于催化反应、生物材料开发,缩短蛋白迭代周期。
计算生物科研,用于蛋白质构象探索,对比不同架构生成蛋白的稳定性与理化特性。
蛋白工程方向,基于目标三维骨架,快速推导可用氨基酸序列,完成蛋白改造。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



