來源Apple Machine Learning•較早收集於 23h
Apple 推出蛋白質序列結構聯合設計模型

#protein-design#drug-discovery#multimodal-modelssimpledesignsimpledesignapple machine learning
統一的序列與結構模型可能簡化生成式蛋白質設計流程。
30 秒速覽
有什麼變化
SimpleDesign 同時建模蛋白質序列與三維結構。
為什麼重要
聯合序列與結構建模可能減少分開設計階段之間的資訊損失。若效果良好,將有助於研究人員生成符合結構與功能限制的候選蛋白質。
下一步行動
下載 SimpleDesign 論文或實作,並將序列有效性、結構合理性與設計成功率與現有蛋白質模型比較。
誰應關注:Researchers & Academics
關鍵要點
- •SimpleDesign 同時建模蛋白質序列與三維結構。
- •模型鎖定蛋白質工程與藥物發現工作流程。
- •它試圖改善多階段自編碼器與潛在表示生成流程的限制。
深度解析
背景與延伸:來自公開資料,非原文內容。引用 14 個來源。
增強重點摘要
- •SimpleDesign 採用單階段、無標記器(Tokenizer-free)架構,直接在原始數據空間進行端到端訓練,避免多階段自編碼器離散化帶來的資訊損失。
- •模型採用 Mixture-of-Transformers(MoT)架構,結合模態專用的前饋網絡與統一的全域跨模態自注意力機制,同時處理 1D 序列與 3D 幾何座標。
- •訓練目標結合了連續流匹配(Flow-matching)回歸損失與離散交叉熵損失,在單一框架中同步優化原子空間位置與氨基酸序列。
- •該模型延續 Apple「極簡主義」設計理念,徹底摒棄三角注意力(Triangle Attention)、Pair 表示更新及多序列比對(MSA)等手工設計的生物領域先驗模組。
- •SimpleDesign 針對 Apple Silicon 與 MLX 開源框架進行了推論優化,支援利用 M 系列晶片統一記憶體架構在個人工作站上本地運行,降低對 NVIDIA 叢集的依賴。
競品分析
SimpleDesign
- 開發單位
- Apple Machine Learning
- 架構與設計範式
- Mixture-of-Transformers (MoT),無 Tokenizer 端到端設計
- 結構與序列生成方式
- 結合連續流匹配與離散交叉熵的同步聯合設計
- 硬體與框架偏好
- 針對 Apple Silicon 與 MLX 優化,支援本地工作站推論
ESM3
- 開發單位
- EvolutionaryScale / Meta
- 架構與設計範式
- 多模態生成式掩碼語言模型 (Masked LM)
- 結構與序列生成方式
- 將 3D 結構離散化為 VQ-VAE Tokens 進行序列化生成
- 硬體與框架偏好
- 主要依賴大規模雲端 NVIDIA GPU 叢集
RFdiffusion + ProteinMPNN
- 開發單位
- Baker Lab / IPD
- 架構與設計範式
- 兩階段級聯式架構 (擴散結構生成 + 逆向折疊)
- 結構與序列生成方式
- 兩階段獨立完成:先生成 3D 主鏈骨架,再推導 1D 氨基酸序列
- 硬體與框架偏好
- 基於 PyTorch,需搭配高效能伺服器 GPU 執行
| 模型名稱 | 開發單位 | 架構與設計範式 | 結構與序列生成方式 | 硬體與框架偏好 |
|---|---|---|---|---|
| SimpleDesign | Apple Machine Learning | Mixture-of-Transformers (MoT),無 Tokenizer 端到端設計 | 結合連續流匹配與離散交叉熵的同步聯合設計 | 針對 Apple Silicon 與 MLX 優化,支援本地工作站推論 |
| ESM3 | EvolutionaryScale / Meta | 多模態生成式掩碼語言模型 (Masked LM) | 將 3D 結構離散化為 VQ-VAE Tokens 進行序列化生成 | 主要依賴大規模雲端 NVIDIA GPU 叢集 |
| RFdiffusion + ProteinMPNN | Baker Lab / IPD | 兩階段級聯式架構 (擴散結構生成 + 逆向折疊) | 兩階段獨立完成:先生成 3D 主鏈骨架,再推導 1D 氨基酸序列 | 基於 PyTorch,需搭配高效能伺服器 GPU 執行 |
技術深入
- 架構設計:採用 Mixture-of-Transformers (MoT) 骨幹網絡,為 1D 序列與 3D 結構分別配置模態特定的前饋網絡(FFN),並透過跨模態全域自注意力層進行特徵融合。
- 聯合優化目標:混合連續與離散損失函數,3D 空間原子幾何結構採用流匹配(Flow-matching)連續回歸損失,1D 氨基酸序列生成則採用標準離散交叉熵(Cross-Entropy)損失。
- 端到端無標記化:直接在連續 3D 空間坐標與離散原始氨基酸數據上聯合訓練,不依賴結構自編碼器(Autoencoder)進行潛在空間壓縮或離散標記化(Tokenization)。
- 去領域先驗化:摒棄傳統蛋白質模型常見的三角注意力(Triangle Attention)、結構成對表示更新(Pair Updates)及多序列比對(MSA),完全依賴通用可擴展 Transformer 方塊。
- 訓練規模與資料集:在超過 200 萬對來源於 PDB 實驗結構與蒸餾結構庫的蛋白質序列-結構對上完成大規模預訓練。
- 硬體適配:整合 Apple MLX 機器學習框架,深度適配 Apple Silicon 晶片統一記憶體架構(UMA),實現本機低延遲推論。
前景展望基於引用來源的 AI 分析
生物生成式 AI 將朝向摒棄結構 Tokenizer 的端到端架構演進
SimpleDesign 驗證了直接在原始連續坐標與離散序列上進行聯合建模的可行性,避免了離散潛在空間引起的資訊損耗與多階段訓練複雜度。
蛋白質工程工作流程將向邊緣工作站轉移
藉由 MLX 框架對 Apple Silicon 統一記憶體的深度優化,研究人員得以在個人 Mac Studio 等設備上本地運行大型聯合設計模型,大幅降低生技實驗室的雲端運算門檻。
時間線
2026-05
Apple 於 ICLR 2026 發表基於流匹配的 3B 蛋白質結構預測模型 SimpleFold
2026-06
Apple 開源 ml-simplefold 專案並整合 MLX 框架支援 Apple Silicon 本地推論
2026-09
Apple Machine Learning 團隊發表序列與結構聯合設計模型 SimpleDesign
- 2026-05Apple 於 ICLR 2026 發表基於流匹配的 3B 蛋白質結構預測模型 SimpleFold
- 2026-06Apple 開源 ml-simplefold 專案並整合 MLX 框架支援 Apple Silicon 本地推論
- 2026-09Apple Machine Learning 團隊發表序列與結構聯合設計模型 SimpleDesign
來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
1apple.commachinelearning.apple.com2Forumopenreview.net32609arxiv.org42609arxiv.org5github.iolujiarui.github.io6Forumopenreview.net7Forumopenreview.net8Simpledesign a Joint Model for Protein Sequence and Structure Codesigntheresanaiforthat.com9Apple Simplefold Protein Folding Prediction AI9to5mac.com10apple.commachinelearning.apple.com11ML Simplefoldgithub.com12Apple Releases Simplefold Protein Folding Modelreddit.com1335954iclr.cc14nih.govpubmed.ncbi.nlm.nih.gov
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Apple Machine Learning ↗
每週電子報
每週一封,可隨時退訂。