🤖Reddit r/MachineLearning•較早收集於 2m
Evo2 偵測超越比對的基因調控

💡Evo2 嵌入揭示 BLAST 忽略的基因調控 – 生物 AI 研究關鍵!(28字)
⚡ 30-Second TL;DR
有什麼變化
Evo2 在 9.3 兆核苷酸基因組資料上訓練
為什麼重要
推進基因組 AI,揭示比對工具無法見的功能連結,有助加速基因調控發現及藥物靶點辨識,利於生物 AI 從業者。
下一步行動
從 Arc Institute 下載 Evo2 模型,並計算您的基因啟動子嵌入。
誰應關注:Researchers & Academics
關鍵要點
- •Evo2 在 9.3 兆核苷酸基因組資料上訓練
- •嵌入比較 25 個人類基因的 512bp 窗口對 BLAST
- •VIM/DES 啟動子相似(餘弦 0.948),因肌肉組織共享調控
- •過濾重複後浮現訊號,但多數匹配仍雜訊
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •Evo2 於 2025 年 2 月由 Arc Institute 和 Stanford University 正式發佈,是迄今最大的公開可用基因組 AI 模型,使用 NVIDIA DGX Cloud 在 AWS 上構建[6]
- •Evo2 採用新穎的深度學習架構,能以單核苷酸解析度處理長達 100 萬個核苷酸的 DNA 序列,相較於傳統序列比對工具(如 BLAST)具有顯著的上下文優勢[4][5]
- •在 BRCA1 乳腺癌相關基因的變異預測中,Evo2 達到 90% 以上的準確度,能區分良性變異與致病性變異,超越傳統序列相似性方法[1][5]
- •Evo2 的可解釋性突破由 Goodfire AI 與 Arc Institute 合作實現,使用稀疏自編碼器(SAE)揭示模型學習的生物特徵,包括外顯子-內顯子邊界、蛋白質二級結構和病毒衍生序列[3]
- •Arc Institute 已開源 Evo2 的訓練資料、推理代碼和模型權重,使其成為迄今規模最大的完全開源 AI 模型,促進全球科學家應用於遺傳病風險預測和合成生物學[1][2]
🛠️ 技術深入
- •模型規模:4,000 億參數,訓練於超過 9 兆核苷酸的多樣化真核和原核生物基因組[4]
- •上下文長度:支援最長 100 萬個核苷酸(1 megabase)的序列輸入,相較於傳統工具提供更廣泛的基因組視野[4][5]
- •架構創新:採用前沿深度學習架構,實現相對於上下文長度的近線性計算和記憶體擴展[4]
- •可解釋性工具:與 Goodfire 合作開發機械可解釋性視覺化工具,使用稀疏自編碼器揭示模型內部學習的生物特徵[1][3]
- •多模態能力:能處理 DNA、RNA 和蛋白質序列,支援預測和生成任務[4][6]
- •驗證方法:結合 Enformer 和 Borzoi 等預測模型進行可控生成,在小鼠胚胎幹細胞中實驗驗證,色質可及性預測的 AUROC 達 0.92-0.95[2]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2024-03
Evo 初版發佈預印本,展示基因組基礎模型的可行性
2025-02
Evo2 正式發佈,由 Arc Institute 和 Stanford University 聯合推出,成為最大公開基因組 AI 模型
2025-03
Evo2 應用於阿茲海默症患者遺傳風險預測,驗證 APOE 位點變異與疾病風險的關聯
2025-06
Goodfire AI 與 Arc Institute 完成可解釋性突破,開發稀疏自編碼器揭示模型內部生物特徵
2025-09
Evo2 可控生成的表觀基因組設計在小鼠胚胎幹細胞中驗證成功,色質可及性預測準確度達 0.92-0.95
2026-03
Evo2 通過 NVIDIA BioNeMo 平台向全球科學家開放,支援跨物種的 DNA、RNA 和蛋白質分析
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。