🏠較早收集於 7m

阿里開源首個統一科學基礎模型 LOGOS

阿里開源首個統一科學基礎模型 LOGOS
PostLinkedIn
🏠閱讀原文: IT之家
#scientific-ai#bioinformatics#open-weights#foundation-modellogosalibabalogosmicrosoftnaturelm

💡一個高效的科學基礎模型,僅用 1/56 的參數規模即超越 Microsoft 的 NatureLM。

⚡ 30-Second TL;DR

有什麼變化

使用統一的「科學語法」將蛋白質與小分子等異構數據編碼為離散 Token。

為什麼重要

該模型透過提供統一且高效的架構,無需複雜的幾何神經網絡即可處理多模態科學數據,顯著降低了 AI 驅動藥物研發與材料科學的門檻。

下一步行動

從 LOGOS-Hub 的 HuggingFace 儲存庫下載模型權重,並在您的特定分子屬性預測任務上進行測試。

誰應關注:Researchers & Academics

關鍵要點

  • 使用統一的「科學語法」將蛋白質與小分子等異構數據編碼為離散 Token。
  • LOGOS-1B 以 1/56 的參數規模超越 Microsoft 的 NatureLM。
  • 透過將 3D 空間交互模式序列化,無需輸入 3D 坐標即可理解分子結構。
  • 實現預訓練目標與下游任務的一致性,大幅降低微調需求。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 11 個來源。

🔑 增強重點摘要

  • LOGOS是由阿里巴巴ATH-Token Foundry與中國人民大學高瓴人工智能學院聯合開發的首個統一科學基礎模型,旨在打破傳統AI for Science領域「一任務一專家模型」的割裂現狀。
  • 其預訓練語料庫涵蓋7種模態,總計448.7億個Token,包括蛋白質、抗體、小分子、化學反應、MOF材料、蛋白質口袋及蛋白質口袋-配體複合物等,實現了廣泛的跨領域知識整合。
  • LOGOS繼承了大型語言模型(LLM)的預訓練權重,使其能夠直接利用vLLM推理加速和模型量化等成熟的工程基礎設施,並推動自然科學研究從「篩選已知」轉變為「設計驅動」。
  • 該模型已完全開源,包括模型權重、推理代碼和技術報告,可在HuggingFace和GitHub上獲取,促進了科學AI研究的開放生態。
  • LOGOS的創新「科學語法」設計,使得模型能夠將蛋白質「方言」(氨基酸口袋序列)直接「翻譯」成小分子「方言」(SMILES結構),證明其學習了不同科學對象之間的深層對應關係。
📊 競品分析▸ Show
特性/模型阿里LOGOSMicrosoft NatureLM
發布日期2026年6月18日2025年2月-3月 (論文/發布)
開發者阿里巴巴ATH-Token Foundry、中國人民大學高瓴人工智能學院Microsoft Research AI for Science
核心理念統一「科學語法」,將異構科學對象編碼為離散Token序列,實現跨領域知識整合與自回歸生成。基於序列的科學基礎模型,整合多個科學領域數據,透過「自然語言」實現科學發現。
參數規模LOGOS-1B (10億參數)10億、80億、467億 (8x7B MoE) 參數版本
訓練數據涵蓋7類模態,總計448.7億Token,包括蛋白質、抗體、小分子、化學反應、MOF材料、蛋白質口袋、蛋白質口袋-配體複合物。數千億個來自生物學、化學和材料科學的精選Token,擴展現有大型語言模型。
3D理解透過將3D空間接觸模式「語法化」為離散Token,無需輸入3D坐標即可理解複雜3D空間互作規律。透過序列建模學習隱式3D結構,可從蛋白質序列設計小分子。
預訓練與下游任務一致性實現形式與目標一致性,大幅降低微調需求。透過指令微調適應任務,並可針對特定任務進行客製化微調。
性能基準LOGOS-1B在六大代表性科學任務上,以1/56的參數量超越Microsoft NatureLM (8x7B),並一致性地匹配或超越領域專用方法。在多項科學任務上表現卓越,常與最先進的專業模型匹配或超越。
開源狀態完全開源 (模型權重、推理代碼、技術報告)開源 (模型,例如NatureLM-8x7B在Hugging Face上可用)
應用領域口袋條件配體生成、逆合成預測、口袋位點識別、MOF材料生成等。藥物發現、蛋白質設計、材料設計、RNA設計、跨領域設計等。

🛠️ 技術深入

  • 模型名稱: LOGOS (Language Of Generative Objects in Science)
  • 開發團隊: 阿里巴巴ATH-Token Foundry 與 中國人民大學高瓴人工智能學院
  • 核心思想: 引入統一的「科學語法」,將蛋白質、小分子、材料、化學反應等異構科學對象編碼為統一的離散Token序列。
  • 模型架構: 採用純序列建模範式,並繼承大型語言模型(LLM)的預訓練權重,實現原生大模型框架下的自回歸理解與生成。
  • 3D空間理解: 創新性地採用「文字描述法」,將3D空間接觸模式直接「語法化」為離散Token,無需顯式輸入3D坐標,僅透過序列預測即可在模型內部構建並理解複雜的3D空間互作規律。
  • 預訓練語料庫: 包含7類模態,總計448.7億個Token,具體包括:
    • 生物大分子層:蛋白質 (289億 Token) + 抗體 (30億 Token)
    • 化學實體與轉化層:小分子 (21億 Token) + 化學反應與MOF材料 (4.7億 Token)
    • 界面互作層:蛋白質口袋 (58億 Token) + 蛋白質口袋-配體複合物 (46億 Token)
  • 預訓練與下游任務對齊: 實現「形式一致」(預訓練數據的序列形式等於下游任務的輸入輸出形式)和「目標一致」(預訓練的next-token prediction等於下游的條件生成目標),有效消除預訓練與下游應用之間的鴻溝,減少對複雜適配層或大量微調的需求。
  • 開源細節: 模型權重、推理代碼和技術報告已完整開源,可在HuggingFace和GitHub上訪問。

🔮 前景展望AI analysis grounded in cited sources

LOGOS將大幅加速新藥研發與材料科學創新。
其統一的科學語法和無需3D坐標理解分子結構的能力,能顯著提升跨領域設計與生成效率,從而縮短研發週期並降低成本。
科學AI研究的門檻將進一步降低,促進更多跨學科合作。
LOGOS的開源及其預訓練目標與下游任務的一致性,使得研究人員無需大量微調即可應用模型,加速了AI在科學領域的普及與應用。
AI for Science領域將從「篩選已知」轉向「設計驅動」的新範式。
LOGOS能夠在統一的生成空間中理解和生成異構科學對象,使其能夠主動設計具有特定性質的分子或材料,而非僅從現有數據中篩選。

時間線

2014
阿里巴巴成立iDST研究院,開始投入人工智能核心技術研發。
2017
阿里巴巴達摩院正式成立,同年阿里云推出中國首個機器學習平台PAI。
2022
通義實驗室正式成立,並發布「通義」系列大模型,啟動通義千問項目。
2023-08
阿里巴巴開源Qwen-7B,一個70億參數的AI模型,免費供商業使用。
2025-02
阿里巴巴達摩院發布開源具身基礎模型RynnBrain,基於Qwen3-VL。
2026-06
阿里與中國人民大學開源首個統一科學基礎模型LOGOS。

📎 來源 (11)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. ithome.com
  2. 9466.com
  3. microsoft.com
  4. huggingface.co
  5. themoonlight.io
  6. huggingface.co
  7. youtube.com
  8. github.io
  9. aliyun.com
  10. aibusiness.com
  11. alibabacloud.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。