🤗較早收集於 22m

OlmoEarth v1.1:更高效的模型系列

OlmoEarth v1.1:更高效的模型系列
PostLinkedIn
🤗閱讀原文: Hugging Face Blog

💡了解全新的 OlmoEarth v1.1 優化如何降低模型的資源佔用與推理成本。

⚡ 30-Second TL;DR

有什麼變化

引入架構優化以提升計算效率

為什麼重要

此更新使開發者能夠在受限的硬體上運行高品質模型。它降低了在資源有限的環境中部署複雜 AI 應用程式的門檻。

下一步行動

從 Hugging Face Hub 下載 OlmoEarth v1.1 權重,並與您目前的模型進行基準測試,以評估推理速度的提升。

誰應關注:Developers & AI Engineers

關鍵要點

  • 引入架構優化以提升計算效率
  • 在降低資源需求的同時保持核心功能
  • 致力於提供高效能開源模型的持續努力之一

🧠 深度解析

Web-grounded analysis with 17 cited sources.

🔑 增強重點摘要

  • OlmoEarth是一個專為地球觀測數據設計的時空多模態基礎模型,能夠同時處理衛星圖像、雷達讀數和上下文地圖等多種數據模態,並跨越空間和時間進行推理。
  • 該模型採用了一種名為Latent MIM Lite的新型自監督學習公式,這是Latent Masked Image Modeling的一個穩定變體,旨在避免表徵崩潰並統一監督式和自監督式學習。
  • OlmoEarth v1.1透過減少token序列長度,將計算成本降低了高達三倍,同時保持了與v1版本在研究基準和合作夥伴任務上的性能,顯著提升了效率。
  • OlmoEarth模型系列提供四種不同大小(Nano、Tiny、Base、Large),參數範圍從約140萬到3億,以平衡速度和準確性,滿足不同應用場景的需求。
  • OlmoEarth作為一個開放的端到端平台部署,旨在簡化和優化地球觀測AI的數據收集、標註、訓練和推理流程,使非營利組織和政府機構無需深厚的AI專業知識即可利用這些強大工具。
📊 競品分析▸ Show
特性/模型OlmoEarthTerraMind (IBM/ESA)Prithvi (NASA/IBM)
發布機構Allen Institute for AI (Ai2) / Hugging FaceIBM / 歐洲太空總署 (ESA)NASA / IBM
模型類型多模態、時空基礎模型 (Vision Transformer)生成式AI模型地理空間AI基礎模型
主要目標使地球AI實用、可擴展、高性能,並為非營利組織提供端到端平台輕量級、低能耗、大規模部署,改善極端天氣事件監測支持全球土地利用變化追蹤、災害監測、作物產量預測
訓練數據數百萬次地球觀測,約10 TB數據,包含Sentinel-1/2, Landsat-8衛星圖像及衍生地圖TerraMesh (最大地理空間數據集), ImpactMesh (極端洪水和野火事件數據集)NASA的Harmonized Landsat and Sentinel-2 (HLS) 數據集
性能聲稱在24項任務中15項表現最佳 (嵌入評估),在29項任務中19項表現最佳 (完整微調);優於Meta DINOv3, IBM Prithvi, IBM Terramind, Google AEF等在類似任務上優於其他模型8%或更多;目前是地球觀測領域表現最佳的AI基礎模型已在洪水繪圖和燒傷疤痕檢測等應用中證明價值
開源狀態完全開源 (程式碼、訓練數據、預訓練權重)開源 (Apache 2.0 許可證)開源
獨特功能Latent MIM Lite自監督學習,統一監督和自監督訓練;端到端OlmoEarth平台「任意到任意」(any-to-any) 多模態生成能力,可自生成訓練數據 (Thinking-in-Modalities, TiM)全球數據支持,專注於多樣化土地利用和生態系統
參數規模Nano (~1.4M), Tiny (~6.2M), Base (~90M), Large (~300M)小型輕量級模型,比標準模型少10倍計算量未明確提及具體參數數量,但為基礎模型

🛠️ 技術深入

  • 架構: OlmoEarth採用基於Vision Transformer (ViT) 的編碼器-解碼器風格架構。
  • 輸入數據處理: 模型處理對齊的衛星圖像和衍生地圖的多模態圖像時間序列。
  • 多模態輸入: 能夠攝取來自多種衛星傳感器(包括光學圖像和雷達)的每月時間序列圖像,並將OpenStreetMap、土地覆蓋數據和樹冠高度等上下文地圖直接納入訓練過程。
  • 投影層: 使用FlexiViT風格的投影層將輸入數據從像素轉換為具有可變補丁大小的token。
  • 編碼: 為token添加位置、時間和模態編碼以提供額外上下文。
  • 訓練方法: 採用Latent Masked Image Modeling of Linear, Invariant Token Embeddings (Latent MIM Lite) 的自監督學習公式。在訓練期間,部分輸入token會被遮蔽,解碼器預測這些被遮蔽token的表示。
  • 解碼器設計: 解碼器深度為4,使得編碼器承擔了大部分建模工作。
  • 預訓練數據集: 包含來自全球的285,288個樣本,每個樣本覆蓋2.56公里x2.56公里的空間區域和一年的時間範圍。
  • 效率提升 (v1.1): 主要透過減少token序列長度來實現,因為Transformer模型中的計算成本與token序列長度呈二次方關係。

🔮 前景展望AI analysis grounded in cited sources

OlmoEarth v1.1的效率提升將加速非營利組織和政府機構在地球觀測領域的AI應用部署。
降低計算成本和資源需求使得更多資源有限的組織能夠利用先進的地球觀測AI模型來應對氣候和環境挑戰。
OlmoEarth平台將促進地球觀測AI模型的開源協作和創新。
作為一個開放的端到端平台,它提供了程式碼、訓練數據和預訓練權重,鼓勵研究人員和開發者貢獻評估並擴展模型應用。
未來的OlmoEarth模型將擴展到新的領域,例如人道主義應對和天氣數據支持。
Ai2已表示正在開發下一代OlmoEarth模型,預計明年發布,將支持天氣數據和額外的模態。

時間線

2024
Ai2的地球系統項目啟動,OlmoEarth由此誕生。
2025-04
IBM和ESA開源TerraMind,一個用於地球觀測的生成式AI模型。
2025-11
Ai2發布OlmoEarth平台及其v1模型系列,提供四種不同大小的模型。
2025-11
OlmoEarth的技術報告《OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observation》在arXiv上發布。
2026-02
ESA和IBM發布ImpactMesh數據集,並使用其微調TerraMind模型以改善對極端天氣事件的監測。
2026-05-19
Hugging Face發布OlmoEarth v1.1,專注於提高計算效率。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog