🤖Reddit r/MachineLearning•較早收集於 7h
全新 1 億張以上高品質圖文數據集 MONET 發布
💡獲取超過 1 億張圖文數據的開源數據集,提升您的 T2i 模型訓練效能。
⚡ 30-Second TL;DR
有什麼變化
包含 1.049 億對精選圖文數據
為什麼重要
此數據集為研究人員與開發者提供了一個龐大的開源資源,可用於訓練大規模視覺語言模型,且無授權限制。
下一步行動
從 Hugging Face 下載 MONET 數據集,以測試您目前的 T2i 模型訓練流程。
誰應關注:Researchers & Academics
關鍵要點
- •包含 1.049 億對精選圖文數據
- •採用 Apache 2.0 開源授權
- •提供訓練文字生成圖像模型的程式碼庫
- •附帶 UMAP 視覺化與檢索工具
🧠 深度解析
Web-grounded analysis with 7 cited sources.
🔑 增強重點摘要
- •MONET 數據集是從 29 億個原始圖文對中,經過多階段嚴格的安全過濾、去重(使用感知哈希和自監督複製檢測)及領域篩選後,精煉出 1.049 億個高品質數據對。
- •數據集中的每張圖片都透過多個視覺語言模型(VLM),包括 Florence-2、InternVL3-8B、ShareGPT4V-7B 和 Gemini-2.5-flash-lite,進行了重新標註,以提供從簡短概念到詳細描述的多樣化文字說明。
- •MONET 由 Jasper AI 開發並在 HuggingFace 上發布,旨在填補因 LAION 等現有大型數據集面臨法律挑戰後,市場上缺乏具備商業友善 Apache 2.0 授權的大規模開源圖文數據集的空白。
- •數據集附帶預計算的嵌入(如 DINOv2、CLIP、SSCD)和結構化註釋(如 YOLO-v9e 物體檢測、YOLO-v8x ImageNet-1k 分類、MediaPipe 人臉元數據、SANA-VAE 潛在表示),以加速下游應用和研究。
📊 競品分析▸ Show
| 特性/數據集 | MONET | LAION-400M/5B | COYO-700M |
|---|---|---|---|
| 規模 | 1.049 億圖文對 | 4 億 / 50 億圖文對 | 7.47 億圖文對 |
| 授權 | Apache 2.0 (商業友善) | 不明確,面臨法律挑戰 | CC-BY-4.0 (需歸因) |
| 數據品質 | 高品質、精選、去重、多 VLM 重新標註 | 未經整理,包含冗餘和低品質內容,短 alt-text 標註 | 大規模,包含 alt-text 和元數據 |
| 過濾流程 | 嚴格的安全過濾、領域篩選、審美預過濾 | 較少或無嚴格過濾 | 圖像和文字層級過濾 |
| 預計算特徵 | 包含預計算嵌入和結構化註釋 | 無此類詳細說明 | 包含多種元屬性 |
🛠️ 技術深入
- 數據來源: MONET 從 29 億個原始圖文對中精煉而來,這些原始數據來自九個異構開源數據集(六個真實數據集,包括 LAION-2B-en、COYO-700M、Common-Catalog-CC-BY、Megalith-10M、Conceptual-12M、Diffusion-Aesthetic-4K;三個合成數據集,包括 FLUX.1-schnell、FLUX.2-klein-4B、Z-Image)。
- 預過濾: 對於最大的數據源(LAION 和 COYO),初步過濾移除了解析度低於 512x512 像素的圖像,以及 VLM 預測審美分數低於 5.0 的圖像。
- 安全過濾: 採用多層安全過濾流程,包括限制使用 Re-LAION-2B-en-safe 中的樣本、結合開源(Falcon、Bumble)和內部 NSFW 檢測器,並進行 DINOv2 嵌入的手動安全審核。
- 去重策略: 實施兩階段去重策略,利用感知哈希(perceptual hashing)和自監督複製檢測(Self-Supervised Copy Detection, SSCD)來移除近乎重複的圖像。
- 重新標註: 每張圖像都使用四個不同複雜度的 VLM 進行重新標註,包括 Florence-2(提供簡短、概念級別的標註)以及 InternVL3-8B、ShareGPT4V-7B 和 Gemini-2.5-flash-lite(提供長而細緻的描述)。
- 合成數據增強: 數據集透過 Apache 2.0 授權的 T2I 模型(FLUX.1-schnell、FLUX.2-klein-4B、Z-Image)生成合成樣本進行增強,提示詞來自重新標註的 MONET 和開源提示詞集,並由 Qwen3-4B 進行升採樣。
- 特徵豐富化: 數據集包含 DINOv2、CLIP 和 SSCD 嵌入;YOLO-v9e 物體檢測;YOLO-v8x ImageNet-1k 分類;MediaPipe 人臉元數據;以及預編碼的 SANA-VAE 潛在表示。
- 模型驗證: 透過在 MONET 數據集上獨家訓練一個 4B 參數的潛在擴散模型(靈感來自 MMDiT,使用帶有 Qwen3-4B 文字條件的 DCVAE),該模型在 GenEval 和 DPG 評分上達到了競爭力,並能生成高達 2048x2048 解析度的圖像。
- 計算成本: MONET 的構建總共耗費約 17.5 萬 GPU 小時,其中重新標註佔據了約 79% 的計算資源。
🔮 前景展望AI analysis grounded in cited sources
MONET 將加速開源文字生成圖像模型的研究與開發。
其高品質、大規模且具備商業友善 Apache 2.0 授權的特性,降低了學術界和新創公司進入大型 T2I 模型訓練的門檻。
MONET 的發布將推動更安全、更高品質的生成式 AI 內容。
嚴格的安全過濾和去重流程,以及多 VLM 重新標註的詳細描述,有助於減少模型訓練中的偏見和低品質輸出。
MONET 可能成為開源多模態數據集的新基準,尤其是在商業應用領域。
鑑於 LAION 等現有大型數據集面臨的法律挑戰,MONET 的 Apache 2.0 授權使其成為一個更具吸引力的替代方案。
⏳ 時間線
2026-05
MONET 數據集論文在 arXiv 上發布,並在 HuggingFace 上開源。
2026-05
AI Weekly 報導 Jasper AI 發布 MONET 數據集,強調其在填補開源多模態數據集空白方面的作用。
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗

