🦙較早收集於 25m

Covenant-72B:迄今最大去中心化GPU訓練模型

Covenant-72B:迄今最大去中心化GPU訓練模型
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#open-source-llmcovenant-72bcovenant-72bsparcelocodiloco

💡最大 LLM 透過去中心化 GPU—解鎖無許可訓練技術。(38字)

⚡ 30-Second TL;DR

有什麼變化

史上最大 72B 模型於去中心化無許可 GPU 訓練

為什麼重要

開創可擴展去中心化訓練,降低開放 AI 開發門檻並挑戰集中式雲端主導地位。

下一步行動

從 Hugging Face 下載 Covenant-72B,並測試 SparseLoco 用於你的分散式訓練設定。

誰應關注:Researchers & Academics

關鍵要點

  • 史上最大 72B 模型於去中心化無許可 GPU 訓練
  • 引入基於 DiLoCo 的 SparseLoco 方法降低通訊開銷
  • 採用本地 AdamW 優化器與降低同步頻率
  • 施加積極 top-K 稀疏化解決頻寬瓶頸

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Covenant-72B 在 Bittensor subnet 3(Templar)上訓練,這是一個完全無許可的去中心化網絡,允許任何擁有 GPU 的人自由加入或離開,無需白名單或中央協調[1][2]
  • 該模型在約 1.1 兆個 token 上訓練,超過 70 個獨立對等節點貢獻計算能力,每個 20 分鐘的計算週期中有 94.5% 的時間用於實際訓練,僅需約 70 秒進行通訊同步[3][7]
  • Templar 團隊開發了名為 Gauntlet 的驗證系統,用於評估貢獻品質並防止惡意行為,使得完全開放的網絡能夠在沒有單點故障的情況下運作[1]
  • Covenant-72B 在 MMLU 基準測試中達到 67.1 分,超過或與多個中央化基線模型相競爭,證明去中心化訓練可以達到與傳統數據中心相當的性能[6]
  • 該項目使用 Cloudflare R2 共享雲存儲作為對等節點間的通訊中介,而非直接點對點連接,每個對等節點通常配備 8 個強大的 GPU 並採用 FSDP 技術分散模型[3]

🛠️ 技術深入

  • 模型規模與訓練數據:72 億參數模型,訓練於約 1.1 兆個 token,是迄今最大的開放式網際網路訓練運行[3][4]
  • 分散式訓練架構:超過 70 個獨立對等節點透過商用網際網路連接參與,無需專用數據中心或超高速網絡硬件(如 InfiniBand 或 NVLink)[1][3]
  • GPU 配置與記憶體管理:每個對等節點通常配備 8 個 GPU,採用 FSDP(完全分片數據並行)技術將模型分片跨 GPU 存儲[3]
  • 通訊優化:使用 Cloudflare R2 作為共享存儲中介,每個 20 分鐘計算週期僅需約 70 秒通訊,達到 94.5% 的硬件利用率[3][7]
  • 驗證與信任機制:Gauntlet 驗證系統實時評估貢獻,防止低品質更新、工作複製或網絡中斷攻擊[1]
  • 性能基準:在 MMLU 測試中達到 67.1 分,超過多個中央化 70B 基線模型[6]

🔮 前景展望AI analysis grounded in cited sources

去中心化 AI 訓練可能成為主流替代方案
Covenant-72B 證明了無許可分散式訓練可以達到與中央化系統相當的性能,這可能降低大型科技公司對 AI 開發的壟斷,並使中小型組織和個人能夠參與大規模模型訓練。
商用 GPU 市場需求將大幅增長
該項目展示了普通 GPU 擁有者可以透過去中心化網絡獲得報酬,這可能激勵更多個人和小型企業購買 GPU 並加入類似的訓練池,改變 GPU 供應鏈的動態。
驗證與信任機制將成為去中心化 AI 的關鍵基礎設施
Gauntlet 等驗證系統的成功表明,可信的分散式訓練需要強大的品質控制機制,這將推動專門的驗證技術和反欺詐工具的發展。

時間線

2026-03
Covenant-72B 完成訓練,成為迄今最大的去中心化無許可 LLM 訓練運行(2026 年 3 月 10 日)
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。