🤖OpenAI News•較早收集於 26h
OpenAI 推出 MRC 強化 AI 訓練網路
💡OpenAI 的 MRC 提升 AI 訓練叢集可靠性—大規模超級電腦必備。(38字)
⚡ 30-Second TL;DR
有什麼變化
OpenAI 透過 OCP 發布 MRC 網路協議。
為什麼重要
MRC 讓大規模 AI 訓練更可靠,減少主要實驗室停機時間,並加速模型開發週期。
下一步行動
從 OCP 下載 MRC 規格,並在您的 AI 訓練叢集模擬器中測試。
誰應關注:Enterprise & Security Teams
關鍵要點
- •OpenAI 透過 OCP 發布 MRC 網路協議。
- •專為 AI 訓練超級電腦網路設計。
- •提升故障韌性和效能表現。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •MRC 協議旨在解決大規模 GPU 叢集中常見的「長尾延遲」問題,透過多路徑傳輸機制,即使在單一網路路徑發生擁塞或故障時,也能維持訓練任務的連續性。
- •該技術與開放運算計畫(OCP)的標準化目標一致,旨在打破封閉式網路架構的限制,推動 AI 基礎設施的互通性與硬體供應鏈的多元化。
- •MRC 針對 RDMA(遠端直接記憶體存取)進行了優化,特別是在處理數萬個 GPU 節點時,能顯著降低封包遺失對訓練收斂速度的負面影響。
📊 競品分析▸ Show
| 特性 | OpenAI MRC | NVIDIA RoCE/NVLink | Google Jupiter/ICI |
|---|---|---|---|
| 架構開放性 | 高 (OCP 標準) | 低 (專有技術) | 低 (內部專用) |
| 主要應用 | 異質 GPU 叢集 | NVIDIA 專用硬體 | TPU 專用叢集 |
| 效能優勢 | 韌性與多路徑傳輸 | 極低延遲與高頻寬 | 垂直整合與大規模擴展 |
🛠️ 技術深入
- 多路徑傳輸 (Multipath Transmission):MRC 允許資料封包同時透過多條網路路徑傳輸,動態避開擁塞節點,減少單點故障造成的訓練中斷。
- 故障偵測與恢復:整合了更細粒度的封包遺失偵測機制,能在微秒級別內重新路由流量,無需等待傳統 TCP/IP 的逾時重傳。
- 硬體抽象層:MRC 設計為與底層乙太網路硬體解耦,支援多種供應商的交換器與網卡,降低對單一供應商的依賴。
- RDMA 整合:優化了對 RoCE (RDMA over Converged Ethernet) 的支援,減少 CPU 參與網路傳輸的開銷,提升 GPU 之間的通訊效率。
🔮 前景展望AI analysis grounded in cited sources
AI 訓練叢集的硬體採購將轉向更具彈性的開放架構。
MRC 的標準化推動將降低企業對單一供應商網路硬體的依賴,促使資料中心採用更多元的硬體組合。
大規模 AI 模型的訓練成本將因網路效率提升而下降。
透過減少因網路故障導致的訓練重啟與閒置時間,整體叢集的 GPU 利用率(MFU)將獲得顯著改善。
⏳ 時間線
2025-03
OpenAI 宣布擴大其 AI 基礎設施投資,並開始研發下一代網路通訊協議。
2026-02
OpenAI 於 OCP 峰會提交 MRC 協議草案,尋求產業標準化合作。
2026-05
OpenAI 正式發布 MRC 協議,並開放相關技術規格供業界採用。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: OpenAI News ↗