🦙較早收集於 8h

組建 64GB VRAM 雙 MI50 設備

組建 64GB VRAM 雙 MI50 設備
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡經濟 64GB VRAM AMD 設備 + 開源安靜 shroud,用於本地 LLM – GLM 50 t/s!

⚡ 30-Second TL;DR

有什麼變化

雙 MI50 GPU 提供 64GB VRAM

為什麼重要

提供經濟 AMD 高 VRAM 設定,用於本地 LLM 推理,促進開源硬體改裝。

下一步行動

從 GitHub 下載 MI50 shroud STL 檔案,並為 ROCm 設定進行 3D 列印。

誰應關注:Developers & AI Engineers

關鍵要點

  • 雙 MI50 GPU 提供 64GB VRAM
  • 自訂 MIT 授權 3D 列印 shroud
  • llama.cpp 上 GLM 4.7 Q8_0 達 50 t/s
  • 負載 155W,閒置 18W
  • 總組裝成本約 1500 歐元

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • AMD Instinct MI50 於 2018 年 11 月推出,採用 7nm TSMC 製程的 Vega 20 晶片,具 3840 個串流處理器及 16GB HBM2 記憶體,記憶體頻寬達 1TB/s。
  • 單張 MI50 在 llama.cpp 上運行 Llama-7B-Q4_0 模型時,處理速度約 1200-1300 t/s、生成速度 100-110 t/s,約為 RTX 3090 的 68% 生成速度,但價格僅 15%。
  • MI50 在 Ollama 與 llama.cpp 基準測試中,單卡運行 20B 模型達 56 t/s,雙卡運行大型模型時功耗約 330W。
  • MI50 具 Infinity Fabric 介面,提供卡間最高 92GB/s 通訊速率,適合多卡配置。
📊 競品分析▸ Show
特點雙 MI50 (64GB)RTX 3090 (24GB)A100 PCIe (40GB)
VRAM64GB HBM224GB GDDR6X40GB HBM2e
記憶體頻寬2TB/s (單卡 1TB/s)~936GB/s1555GB/s
LLM 生成速度 (Llama-7B-Q4_0)~50 t/s (GLM 4.7 Q8_0, 雙卡)~145 t/s (推估 68% 較慢)未直接基準
功耗 (負載)155W~350W250W TDP
價格~1500 歐元高於 MI50 6-7 倍遠高於 MI50

🛠️ 技術深入

  • MI50 峰值性能:FP16 26.5 TFLOPs、FP32 13.3 TFLOPs、FP64 6.6 TFLOPs、INT8 53 TOPS。
  • 採用 PCIe 4.0 x16 介面,2U 被動冷卻設計,透過 2x Infinity Fabric 鏈接多卡,通訊速率達 92GB/s。
  • HBM2 記憶體 4096-bit 匯流排,頻寬 1TB/s;單卡閒置功耗約 17-20W,負載下 GPU 頻率達 1725MHz,RAM 1000MHz。
  • ROCm 支援 gfx906 架構,用於 llama.cpp 編譯;風扇 PWM 控制可維持 80-104°C 溫度,生成階段受 RAM 頻寬限制導致 GPU 降頻。

🔮 前景展望AI analysis grounded in cited sources

二手 MI50 將持續主導低成本高 VRAM AI 推理市場至 2027 年
其極低價格與高頻寬 HBM2 使之優於同價位 NVIDIA 卡,且 ROCm 6.3 持續優化支援舊世代 AMD GPU。
多 MI50 配置將擴展至 128GB VRAM 家用叢集
Infinity Fabric 高效卡間通訊與開源軟體生態,結合低功耗特性,適合 DIY 社群建置更大規模本地 LLM 系統。

時間線

2018-11
AMD 推出 Radeon Instinct MI50,首款 Vega 20 加速器具 16GB HBM2
2024-11
社群測試 MI50 用於 LLM 推理,強調高頻寬優勢
2025-12
基準顯示單 MI50 運行 Llama-7B 達 100+ t/s,定位入門 AI 卡
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。