🦙較早收集於 6h

RTX PRO 6000 MoE 基準測試:最高 50.5 tok/s

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#moe#blackwell#benchmarkqwen3.5-397bqwen3.5-397brtx-pro-6000marlincutlass

💡397B MoE 實測 50.5 tok/s + NVIDIA SM120 錯誤曝光 (22字)

⚡ 30-Second TL;DR

有什麼變化

Marlin TP=4 持續達 50.5 tok/s—SM120 硬體最佳。

為什麼重要

凸顯 NVIDIA 在工作站 Blackwell 的驗證缺口,限制 FP4 吞吐量。引導推論最佳化偏向 Marlin,而非故障 CUTLASS 用於消費 GPU。

下一步行動

在你的 SM120 設定基準測試 Marlin TP=4,再試 CUTLASS 或 MTP。

誰應關注:Developers & AI Engineers

關鍵要點

  • Marlin TP=4 持續達 50.5 tok/s—SM120 硬體最佳。
  • CUTLASS grouped GEMM 在 RTX PRO 6000 (SM120) 失敗,提交 bug #3096。
  • MTP=2 使 Marlin 從 50.5 降至 39.6 tok/s,因去量化不符。
  • 無 NVLink PCIe 限制專家並行僅 1.4-2.6 tok/s。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • RTX PRO 6000 採用 Blackwell 架構,配備 96GB GDDR7 記憶體與 1.792 TB/s 頻寬,支援 NVFP4 量化以提升大型模型推論效率。[1][7][8]
  • 單張 RTX PRO 6000 在 30B AWQ 模型上達 8,400 tok/s,接近 4x RTX 4090 的 8,900 tok/s,功耗更低。[1]
  • 相較資料中心 GPU,單 GPU 推論中 RTX PRO 6000 吞吐量超越 H100 (3,140 vs 2,987 tok/s),每令牌成本降低 28%。[3]
📊 競品分析▸ Show
特點/基準RTX PRO 6000 BlackwellRTX 5090RTX 4090H100
VRAM96GB GDDR732GB GDDR724GB GDDR6X80GB HBM2e
記憶體頻寬1.792 TB/s1.792 TB/s~1 TB/s2.0 TB/s
30B AWQ tok/s (單GPU)8,400 [1]N/A8,900 (4x) [1]2,987 [3]
單精度效能125 TFLOPS [7]N/A~73 TFLOPSN/A
AI TOPS4000 [5]N/AN/AN/A

🛠️ 技術深入

  • Blackwell 架構包含第 5 代 Tensor Cores (752 個) 與第 4 代 RT Cores (188 個),單精度 125 TFLOPS,RT 核心 380 TFLOPS。[5][7]
  • 512-bit 記憶體匯流排,PCIe 5.0 介面,TDP 約 600W,內建原生 FP4/NVFP4 支援以優化量化 LLM 推論。[7][8]
  • 在 vLLM 引擎下,適合 AWQ/FP8 量化模型,96GB VRAM 允許 70B FP8 或更大批次處理。[1][9]

🔮 前景展望AI analysis grounded in cited sources

RTX PRO 6000 將主導單 GPU 大型模型推論市場
其 96GB VRAM 與 NVFP4 支援超越 H100 在單 GPU 吞吐量與成本效益,減少多 GPU 需求。[1][3][8]
軟體相容性問題將在數月內修復
類似 CUTLASS 初始化失敗已提交 bug 追蹤,NVIDIA 與社群快速迭代 Marlin/vLLM 更新。[原文推斷]

時間線

2025-03
NVIDIA 發布 Blackwell 架構,RTX PRO 6000 亮相為工作站頂級 GPU
2025-10
CloudRift 發布 RTX PRO 6000 單 GPU 30B AWQ 基準,達 8,400 tok/s
2026-01
GamersNexus 與 Trooper.ai 比較 RTX PRO 6000 對 RTX 5090/4090 LLM 效能
2026-02
CloudRift 基準顯示 RTX PRO 6000 單 GPU 超越 H100 推論吞吐量
2026-03
Reddit r/LocalLLaMA 發布 Qwen3.5-397B 在 4x RTX PRO 6000 上 50.5 tok/s MoE 測試
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。