🦙最新收集於 15m

vLLM-Radiance 以四張 GPU 達到 17.6K Prefill

vLLM-Radiance 以四張 GPU 達到 17.6K Prefill
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#inference#multi-gpu#amd-gpu#throughputvllm-radiancevllm-radiancevllmqwen 3.8 27bamd r9700 ai prohermes

💡實測報告顯示,替代版 vLLM 堆疊讓 4 張 AMD GPU 達到 17.6K prefill。

⚡ 30-Second TL;DR

有什麼變化

報告中的 prefill 效能達到每秒 17,636 個 token,該次尖峰期間的生成速度為每秒 36.6 token。

為什麼重要

這份報告顯示,替代版 vLLM 實作可能讓原本在官方堆疊上表現不佳的硬體,獲得強大的多 GPU 吞吐量。若能重現,將提升 AMD 系統對高吞吐本地推論開發者的吸引力。

下一步行動

在你的多 GPU AMD 主機上,使用相同的 Qwen 模型、context、批次與 MTP 設定,對 vLLM-Radiance 和官方 vLLM 進行基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • 報告中的 prefill 效能達到每秒 17,636 個 token,該次尖峰期間的生成速度為每秒 36.6 token。
  • 搭配 80% 的 MTP 接受率時,最高生成速度達到每秒 106 token。
  • 4 張 GPU 均持續顯示 100% 使用率,儘管官方據稱僅支援雙 GPU 配置。
  • 工作負載使用 Hermes、Qwen 3.8 27B FP8,以及 262K context window。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。