🦙Reddit r/LocalLLaMA•最新收集於 15m
vLLM-Radiance 以四張 GPU 達到 17.6K Prefill

#inference#multi-gpu#amd-gpu#throughputvllm-radiancevllm-radiancevllmqwen 3.8 27bamd r9700 ai prohermes
💡實測報告顯示,替代版 vLLM 堆疊讓 4 張 AMD GPU 達到 17.6K prefill。
⚡ 30-Second TL;DR
有什麼變化
報告中的 prefill 效能達到每秒 17,636 個 token,該次尖峰期間的生成速度為每秒 36.6 token。
為什麼重要
這份報告顯示,替代版 vLLM 實作可能讓原本在官方堆疊上表現不佳的硬體,獲得強大的多 GPU 吞吐量。若能重現,將提升 AMD 系統對高吞吐本地推論開發者的吸引力。
下一步行動
在你的多 GPU AMD 主機上,使用相同的 Qwen 模型、context、批次與 MTP 設定,對 vLLM-Radiance 和官方 vLLM 進行基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •報告中的 prefill 效能達到每秒 17,636 個 token,該次尖峰期間的生成速度為每秒 36.6 token。
- •搭配 80% 的 MTP 接受率時,最高生成速度達到每秒 106 token。
- •4 張 GPU 均持續顯示 100% 使用率,儘管官方據稱僅支援雙 GPU 配置。
- •工作負載使用 Hermes、Qwen 3.8 27B FP8,以及 262K context window。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
