🦙Reddit r/LocalLLaMA•最新收集於 2h
雙 R9700 主機每秒生成 111 個 Token
#local-inference#multi-gpu#quantization#amd-gpuamd-radeon-ai-pro-r9700amdradeon ai pro r9700qwen3.8vllm radiancebetterbench
💡了解約 4,000 歐元的雙 AMD 主機,如何以更低成本挑戰 RTX 5090 的本地 LLM 推論效能。
⚡ 30-Second TL;DR
有什麼變化
兩張 32 GB Radeon AI PRO R9700 顯示卡透過 PCIe 5.0 x8 運作,搭配 64 GB 系統記憶體。
為什麼重要
這項基準測試顯示,多 GPU AMD 工作站可能是本地 LLM 實驗中取代單張高階 NVIDIA 顯示卡的高性價比方案。結果也凸顯量化、專家卸載、散熱與持續生成速度之間的實務取捨。
下一步行動
在決定使用 FP8、AWQ MXFP4 或專家卸載前,先用 BetterBench 在雙 GPU 上測試目標 Qwen3.8 量化版本。
誰應關注:Researchers & Academics
關鍵要點
- •兩張 32 GB Radeon AI PRO R9700 顯示卡透過 PCIe 5.0 x8 運作,搭配 64 GB 系統記憶體。
- •Qwen3.8-27B 使用 Quark AWQ MXFP4 時可達每秒 111.4 個 Token,原生 FP8 則為每秒 87.6 個 Token。
- •Qwen3.8-Flash-Next 使用 UD-IQ4_XS GGUF 與分層專家卸載時,可達每秒 35.4 個 Token。
- •Qwen3.8-27B 的 TTFT 為 73–81 毫秒,Prefill 速度超過每秒 4,200 個 Token。
- •其中一張 GPU 溫度高出 10–15°C,計畫透過限制功耗至 210 W 及降壓改善。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。

