🦙Reddit r/LocalLLaMA•最新收集於 2h
客製化 llama.cpp 版本榨出 7900 XTX 效能
#amd-gpu#multi-gpu#tensor-parallelism#local-inferencellama.cpp-rdna3-7900-xtx-optimized-buildllama.cppqwenamdradeon rx 7900 xtxrocm
💡取得 AMD 多 GPU 實用最佳化,透過 PCIe 壓縮與張量平行加速 Qwen 推理。
⚡ 30-Second TL;DR
有什麼變化
此版本據報使用兩張顯示卡處理 Qwen 3.8 Next Q3_K_XL 時,提示處理速度最高可達每秒 920 tokens。
為什麼重要
對使用 AMD 硬體的開發者而言,此分支可能讓多 GPU 本地推理更實用,尤其適合顯示卡透過 PCIe x4 或晶片組連接的配置。不過這些數據來自社群基準測試,作者也不提供後續支援,因此導入正式環境前需仔細驗證。
下一步行動
複製此最佳化 llama.cpp 分支,並在正式部署前,依照你的 RX 7900 XTX PCIe 拓撲重現 Qwen 3.8 27B Q8_0 基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •此版本據報使用兩張顯示卡處理 Qwen 3.8 Next Q3_K_XL 時,提示處理速度最高可達每秒 920 tokens。
- •Qwen 3.8 27B Q8_0 在一張經晶片組連接的顯示卡上,據報可達每秒 1,600 tokens 的提示處理速度,以及每秒 60–65 tokens 的一般文字解碼速度。
- •功能包括 Q8_0 壓縮 PCIe 傳輸、自訂 HIP allreduce、自適應 MTP、張量平行 DFLASH2,以及 AMD 專用核心調校。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
