🦙最新收集於 2h

客製化 llama.cpp 版本榨出 7900 XTX 效能

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#amd-gpu#multi-gpu#tensor-parallelism#local-inferencellama.cpp-rdna3-7900-xtx-optimized-buildllama.cppqwenamdradeon rx 7900 xtxrocm

💡取得 AMD 多 GPU 實用最佳化,透過 PCIe 壓縮與張量平行加速 Qwen 推理。

⚡ 30-Second TL;DR

有什麼變化

此版本據報使用兩張顯示卡處理 Qwen 3.8 Next Q3_K_XL 時,提示處理速度最高可達每秒 920 tokens。

為什麼重要

對使用 AMD 硬體的開發者而言,此分支可能讓多 GPU 本地推理更實用,尤其適合顯示卡透過 PCIe x4 或晶片組連接的配置。不過這些數據來自社群基準測試,作者也不提供後續支援,因此導入正式環境前需仔細驗證。

下一步行動

複製此最佳化 llama.cpp 分支,並在正式部署前,依照你的 RX 7900 XTX PCIe 拓撲重現 Qwen 3.8 27B Q8_0 基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • 此版本據報使用兩張顯示卡處理 Qwen 3.8 Next Q3_K_XL 時,提示處理速度最高可達每秒 920 tokens。
  • Qwen 3.8 27B Q8_0 在一張經晶片組連接的顯示卡上,據報可達每秒 1,600 tokens 的提示處理速度,以及每秒 60–65 tokens 的一般文字解碼速度。
  • 功能包括 Q8_0 壓縮 PCIe 傳輸、自訂 HIP allreduce、自適應 MTP、張量平行 DFLASH2,以及 AMD 專用核心調校。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。