Arc Pro B70 在 llama.cpp 基準測試落後 RTX 3090
基準測試比較 Nvidia RTX 3090 和 Intel Arc Pro B70,使用 llama.cpp 在 Vulkan 和 SYCL 後端測試多個 GGUF 模型。Arc Pro B70 的提示處理平均慢 71%,令牌生成慢 53%。SYCL 後端在某些 Arc 結果優於 Vulkan。
Tag: #vulkan6 results
基準測試比較 Nvidia RTX 3090 和 Intel Arc Pro B70,使用 llama.cpp 在 Vulkan 和 SYCL 後端測試多個 GGUF 模型。Arc Pro B70 的提示處理平均慢 71%,令牌生成慢 53%。SYCL 後端在某些 Arc 結果優於 Vulkan。
ZINC 是用 Zig 撰寫的新 LLM 推理引擎,可在 $550 AMD GPU 上運行 35B 模型,透過 Vulkan。它載入 GGUF 模型,在 RDNA4 上達 7.1 tok/s,解決 AMD 消費級 GPU 缺口。儲存庫:github.com/zolotukhin/zinc。

一項新的 PR 旨在使 llama.cpp 的 Vulkan 後端中的 Tensor Parallelism 變得可行。此更新是改善非 Nvidia 硬體多 GPU 效能的重要一步。
使用者在 Strix Halo 上基準測試並將家用實驗室從三個模型整合至單一 122B Qwen3.5 MoE,達到 27.4 tok/s 並獲最高分數。IQ3 量化在半 VRAM 下性能匹配 Q4_K_M。同時處理電子郵件、財務和攝像頭等多個應用。

Mesa 26.3 已合併 AMD 的 GFX1171 目標,並在 RADV Vulkan 與 RadeonSI OpenGL 驅動中加入支援。這項變更讓 Linux 開源圖形堆疊開始為一款尚未公開的 RDNA 4m 整合式 GPU 變體做準備。
使用者報告使用 Q5_K_XL 量化 Qwen3.6-35B-A3B 在 AMD RX 7900 上搭配 llama.cpp Vulkan 伺服器獲得優異成果。整合 VS Code Copilot 從大型提示產生完整 React 應用與 Playwright 測試。分享詳細伺服器指令、取樣參數與聊天設定。