Search

Tag: #vulkan6 results

⚙️

Arc Pro B70 Trails RTX 3090 in llama.cpp Benchmarks

Benchmarks compare Nvidia RTX 3090 and Intel Arc Pro B70 using llama.cpp on Vulkan and SYCL backends across multiple GGUF models. Arc Pro B70 shows 71% slower prompt processing and 53% slower token generation on average versus RTX 3090. SYCL backend improves some Arc results over Vulkan.

Reddit r/LocalLLaMACommunityApr 23#benchmarks#vulkan#sycl
⚙️

ZINC: Zig LLM Inference for AMD GPUs

ZINC is a new LLM inference engine written in Zig, enabling 35B models on $550 AMD GPUs via Vulkan. It loads GGUF models, achieves 7.1 tok/s on RDNA4, and addresses AMD consumer GPU gaps. Repo at github.com/zolotukhin/zinc.

Reddit r/LocalLLaMACommunityMar 29#amd-gpu#vulkan#gguf
🤖

Homelab Consolidates to 122B Qwen MoE

User benchmarks and consolidates homelab from three models to a single 122B Qwen3.5 MoE on Strix Halo, achieving 27.4 tok/s and top scores. IQ3 quantization matches Q4_K_M performance at half VRAM. Handles multiple apps like email, finance, and cameras concurrently.

Reddit r/LocalLLaMACommunityMar 27#homelab#moe#quantization