๐Ÿฆ™Stalecollected in 63m

Dual GPUs Hack for 16GB VRAM Users

PostLinkedIn
๐Ÿฆ™Read original on Reddit r/LocalLLaMA

๐Ÿ’กCheap VRAM hack runs 30B models at 19t/s on mixed GPUs

โšก 30-Second TL;DR

What Changed

Combine 16GB + 6GB GPUs via Vulkan devices

Why It Matters

Config tweaks like split-mode=layer and no-mmap minimize RAM use.

What To Do Next

Run `llama-server --list-devices` to identify Vulkan IDs and test dual-GPU config.

Who should care:Developers & AI Engineers

Key Points

  • โ€ขCombine 16GB + 6GB GPUs via Vulkan devices
  • โ€ขConfig: n-gpu-layers=999, split-mode=layer, np=1
  • โ€ข22GB total VRAM runs 27B Q4_K_M model
  • โ€ข19.21 t/s eval, 186 t/s prompt at 128k context
๐Ÿ“ฐ

Weekly AI Recap

Read this week's curated digest of top AI events โ†’

๐Ÿ‘‰Related Updates

AI-curated news aggregator. All content rights belong to original publishers.
Original source: Reddit r/LocalLLaMA โ†—