在 5060ti + 1080ti 上運行 35B/120B 模型
詳述使用 llama.cpp RPC 在 RTX 5060ti(主機)和 GTX 1080ti(VM 直通)上全 GPU 運行 Qwen3.5-35B-A3B,達 60tok/s。Nemotron-3-Super-120B-A12B 使用 64GB RAM 運行 3tok/s。透過 VM 解決混合 GPU 架構驅動問題。
Tag: #multi-gpu20 results
詳述使用 llama.cpp RPC 在 RTX 5060ti(主機)和 GTX 1080ti(VM 直通)上全 GPU 運行 Qwen3.5-35B-A3B,達 60tok/s。Nemotron-3-Super-120B-A12B 使用 64GB RAM 運行 3tok/s。透過 VM 解決混合 GPU 架構驅動問題。

LLmFit 是一款終端工具,偵測硬體並評分來自 133 提供者的 497 模型,涵蓋品質、速度、適配與上下文。支援 TUI/CLI、多 GPU、MoE 與動態量化。協助使用者找到適合其 RAM、CPU、GPU 配置的最佳模型。

Qwen3.5 122B 在 72GB VRAM(3x3090)上以 Q3_K 達 25 tok/s,被譽為最佳模型,支援 120k 上下文。分享最佳設定修復迴圈:Temp 0.6、Top P 0.8、Repeat 1.3。在佔用與速度平衡勝出。

一名 Reddit 使用者提出組裝四張 GPU、總計 200GB VRAM 的系統計畫。方案結合 RTX PRO、RTX 5090、PCIe 擴充與功耗限制策略,目標是在 1,300W 電源供應器內運作。

一名基礎架構工程師分享一台工作站級 AI 伺服器經過六至八個月運作後的實務評測,目標是支援大型 MoE 推理、創意工作與企業研究。系統結合八張 RTX 3090、兩張 RTX 5090、512GB ECC 記憶體,並透過 Open WebUI 搭配 llama.cpp 或 koboldcpp。
使用llama-server Vulkan支援,將16GB GPU搭配舊6GB+卡運行30B模型。split-mode=layer及no-mmap等設定最小化RAM使用。在Qwen3.6-27B 128k上下文達19t/s評估速度。

新型PC組裝包含2x RTX 6000 Blackwell max-Q GPU、Intel i9-13900K與Supermicro X13SAE-F主機板及128GB ECC RAM。因PCI通道限制GPU以x8 PCIe 5.0運行;用戶考慮升級CPU/RAM。高容量SSD提供儲存。

一名 LocalLLaMA 使用者記錄了多年升級歷程,從搭載 RTX 3090 的遊戲電腦,發展為結合四張 RTX 6000 Pro Max Q 與四張 RTX 3090 的專用叢集。這套系統以本地推論、資料隱私與實驗為主要目標,同時也凸顯電力、PCIe 與可靠性方面的重大挑戰。
用戶表示 Qwen 3.6 在單張 RTX 3090 上運作良好,引發對雙卡設定的好奇。討論探索雙 GPU 能實現的進階本地 LLM 任務。來自 r/LocalLLaMA 社群。
使用者尋求在 llama.cpp 中指定 KV 快取至特定 GPU 及卸載專家張量的方法。目標是將非專家張量置於強 GPU,其餘置於弱 GPU。已跨貼至 GitHub 討論 #20642。