🦙Reddit r/LocalLLaMA•較早收集於 7h
在 5060ti + 1080ti 上運行 35B/120B 模型
#multi-gpu#rpc#local-inferencellama.cppllama.cppqwen3.5-35b-a3bnemotron-3-super-120b-a12b
💡技巧:結合 5060ti+1080ti 經 llama.cpp RPC 達 35B Qwen 60t/s—完整指南
⚡ 30-Second TL;DR
有什麼變化
Qwen3.5-35B-A3B Q4_K_M:經 RPC 在 5060ti + 1080ti 上 60tok/s
為什麼重要
實現消費級/舊 GPU 運行巨型模型,延長硬體壽命並普及本地 100B+ LLM 存取。
下一步行動
使用 CUDA 和 RPC 旗標建置 llama.cpp,然後在混合 GPU 上測試 Qwen3.5-35B,使用 VM 直通。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen3.5-35B-A3B Q4_K_M:經 RPC 在 5060ti + 1080ti 上 60tok/s
- •Nemotron-3-Super-120B-A12B UD-Q4_K_M:3tok/s,需要 64GB RAM
- •VM 直通解決驅動衝突(5060ti 需 290+,1080ti 需 280-)
- •使用 -DGGML_CUDA=ON -DGGML_RPC=ON 建置 llama.cpp
- •跨 GPU 張量分割 5,8,總計 27GB VRAM
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
🛠️ 技術深入
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-02
Qwen3.5-35B-A3B 由 Alibaba Cloud 發布,引入 35B MoE 高效多模態模型
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
