🦙較早收集於 7h

在 5060ti + 1080ti 上運行 35B/120B 模型

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#multi-gpu#rpc#local-inferencellama.cppllama.cppqwen3.5-35b-a3bnemotron-3-super-120b-a12b

💡技巧:結合 5060ti+1080ti 經 llama.cpp RPC 達 35B Qwen 60t/s—完整指南

⚡ 30-Second TL;DR

有什麼變化

Qwen3.5-35B-A3B Q4_K_M:經 RPC 在 5060ti + 1080ti 上 60tok/s

為什麼重要

實現消費級/舊 GPU 運行巨型模型,延長硬體壽命並普及本地 100B+ LLM 存取。

下一步行動

使用 CUDA 和 RPC 旗標建置 llama.cpp,然後在混合 GPU 上測試 Qwen3.5-35B,使用 VM 直通。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen3.5-35B-A3B Q4_K_M:經 RPC 在 5060ti + 1080ti 上 60tok/s
  • Nemotron-3-Super-120B-A12B UD-Q4_K_M:3tok/s,需要 64GB RAM
  • VM 直通解決驅動衝突(5060ti 需 290+,1080ti 需 280-)
  • 使用 -DGGML_CUDA=ON -DGGML_RPC=ON 建置 llama.cpp
  • 跨 GPU 張量分割 5,8,總計 27GB VRAM

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B 採用 Mixture-of-Experts 架構,總參數 35B,每 token 僅激活 3B(256 專家中路由 8 個 + 1 共享專家)。[1][5]
  • 模型支援多模態輸入(文字與圖像),上下文長度達 262k tokens,可擴展至 1,010k tokens,並在 MMLU-Pro 得分 85.3%。[2][5]
  • 在 API 基準測試中,輸出速度達 159.9 tokens/s,遠高於同級開源模型中位數 96.8 t/s,且 Intelligence Index 得分 37。[2]
📊 競品分析▸ Show
模型架構活躍參數基準速度 (t/s)價格 (USD/1M tokens)
Qwen3.5-35B-A3BMoE (256 experts)3B159.9 [2]未指定 [2]
NVIDIA Nemotron 3 Super 120B A12BMoE12B447.7 [3]未指定 [3]
Qwen3.5-27BDense27B~7.5 (Q8 local) [4]未指定 [4]

🛠️ 技術深入

  • 隱藏維度:2048,層數:40,注意力頭數:Q 16 / KV 2,頭維度:Q 128 / KV 256,旋轉位置嵌入維度:64。[1][5]
  • 激活函數:SwigLU,歸一化:RMS Normalization,專家中間維度:512,LM 輸出:248320 (填充)。[1][5]
  • 支援 Grouped-Query Attention,上下文長度原生 262,144 tokens,可擴展至 1,010,000 tokens,使用多步驟訓練 (MTP)。[1][5]

🔮 前景展望AI analysis grounded in cited sources

消費級 GPU 可運行高效 MoE 模型將加速本地 AI 部署
如 Reddit 案例所示,RTX 5060 Ti + GTX 1080 Ti 組合透過 llama.cpp RPC 實現 60 t/s,結合 Qwen3.5-35B-A3B 的低活躍參數設計,使高性能推理更易取得。[1]
MoE 模型將主導開源高效推理領域
Qwen3.5-35B-A3B 以 3B 活躍參數超越多項基準(如 GPQA 84.2%),而 Nemotron-120B-A12B 等競爭者顯示 MoE 架構正成為標準。[1][3]

時間線

2026-02
Qwen3.5-35B-A3B 由 Alibaba Cloud 發布,引入 35B MoE 高效多模態模型
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。